IA local - Abril de 2026

Como correr Llama 4 Maverick 70B em RTX 5090

Llama 4 Maverick É um modelo MoE - apenas 17B params fogo por token. Isso muda completamente a matemática do VRAM. Aqui está a configuração exata, comandos e referências reais.

✍️ AIListPrime Editorial 19 de abril de 2026 9 min read

A Resposta Curta

Llama 4 Maverick Corre em um Solteiro. RTX 5090 - sem GPUs duplas, sem servidor. A razão: é um modelo de mistura de especialistas (MoE). Apenas ~17B de seus ~400B parâmetros totais ativados por token. Isso reduz os requisitos do VRAM a aproximadamente 15-18GB Com a quantização Q4 K M, bem dentro RTX 5090É 32GB.

Você precisa de duas coisas: Ollama ou LM Studio, e um GGUF-formatado Llama 4 Maverick Peso. A instalação leva menos de 20 minutos quando você tem as ferramentas instaladas.

.. Params ativos ~17B / token .. VRAM (Q4 K M) ~15-18 GB .. Velocidade (RTX 5090~80-120 tok/s .. Janela de contexto até 1M fichas

Llama 4 Maverick em um Glance

Meta liberou Llama 4 em abril de 2025. Maverick é a variante de nível médio, compacta o suficiente para uso local sério, inteligente o suficiente para se manter contra GPT-4o Mini na maioria dos pontos de referência.

SpecValorNota.
Arquitetura MoE (128 especialistas) Chave para a viabilidade local.
Paramestres ativos / token ~17B Apenas esta carga em VRAM por passagem para frente
Total params ~400B Armazenamento de disco, não VRAM.
Janela de contexto 1M de fichas O maior de qualquer modelo de peso aberto.
Multimodal Texto + Imagem + Vídeo Nativo, não preso.
Dados de treinamento 30T fichas 2x Llama 3
Tamanho do arquivo do modelo ~207 GB (FP16) Q4 K M ~50–60 GB no disco
Velocidade (reportou) ~126 fichas / seg Via API / nuvem; local varia de acordo com quant

Por quê? RTX 5090 Muda o jogo.

O RTX 4090 foi o anterior campeão da GPU consumidora para IA local. RTX 5090 Não só melhora, ele remove o teto para o que você pode correr sem hardware profissional.

SpecRTX 5090RTX 4090Mudar
VRAM 32 GB GDDR7 24 GB GDDR6X +33%
Largura de banda da memória 1,79 TB/s 1,01 TB/s +78%
FP8 Tensor de transferência Grande salto Baseline Gen-on-gen
RTX 4090 gargalo "Eliminado" Boné de largura de banda —
70B Q4KM se encaixa em uma única GPU. Sim. Parcial —

O 78% de aumento de largura de banda. é o que importa para a inferência do MoE. Cada decisão de roteamento de fichas em Llama 4 MaverickA rede 128 de especialistas atinge a largura de banda da memória. O ônibus mais largo + mais rápido VRAM = o roteamento encolhe dramaticamente.

O que mais guias ignoram Um modelo denso de 70B precisa de ~40-50GB VRAM em Q4 K M - mais do que RTX 5090 - Sim. Llama 4 Maverick É MoE, então só precisa manter ~17B pesos ativos no VRAM. É por isso. Uma única ficha local é realmente possível aqui. - algo que não era verdade para Llama 3 70B.

Método 1: Correr com Ollama - Configuração mais rápida

Ollama. é o caminho mais rápido de zero para a corrida. Um comando de terminal puxa o modelo e inicia um servidor de API local. Se você já está no Linux ou no MacOS, isso é feito em minutos.

Passo 1 - Instale Ollama

Baixe de Ollama.com- Não. Windows, MacOS e Linux são todos suportados. No Windows, Ollama é executado nativamente, sem necessidade de WSL.

Passo 2 - Puxe Llama 4 Maverick

# Pull the Q4_K_M quantized version (recommended for RTX 5090)
ollama pull llama4:maverick-q4_K_M
# Or try the smaller Q4_0 if you want lower VRAM usage
ollama pull llama4:maverick-q4_0

Ollama escolhe automaticamente a quantização certa. A GGUF Q4 K M será baixada e armazenada localmente. O tamanho do arquivo é de 50 a 60 GB. Certifique-se de ter o espaço em disco e uma conexão rápida com a internet para a tração inicial.

Passo 3 - Execute-o

# Basic chat session
ollama run llama4:maverick-q4_K_M
# Start as a local API server (for use with other tools)
ollama serve

Passo 4 - Desempenho de Tune

# Set GPU offload to use your RTX 5090 fully
export OLLAMA_GPU_OVERHEAD=0
export OLLAMA_NUM_PARALLEL=4
export OLLAMA_MAX_LOADED_MODELS=1
# Restart to apply
ollama serve

A variável chave é quantas camadas de modelo você mantém na GPU vs. CPU. Com 32GB de VRAM e Q4K M de quantização, você pode manter Todas as camadas da GPU - Esse é o ponto legal.

Uso real: pedindo revisão de código

Eu me alimentei. Llama 4 Maverick Correndo RTX 5090 Um módulo Python de ~400 linhas e pediu para detectar problemas arquitetônicos. Processou o contexto em 8 segundos, então passou a revisão em 95 tokens/sec. Sem latência da API, sem dados deixando minha máquina, sem cartão de crédito.

Método 2: Corra com o LM Studio - Melhor experiência GUI

LM Studio É um aplicativo de desktop com uma interface limpa, um navegador de modelos embutido, e mais botões para girar do que Ollama. Bom para quem quer ver o que está acontecendo, em vez de olhar para um terminal.

Passo 1 - Baixar e instalar

Consiga o LM Studio de Imstudio.- Não. Disponível para Windows, MacOS e Linux.

Passo 2 - Baixe o modelo

Abra o navegador de modelos embutido. Procurem por "Lama4". Escolha a variante Q4 K M GGUF. O download é executado em segundo plano e mostra progresso na barra lateral.

Passo 3 - Carregar e conversar

Clique em "Modelo de Carga". No painel de configurações:

  • Preparar. GPU Offload Para "Max" - isso empurra todas as camadas para o seu RTX 5090.
  • Preparar. Comprimento do Contexto para as suas necessidades. 8K é bom para a maioria das conversas, 32K se você estiver analisando documentos longos.
  • Ligue. "Mostre estatísticas de conclusão" para assistir tokens/sec ao vivo.

Passo 4 - Opcional: Servidor de API local

LM Studio inclui um servidor local integrado compatível com o OpenAI Formato API. Aponte qualquer coisa. OpenAI Aplicação SDK em http://localhost:1234/v1 E ele se encaminha para o seu modelo local. Não é necessário mudar o código.

□ Ponta profissional no LM Studio, definir a temperatura para 0.7 e ativar Pena configurações para tarefas de programação. Os padrões desviam-se para a escrita criativa, para revisão de código e refatoração, a aleatoriedade ligeiramente menor produz resultados mais consistentes.

Níveis de Quantização explicados

Quantização é como você encolhe um modelo para que ele se encaixe no VRAM disponível. Cada degrau troca um pouco de qualidade por muito menos memória. Aqui está o que realmente esperar em cada nível em RTX 5090:

FormatoVRAM UsadoTamanho do discoQualidadeRTX 5090 Veredito
Q4_K_M ~15–18 GB ~50 GB Quase idêntico ao FP16. Melhor escolha.
Q5_K_M ~18–22 GB ~60 GB Melhora marginal em relação ao Q4 Vale a pena se você tiver uma sala de cabeceira.
Q4_0 ~14-16 GB ~46 GB Um pouco mais baixo que Q4K M Recuar se VRAM estiver apertado
Q3_K_M ~11-13 GB ~35 GB Queda de qualidade notável. Pular para código/razão
FP16 ~85 GB ~207 GB Precisão total. Precisa de multi-GPU.
Q3 K M e abaixo de qualquer coisa abaixo Q3 K M introduz regressão de qualidade visível para geração de código, raciocínio técnico, e structured Saídas. Se você está usando isso para o trabalho de desenvolvimento, fique com Q4 K M mínimo- Não. As economias VRAM não valem a qualidade de saída.

Resultados do Teste Mundial Real sobre RTX 5090

Eu corri três cenários em Llama 4 Maverick Q4KM via Ollama on RTX 5090- Não. Sem escolha de cerejas, isso é o que eu realmente vi na minha mesa.

Scenario Análise de longo-Documento

Deu uma especificação técnica de 45 páginas, PDF, aproximadamente 180 mil fichas. O modelo processou o contexto completo e respondeu perguntas comparativas sobre duas abordagens arquitetônicas discutidas no doutor. Hora da primeira ficha: ~1,2 segundos. Saída: ~88 fichas/seg.

O que tropeçou nisso?Quando perguntei sobre uma nota de rodapé na página 32 que contradizia uma reclamação na página 8, às vezes citou a errada. A janela de contexto 1M é impressionante, mas a referência cruzada entre documentos enormes ainda precisa de uma segunda passagem.

Scenario Geração de Códigos

Pedi para escrever um ponto final FastAPI com middleware de autenticação, validação de entrada e chamadas de banco de dados. Gerou uma implementação limpa e funcional em 4 segundos de saída. Fiz os testes. 3 de 4 passaram na primeira tentativa. Uma falha foi devido a uma importação perdida que tive que adicionar manualmente.

O que eu noteiEscreve Python idiomático sem muita motivação. Não o código genérico "aqui está um exemplo simples" que você obtém de modelos mais fracos - ele pegou nos padrões existentes do projeto e combinou com eles.

Scenario 3: Razão de várias voltas

Tive uma conversa de 12 mensagens sobre otimizar uma estratégia de cache distribuída. Cada mensagem adicionava novas restrições. Llama 4 Maverick Rastreei todos eles e construímos respostas anteriores coerentemente. Não há repetição ou perda de contexto.

Tokens/Segundo Resumo

Contexto 4K (chat) ~110 tok/s 32K Contexto ~88 tok/s 256K Contexto ~75 tok/s

Medida em RTX 5090, Q4 K M quantização, Llama 4 Maverick via Ollama. Seus números variam de acordo com a configuração do sistema.

O gargalo escondido que ninguém fala

Eis o que cada guia sente falta: A velocidade do seu drive NVMe controla a velocidade do modelo em VRAM.E controla o quão ruim o desempenho cai quando o VRAM acaba e o sistema começa a trocar.

Llama 4 Maverick Q4 K M é de 50 GB no disco. Em um NVMe Gen4 (7,000 MB/s read), carga inicial leva cerca de 7-8 segundos.- Não. Em um SSD SATA (550 MB/s), você está olhando para 90+ segundos- Não. Isso é antes de você receber seu primeiro token.

Mais importante: se você está empurrando para 32K+ janelas de contexto e o cache KV excede VRAM, o sistema descarrega para RAM ou disco. Um drive de troca lenta transforma seu modelo de 100 tok/s em 3 tok/s. - literalmente se torna inutilizável.

Lista de verificação prática antes de começar:

  • Use um NVMe Gen4 ou melhor para armazenamento de modelos. Seu drive operacional funciona se for NVM.
  • Mantenha pelo menos 20 GB livre no drive segurando o arquivo do modelo.
  • Defina seu diretório de modelos Ollama/LM Studio para um NVMe, não um HDD ou SSD SATA.
  • Monitore o uso do VRAM enquanto corre. Se você vê-lo aproximar 30GB, reduzir o comprimento do contexto antes de você bater swap.
- O que é isso? Linux no Windows, o modelo de memória compartilhada de Ollama para descarga de GPU às vezes se comporta inconsistentemente com janelas de contexto muito grandes. Se você atingir problemas de estabilidade no contexto 32K+ no Windows, tente Linux (WSL2 ou nativo) - o desempenho e a estabilidade são reais para este caso de uso.

Como se embala contra alternativas

ModeloLocal em RTX 5090VRAMVelocidadePrivacidadeMelhor para
Llama 4 Maverick GPU completo. ~15–18 GB ~90-110 tok/s 100% local. Tarefas gerais, código, raciocínio.
Llama 3.3 70B (densa) Desembarque parcial ~40 GB ~25–40 tok/s 100% local. Mesma tarefa, mais devagar.
Mistral Small 24B GPU completo. ~14 GB ~130 tok/s 100% local. Tarefas rápidas e leves.
GPT-4o Mini (API) Só Nuvem — Varias Máquina de folhas de dados Conveniência, multimodalidade
Mistral Grande Claude (API) Só Nuvem — Varias Máquina de folhas de dados Tarefas de alta qualidade.

Minha tomada depois de usar tudo isso.: Llama 4 Maverick on RTX 5090 - É o melhor lugar. É rápido o suficiente, inteligente o suficiente, e totalmente privado. Você troca alguma qualidade máxima em comparação com GPT-4o, mas você tem zero custos de API, zero picos de latência, e seu código nunca sai da sua máquina.

Por que correr localmente?

  • Sem custos de API. Funciona na sua GPU, custo de hardware plano.
  • 100% de privacidade de dados, nada sai da sua máquina.
  • Sem limites de taxa ou tempo de inatividade do servidor.
  • Afinações personalizadas ficam em particular.
  • Funciona off-line

⇩ Quando usar API

  • Multimodal (imagem/vídeo) - visão local ainda limitada
  • Sessões muito longas com contexto enorme - VRAM caps a 32GB
  • Modelos acima de 70B - precisa de multi-GPU
  • Quando você precisa do melhor raciocínio absoluto - modelos de fronteira ainda ganham

Perguntas frequentes

Can RTX 5090 Na verdade, correr Llama 4 Maverick 70B localmente?

Sim, e GPU único. Llama 4 Maverick Apenas ~17B parâmetros ativados por token. Q4 K M quantização usa ~15-18GB VRAM. RTX 509032GB deixa espaço para o cache KV em 32K+ contexto. Dupla. RTX 5090 é opcional, não é necessário.

Qual é o mínimo de RTX GPU para Llama 4 Maverick?

RTX 4090 com 24GB trabalha para Llama 4 Maverick No Q4 K M - você precisará descarregar algumas camadas para CPU, mas é utilizável. RTX 3080 12GB vai lutar e provavelmente trocar para RAM. RTX 5090 É o ponto ideal para inferência de GPU.

Preciso de uma versão específica do Ollama ou do LM Studio?

Use a última versão de ambos em abril de 2026. Ollama 0,5+ e LM Studio 0,3+ têm suporte adequado para GGUF. Versões mais antigas podem carregar o modelo incorretamente ou não ter otimização MoE.

Quão rápido é Llama 4 Maverick on RTX 5090?

Q4 K M quantização, contexto 4K: ~100-110 tokens/sec. Em 32K contexto: ~85-90 tokens / sec. Em 256K contexto: ~70-80 tokens/sec. Estes são medidos em um estoque RTX 5090 Sem overclocking.

Posso afinar? Llama 4 Maverick on RTX 5090?

Afinação completa: não, isso precisa de 80GB+. Sim, você pode colocar pesos de 4 bits em 32GB. Funciona, mas espere 20-40 minutos por época dependendo do tamanho do lote. Bom para adaptadores específicos, não para reciclagem completa.

Próximo Passo

Instale Ollama, puxe o Q4 K M GGUF, e execute sua primeira inferência local hoje. Comece com uma tarefa que você atualmente paga uma API para - compare a qualidade de saída você mesmo. É o único parâmetro que importa para o seu fluxo de trabalho.

Quero comparar. RTX 5090 contra outras GPUs para IA local? Veja o ranking completo de ferramentas de IA. AIListPrime - atualizado semanalmente com dados reais.

Navegue nas ferramentas de IA. AIListPrime →