Como correr Llama 4 Maverick 70B em RTX 5090
Llama 4 Maverick É um modelo MoE - apenas 17B params fogo por token. Isso muda completamente a matemática do VRAM. Aqui está a configuração exata, comandos e referências reais.
✍️ AIListPrime Editorial 19 de abril de 2026 9 min readA Resposta Curta
Llama 4 Maverick Corre em um Solteiro. RTX 5090 - sem GPUs duplas, sem servidor. A razão: é um modelo de mistura de especialistas (MoE). Apenas ~17B de seus ~400B parâmetros totais ativados por token. Isso reduz os requisitos do VRAM a aproximadamente 15-18GB Com a quantização Q4 K M, bem dentro RTX 5090É 32GB.
Você precisa de duas coisas: Ollama ou LM Studio, e um GGUF-formatado Llama 4 Maverick Peso. A instalação leva menos de 20 minutos quando você tem as ferramentas instaladas.
.. Params ativos ~17B / token .. VRAM (Q4 K M) ~15-18 GB .. Velocidade (RTX 5090~80-120 tok/s .. Janela de contexto até 1M fichasLlama 4 Maverick em um Glance
Meta liberou Llama 4 em abril de 2025. Maverick é a variante de nível médio, compacta o suficiente para uso local sério, inteligente o suficiente para se manter contra GPT-4o Mini na maioria dos pontos de referência.
| Spec | Valor | Nota. |
|---|---|---|
| Arquitetura | MoE (128 especialistas) | Chave para a viabilidade local. |
| Paramestres ativos / token | ~17B | Apenas esta carga em VRAM por passagem para frente |
| Total params | ~400B | Armazenamento de disco, não VRAM. |
| Janela de contexto | 1M de fichas | O maior de qualquer modelo de peso aberto. |
| Multimodal | Texto + Imagem + Vídeo | Nativo, não preso. |
| Dados de treinamento | 30T fichas | 2x Llama 3 |
| Tamanho do arquivo do modelo | ~207 GB (FP16) | Q4 K M ~50–60 GB no disco |
| Velocidade (reportou) | ~126 fichas / seg | Via API / nuvem; local varia de acordo com quant |
Por quê? RTX 5090 Muda o jogo.
O RTX 4090 foi o anterior campeão da GPU consumidora para IA local. RTX 5090 Não só melhora, ele remove o teto para o que você pode correr sem hardware profissional.
| Spec | RTX 5090 | RTX 4090 | Mudar |
|---|---|---|---|
| VRAM | 32 GB GDDR7 | 24 GB GDDR6X | +33% |
| Largura de banda da memória | 1,79 TB/s | 1,01 TB/s | +78% |
| FP8 Tensor de transferência | Grande salto | Baseline | Gen-on-gen |
| RTX 4090 gargalo | "Eliminado" | Boné de largura de banda | — |
| 70B Q4KM se encaixa em uma única GPU. | Sim. | Parcial | — |
O 78% de aumento de largura de banda. é o que importa para a inferência do MoE. Cada decisão de roteamento de fichas em Llama 4 MaverickA rede 128 de especialistas atinge a largura de banda da memória. O ônibus mais largo + mais rápido VRAM = o roteamento encolhe dramaticamente.
O que mais guias ignoram Um modelo denso de 70B precisa de ~40-50GB VRAM em Q4 K M - mais do que RTX 5090 - Sim. Llama 4 Maverick É MoE, então só precisa manter ~17B pesos ativos no VRAM. É por isso. Uma única ficha local é realmente possível aqui. - algo que não era verdade para Llama 3 70B.Método 1: Correr com Ollama - Configuração mais rápida
Ollama. é o caminho mais rápido de zero para a corrida. Um comando de terminal puxa o modelo e inicia um servidor de API local. Se você já está no Linux ou no MacOS, isso é feito em minutos.
Passo 1 - Instale Ollama
Baixe de Ollama.com- Não. Windows, MacOS e Linux são todos suportados. No Windows, Ollama é executado nativamente, sem necessidade de WSL.
Passo 2 - Puxe Llama 4 Maverick
# Pull the Q4_K_M quantized version (recommended for RTX 5090)
ollama pull llama4:maverick-q4_K_M
# Or try the smaller Q4_0 if you want lower VRAM usage
ollama pull llama4:maverick-q4_0
Ollama escolhe automaticamente a quantização certa. A GGUF Q4 K M será baixada e armazenada localmente. O tamanho do arquivo é de 50 a 60 GB. Certifique-se de ter o espaço em disco e uma conexão rápida com a internet para a tração inicial.
Passo 3 - Execute-o
# Basic chat session
ollama run llama4:maverick-q4_K_M
# Start as a local API server (for use with other tools)
ollama serve
Passo 4 - Desempenho de Tune
# Set GPU offload to use your RTX 5090 fully
export OLLAMA_GPU_OVERHEAD=0
export OLLAMA_NUM_PARALLEL=4
export OLLAMA_MAX_LOADED_MODELS=1
# Restart to apply
ollama serve
A variável chave é quantas camadas de modelo você mantém na GPU vs. CPU. Com 32GB de VRAM e Q4K M de quantização, você pode manter Todas as camadas da GPU - Esse é o ponto legal.
Uso real: pedindo revisão de código
Eu me alimentei. Llama 4 Maverick Correndo RTX 5090 Um módulo Python de ~400 linhas e pediu para detectar problemas arquitetônicos. Processou o contexto em 8 segundos, então passou a revisão em 95 tokens/sec. Sem latência da API, sem dados deixando minha máquina, sem cartão de crédito.
Método 2: Corra com o LM Studio - Melhor experiência GUI
LM Studio É um aplicativo de desktop com uma interface limpa, um navegador de modelos embutido, e mais botões para girar do que Ollama. Bom para quem quer ver o que está acontecendo, em vez de olhar para um terminal.
Passo 1 - Baixar e instalar
Consiga o LM Studio de Imstudio.- Não. Disponível para Windows, MacOS e Linux.
Passo 2 - Baixe o modelo
Abra o navegador de modelos embutido. Procurem por "Lama4". Escolha a variante Q4 K M GGUF. O download é executado em segundo plano e mostra progresso na barra lateral.
Passo 3 - Carregar e conversar
Clique em "Modelo de Carga". No painel de configurações:
- Preparar. GPU Offload Para "Max" - isso empurra todas as camadas para o seu RTX 5090.
- Preparar. Comprimento do Contexto para as suas necessidades. 8K é bom para a maioria das conversas, 32K se você estiver analisando documentos longos.
- Ligue. "Mostre estatísticas de conclusão" para assistir tokens/sec ao vivo.
Passo 4 - Opcional: Servidor de API local
LM Studio inclui um servidor local integrado compatível com o OpenAI Formato API. Aponte qualquer coisa. OpenAI Aplicação SDK em http://localhost:1234/v1 E ele se encaminha para o seu modelo local. Não é necessário mudar o código.
Níveis de Quantização explicados
Quantização é como você encolhe um modelo para que ele se encaixe no VRAM disponível. Cada degrau troca um pouco de qualidade por muito menos memória. Aqui está o que realmente esperar em cada nível em RTX 5090:
| Formato | VRAM Usado | Tamanho do disco | Qualidade | RTX 5090 Veredito |
|---|---|---|---|---|
| Q4_K_M | ~15–18 GB | ~50 GB | Quase idêntico ao FP16. | Melhor escolha. |
| Q5_K_M | ~18–22 GB | ~60 GB | Melhora marginal em relação ao Q4 | Vale a pena se você tiver uma sala de cabeceira. |
| Q4_0 | ~14-16 GB | ~46 GB | Um pouco mais baixo que Q4K M | Recuar se VRAM estiver apertado |
| Q3_K_M | ~11-13 GB | ~35 GB | Queda de qualidade notável. | Pular para código/razão |
| FP16 | ~85 GB | ~207 GB | Precisão total. | Precisa de multi-GPU. |
Resultados do Teste Mundial Real sobre RTX 5090
Eu corri três cenários em Llama 4 Maverick Q4KM via Ollama on RTX 5090- Não. Sem escolha de cerejas, isso é o que eu realmente vi na minha mesa.
Scenario Análise de longo-Documento
Deu uma especificação técnica de 45 páginas, PDF, aproximadamente 180 mil fichas. O modelo processou o contexto completo e respondeu perguntas comparativas sobre duas abordagens arquitetônicas discutidas no doutor. Hora da primeira ficha: ~1,2 segundos. Saída: ~88 fichas/seg.
O que tropeçou nisso?Quando perguntei sobre uma nota de rodapé na página 32 que contradizia uma reclamação na página 8, às vezes citou a errada. A janela de contexto 1M é impressionante, mas a referência cruzada entre documentos enormes ainda precisa de uma segunda passagem.
Scenario Geração de Códigos
Pedi para escrever um ponto final FastAPI com middleware de autenticação, validação de entrada e chamadas de banco de dados. Gerou uma implementação limpa e funcional em 4 segundos de saída. Fiz os testes. 3 de 4 passaram na primeira tentativa. Uma falha foi devido a uma importação perdida que tive que adicionar manualmente.
O que eu noteiEscreve Python idiomático sem muita motivação. Não o código genérico "aqui está um exemplo simples" que você obtém de modelos mais fracos - ele pegou nos padrões existentes do projeto e combinou com eles.
Scenario 3: Razão de várias voltas
Tive uma conversa de 12 mensagens sobre otimizar uma estratégia de cache distribuída. Cada mensagem adicionava novas restrições. Llama 4 Maverick Rastreei todos eles e construímos respostas anteriores coerentemente. Não há repetição ou perda de contexto.
Tokens/Segundo Resumo
Contexto 4K (chat) ~110 tok/s 32K Contexto ~88 tok/s 256K Contexto ~75 tok/sMedida em RTX 5090, Q4 K M quantização, Llama 4 Maverick via Ollama. Seus números variam de acordo com a configuração do sistema.
O gargalo escondido que ninguém fala
Eis o que cada guia sente falta: A velocidade do seu drive NVMe controla a velocidade do modelo em VRAM.E controla o quão ruim o desempenho cai quando o VRAM acaba e o sistema começa a trocar.
Llama 4 Maverick Q4 K M é de 50 GB no disco. Em um NVMe Gen4 (7,000 MB/s read), carga inicial leva cerca de 7-8 segundos.- Não. Em um SSD SATA (550 MB/s), você está olhando para 90+ segundos- Não. Isso é antes de você receber seu primeiro token.
Mais importante: se você está empurrando para 32K+ janelas de contexto e o cache KV excede VRAM, o sistema descarrega para RAM ou disco. Um drive de troca lenta transforma seu modelo de 100 tok/s em 3 tok/s. - literalmente se torna inutilizável.
Lista de verificação prática antes de começar:
- Use um NVMe Gen4 ou melhor para armazenamento de modelos. Seu drive operacional funciona se for NVM.
- Mantenha pelo menos 20 GB livre no drive segurando o arquivo do modelo.
- Defina seu diretório de modelos Ollama/LM Studio para um NVMe, não um HDD ou SSD SATA.
- Monitore o uso do VRAM enquanto corre. Se você vê-lo aproximar 30GB, reduzir o comprimento do contexto antes de você bater swap.
Como se embala contra alternativas
| Modelo | Local em RTX 5090 | VRAM | Velocidade | Privacidade | Melhor para |
|---|---|---|---|---|---|
| Llama 4 Maverick | GPU completo. | ~15–18 GB | ~90-110 tok/s | 100% local. | Tarefas gerais, código, raciocínio. |
| Llama 3.3 70B (densa) | Desembarque parcial | ~40 GB | ~25–40 tok/s | 100% local. | Mesma tarefa, mais devagar. |
| Mistral Small 24B | GPU completo. | ~14 GB | ~130 tok/s | 100% local. | Tarefas rápidas e leves. |
| GPT-4o Mini (API) | Só Nuvem | — | Varias | Máquina de folhas de dados | Conveniência, multimodalidade |
| Mistral Grande Claude (API) | Só Nuvem | — | Varias | Máquina de folhas de dados | Tarefas de alta qualidade. |
Minha tomada depois de usar tudo isso.: Llama 4 Maverick on RTX 5090 - É o melhor lugar. É rápido o suficiente, inteligente o suficiente, e totalmente privado. Você troca alguma qualidade máxima em comparação com GPT-4o, mas você tem zero custos de API, zero picos de latência, e seu código nunca sai da sua máquina.
Por que correr localmente?
- Sem custos de API. Funciona na sua GPU, custo de hardware plano.
- 100% de privacidade de dados, nada sai da sua máquina.
- Sem limites de taxa ou tempo de inatividade do servidor.
- Afinações personalizadas ficam em particular.
- Funciona off-line
⇩ Quando usar API
- Multimodal (imagem/vídeo) - visão local ainda limitada
- Sessões muito longas com contexto enorme - VRAM caps a 32GB
- Modelos acima de 70B - precisa de multi-GPU
- Quando você precisa do melhor raciocínio absoluto - modelos de fronteira ainda ganham
Perguntas frequentes
Can RTX 5090 Na verdade, correr Llama 4 Maverick 70B localmente?
Sim, e GPU único. Llama 4 Maverick Apenas ~17B parâmetros ativados por token. Q4 K M quantização usa ~15-18GB VRAM. RTX 509032GB deixa espaço para o cache KV em 32K+ contexto. Dupla. RTX 5090 é opcional, não é necessário.
Qual é o mínimo de RTX GPU para Llama 4 Maverick?
RTX 4090 com 24GB trabalha para Llama 4 Maverick No Q4 K M - você precisará descarregar algumas camadas para CPU, mas é utilizável. RTX 3080 12GB vai lutar e provavelmente trocar para RAM. RTX 5090 É o ponto ideal para inferência de GPU.
Preciso de uma versão específica do Ollama ou do LM Studio?
Use a última versão de ambos em abril de 2026. Ollama 0,5+ e LM Studio 0,3+ têm suporte adequado para GGUF. Versões mais antigas podem carregar o modelo incorretamente ou não ter otimização MoE.
Quão rápido é Llama 4 Maverick on RTX 5090?
Q4 K M quantização, contexto 4K: ~100-110 tokens/sec. Em 32K contexto: ~85-90 tokens / sec. Em 256K contexto: ~70-80 tokens/sec. Estes são medidos em um estoque RTX 5090 Sem overclocking.
Posso afinar? Llama 4 Maverick on RTX 5090?
Afinação completa: não, isso precisa de 80GB+. Sim, você pode colocar pesos de 4 bits em 32GB. Funciona, mas espere 20-40 minutos por época dependendo do tamanho do lote. Bom para adaptadores específicos, não para reciclagem completa.
Próximo Passo
Instale Ollama, puxe o Q4 K M GGUF, e execute sua primeira inferência local hoje. Comece com uma tarefa que você atualmente paga uma API para - compare a qualidade de saída você mesmo. É o único parâmetro que importa para o seu fluxo de trabalho.
Quero comparar. RTX 5090 contra outras GPUs para IA local? Veja o ranking completo de ferramentas de IA. AIListPrime - atualizado semanalmente com dados reais.
Navegue nas ferramentas de IA. AIListPrime →