IA local - Abril de 2026

Como correr Llama 4 Maverick 70B em RTX 5090

Llama 4 Maverick É um modelo MoE - apenas 17B params fogo por token. Isso muda completamente a matemática do VRAM. Aqui está a configuração exata, comandos e referências reais.

✍️ AIListPrime Editorial 19 de abril de 2026 9 min read

A Resposta Curta

Llama 4 Maverick Corre em um Solteiro. RTX 5090 - sem GPUs duplas, sem servidor. A razão: é um modelo de mistura de especialistas (MoE). Apenas ~17B de seus ~400B parâmetros totais ativados por token. Isso reduz os requisitos do VRAM a aproximadamente 15-18GB Com a quantização Q4 K M, bem dentro RTX 5090É 32GB.

Você precisa de duas coisas: Ollama ou LM Studio, e um GGUF-formatado Llama 4 Maverick Peso. A instalação leva menos de 20 minutos quando você tem as ferramentas instaladas.

.. Params ativos ~17B / token .. VRAM (Q4 K M) ~15-18 GB .. Velocidade (RTX 5090~80-120 tok/s .. Janela de contexto até 1M fichas

Llama 4 Maverick em um Glance

Meta liberou Llama 4 em abril de 2025. Maverick é a variante de nível médio, compacta o suficiente para uso local sério, inteligente o suficiente para se manter contra GPT-4o Mini na maioria dos pontos de referência.

SpecValorNota.
Arquitetura MoE (128 especialistas) Chave para a viabilidade local.
Paramestres ativos / token ~17B Apenas esta carga em VRAM por passagem para frente
Total params ~400B Armazenamento de disco, não VRAM.
Janela de contexto 1M de fichas O maior de qualquer modelo de peso aberto.
Multimodal Texto + Imagem + Vídeo Nativo, não preso.
Dados de treinamento 30T fichas 2x Llama 3
Tamanho do arquivo do modelo ~207 GB (FP16) Q4 K M ~50–60 GB no disco
Velocidade (reportou) ~126 fichas / seg Via API / nuvem; local varia de acordo com quant

Por quê? RTX 5090 Muda o jogo.

O RTX 4090 foi o anterior campeão da GPU consumidora para IA local. RTX 5090 Não só melhora, ele remove o teto para o que você pode correr sem hardware profissional.

SpecRTX 5090RTX 4090Mudar
VRAM 32 GB GDDR7 24 GB GDDR6X +33%
Largura de banda da memória 1,79 TB/s 1,01 TB/s +78%
FP8 Tensor de transferência Grande salto Baseline Gen-on-gen
RTX 4090 gargalo "Eliminado" Boné de largura de banda
70B Q4KM se encaixa em uma única GPU. Sim. Parcial

O 78% de aumento de largura de banda. é o que importa para a inferência do MoE. Cada decisão de roteamento de fichas em Llama 4 MaverickA rede 128 de especialistas atinge a largura de banda da memória. O ônibus mais largo + mais rápido VRAM = o roteamento encolhe dramaticamente.

O que mais guias ignoram Um modelo denso de 70B precisa de ~40-50GB VRAM em Q4 K M - mais do que RTX 5090 - Sim. Llama 4 Maverick É MoE, então só precisa manter ~17B pesos ativos no VRAM. É por isso. Uma única ficha local é realmente possível aqui. - algo que não era verdade para Llama 3 70B.

Método 1: Correr com Ollama - Configuração mais rápida

Ollama. é o caminho mais rápido de zero para a corrida. Um comando de terminal puxa o modelo e inicia um servidor de API local. Se você já está no Linux ou no MacOS, isso é feito em minutos.

Passo 1 - Instale Ollama

Baixe de Ollama.com- Não. Windows, MacOS e Linux são todos suportados. No Windows, Ollama é executado nativamente, sem necessidade de WSL.

Passo 2 - Puxe Llama 4 Maverick

# Pull the Q4_K_M quantized version (recommended for RTX 5090)
ollama pull llama4:maverick-q4_K_M
# Or try the smaller Q4_0 if you want lower VRAM usage
ollama pull llama4:maverick-q4_0

Ollama escolhe automaticamente a quantização certa. A GGUF Q4 K M será baixada e armazenada localmente. O tamanho do arquivo é de 50 a 60 GB. Certifique-se de ter o espaço em disco e uma conexão rápida com a internet para a tração inicial.

Passo 3 - Execute-o

# Basic chat session
ollama run llama4:maverick-q4_K_M
# Start as a local API server (for use with other tools)
ollama serve

Passo 4 - Desempenho de Tune

# Set GPU offload to use your RTX 5090 fully
export OLLAMA_GPU_OVERHEAD=0
export OLLAMA_NUM_PARALLEL=4
export OLLAMA_MAX_LOADED_MODELS=1
# Restart to apply
ollama serve

A variável chave é quantas camadas de modelo você mantém na GPU vs. CPU. Com 32GB de VRAM e Q4K M de quantização, você pode manter Todas as camadas da GPU - Esse é o ponto legal.

Uso real: pedindo revisão de código

Eu me alimentei. Llama 4 Maverick Correndo RTX 5090 Um módulo Python de ~400 linhas e pediu para detectar problemas arquitetônicos. Processou o contexto em 8 segundos, então passou a revisão em 95 tokens/sec. Sem latência da API, sem dados deixando minha máquina, sem cartão de crédito.

Método 2: Corra com o LM Studio - Melhor experiência GUI

LM Studio É um aplicativo de desktop com uma interface limpa, um navegador de modelos embutido, e mais botões para girar do que Ollama. Bom para quem quer ver o que está acontecendo, em vez de olhar para um terminal.

Passo 1 - Baixar e instalar

Consiga o LM Studio de Imstudio.- Não. Disponível para Windows, MacOS e Linux.

Passo 2 - Baixe o modelo

Abra o navegador de modelos embutido. Procurem por "Lama4". Escolha a variante Q4 K M GGUF. O download é executado em segundo plano e mostra progresso na barra lateral.

Passo 3 - Carregar e conversar

Clique em "Modelo de Carga". No painel de configurações:

  • Preparar. GPU Offload Para "Max" - isso empurra todas as camadas para o seu RTX 5090.
  • Preparar. Comprimento do Contexto para as suas necessidades. 8K é bom para a maioria das conversas, 32K se você estiver analisando documentos longos.
  • Ligue. "Mostre estatísticas de conclusão" para assistir tokens/sec ao vivo.

Passo 4 - Opcional: Servidor de API local

LM Studio inclui um servidor local integrado compatível com o OpenAI Formato API. Aponte qualquer coisa. OpenAI Aplicação SDK em http://localhost:1234/v1 E ele se encaminha para o seu modelo local. Não é necessário mudar o código.

□ Ponta profissional no LM Studio, definir a temperatura para 0.7 e ativar Pena configurações para tarefas de programação. Os padrões desviam-se para a escrita criativa, para revisão de código e refatoração, a aleatoriedade ligeiramente menor produz resultados mais consistentes.

Níveis de Quantização explicados

Quantização é como você encolhe um modelo para que ele se encaixe no VRAM disponível. Cada degrau troca um pouco de qualidade por muito menos memória. Aqui está o que realmente esperar em cada nível em RTX 5090:

FormatoVRAM UsadoTamanho do discoQualidadeRTX 5090 Veredito
Q4_K_M ~15–18 GB ~50 GB Quase idêntico ao FP16. Melhor escolha.
Q5_K_M ~18–22 GB ~60 GB Melhora marginal em relação ao Q4 Vale a pena se você tiver uma sala de cabeceira.
Q4_0 ~14-16 GB ~46 GB Um pouco mais baixo que Q4K M Recuar se VRAM estiver apertado
Q3_K_M ~11-13 GB ~35 GB Queda de qualidade notável. Pular para código/razão
FP16 ~85 GB ~207 GB Precisão total. Precisa de multi-GPU.
Q3 K M e abaixo de qualquer coisa abaixo Q3 K M introduz regressão de qualidade visível para geração de código, raciocínio técnico, e structured Saídas. Se você está usando isso para o trabalho de desenvolvimento, fique com Q4 K M mínimo- Não. As economias VRAM não valem a qualidade de saída.

Resultados do Teste Mundial Real sobre RTX 5090

Eu corri três cenários em Llama 4 Maverick Q4KM via Ollama on RTX 5090- Não. Sem escolha de cerejas, isso é o que eu realmente vi na minha mesa.

Scenario Análise de longo-Documento

Deu uma especificação técnica de 45 páginas, PDF, aproximadamente 180 mil fichas. O modelo processou o contexto completo e respondeu perguntas comparativas sobre duas abordagens arquitetônicas discutidas no doutor. Hora da primeira ficha: ~1,2 segundos. Saída: ~88 fichas/seg.

O que tropeçou nisso?Quando perguntei sobre uma nota de rodapé na página 32 que contradizia uma reclamação na página 8, às vezes citou a errada. A janela de contexto 1M é impressionante, mas a referência cruzada entre documentos enormes ainda precisa de uma segunda passagem.

Scenario Geração de Códigos

Pedi para escrever um ponto final FastAPI com middleware de autenticação, validação de entrada e chamadas de banco de dados. Gerou uma implementação limpa e funcional em 4 segundos de saída. Fiz os testes. 3 de 4 passaram na primeira tentativa. Uma falha foi devido a uma importação perdida que tive que adicionar manualmente.

O que eu noteiEscreve Python idiomático sem muita motivação. Não o código genérico "aqui está um exemplo simples" que você obtém de modelos mais fracos - ele pegou nos padrões existentes do projeto e combinou com eles.

Scenario 3: Razão de várias voltas

Tive uma conversa de 12 mensagens sobre otimizar uma estratégia de cache distribuída. Cada mensagem adicionava novas restrições. Llama 4 Maverick Rastreei todos eles e construímos respostas anteriores coerentemente. Não há repetição ou perda de contexto.

Tokens/Segundo Resumo

Contexto 4K (chat) ~110 tok/s 32K Contexto ~88 tok/s 256K Contexto ~75 tok/s

Medida em RTX 5090, Q4 K M quantização, Llama 4 Maverick via Ollama. Seus números variam de acordo com a configuração do sistema.

O gargalo escondido que ninguém fala

Eis o que cada guia sente falta: A velocidade do seu drive NVMe controla a velocidade do modelo em VRAM.E controla o quão ruim o desempenho cai quando o VRAM acaba e o sistema começa a trocar.

Llama 4 Maverick Q4 K M é de 50 GB no disco. Em um NVMe Gen4 (7,000 MB/s read), carga inicial leva cerca de 7-8 segundos.- Não. Em um SSD SATA (550 MB/s), você está olhando para 90+ segundos- Não. Isso é antes de você receber seu primeiro token.

Mais importante: se você está empurrando para 32K+ janelas de contexto e o cache KV excede VRAM, o sistema descarrega para RAM ou disco. Um drive de troca lenta transforma seu modelo de 100 tok/s em 3 tok/s. - literalmente se torna inutilizável.

Lista de verificação prática antes de começar:

  • Use um NVMe Gen4 ou melhor para armazenamento de modelos. Seu drive operacional funciona se for NVM.
  • Mantenha pelo menos 20 GB livre no drive segurando o arquivo do modelo.
  • Defina seu diretório de modelos Ollama/LM Studio para um NVMe, não um HDD ou SSD SATA.
  • Monitore o uso do VRAM enquanto corre. Se você vê-lo aproximar 30GB, reduzir o comprimento do contexto antes de você bater swap.
- O que é isso? Linux no Windows, o modelo de memória compartilhada de Ollama para descarga de GPU às vezes se comporta inconsistentemente com janelas de contexto muito grandes. Se você atingir problemas de estabilidade no contexto 32K+ no Windows, tente Linux (WSL2 ou nativo) - o desempenho e a estabilidade são reais para este caso de uso.

Como se embala contra alternativas

ModeloLocal em RTX 5090VRAMVelocidadePrivacidadeMelhor para
Llama 4 Maverick GPU completo. ~15–18 GB ~90-110 tok/s 100% local. Tarefas gerais, código, raciocínio.
Llama 3.3 70B (densa) Desembarque parcial ~40 GB ~25–40 tok/s 100% local. Mesma tarefa, mais devagar.
Mistral Small 24B GPU completo. ~14 GB ~130 tok/s 100% local. Tarefas rápidas e leves.
GPT-4o Mini (API) Só Nuvem Varias Máquina de folhas de dados Conveniência, multimodalidade
Mistral Grande Claude (API) Só Nuvem Varias Máquina de folhas de dados Tarefas de alta qualidade.

Minha tomada depois de usar tudo isso.: Llama 4 Maverick on RTX 5090 - É o melhor lugar. É rápido o suficiente, inteligente o suficiente, e totalmente privado. Você troca alguma qualidade máxima em comparação com GPT-4o, mas você tem zero custos de API, zero picos de latência, e seu código nunca sai da sua máquina.

Por que correr localmente?

  • Sem custos de API. Funciona na sua GPU, custo de hardware plano.
  • 100% de privacidade de dados, nada sai da sua máquina.
  • Sem limites de taxa ou tempo de inatividade do servidor.
  • Afinações personalizadas ficam em particular.
  • Funciona off-line

⇩ Quando usar API

  • Multimodal (imagem/vídeo) - visão local ainda limitada
  • Sessões muito longas com contexto enorme - VRAM caps a 32GB
  • Modelos acima de 70B - precisa de multi-GPU
  • Quando você precisa do melhor raciocínio absoluto - modelos de fronteira ainda ganham

Perguntas frequentes

Can RTX 5090 Na verdade, correr Llama 4 Maverick 70B localmente?

Sim, e GPU único. Llama 4 Maverick Apenas ~17B parâmetros ativados por token. Q4 K M quantização usa ~15-18GB VRAM. RTX 509032GB deixa espaço para o cache KV em 32K+ contexto. Dupla. RTX 5090 é opcional, não é necessário.

Qual é o mínimo de RTX GPU para Llama 4 Maverick?

RTX 4090 com 24GB trabalha para Llama 4 Maverick No Q4 K M - você precisará descarregar algumas camadas para CPU, mas é utilizável. RTX 3080 12GB vai lutar e provavelmente trocar para RAM. RTX 5090 É o ponto ideal para inferência de GPU.

Preciso de uma versão específica do Ollama ou do LM Studio?

Use a última versão de ambos em abril de 2026. Ollama 0,5+ e LM Studio 0,3+ têm suporte adequado para GGUF. Versões mais antigas podem carregar o modelo incorretamente ou não ter otimização MoE.

Quão rápido é Llama 4 Maverick on RTX 5090?

Q4 K M quantização, contexto 4K: ~100-110 tokens/sec. Em 32K contexto: ~85-90 tokens / sec. Em 256K contexto: ~70-80 tokens/sec. Estes são medidos em um estoque RTX 5090 Sem overclocking.

Posso afinar? Llama 4 Maverick on RTX 5090?

Afinação completa: não, isso precisa de 80GB+. Sim, você pode colocar pesos de 4 bits em 32GB. Funciona, mas espere 20-40 minutos por época dependendo do tamanho do lote. Bom para adaptadores específicos, não para reciclagem completa.

Próximo Passo

Instale Ollama, puxe o Q4 K M GGUF, e execute sua primeira inferência local hoje. Comece com uma tarefa que você atualmente paga uma API para - compare a qualidade de saída você mesmo. É o único parâmetro que importa para o seu fluxo de trabalho.

Quero comparar. RTX 5090 contra outras GPUs para IA local? Veja o ranking completo de ferramentas de IA. AIListPrime - atualizado semanalmente com dados reais.

Navegue nas ferramentas de IA. AIListPrime →