Você consegue rodar o Llama 4 Maverick em um RTX 5090? Limites práticos
O guia anterior tratou incorretamente o Llama 4 Maverick como um modelo 70B que cabe inteiramente em 15–18 GB de VRAM. O cartão de modelo da Meta diz que Maverick é um modelo misto de especialistas com 17B de parâmetros ativados e 400B de parâmetros totais. Os parâmetros ativados descrevem a computação por token; eles não significam que apenas pesos de 17B devem ser armazenados.
Esta página substitui uma versão anterior com informações desatualizadas ou alegações sem comprovação.
Dados verificados
Meta lista o Llama 4 Maverick como parâmetros ativados de 17B, 128 especialistas e parâmetros totais de 400B com uma janela de contexto de 1M.
Meta distribui pesos BF16 e FP8 e diz que os pesos oficiais de FP8 cabem em um único host H100 DGX, não uma GPU de consumidor de 32 GB.
Uma quantização de terceiros pode usar RAM do sistema, CPU ou descarregamento de disco, mas isso é diferente de manter o modelo completo em RTX 5090 VRAM.
Os antigos comandos Ollama, reivindicação de 15 a 18 GB e benchmark de 80 a 120 tokens por segundo não eram suportados por evidências reproduzíveis e foram foi removido.
Uma decisão de implantação local realista
- Use um modelo menor se precisar de desempenho previsível de GPU única em VRAM de 32 GB.
- Se estiver experimentando quantizações de comunidade, verifique o tamanho exato do arquivo, o suporte ao tempo de execução, os requisitos de RAM, o comprimento do contexto e a velocidade medida antes de fazer o download.
- Trate os resultados do benchmark como específicos da configuração: quantização, divisão de descarregamento, comprimento do prompt e largura de banda da memória, todas as alterações desempenho.