CORRECCIÓN TÉCNICA · VERIFICADA EL 11 DE AGOSTO DE 2026

¿Puedes ejecutar Llama 4 Maverick en un RTX 5090? Límites prácticos

La guía anterior trataba incorrectamente a Llama 4 Maverick como un modelo 70B que cabe completamente en 15 a 18 GB de VRAM. La tarjeta del modelo de Meta dice que Maverick es un modelo de mezcla de expertos con 17 mil millones de parámetros activados y 400 mil millones de parámetros totales. Los parámetros activados describen el cálculo por token; no significan que solo se deban almacenar 17B de pesos.

Investigación basada en fuentes

Esta página sustituye una versión anterior con datos obsoletos o afirmaciones sin respaldo.

Datos verificados

01

Meta enumera Llama 4 Maverick como parámetros activados de 17B, 128 expertos y 400B de parámetros totales con una ventana de contexto de 1M.

02

Meta distribuye pesos de BF16 y FP8 y dice que los pesos oficiales de FP8 encajan en un único host H100 DGX, no una GPU de consumo de 32 GB.

03

Una cuantificación de terceros puede usar la RAM del sistema, la CPU o la descarga del disco, pero eso es diferente a mantener el modelo completo en RTX 5090 VRAM.

04

Los antiguos comandos de Ollama, la afirmación de 15 a 18 GB y el punto de referencia de 80 a 120 tokens por segundo no estaban respaldados por evidencia reproducible y se han eliminado.

Una decisión de implementación local realista

  1. Utilice un modelo más pequeño si necesita un rendimiento predecible de una sola GPU en 32 GB de VRAM.
  2. Si experimenta con cuantificaciones comunitarias, verifique el tamaño exacto del archivo, la compatibilidad con el tiempo de ejecución, los requisitos de RAM, la longitud del contexto y la velocidad medida antes de descargar.
  3. Trate los resultados de las pruebas comparativas como específicos de la configuración: cuantificación, división de descarga, longitud de solicitud y ancho de banda de memoria. todo cambia el rendimiento.
Datos verificados · 2026-08-11

Fuentes oficiales consultadas