CORRECTION TECHNIQUE · VÉRIFIÉ LE 11 AOÛT 2026

Pouvez-vous exécuter Llama 4 Maverick sur un RTX 5090 ? Limites pratiques

Le guide précédent traitait de manière incorrecte Llama 4 Maverick comme un modèle 70B qui tient entièrement dans 15 à 18 Go de VRAM. La carte modèle de Meta indique que Maverick est un modèle mixte d'experts avec 17 milliards de paramètres activés et 400 milliards de paramètres au total. Les paramètres activés décrivent le calcul par jeton ; cela ne signifie pas que seuls 17 B de poids doivent être stockés.

Recherche fondée sur les sources

Cette page remplace une ancienne version contenant des informations obsolètes ou non étayées.

Faits vérifiés

01

Meta répertorie Llama 4 Maverick comme 17B de paramètres activés, 128 experts et 400B de paramètres au total avec une fenêtre de contexte de 1 M.

02

Meta distribue les poids BF16 et FP8 et indique les poids officiels FP8. s'adapter à un seul hôte H100 DGX, et non à un GPU grand public de 32 Go.

03

Une quantification tierce peut utiliser la RAM du système, le processeur ou le déchargement de disque, mais cela est différent de conserver le modèle complet dans RTX 5090 VRAM.

04

Les anciennes commandes Ollama, la revendication de 15 à 18 Go et le benchmark de 80 à 120 jetons par seconde n'étaient pas pris en charge par preuves reproductibles et ont été supprimées.

Une décision de déploiement local réaliste

  1. Utilisez un modèle plus petit si vous avez besoin de performances prévisibles avec un seul GPU sur 32 Go de VRAM.
  2. Si vous expérimentez des quantifications communautaires, vérifiez la taille exacte du fichier, la prise en charge de l'exécution, les besoins en RAM, la longueur du contexte et la vitesse mesurée avant le téléchargement.
  3. Traitez les résultats du test comme spécifiques à la configuration : quantification, répartition du déchargement, longueur de l'invite et la bande passante mémoire modifie toutes les performances.
Faits vérifiés · 2026-08-11

Sources officielles vérifiées