TECHNISCHE KORREKTUR · VERIFIZIERT AM 11. AUGUST 2026

Können Sie Llama 4 Maverick auf einer RTX 5090 ausführen? Praktische Grenzen

Im vorherigen Leitfaden wurde Llama 4 Maverick fälschlicherweise wie ein 70B-Modell behandelt, das vollständig in 15–18 GB VRAM passt. Laut Metas Modellkarte handelt es sich bei Maverick um ein Expertenmischungsmodell mit 17 Milliarden aktivierten Parametern und 400 Milliarden Gesamtparametern. Aktivierte Parameter beschreiben die Berechnung pro Token; Sie bedeuten nicht, dass nur 17B-Gewichte gespeichert werden müssen.

Quellenbasierte Recherche

Diese Seite ersetzt eine ältere Fassung mit veralteten oder unbelegten Aussagen.

Geprüfte Fakten

01

Meta listet Llama 4 Maverick mit 17B aktivierten Parametern, 128 Experten und 400B Gesamtparametern mit einem 1M-Kontextfenster auf.

02

Meta verteilt BF16- und FP8-Gewichte und gibt die offiziellen FP8-Gewichte an passen auf einen einzelnen H100 DGX-Host, nicht auf eine 32-GB-Consumer-GPU.

03

Eine Drittanbieter-Quantisierung kann System-RAM, CPU oder Festplatten-Offloading verwenden, aber das unterscheidet sich davon, das komplette Modell im RTX 5090-VRAM zu belassen.

04

Die alten Ollama-Befehle, 15–18 GB Anspruch und 80–120 Token-pro-Sekunde-Benchmark wurden von nicht unterstützt reproduzierbare Beweise und wurden entfernt.

Eine realistische lokale Bereitstellungsentscheidung

  1. Verwenden Sie ein kleineres Modell, wenn Sie vorhersehbare Einzel-GPU-Leistung auf 32 GB VRAM benötigen.
  2. Wenn Sie mit Community-Quantisierungen experimentieren, überprüfen Sie vor dem Herunterladen die genaue Dateigröße, Laufzeitunterstützung, RAM-Anforderung, Kontextlänge und gemessene Geschwindigkeit.
  3. Behandeln Sie Benchmark-Ergebnisse als konfigurationsspezifisch: Quantisierung, Auslagerung Aufteilung, Eingabeaufforderungslänge und Speicherbandbreite ändern alle die Leistung.
Fakten geprüft · 2026-08-11

Geprüfte offizielle Quellen