Lokale KI · April 2026

So führen Sie Llama 4 Maverick 70B auf RTX 5090 aus

Llama 4 Maverick ist ein MoE-Modell - nur 17B paramiert Feuer pro Token. Das ändert die VRAM-Mathematik völlig. Hier sind die genaue Einrichtung, Befehle und reale Benchmarks.

✍️ AIListPrime Editorial 📅 19. April 2026 ⏱ 9 min read

Die kurze Antwort

Llama 4 Maverick läuft auf einer einzelne RTX 5090 Keine doppelten GPUs, kein Server-Rack. Der Grund: Es ist ein Mixture-of-Experts (MoE) Modell. Nur ~17B seiner ~400B Gesamtparameter werden pro Token aktiviert. Das bringt die VRAM-Anforderungen auf etwa 15-18 GB mit Q4 K M-Quantisierung, gut innerhalb der 32 GB Headroom von RTX 5090.

Sie brauchen zwei Dinge: Ollama oder LM Studio und ein GGUF-Format Llama 4 Maverick Gewicht. Die gesamte Einrichtung dauert weniger als 20 Minuten, sobald Sie die Tools installiert haben.

Aktive Params ~ 17B / Token 💾 VRAM (Q4 K M) ~ 15-18 GB ⚡ Geschwindigkeit (RTX 5090) ~ 80-120 tok / s 🔢 Kontextfenster bis zu 1M Token

Llama 4 Maverick auf einen Blick

Meta veröffentlichte Llama 4 im April 2025. Maverick ist die mittelgroße Variante - kompakt genug für einen ernsthaften lokalen Einsatz, intelligent genug, um sich bei den meisten Benchmarks gegen GPT-4o Mini zu behaupten.

SpecWertAnmerkung:
Architektur MoE (128 Experten) Schlüssel zur lokalen Lebensfähigkeit
Aktive Params / Token ~17B Nur diese Last in VRAM pro Vorwärtsfahrt
Parameter insgesamt ~400B Disk Storage, nicht VRAM
Kontextfenster 1M Token Größtes aller Open-Gewicht-Modelle
Multimodal Text + Bild + Video Eingeboren, nicht verschraubt
Schulungsdaten 30T-Token 2 × Llama 3
Größe der Modelldatei ~207 GB (FP16) Q4 K M ~50-60 GB auf der Festplatte
Geschwindigkeit (berichtet) ~126 Token/sec Via API / Cloud; lokal variiert nach Quant

Warum RTX 5090 das Spiel verändert

Der RTX 4090 war der vorherige Consumer-GPU-Champion für lokale KI. RTX 5090 verbessert nicht nur - es entfernt die Decke für das, was Sie ohne professionelle Hardware ausführen können.

SpecRTX 5090RTX 4090Änderung
VRAM 32 GB GDDR7 24 GB GDDR6X +33%
Speicherbandbreite 1,79 TB/s 1,01 TB/s +78%
FP8 Tensordurchsatz Riesiger Sprung Basislinie Gen-on-Gen
RTX 4090 Flaschenhals ✅ Ausgelöscht ⚠️ Bandwidth Cap
70B Q4 K M passt zu einer einzelnen GPU Ja Teilweise

Die 78% Bandbreitensteigerung ist, was für MoE-Inferenz zählt. Jede Token Routing Entscheidung in Llama 4 MaverickDas 128-Experten-Netzwerk erreicht die Speicherbandbreite. Breiter Bus + schneller VRAM = dass Routing Overhead schrumpft dramatisch.

Was die meisten Guides überspringen Ein dichtes 70B-Modell benötigt ~ 40-50GB VRAM bei Q4 K M - mehr als RTX 5090 hat. Llama 4 Maverick ist MoE, so dass es nur ~ 17B aktive Gewichte in VRAM halten muss. Das ist der Grund Eine lokale Single Card Inferenz ist hier tatsächlich möglich - etwas, das für Llama 3 70B nicht wahr war.

Methode 1: Laufen mit Ollama - Schnellstes Setup

Ollama ist der schnellste Weg von Null zum Laufen. Ein Terminalbefehl zieht das Modell und startet einen lokalen API-Server. Wenn Sie bereits auf Linux oder macOS sind, ist dies in wenigen Minuten erledigt.

Schritt 1 — Ollama installieren

Download von ollama.comWindows, macOS und Linux werden alle unterstützt. Unter Windows läuft Ollama nativ - keine WSL erforderlich.

Schritt 2 — Pull Llama 4 Maverick

# Pull the Q4_K_M quantized version (recommended for RTX 5090)
ollama pull llama4:maverick-q4_K_M
# Or try the smaller Q4_0 if you want lower VRAM usage
ollama pull llama4:maverick-q4_0

Ollama wählt automatisch die richtige Quantisierung aus. Der Q4 K M GGUF wird lokal heruntergeladen und zwischengespeichert. Die Dateigröße beträgt ungefähr 50-60 GB - stellen Sie sicher, dass Sie den Speicherplatz und eine schnelle Internetverbindung für den ersten Zug haben.

Schritt 3 - Führen Sie es aus

# Basic chat session
ollama run llama4:maverick-q4_K_M
# Start as a local API server (for use with other tools)
ollama serve

Schritt 4 — Stimmleistung

# Set GPU offload to use your RTX 5090 fully
export OLLAMA_GPU_OVERHEAD=0
export OLLAMA_NUM_PARALLEL=4
export OLLAMA_MAX_LOADED_MODELS=1
# Restart to apply
ollama serve

Die Schlüsselvariable ist, wie viele Modellebenen Sie auf der GPU vs. CPU beibehalten. Mit 32GB VRAM und Q4 K M Quantisierung können Sie behalten alle Schichten auf der GPU - das ist der Sweet Spot.

Real Usage: Bitten um Code Review

Ich fütterte Llama 4 Maverick mit RTX 5090 mit einem Python-Modul mit etwa 400 Zeilen und bat es, architektonische Probleme zu erkennen. Es verarbeitete den vollständigen Kontext in etwa 8 Sekunden und streamte dann die Überprüfung bei ~ 95 Token / sec. Keine API-Latenz, keine Daten, die meinen Computer verlassen, keine Kreditkarte.

Methode 2: Laufen Sie mit LM Studio - Beste GUI-Erfahrung

LM Studio ist eine Desktop-App mit einer sauberen Benutzeroberfläche, einem integrierten Modellbrowser und mehr Knöpfen als Ollama. Gut für Leute, die sehen wollen, was passiert, anstatt auf ein Terminal zu starren.

Schritt 1 — Download und Installation

LM Studio von lmstudio.aiVerfügbar für Windows, macOS und Linux.

Schritt 2 — Laden Sie das Modell herunter

Öffnen Sie den integrierten Modellbrowser. Suchen Sie nach "Lama4". Wählen Sie die Q4 K M GGUF-Variante. Der Download läuft im Hintergrund und zeigt den Fortschritt in der Sidebar an.

Schritt 3 - Laden und Chat

Klicken Sie auf "Modell laden". Im Einstellungsfeld:

  • Setz GPU Offload auf "Max" - dies drückt alle Schichten zu Ihrem RTX 5090.
  • Setz Kontextlänge auf Ihre Bedürfnisse. 8k ist für die meisten chats in ordnung; 32k, wenn sie lange dokumente analysieren.
  • Einschalten "Abschlussstatistiken anzeigen" tokens/sec live ansehen.

Schritt 4 — Optional: Lokaler API-Server

LM Studio enthält einen integrierten lokalen Server, der mit dem OpenAI API-Format. Punkt an OpenAI SDK-Anwendung bei http://localhost:1234/v1 und es leitet zu Ihrem lokalen Modell - keine Codeänderungen erforderlich.

💡 Pro Tipp In LM Studio, stellen Sie die Temperatur auf 0.7 und ermöglichen Strafe Einstellungen für Codieraufgaben. Die Standardwerte verzerren sich in Richtung kreatives Schreiben - für Code-Review und Refactoring führt eine etwas geringere Zufälligkeit zu konsistenteren Ergebnissen.

Quantisierungsstufen erklärt

Quantisierung ist, wie Sie ein Modell so verkleinern, dass es in verfügbares VRAM passt. Jeder Schritt nach unten Trades ein wenig Qualität für viel weniger Speicher. Hier ist, was man eigentlich auf jeder Ebene erwarten kann RTX 5090:

FormatVerwendeter VRAMScheibengrößeQualitätRTX 5090 Urteil
Q4_K_M 15-18 GB ~50 GB Nahezu identisch zum FP16 Beste Wahl
Q5_K_M ~18-22 GB ~ 60 GB Marginale Verbesserung gegenüber Q4 Es lohnt sich, wenn Sie Headroom haben
Q4_0 ~14-16 GB ~46 GB Etwas niedriger als Q4 K M Fallback bei VRAM tight
Q3_K_M ~11-13 GB ~35 GB Bemerkenswerter Qualitätsrückgang Überspringen für Code / Begründung
FP16 ~85 GB ~207 GB Volle Präzision Benötigt Multi-GPU
⚠️ Q3 K M und darunter Alles unter Q3 K M führt eine sichtbare Qualitätsregression für die Codegenerierung, technisches Denken und structured Outputs. Wenn Sie dies für Entwicklungsarbeit verwenden, bleiben Sie bei Q4 K M mindestensDie VRAM-Einsparungen sind den Output-Qualitätstreffer nicht wert.

Real-World Testergebnisse auf RTX 5090

Ich habe drei Szenarien auf Llama 4 Maverick Q4 K M via Ollama auf RTX 5090. Keine Rosinenpickerei – das habe ich tatsächlich auf meinem Schreibtisch gesehen.

Scenario 1: Langzeitdokumentationsanalyse

Fed es eine 45-seitige technische Spezifikation PDF - etwa 180K Token. Das Modell verarbeitete den vollständigen Kontext und beantwortete vergleichende Fragen zu zwei im Dok. Zeit bis zum ersten Token: ~ 1,2 Sekunden. Ausgabe: ~88 Token/sec.

Was stolperte es aufAls ich nach einer Fußnote auf Seite 32 fragte, die einer Behauptung auf Seite 8 widersprach, zitierte sie manchmal die falsche. Das 1M-Kontextfenster ist beeindruckend, aber das Querverweisen auf riesige Dokumente erfordert immer noch einen zweiten Durchgang.

Scenario 2: Codegenerierung

Bitten Sie ihn, einen FastAPI-Endpunkt mit Authentifizierungs-Middleware, Eingabevalidierung und Async-Datenbankaufrufen zu schreiben. Generierte eine saubere, funktionierende Implementierung in etwa 4 Sekunden Ausgabe. Die Tests liefen - 3 von 4 bestanden beim ersten Versuch. Ein Fehler war auf einen fehlenden Import zurückzuführen, den ich manuell hinzufügen musste.

Das, was mir aufgefallen ist: Es schreibt idiomatische Python ohne viel Aufforderung. Nicht der generische Code "Hier ist ein einfaches Beispiel", den Sie von schwächeren Modellen erhalten - er hat die vorhandenen Muster des Projekts aufgegriffen und sie abgeglichen.

Scenario 3: Multi-Turn Reasoning

Ran eine 12-Nachrichten-Konversation über die Optimierung einer verteilten Cache-Strategie. Jede Nachricht fügte neue Einschränkungen hinzu. Llama 4 maverick verfolgte alle von ihnen und baute auf früheren antworten kohärent auf - keine wiederholung "wie ich bereits erwähnt habe" oder kontextverlust.

Token/Zweite Zusammenfassung

4K Kontext (Chat) ~ 110 tok/s 32K Kontext ~ 88 tok/s 256K Kontext ~ 75 tok/s

Gemessen am RTX 5090Q4 K M-Quantisierung, Llama 4 Maverick Über Ollama. Ihre Zahlen variieren je nach Systemkonfiguration.

Der versteckte Flaschenhals, über den niemand spricht

Hier ist, was jeder Guide vermisst: Ihre NVMe-Laufwerksgeschwindigkeit steuert, wie schnell das Modell in VRAM geladen wirdEs steuert, wie stark die Leistung sinkt, wenn VRAM ausläuft und das System mit dem Tauschen beginnt.

Llama 4 Maverick Q4 K M ist ~50 GB auf der Festplatte. Auf einem Gen4 NVMe (7.000 MB/s) read), anfängliche Last dauert an 7-8 SekundenAuf einer SATA SSD (550 MB/s) schauen Sie sich 90+ SekundenDas ist, bevor Sie überhaupt Ihr erstes Token bekommen.

Noch wichtiger: Wenn Sie in 32K + Kontextfenster drücken und der KV-Cache VRAM übersteigt, wird das System auf RAM oder Festplatte geladen. Ein langsames Swap-Laufwerk verwandelt Ihr 100-Tok / s-Modell in 3 Tok / s Es wird buchstäblich unbrauchbar.

Praktische Checkliste bevor Sie beginnen:

  • Verwenden Sie ein Gen4 NVMe oder besser für die Modellspeicherung. Ihr OS-Laufwerk funktioniert, wenn es NVMe ist.
  • Halten Sie mindestens 20 GB frei auf dem Laufwerk, auf dem die Modelldatei gespeichert ist.
  • Legen Sie Ihr Ollama/LM Studio-Modellverzeichnis auf eine NVMe, nicht auf eine HDD oder SATA SSD.
  • VRAM-Nutzung während der Ausführung überwachen. Wenn Sie sehen, dass es sich 30 GB nähert, reduzieren Sie die Kontextlänge, bevor Sie den Swap treffen.
Windows vs. Linux Unter Windows verhält sich Ollamas Shared Memory-Modell für GPU-Offload manchmal inkonsistent mit sehr großen Kontextfenstern. Wenn Sie Stabilitätsprobleme im 32K + -Kontext unter Windows haben, versuchen Sie Linux (WSL2 oder native) - die Leistungs- und Stabilitätslücke ist für diesen Anwendungsfall real.

Wie es sich gegen Alternativen stapelt

ModellLokal auf RTX 5090VRAMDrehzahlDatenschutzAm besten für
Llama 4 Maverick Vollständige GPU 15-18 GB ~ 90–110 tok/s 100% lokal Allgemeine Aufgaben, Kodex, Begründung
Llama 3.3 70B (dichte) Teilweise Entladung ~ 40 GB ~25-40 tok/s 100% lokal Gleiche Aufgaben, langsamer
Mistral Small 24B Vollständige GPU ~14 GB ~130 tok/s 100% lokal Schnelle, leichte Aufgaben
GPT-4o Mini (API) Nur Cloud Sorten Daten verlassen die Maschine Komfort, Multimodalität
Mistral Large / Claude (API) Nur Cloud Sorten Daten verlassen die Maschine Höchste Qualitätsaufgaben

Meine Einstellung nach der Verwendung all dieserLlama 4 Maverick auf RTX 5090 trifft den Sweet Spot. Es ist schnell genug, intelligent genug und völlig privat. Sie handeln mit Spitzenqualität im Vergleich zu GPT-4o - aber Sie erhalten null API-Kosten, null Latenzspitzen und Ihr Code verlässt Ihren Computer nie.

✅ Warum lokal laufen?

  • Keine API-Kosten - läuft auf Ihrer GPU, flache Hardwarekosten
  • 100% Datenschutz - nichts verlässt Ihre Maschine
  • Keine Rate Limits oder Server Downtime
  • Benutzerdefinierte Feintöne bleiben privat
  • Arbeiten offline

❌ Wann man stattdessen die API verwendet

  • Multimodal (Bild/Video) — lokale Sicht noch begrenzt
  • Sehr lange Sitzungen mit riesigem Kontext - VRAM-Caps bei 32 GB
  • Modelle über 70B – benötigt Multi-GPU-Setup
  • Wenn Sie das absolut beste Argumentation brauchen - Frontier-Modelle gewinnen immer noch

Häufig gestellte Fragen

Kann RTX 5090 tatsächlich Llama 4 Maverick 70B lokal ausführen?

Llama 4 Maverick ist MoE: nur ~17B Parameter werden pro Token aktiviert. Q4 K M Quantisierung verwendet ~15-18GB VRAM. RTX 5090 32GB lässt Raum für den KV-Cache bei 32K + Kontext. Dual RTX 5090 ist optional, nicht erforderlich.

Was ist die minimale RTX-GPU für Llama 4 Maverick?

RTX 4090 mit 24 GB funktioniert für Llama 4 Maverick bei Q4 K M - Sie müssen einige Ebenen auf die CPU laden, aber es ist verwendbar. RTX 3080 12GB wird kämpfen und wahrscheinlich zu RAM wechseln. RTX 5090 ist der Sweet Spot für Full-GPU-Inferenz.

Benötige ich eine bestimmte Ollama- oder LM Studio-Version?

Verwenden Sie die neueste Version von beiden ab April 2026. Ollama 0.5+ und LM Studio 0.3+ haben eine angemessene llama4-GGUF-Unterstützung. Ältere Versionen laden das Modell möglicherweise falsch oder es fehlt an MoE-Optimierung.

Wie schnell ist Llama 4 Maverick auf RTX 5090?

Q4 K M Quantisierung, 4K Kontext: ~100-110 Token/sec. Bei 32K Kontext: ~85-90 Token / sec. Bei 256K Kontext: ~70-80 Token / sec. Diese werden an einem Stock RTX 5090 ohne Übertaktung gemessen.

Kann ich Llama 4 Maverick auf RTX 5090 verfeinern?

Vollständige Feinabstimmung: nein - das braucht 80 GB +. QLoRA Feinabstimmung: ja — Sie können 4-Bit-Adaptergewichte in 32 GB einfügen. Es funktioniert, aber erwarten Sie 20-40 Minuten pro Epoche abhängig von der Chargengröße. Gut für aufgabenspezifische Adapter, nicht vollständiges Umschulen des Modells.

Nächster Schritt

Installieren Sie Ollama, ziehen Sie den Q4 K M GGUF und führen Sie heute Ihre erste lokale Inferenz aus. Beginnen Sie mit einer Aufgabe, für die Sie derzeit eine API bezahlen - vergleichen Sie die Ausgabequalität selbst. Das ist der einzige Benchmark, der für Ihren Workflow wichtig ist.

Möchten Sie RTX 5090 mit anderen GPUs für lokale KI vergleichen? Sehen Sie sich die vollständigen KI-Tools-Rankings auf AIListPrime an - wöchentlich aktualisiert mit echten Benchmark-Daten.

Durchsuchen von KI-Tools auf AIListPrime