技術更正 · 2026 年 8 月 11 日驗證
可以在 RTX 5090 上執行 Llama 4 Maverick 嗎?實際限制
先前的指南錯誤地將 Llama 4 Maverick 視為完全適合 15-18GB VRAM 的 70B 型號。 Meta 的模型卡顯示 Maverick 是一個混合專家模型,有 17B 個活化參數和 400B 個總參數。啟動的參數描述每個令牌的計算;它們並不意味著只需要儲存 17B 權重。
依官方來源研究
本頁已全面取代含有過期或無法證實內容的舊版本。
已查核事實
Meta 將 Llama 4 Maverick 列為 17B 激活參數、128 個專家和 400B 總參數,具有 1M 上下文視窗。
Meta 分配 BF16 和 FP8 權重,並表示官方 FP8 權重適合單一 H100 DGX 主機,而非 32GB 消費性 GPU。
第三方量化可能會使用系統 RAM、CPU 或磁碟卸載,但這與將完整模型保留在 RTX 5090 VRAM 中不同。
舊的 Ollama 命令、15–18GB 聲明和每秒 80–120 個令牌基準沒有得到可重現證據的支持並已被刪除。
現實的本地部署決策
- 如果您需要在 32GB VRAM 上實現可預測的單 GPU 效能,請使用較小的模型。
- 如果嘗試社群量化,請在下載前驗證確切的檔案大小、執行時間支援、RAM 要求、上下文長度和測量速度。
- 將基準測試結果視為特定於配置的:量化、卸載分割、提示長度和記憶體頻寬都會改變