技術更正 · 2026 年 8 月 11 日驗證

可以在 RTX 5090 上執行 Llama 4 Maverick 嗎?實際限制

先前的指南錯誤地將 Llama 4 Maverick 視為完全適合 15-18GB VRAM 的 70B 型號。 Meta 的模型卡顯示 Maverick 是一個混合專家模型,有 17B 個活化參數和 400B 個總參數。啟動的參數描述每個令牌的計算;它們並不意味著只需要儲存 17B 權重。

依官方來源研究

本頁已全面取代含有過期或無法證實內容的舊版本。

已查核事實

01

Meta 將 Llama 4 Maverick 列為 17B 激活參數、128 個專家和 400B 總參數,具有 1M 上下文視窗。

02

Meta 分配 BF16 和 FP8 權重,並表示官方 FP8 權重適合單一 H100 DGX 主機,而非 32GB 消費性 GPU。

03

第三方量化可能會使用系統 RAM、CPU 或磁碟卸載,但這與將完整模型保留在 RTX 5090 VRAM 中不同。

04

舊的 Ollama 命令、15–18GB 聲明和每秒 80–120 個令牌基準沒有得到可重現證據的支持並已被刪除。

現實的本地部署決策

  1. 如果您需要在 32GB VRAM 上實現可預測的單 GPU 效能,請使用較小的模型。
  2. 如果嘗試社群量化,請在下載前驗證確切的檔案大小、執行時間支援、RAM 要求、上下文長度和測量速度。
  3. 將基準測試結果視為特定於配置的:量化、卸載分割、提示長度和記憶體頻寬都會改變
事實查核 · 2026-08-11

已查核的官方來源