技術的な修正 · 2026 年 8 月 11 日に確認

RTX 5090 で Llama 4 Maverick を実行できますか?実用的な制限

前のガイドでは、Llama 4 Maverick を 15 ~ 18GB の VRAM に完全に収まる 70B モデルのように誤って扱っていました。 Meta のモデル カードによると、Maverick は 17B の有効化パラメータと 400B の合計パラメータを持つ専門家混合モデルです。アクティブ化されたパラメータは、トークンごとの計算を記述します。 170 億のウェイトのみを保存する必要があるという意味ではありません。

公式情報に基づく調査

本ページは、古い情報や根拠不十分な記述を含んでいた旧版を全面的に差し替えています。

確認済みの事実

01

メタは、ラマ 4 マーベリックを 170 億の有効化パラメータ、128 人のエキスパート、1M コンテキスト ウィンドウの合計 4000 億のパラメータとしてリストしています。

02

メタは、BF16 と FP8 のウェイトを配布し、公式の FP8 ウェイトが適合すると述べています。 32 GB のコンシューマ GPU ではなく、単一の H100 DGX ホストです。

03

サードパーティの量子化ではシステム RAM、CPU、またはディスクのオフロードが使用される場合がありますが、それは完全なモデルを RTX 5090 VRAM に保持することとは異なります。

04

古い Ollama コマンド、15 ~ 18 GB の要求、および 80 ~ 120 トークン/秒のベンチマークは、サポートされていませんでした。再現可能な証拠があり、削除されました。

現実的なローカル展開の決定

  1. 32 GB VRAM で予測可能なシングル GPU パフォーマンスが必要な場合は、より小さいモデルを使用してください。
  2. コミュニティ量子化を実験する場合は、ダウンロード前に正確なファイル サイズ、ランタイム サポート、RAM 要件、コンテキストの長さ、測定速度を確認してください。
  3. ベンチマーク結果を構成固有のものとして扱います: 量子化、オフロード分割、プロンプトの長さ、およびメモリ帯域幅はすべてパフォーマンスに影響します。
情報確認日 · 2026-08-11

確認した公式情報