入力キャッシュ、未キャッシュ入力、出力を別々に集計してください。30日間・毎日500件の実測という旧記述は裏付けがないため削除しました。

公式料金と明示的な計算例で総費用を比較します。

API = (uncached input × rate + cached input × rate + output × rate) / 1,000,000.

100万tokenあたりの米ドル料金。2026年10月4日確認
API model利用期間キャッシュ入力未キャッシュ入力出力
deepseek-flash (V4.1 Flash)低峰$0.003$0.15$0.60
deepseek-flash (V4.1 Flash)ピーク$0.006$0.30$1.20
deepseek-v4-pro (V4-Pro-0813)低峰$0.022$0.66$1.98
deepseek-v4-pro (V4-Pro-0813)ピーク$0.044$1.32$3.96

deepseek-flash = DeepSeek-V4.1-Flash; deepseek-v4-pro = DeepSeek-V4-Pro-0813. API公開は全チャットアカウントのモデル切替を意味しません。

中国の法定休日と週末は低峰です。平日のUTC 01:00–04:00と06:00–10:00がピークです。

2026年10月4日確認 · 公式料金と明示的な計算例で総費用を比較します。

計算例(実測ではありません): 8M cached input + 2M uncached input + 1M output.

低峰: 8 × $0.003 + 2 × $0.15 + 1 × $0.60 = $0.924.
ピーク: 8 × $0.006 + 2 × $0.30 + 1 × $1.20 = $1.848.

モデルtokenのみの費用です。税、ツール、追加呼び出しは含みません。

ローカルLLMとクラウドAPI:スタートアップの費用比較

GPUの請求時間、CPU・メモリ・保存・転送、運用担当の時間、APIへのフォールバックを含めます。アイドル時間は請求時間に含まれるため二重計上しません。

Cost per accepted task = total cost / accepted tasks.
Break-even = F / (A − V), A > V.
固定月額F、APIの合格タスク単価A、ローカルの変動単価V。AがVを超える場合のみ損益分岐を計算できます。

同じタスクと合格基準で品質、p95遅延、同時実行、再試行を測定します。量子化、文脈長、メモリ条件を実機で確認してください。固定のトークン数や70/30配分で節約を保証できません。

自己ホストだけでプライバシーは保証されません。アクセス、ログ、バックアップ、連携先を確認してください。

出典 · 2026年10月4日確認

DeepSeek → · AIListPrime →