ローカルLLMとクラウドAPI:スタートアップの費用比較
公式料金と明示的な計算例で総費用を比較します。
入力キャッシュ、未キャッシュ入力、出力を別々に集計してください。30日間・毎日500件の実測という旧記述は裏付けがないため削除しました。
公式料金と明示的な計算例で総費用を比較します。
API = (uncached input × rate + cached input × rate + output × rate) / 1,000,000.
| API model | 利用期間 | キャッシュ入力 | 未キャッシュ入力 | 出力 |
|---|---|---|---|---|
| deepseek-flash (V4.1 Flash) | 低峰 | $0.003 | $0.15 | $0.60 |
| deepseek-flash (V4.1 Flash) | ピーク | $0.006 | $0.30 | $1.20 |
| deepseek-v4-pro (V4-Pro-0813) | 低峰 | $0.022 | $0.66 | $1.98 |
| deepseek-v4-pro (V4-Pro-0813) | ピーク | $0.044 | $1.32 | $3.96 |
deepseek-flash = DeepSeek-V4.1-Flash; deepseek-v4-pro = DeepSeek-V4-Pro-0813. API公開は全チャットアカウントのモデル切替を意味しません。
中国の法定休日と週末は低峰です。平日のUTC 01:00–04:00と06:00–10:00がピークです。
2026年10月4日確認 · 公式料金と明示的な計算例で総費用を比較します。
計算例(実測ではありません): 8M cached input + 2M uncached input + 1M output.
低峰: 8 × $0.003 + 2 × $0.15 + 1 × $0.60 = $0.924.
ピーク: 8 × $0.006 + 2 × $0.30 + 1 × $1.20 = $1.848.
モデルtokenのみの費用です。税、ツール、追加呼び出しは含みません。
ローカルLLMとクラウドAPI:スタートアップの費用比較
GPUの請求時間、CPU・メモリ・保存・転送、運用担当の時間、APIへのフォールバックを含めます。アイドル時間は請求時間に含まれるため二重計上しません。
Cost per accepted task = total cost / accepted tasks.
Break-even = F / (A − V), A > V.
固定月額F、APIの合格タスク単価A、ローカルの変動単価V。AがVを超える場合のみ損益分岐を計算できます。
同じタスクと合格基準で品質、p95遅延、同時実行、再試行を測定します。量子化、文脈長、メモリ条件を実機で確認してください。固定のトークン数や70/30配分で節約を保証できません。
自己ホストだけでプライバシーは保証されません。アクセス、ログ、バックアップ、連携先を確認してください。