本地 LLM 與雲端 API:新創成本比較
以官方價格與明確標示的假設範例計算總成本。
分別記錄未快取輸入、快取輸入與輸出 token。已刪除缺乏證據的「30 天、每日 500 次查詢」實測敘述。
以官方價格與明確標示的假設範例計算總成本。
API = (uncached input × rate + cached input × rate + output × rate) / 1,000,000.
| API model | 時段 | 快取輸入 | 未快取輸入 | 輸出 |
|---|---|---|---|---|
| deepseek-flash (V4.1 Flash) | 離峰 | $0.003 | $0.15 | $0.60 |
| deepseek-flash (V4.1 Flash) | 尖峰 | $0.006 | $0.30 | $1.20 |
| deepseek-v4-pro (V4-Pro-0813) | 離峰 | $0.022 | $0.66 | $1.98 |
| deepseek-v4-pro (V4-Pro-0813) | 尖峰 | $0.044 | $1.32 | $3.96 |
deepseek-flash = DeepSeek-V4.1-Flash; deepseek-v4-pro = DeepSeek-V4-Pro-0813. API 上線不代表所有聊天帳號都已切換模型。
週一至週五 UTC 01:00–04:00、06:00–10:00為尖峰;週末與中國法定假日為離峰。
2026 年 10 月 4 日查核 · 以官方價格與明確標示的假設範例計算總成本。
假設計算範例,並非實測: 8M cached input + 2M uncached input + 1M output.
離峰: 8 × $0.003 + 2 × $0.15 + 1 × $0.60 = $0.924.
尖峰: 8 × $0.006 + 2 × $0.30 + 1 × $1.20 = $1.848.
僅計算模型token,不含稅、工具與額外呼叫。
本地 LLM 與雲端 API:新創成本比較
納入 GPU 計費時數、CPU、記憶體、儲存、傳輸、維運工時及 API 備援。閒置時間已包含在租用時數內,請勿重複計算。
Cost per accepted task = total cost / accepted tasks.
Break-even = F / (A − V), A > V.
F為固定月成本,A為API驗收合格工作單價,V為本地變動單價。只有A大於V時能計算損益分岐。
以同一工作集和驗收標準比較品質、p95 延遲、並行與重試。量化、上下文與記憶體需求須用實際配置確認。不存在通用 token 損益門檻,也不能保證 70/30 分流一定省錢。
自行部署不能自動保證隱私;請查存取控制、日誌、備份與整合。