分別記錄未快取輸入、快取輸入與輸出 token。已刪除缺乏證據的「30 天、每日 500 次查詢」實測敘述。

以官方價格與明確標示的假設範例計算總成本。

API = (uncached input × rate + cached input × rate + output × rate) / 1,000,000.

每百萬token的美元費率;2026年10月4日查核
API model時段快取輸入未快取輸入輸出
deepseek-flash (V4.1 Flash)離峰$0.003$0.15$0.60
deepseek-flash (V4.1 Flash)尖峰$0.006$0.30$1.20
deepseek-v4-pro (V4-Pro-0813)離峰$0.022$0.66$1.98
deepseek-v4-pro (V4-Pro-0813)尖峰$0.044$1.32$3.96

deepseek-flash = DeepSeek-V4.1-Flash; deepseek-v4-pro = DeepSeek-V4-Pro-0813. API 上線不代表所有聊天帳號都已切換模型。

週一至週五 UTC 01:00–04:00、06:00–10:00為尖峰;週末與中國法定假日為離峰。

2026 年 10 月 4 日查核 · 以官方價格與明確標示的假設範例計算總成本。

假設計算範例,並非實測: 8M cached input + 2M uncached input + 1M output.

離峰: 8 × $0.003 + 2 × $0.15 + 1 × $0.60 = $0.924.
尖峰: 8 × $0.006 + 2 × $0.30 + 1 × $1.20 = $1.848.

僅計算模型token,不含稅、工具與額外呼叫。

本地 LLM 與雲端 API:新創成本比較

納入 GPU 計費時數、CPU、記憶體、儲存、傳輸、維運工時及 API 備援。閒置時間已包含在租用時數內,請勿重複計算。

Cost per accepted task = total cost / accepted tasks.
Break-even = F / (A − V), A > V.
F為固定月成本,A為API驗收合格工作單價,V為本地變動單價。只有A大於V時能計算損益分岐。

以同一工作集和驗收標準比較品質、p95 延遲、並行與重試。量化、上下文與記憶體需求須用實際配置確認。不存在通用 token 損益門檻,也不能保證 70/30 分流一定省錢。

自行部署不能自動保證隱私;請查存取控制、日誌、備份與整合。

來源 · 2026 年 10 月 4 日查核

DeepSeek → · AIListPrime →