Tách token đầu vào chưa lưu cache, có cache và đầu ra. Đã bỏ tuyên bố không có bằng chứng về thử nghiệm 30 ngày với 500 truy vấn mỗi ngày.

Giá chính thức và phép tính với giả định rõ ràng.

API = (uncached input × rate + cached input × rate + output × rate) / 1,000,000.

USD mỗi triệu token; ngày 4 tháng 10 năm 2026
API modelThời điểmĐầu vào cacheĐầu vào chưa cacheĐầu ra
deepseek-flash (V4.1 Flash)Thấp điểm$0.003$0.15$0.60
deepseek-flash (V4.1 Flash)Cao điểm$0.006$0.30$1.20
deepseek-v4-pro (V4-Pro-0813)Thấp điểm$0.022$0.66$1.98
deepseek-v4-pro (V4-Pro-0813)Cao điểm$0.044$1.32$3.96

deepseek-flash = DeepSeek-V4.1-Flash; deepseek-v4-pro = DeepSeek-V4-Pro-0813. API không xác nhận mô hình cho mọi tài khoản chat.

Cao điểm UTC 01:00–04:00 và 06:00–10:00 từ thứ Hai đến thứ Sáu; cuối tuần và lễ công cộng Trung Quốc là thấp điểm.

Đã kiểm tra ngày 4 tháng 10 năm 2026 · Giá chính thức và phép tính với giả định rõ ràng.

Ví dụ minh họa, không phải đo thực tế: 8M cached input + 2M uncached input + 1M output.

Thấp điểm: 8 × $0.003 + 2 × $0.15 + 1 × $0.60 = $0.924.
Cao điểm: 8 × $0.006 + 2 × $0.30 + 1 × $1.20 = $1.848.

Chỉ tính token mô hình; chưa gồm thuế, công cụ và gọi thêm.

LLM cục bộ và API đám mây: chi phí cho startup

Tính giờ GPU bị tính phí, CPU, RAM, lưu trữ, truyền dữ liệu, nhân công vận hành và API dự phòng. Không cộng lại giờ nhàn rỗi đã nằm trong giờ thanh toán.

Cost per accepted task = total cost / accepted tasks.
Break-even = F / (A − V), A > V.
F: chi phí cố định tháng; A: API mỗi nhiệm vụ được chấp nhận; V: chi phí biến đổi cục bộ. Chỉ có hòa vốn khi A lớn hơn V.

Dùng cùng nhiệm vụ và tiêu chí chấp nhận; đo chất lượng, độ trễ p95, đồng thời và thử lại. Kiểm tra lượng tử hóa, ngữ cảnh và bộ nhớ trên cấu hình thực. Không có ngưỡng token chung hay tiết kiệm bảo đảm từ tỷ lệ 70/30.

Tự lưu trữ không bảo đảm riêng tư; kiểm tra truy cập, nhật ký, sao lưu và tích hợp.

Nguồn · Đã kiểm tra ngày 4 tháng 10 năm 2026

DeepSeek → · AIListPrime →