캐시 입력, 비캐시 입력, 출력을 별도로 기록하세요. 근거 없는 30일간 하루 500건 실험 주장은 삭제했습니다.

공식 요금과 가정이 명확한 계산 예시로 비교합니다.

API = (uncached input × rate + cached input × rate + output × rate) / 1,000,000.

100만 token당 USD. 2026년 10월 4일 확인
API model시간대캐시 입력비캐시 입력출력
deepseek-flash (V4.1 Flash)비혼잡$0.003$0.15$0.60
deepseek-flash (V4.1 Flash)혼잡$0.006$0.30$1.20
deepseek-v4-pro (V4-Pro-0813)비혼잡$0.022$0.66$1.98
deepseek-v4-pro (V4-Pro-0813)혼잡$0.044$1.32$3.96

deepseek-flash = DeepSeek-V4.1-Flash; deepseek-v4-pro = DeepSeek-V4-Pro-0813. API 공개는 모든 채팅 계정의 모델 전환을 의미하지 않습니다.

주말과 중국 공휴일은 비혼잡입니다. 평일 UTC 01:00–04:00 및 06:00–10:00는 혼잡입니다.

2026년 10월 4일 확인 · 공식 요금과 가정이 명확한 계산 예시로 비교합니다.

계산 예시 (실측 아님): 8M cached input + 2M uncached input + 1M output.

비혼잡: 8 × $0.003 + 2 × $0.15 + 1 × $0.60 = $0.924.
혼잡: 8 × $0.006 + 2 × $0.30 + 1 × $1.20 = $1.848.

모델 token 비용만 계산합니다. 세금·도구·추가 호출은 제외합니다.

로컬 LLM과 클라우드 API: 스타트업 비용 비교

GPU 청구 시간, CPU·메모리·저장·전송, 운영 인력과 API 대체 호출을 합산합니다. 유휴 시간은 청구 시간에 포함되므로 이중 계산하지 마세요.

Cost per accepted task = total cost / accepted tasks.
Break-even = F / (A − V), A > V.
F는 고정 월 비용, A는 API 합격 작업 단가, V는 로컬 변동 단가입니다. A가 V보다 높아야 손익분기를 계산할 수 있습니다.

동일한 작업과 합격 기준으로 품질, p95 지연, 동시 처리와 재시도를 측정하세요. 양자화·문맥 길이·메모리를 실제 구성에서 검증해야 합니다. 고정 토큰 기준이나 70/30 분할은 절감을 보장하지 않습니다.

자체 호스팅만으로 개인정보 보호가 보장되지 않습니다. 접근·로그·백업·연동을 확인하세요.

출처 · 2026년 10월 4일 확인

DeepSeek → · AIListPrime →