로컬 LLM과 클라우드 API: 스타트업 비용 비교
공식 요금과 가정이 명확한 계산 예시로 비교합니다.
캐시 입력, 비캐시 입력, 출력을 별도로 기록하세요. 근거 없는 30일간 하루 500건 실험 주장은 삭제했습니다.
공식 요금과 가정이 명확한 계산 예시로 비교합니다.
API = (uncached input × rate + cached input × rate + output × rate) / 1,000,000.
| API model | 시간대 | 캐시 입력 | 비캐시 입력 | 출력 |
|---|---|---|---|---|
| deepseek-flash (V4.1 Flash) | 비혼잡 | $0.003 | $0.15 | $0.60 |
| deepseek-flash (V4.1 Flash) | 혼잡 | $0.006 | $0.30 | $1.20 |
| deepseek-v4-pro (V4-Pro-0813) | 비혼잡 | $0.022 | $0.66 | $1.98 |
| deepseek-v4-pro (V4-Pro-0813) | 혼잡 | $0.044 | $1.32 | $3.96 |
deepseek-flash = DeepSeek-V4.1-Flash; deepseek-v4-pro = DeepSeek-V4-Pro-0813. API 공개는 모든 채팅 계정의 모델 전환을 의미하지 않습니다.
주말과 중국 공휴일은 비혼잡입니다. 평일 UTC 01:00–04:00 및 06:00–10:00는 혼잡입니다.
2026년 10월 4일 확인 · 공식 요금과 가정이 명확한 계산 예시로 비교합니다.
계산 예시 (실측 아님): 8M cached input + 2M uncached input + 1M output.
비혼잡: 8 × $0.003 + 2 × $0.15 + 1 × $0.60 = $0.924.
혼잡: 8 × $0.006 + 2 × $0.30 + 1 × $1.20 = $1.848.
모델 token 비용만 계산합니다. 세금·도구·추가 호출은 제외합니다.
로컬 LLM과 클라우드 API: 스타트업 비용 비교
GPU 청구 시간, CPU·메모리·저장·전송, 운영 인력과 API 대체 호출을 합산합니다. 유휴 시간은 청구 시간에 포함되므로 이중 계산하지 마세요.
Cost per accepted task = total cost / accepted tasks.
Break-even = F / (A − V), A > V.
F는 고정 월 비용, A는 API 합격 작업 단가, V는 로컬 변동 단가입니다. A가 V보다 높아야 손익분기를 계산할 수 있습니다.
동일한 작업과 합격 기준으로 품질, p95 지연, 동시 처리와 재시도를 측정하세요. 양자화·문맥 길이·메모리를 실제 구성에서 검증해야 합니다. 고정 토큰 기준이나 70/30 분할은 절감을 보장하지 않습니다.
자체 호스팅만으로 개인정보 보호가 보장되지 않습니다. 접근·로그·백업·연동을 확인하세요.