LLM local ou API cloud : coûts pour les start-up
Tarifs officiels et exemples de calcul aux hypothèses explicites.
Séparez entrée non mise en cache, entrée en cache et sortie. La prétendue expérience de 30 jours à 500 requêtes par jour, sans preuve, a été supprimée.
Tarifs officiels et exemples de calcul aux hypothèses explicites.
API = (uncached input × rate + cached input × rate + output × rate) / 1,000,000.
| API model | Période | Entrée en cache | Entrée sans cache | Sortie |
|---|---|---|---|---|
| deepseek-flash (V4.1 Flash) | Hors pointe | $0.003 | $0.15 | $0.60 |
| deepseek-flash (V4.1 Flash) | Pointe | $0.006 | $0.30 | $1.20 |
| deepseek-v4-pro (V4-Pro-0813) | Hors pointe | $0.022 | $0.66 | $1.98 |
| deepseek-v4-pro (V4-Pro-0813) | Pointe | $0.044 | $1.32 | $3.96 |
deepseek-flash = DeepSeek-V4.1-Flash; deepseek-v4-pro = DeepSeek-V4-Pro-0813. L’accès API ne confirme pas le modèle de tous les comptes de chat.
Pointe UTC 01:00–04:00 et 06:00–10:00 du lundi au vendredi. Week-ends et jours fériés chinois : hors pointe.
Vérifié le 4 octobre 2026 · Tarifs officiels et exemples de calcul aux hypothèses explicites.
Exemple illustratif, pas une mesure: 8M cached input + 2M uncached input + 1M output.
Hors pointe: 8 × $0.003 + 2 × $0.15 + 1 × $0.60 = $0.924.
Pointe: 8 × $0.006 + 2 × $0.30 + 1 × $1.20 = $1.848.
Tokens du modèle uniquement ; hors taxes, outils et appels supplémentaires.
LLM local ou API cloud : coûts pour les start-up
Additionnez heures GPU facturées, CPU, mémoire, stockage, transfert, travail opérationnel et appels de secours. Ne comptez pas deux fois le temps inactif déjà facturé.
Cost per accepted task = total cost / accepted tasks.
Break-even = F / (A − V), A > V.
F : coût fixe mensuel ; A : coût API par tâche acceptée ; V : coût local variable. Équilibre seulement si A dépasse V.
Comparez les mêmes tâches avec les mêmes critères d’acceptation ; mesurez qualité, latence p95, concurrence et nouvelles tentatives. Vérifiez quantification, contexte et mémoire dans votre configuration. Aucun seuil universel de tokens ni économie garantie avec un partage 70/30.
Auto-héberger ne garantit pas la confidentialité : vérifiez accès, journaux, sauvegardes et intégrations.