Erfassen Sie ungespeicherte Eingabe, Cache-Eingabe und Ausgabe getrennt. Die unbelegte Behauptung eines 30-Tage-Tests mit täglich 500 Anfragen wurde entfernt.

Offizielle Preise und nachvollziehbare Beispielrechnungen.

API = (uncached input × rate + cached input × rate + output × rate) / 1,000,000.

USD je Million Tokens; 4. Oktober 2026
API modelZeitraumCache-EingabeEingabe ohne CacheAusgabe
deepseek-flash (V4.1 Flash)Nebenzeit$0.003$0.15$0.60
deepseek-flash (V4.1 Flash)Hauptzeit$0.006$0.30$1.20
deepseek-v4-pro (V4-Pro-0813)Nebenzeit$0.022$0.66$1.98
deepseek-v4-pro (V4-Pro-0813)Hauptzeit$0.044$1.32$3.96

deepseek-flash = DeepSeek-V4.1-Flash; deepseek-v4-pro = DeepSeek-V4-Pro-0813. API-Zugang bestätigt nicht das Modell aller Chat-Konten.

Hauptzeit: UTC 01:00–04:00 und 06:00–10:00, Montag–Freitag. Wochenenden und chinesische Feiertage: Nebenzeit.

Geprüft am 4. Oktober 2026 · Offizielle Preise und nachvollziehbare Beispielrechnungen.

Illustrative Rechnung, keine Messung: 8M cached input + 2M uncached input + 1M output.

Nebenzeit: 8 × $0.003 + 2 × $0.15 + 1 × $0.60 = $0.924.
Hauptzeit: 8 × $0.006 + 2 × $0.30 + 1 × $1.20 = $1.848.

Nur Modell-Tokens; ohne Steuern, Werkzeuge und weitere Aufrufe.

Lokales LLM vs Cloud-API: Kosten für Start-ups

Berücksichtigen Sie abgerechnete GPU-Stunden, CPU, RAM, Speicher, Transfer, Betriebspersonal und API-Fallback. Leerlauf ist bereits in den Instanzstunden enthalten.

Cost per accepted task = total cost / accepted tasks.
Break-even = F / (A − V), A > V.
F: monatliche Fixkosten; A: API-Kosten je akzeptierter Aufgabe; V: lokale variable Kosten. Break-even nur bei A größer als V.

Vergleichen Sie dieselben Aufgaben mit gleichen Abnahmekriterien; messen Sie Qualität, p95-Latenz, Parallelität und Wiederholungen. Prüfen Sie Quantisierung, Kontext und Speicherbedarf praktisch. Es gibt keine universelle Token-Schwelle oder garantierte Ersparnis durch 70/30-Routing.

Selbsthosting garantiert keine Privatsphäre; prüfen Sie Zugriffe, Logs, Backups und Integrationen.

Quellen · Geprüft am 4. Oktober 2026

DeepSeek → · AIListPrime →