Separe entrada sem cache, entrada em cache e saída. Foi removida a alegação sem evidências de um teste de 30 dias com 500 consultas diárias.

Preços oficiais e exemplos com premissas explícitas.

API = (uncached input × rate + cached input × rate + output × rate) / 1,000,000.

USD por milhão de tokens; 4 de outubro de 2026
API modelPeríodoEntrada em cacheEntrada sem cacheSaída
deepseek-flash (V4.1 Flash)Fora de pico$0.003$0.15$0.60
deepseek-flash (V4.1 Flash)Pico$0.006$0.30$1.20
deepseek-v4-pro (V4-Pro-0813)Fora de pico$0.022$0.66$1.98
deepseek-v4-pro (V4-Pro-0813)Pico$0.044$1.32$3.96

deepseek-flash = DeepSeek-V4.1-Flash; deepseek-v4-pro = DeepSeek-V4-Pro-0813. A API não confirma o modelo de todas as contas de chat.

Pico UTC 01:00–04:00 e 06:00–10:00, segunda a sexta. Fins de semana e feriados públicos chineses: fora de pico.

Verificado em 4 de outubro de 2026 · Preços oficiais e exemplos com premissas explícitas.

Exemplo ilustrativo, não medição: 8M cached input + 2M uncached input + 1M output.

Fora de pico: 8 × $0.003 + 2 × $0.15 + 1 × $0.60 = $0.924.
Pico: 8 × $0.006 + 2 × $0.30 + 1 × $1.20 = $1.848.

Apenas tokens do modelo; exclui impostos, ferramentas e chamadas adicionais.

LLM local vs API na nuvem: custos para startups

Inclua horas GPU faturadas, CPU, memória, armazenamento, transferência, operação e API de contingência. Não conte novamente a ociosidade já incluída nas horas.

Cost per accepted task = total cost / accepted tasks.
Break-even = F / (A − V), A > V.
F: custo fixo mensal; A: custo API por tarefa aceita; V: custo local variável. Equilíbrio apenas quando A supera V.

Compare as mesmas tarefas com critérios iguais; meça qualidade, latência p95, concorrência e novas tentativas. Verifique quantização, contexto e memória na configuração real. Não há limite universal de tokens nem economia garantida com divisão 70/30.

Hospedar localmente não garante privacidade: confira acesso, logs, backups e integrações.

Fontes · Verificado em 4 de outubro de 2026

DeepSeek → · AIListPrime →