Resumão: A DeepSeek anunciou que a API do V4 vai adotar precificação dinâmica por faixa de horário — nos horários de pico dos dias úteis (horário de Pequim, 9h–12h e 14h–18h), o preço dobra na lata; nos horários de vale, mantém o valor atual. O lançamento oficial do V4 está marcado para meados de julho de 2026. Mesmo pelo preço de pico (já dobrado), a DeepSeek continua sendo a API de IA de fronteira mais barata do planeta — e por uma margem enorme.
⚡ O que aconteceu
Em 29 de junho, a DeepSeek disparou para a sua base de usuários um e-mail intitulado "Plano de lançamento da versão oficial do DeepSeek V4 e ajuste na cobrança". A principal mudança: precificação dinâmica por faixa de horário — uma estreia entre os grandes provedores de API de IA.
Nos horários de pico dos dias úteis (horário de Pequim, 9h–12h e 14h–18h), todos os preços da API V4 dobram direto; nos demais horários nada muda, e seguem naquele nível já ridiculamente baixo que a gente conhece.
Pense nisso como o surge pricing da Uber nos horários de pico, só que a unidade cobrada é o token de IA. Todo mundo escrevendo código ao mesmo tempo? Você paga o prêmio. Jogar o lote pesado para rodar às 3 da manhã? Desconto.
📊 Tabela de preços
DeepSeek V4 Pro
| Item de cobrança | Horário de vale (¥/M tokens) | Horário de pico (¥/M tokens) |
|---|---|---|
| Entrada (cache hit) | ¥0,025 | ¥0,05 |
| Entrada (cache miss) | ¥3,00 | ¥6,00 |
| Saída | ¥6,00 | ¥12,00 |
DeepSeek V4 Flash
| Item de cobrança | Horário de vale (¥/M tokens) | Horário de pico (¥/M tokens) |
|---|---|---|
| Entrada (cache hit) | ¥0,02 | ¥0,04 |
| Entrada (cache miss) | ¥1,00 | ¥2,00 |
| Saída | ¥2,00 | ¥4,00 |
📋 Custo real
Só de olhar o preço unitário não dá para sentir a dimensão? Então vamos de conta real. Um leitor do portal Appinn compartilhou o próprio uso de fato: rodando o DeepSeek V4 Flash para atualizar automaticamente um calendário da Copa do Mundo — capturando placares, gols e dados das partidas — durante um mês inteiro:
- Dia normal: cerca de ¥2 (US$0,28)
- Dia pesado (corrigindo bug, reprocessando tarefas): ¥13 (US$1,82)
- Mês inteiro, total: ¥60 (US$8,40)
É isso aí — uma pipeline que roda todo dia, em automático, durante um mês, custa menos que um almoço em São Francisco.
🏆 Comparação com a concorrência
Aí estão os preços de saída dos principais modelos (em dólar, por milhão de tokens):
| Modelo | Saída US$/M | Janela de contexto |
|---|---|---|
| DeepSeek V4 Flash (vale / pico) | US$0,28 / US$0,56 | 1.000.000 |
| DeepSeek V4 Pro (vale / pico) | US$0,87 / US$1,74 | 1.000.000 |
| Xiaomi MiMo V2.5 | US$0,28 | 1.000.000 |
| Xiaomi MiMo V2.5 Pro | US$0,87 | 1.000.000 |
| MiniMax M3 | US$1,20 | 1.000.000 |
| GLM-5.1 (Zhipu) | US$4,40 | 200.000 |
| Kimi K2.6 | ¥27 ≈ US$3,78 | 262.000 |
| Qwen3.7 Plus | ¥8 ≈ US$1,12 | 1.000.000 |
| GPT-5.5 (OpenAI) | US$30,00 | 1.100.000 |
| Claude Opus 4.8 (Anthropic) | US$25,00 | 1.000.000 |
Na faixa de "1 milhão de contexto + preço muito baixo", o rival mais próximo é o Xiaomi MiMo V2.5 — saída a US$0,28/M, empatando com o preço de vale do DeepSeek V4 Flash, mas sem surge de pico. Se você é sensível a custo e não quer ficar vigiando o relógio, o MiMo pode ser a escolha mais segura.
🤔 Por que fazer isso
O motivo é direto: gerenciamento de capacidade. Os servidores da DeepSeek são massacrados durante o horário comercial chinês. Em vez de recusar serviço (ou deixar a sobrecarga degradar a qualidade), eles usam o sinal de preço para aplainar a curva de demanda.
Na prática, é economia de infraestrutura bem-feita. AWS, Google Cloud e todas as grandes nuvens fazem isso há anos — instâncias spot e capacidade reservada seguem exatamente a mesma lógica. A DeepSeek é apenas a primeira a trazer esse modelo para a inferência de modelos de linguagem.
É de esperar que outros sigam. Se a DeepSeek consolidar esse formato, Kimi e Qwen quase certamente vão lançar suas próprias faixas de cobrança por horário.
🎯 O que você faz com isso
- Se preço é sensível: agende as cargas pesadas (batch, geração de dados de treino, análises em larga escala) fora do horário comercial de Pequim (9h–12h e 14h–18h). Sua carteira agradece.
- Se precisa estar no ar 7×24: faça o orçamento pelo preço de pico, ou monte uma cadeia de fallback — roteie o tráfego do pico para o MiMo V2.5 ou o Qwen3.7 Plus, e no vale volte para a DeepSeek.
- Se é do time low-budget ou caça-frete grátis: o V4 Flash no horário de vale é praticamente de graça. Entrada (cache miss) a ¥1/M significa processar 1 milhão de tokens de entrada e 1 milhão de tokens de saída por cerca de ¥3 (41 centavos de dólar). Uma novela inteira, lida, analisada e devolvida, por isso.
⏳ Conclusão
Mesmo com o preço dobrado, o DeepSeek V4 continua sendo a API de IA de fronteira mais barata do mundo. A precificação por faixa de horário é feature, não bug — mostra que a demanda pela DeepSeek já é grande o bastante para exigir gestão de capacidade, e eles deixaram isso explícito no preço, sem enrolação.
Se você usa APIs de IA chinesas (e, sinceramente, deveria — o desconto frente aos provedores americanos já chegou num nível absurdo), enquanto a tarefa não exigir entrada multimodal, o DeepSeek V4 Flash segue sendo a escolha padrão. É só deixar o trabalho pesado rodar depois do jantar.
Fontes: e-mail da DeepSeek aos usuários (29 de junho de 2026), reportagem do Appinn, catálogo de preços da DevTk.AI. Preços conferidos em 3 de julho de 2026.