Resumão: A DeepSeek anunciou que a API do V4 vai adotar precificação dinâmica por faixa de horário — nos horários de pico dos dias úteis (horário de Pequim, 9h–12h e 14h–18h), o preço dobra na lata; nos horários de vale, mantém o valor atual. O lançamento oficial do V4 está marcado para meados de julho de 2026. Mesmo pelo preço de pico (já dobrado), a DeepSeek continua sendo a API de IA de fronteira mais barata do planeta — e por uma margem enorme.

⚡ O que aconteceu

Em 29 de junho, a DeepSeek disparou para a sua base de usuários um e-mail intitulado "Plano de lançamento da versão oficial do DeepSeek V4 e ajuste na cobrança". A principal mudança: precificação dinâmica por faixa de horário — uma estreia entre os grandes provedores de API de IA.

Nos horários de pico dos dias úteis (horário de Pequim, 9h–12h e 14h–18h), todos os preços da API V4 dobram direto; nos demais horários nada muda, e seguem naquele nível já ridiculamente baixo que a gente conhece.

Pense nisso como o surge pricing da Uber nos horários de pico, só que a unidade cobrada é o token de IA. Todo mundo escrevendo código ao mesmo tempo? Você paga o prêmio. Jogar o lote pesado para rodar às 3 da manhã? Desconto.

📊 Tabela de preços

DeepSeek V4 Pro

Item de cobrançaHorário de vale (¥/M tokens)Horário de pico (¥/M tokens)
Entrada (cache hit)¥0,025¥0,05
Entrada (cache miss)¥3,00¥6,00
Saída¥6,00¥12,00

DeepSeek V4 Flash

Item de cobrançaHorário de vale (¥/M tokens)Horário de pico (¥/M tokens)
Entrada (cache hit)¥0,02¥0,04
Entrada (cache miss)¥1,00¥2,00
Saída¥2,00¥4,00
⚡ Lembrando: mesmo pelo preço de pico, a saída do DeepSeek V4 Flash sai por apenas ¥4/M tokens — algo como US$0,56/M tokens. Para efeito de comparação: o GPT-5.5 custa US$30/M e o Claude Opus 4.8, US$25/M. Ou seja, no momento em que a DeepSeek está mais cara, ela ainda sai de 45 a 50 vezes mais barata que o modelo flagship da OpenAI.

📋 Custo real

Só de olhar o preço unitário não dá para sentir a dimensão? Então vamos de conta real. Um leitor do portal Appinn compartilhou o próprio uso de fato: rodando o DeepSeek V4 Flash para atualizar automaticamente um calendário da Copa do Mundo — capturando placares, gols e dados das partidas — durante um mês inteiro:

  • Dia normal: cerca de ¥2 (US$0,28)
  • Dia pesado (corrigindo bug, reprocessando tarefas): ¥13 (US$1,82)
  • Mês inteiro, total: ¥60 (US$8,40)

É isso aí — uma pipeline que roda todo dia, em automático, durante um mês, custa menos que um almoço em São Francisco.

🏆 Comparação com a concorrência

Aí estão os preços de saída dos principais modelos (em dólar, por milhão de tokens):

ModeloSaída US$/MJanela de contexto
DeepSeek V4 Flash (vale / pico)US$0,28 / US$0,561.000.000
DeepSeek V4 Pro (vale / pico)US$0,87 / US$1,741.000.000
Xiaomi MiMo V2.5US$0,281.000.000
Xiaomi MiMo V2.5 ProUS$0,871.000.000
MiniMax M3US$1,201.000.000
GLM-5.1 (Zhipu)US$4,40200.000
Kimi K2.6¥27 ≈ US$3,78262.000
Qwen3.7 Plus¥8 ≈ US$1,121.000.000
GPT-5.5 (OpenAI)US$30,001.100.000
Claude Opus 4.8 (Anthropic)US$25,001.000.000

Na faixa de "1 milhão de contexto + preço muito baixo", o rival mais próximo é o Xiaomi MiMo V2.5 — saída a US$0,28/M, empatando com o preço de vale do DeepSeek V4 Flash, mas sem surge de pico. Se você é sensível a custo e não quer ficar vigiando o relógio, o MiMo pode ser a escolha mais segura.

🤔 Por que fazer isso

O motivo é direto: gerenciamento de capacidade. Os servidores da DeepSeek são massacrados durante o horário comercial chinês. Em vez de recusar serviço (ou deixar a sobrecarga degradar a qualidade), eles usam o sinal de preço para aplainar a curva de demanda.

Na prática, é economia de infraestrutura bem-feita. AWS, Google Cloud e todas as grandes nuvens fazem isso há anos — instâncias spot e capacidade reservada seguem exatamente a mesma lógica. A DeepSeek é apenas a primeira a trazer esse modelo para a inferência de modelos de linguagem.

É de esperar que outros sigam. Se a DeepSeek consolidar esse formato, Kimi e Qwen quase certamente vão lançar suas próprias faixas de cobrança por horário.

🎯 O que você faz com isso

  1. Se preço é sensível: agende as cargas pesadas (batch, geração de dados de treino, análises em larga escala) fora do horário comercial de Pequim (9h–12h e 14h–18h). Sua carteira agradece.
  2. Se precisa estar no ar 7×24: faça o orçamento pelo preço de pico, ou monte uma cadeia de fallback — roteie o tráfego do pico para o MiMo V2.5 ou o Qwen3.7 Plus, e no vale volte para a DeepSeek.
  3. Se é do time low-budget ou caça-frete grátis: o V4 Flash no horário de vale é praticamente de graça. Entrada (cache miss) a ¥1/M significa processar 1 milhão de tokens de entrada e 1 milhão de tokens de saída por cerca de ¥3 (41 centavos de dólar). Uma novela inteira, lida, analisada e devolvida, por isso.
🔮 Previsão: o surge por faixa de horário do DeepSeek V4 é só o primeiro sinal. Até o quarto trimestre de 2026, pelo menos mais dois provedores chineses de IA devem adotar precificação por horário. A era do "IA de preço único e uso ilimitado" está chegando ao fim — e, na verdade, isso é bom. Significa que a IA está virando infraestrutura de verdade, e não mais uma demo que queima dinheiro para fazer barulho.

⏳ Conclusão

Mesmo com o preço dobrado, o DeepSeek V4 continua sendo a API de IA de fronteira mais barata do mundo. A precificação por faixa de horário é feature, não bug — mostra que a demanda pela DeepSeek já é grande o bastante para exigir gestão de capacidade, e eles deixaram isso explícito no preço, sem enrolação.

Se você usa APIs de IA chinesas (e, sinceramente, deveria — o desconto frente aos provedores americanos já chegou num nível absurdo), enquanto a tarefa não exigir entrada multimodal, o DeepSeek V4 Flash segue sendo a escolha padrão. É só deixar o trabalho pesado rodar depois do jantar.


Fontes: e-mail da DeepSeek aos usuários (29 de junho de 2026), reportagem do Appinn, catálogo de preços da DevTk.AI. Preços conferidos em 3 de julho de 2026.