⚡ Ce qui s'est passé

Fin juin 2026, DeepSeek a lâché une bombe : la tarification des API d'IA en heures pleines / heures creuses. Du jamais vu — aucun acteur majeur de l'IA (OpenAI, Anthropic, Google, Meta) n'avait jamais tenté ça. Les fournisseurs d'électricité pratiquent ce modèle depuis longtemps, les apps de VTT font du surge pricing aux heures de pointe, mais une API d'IA ? DeepSeek est le premier, et ça bouleverse complètement l'économie de l'usage massif des LLM.

En résumé : pendant les heures de travail en Chine (pleine tarification), les prix doublent. Le soir et le week-end (heures creuses), le tarif bas actuel est maintenu. La grille entrera en vigueur à la sortie de la version stable de V4 (mi-juillet 2026), avec un préavis de 24 heures par e-mail avant le basculement.

📊 Les chiffres : prix en heures pleines vs heures creuses

Les heures pleines correspondent aux jours ouvrés de 9 h à 12 h et de 14 h à 18 h (heure de Pékin, UTC+8). Tout le reste — week-ends, pause déjeuner, nuit complète — est en heures creuses, à moitié prix.

Élément facturéV4 Pro (creuses)V4 Pro (pleines)V4 Flash (creuses)V4 Flash (pleines)
Hit cache¥0,025 / million de tokens¥0,05 / million de tokens¥0,02 / million de tokens¥0,04 / million de tokens
Miss cache¥3 / million de tokens¥6 / million de tokens¥1 / million de tokens¥2 / million de tokens
Sortie¥6 / million de tokens¥12 / million de tokens¥2 / million de tokens¥4 / million de tokens

🕐 Heures pleines de Pékin : quelle heure chez vous ?

Pékin, heures pleines (lun–ven)Ouest US (PDT)Est US (EDT)Londres (BST)Tokyo (JST)
9:00 – 12:00veille 18:00 – 21:00veille 21:00 – 00:0002:00 – 05:0010:00 – 13:00
14:00 – 18:0023:00 – 03:0002:00 – 06:0007:00 – 11:0015:00 – 19:00
💡 L'idée clé
Les heures pleines de Pékin (en rouge ci-dessus) tombent en fin d'après-midi et en soirée pour les Américains. Concrètement, pendant la journée de travail aux États-Unis, la Chine dort — DeepSeek est donc en tarif creux. Et la réciproque est vraie : quand la Chine travaille, les États-Unis dorment. On obtient une boucle d'arbitrage parfaitement bidirectionnelle.

🌍 Manuel d'arbitrage bidirectionnel

Comme les plages pleines/creuses de DeepSeek sont calées sur l'heure de Pékin, une même horloge signifie une réalité opposée selon l'endroit où vous vous trouvez. Voici les deux sens possibles, avec le mode d'emploi de chacun.

🅰️ Direction 1 : compte chinois → revendre aux utilisateurs occidentaux

Setup :
1. Ouvrez un compte DeepSeek avec un numéro de téléphone chinois (pour profiter du tarif de base le plus bas).
2. Vos heures creuses (nuit de Pékin, 18:00–09:00, plus tout le week-end) tombent en plein jour en Europe et en Amérique — pile quand les devs occidentaux sont les plus actifs.
3. Faites tourner un simple proxy API qui reçoit les requêtes des utilisateurs occidentaux et les forward à DeepSeek pendant les heures creuses.

L'équation :
• Sortie V4 Flash en heures creuses : ¥2 / million de tokens (≈ 0,27 $ / million).
• Sortie OpenAI GPT-4o : 10 $ / million de tokens.
• Différentiel : ×37. Vous pouvez revendre à 2–5 $ / million de tokens, rester 2 à 5 fois moins cher qu'OpenAI et empocher une marge nette de ×7 à ×18.

Idéal pour : les traitements par lots, la génération de contenu, la relecture de code, la traduction — toute tâche qui tolère quelques minutes de latence. Les utilisateurs occidentaux soumettent leurs jobs en journée ; votre proxy les met en file d'attente et les exécute la nuit de Pékin, au tarif creux.
🅱️ Direction 2 : compte étranger → revendre aux utilisateurs chinois

Setup :
1. Si DeepSeek applique des plages pleines/creuses selon la région d'enregistrement (par exemple un compte US calé sur les heures de travail américaines), enregistrez-vous avec un numéro US ou européen.
2. Vos heures creuses (la nuit aux US) tombent en pleine journée de travail à Pékin — pile quand les développeurs chinois codent.
3. Depuis votre compte US, proxyez les requêtes des utilisateurs chinois pendant vos heures creuses.

⚠️ Point important : à ce jour (juillet 2026), DeepSeek n'a annoncé de tarification horaire que pour les comptes enregistrés en Chine, calée sur l'heure de Pékin. On ne sait pas encore si les comptes internationaux auront leurs propres plages régionales ou s'ils suivront tous Pékin. On suit le dossier et on mettra à jour cet article à la sortie de la version stable. Si les comptes internationaux suivent eux aussi Pékin, la direction 2 ne tient pas — mais la direction 1 reste valable, et c'est de toute façon la plus porteuse.

Idéal pour : si des plages régionales sont confirmées — servir les développeurs chinois qui ont saturé leur quota DeepSeek aux heures pleines et cherchent une capacité de débordement. Votre compte US leur offre du tarif creux au moment où ils en ont le plus besoin.

🔧 Construire le proxy (mise en œuvre technique)

Pas besoin d'usine à gaz. Un proxy à file d'attente sur un petit VPS pas cher — voire un Raspberry Pi à la maison — suffit largement. L'architecture est rudimentaire :

🔄 Architecture du proxy (direction 1)

1. Couche d'entrée — un endpoint compatible OpenAI qui capte les requêtes des clients occidentaux 24/7.
2. File d'attente — les jobs entrent dans une file Redis (SQLite suffit à petite échelle). Chaque job porte une priorité et un deadline.
3. Planificateur — un process façon cron qui vérifie : « Est-on en heures creuses de Pékin ? » Si oui, il vide la file vers l'API DeepSeek. Sinon, il attend.
4. Couche de réponse — les résultats sont renvoyés, stockés, puis livrés au client (polling ou webhook).

Optimisation clé : exploitez à fond le cache de contexte de DeepSeek. Les tokens en hit cache coûtent seulement ¥0,02–0,025 / million en heures creuses — quasiment gratuit. Structurez vos prompts pour maximiser la réutilisation du cache (system prompt, longs documents, codebase).

⏰ Logique du planificateur (pseudo-code)

# Détermine si on est en heures creuses de Pékin
import datetime

def is_beijing_offpeak():
    now = datetime.datetime.now(datetime.timezone(datetime.timedelta(hours=8)))
    weekday = now.weekday()  # 0=lun, 6=dim
    hour = now.hour

    # Week-end : creuses toute la journée
    if weekday >= 5:
        return True

    # Jours ouvrés : 9-12 et 14-18 = pleines, sinon creuses
    if 9 <= hour < 12:
        return False
    if 14 <= hour < 18:
        return False
    return True

# Boucle principale : on ne traite la file qu'en heures creuses
while True:
    if is_beijing_offpeak():
        job = queue.pop()
        if job:
            result = deepseek_api.chat(job.prompt, model="deepseek-v4-flash")
            store_result(job.id, result)
    else:
        time.sleep(60)  # En heures pleines, on dort et on attend les creuses

💰 La mine d'or du week-end

C'est le détail que la plupart des gens laissent passer : les 48 heures du week-end sont intégralement en heures creuses. Deux jours entiers par semaine, à moitié prix, quel que soit votre fuseau. Si vous caliez vos grosses charges entre vendredi soir et dimanche, vous ne paieriez quasiment jamais le tarif plein. Pour les SaaS qui traitent du texte en volume — résumés, traductions, modération de contenu, extraction de données — cette seule astuce ampute 30 à 40 % de la facture API, sans aucun jeu de fuseaux horaires.

🧠 Stratégie avancée : le pipeline de lots le week-end

1. Pendant la semaine, capitalisez toutes les tâches non urgentes.
2. Vendredi 18:00 heure de Pékin : démarrez le worker de traitement.
3. Tournez pendant 48 heures, intégralement au tarif creux.
4. Lundi matin : tout est livré, la facture fait 50 % du tarif normal.

Pour les boîtes qui traitent plusieurs millions de tokens par jour, ce n'est pas de la petite monnaie — c'est la ligne qui sépare une opération rentable d'une opération à perte.

📋 Cas réel : le bot calendrier de la Coupe du Monde

Un développeur chinois (青小蛙) a monté avec DeepSeek V4 un bot qui scrape automatiquement le calendrier de la Coupe du Monde et génère des événements d'agenda. Avant l'entrée en vigueur de la tarification horaire, le bot a tourné un mois complet pour 60 ¥ (environ 8,20 $) : extraction de données structurées depuis des pages web, chaque jour, pendant 30 jours.

Même au tarif plein (sortie V4 Pro à ¥12 / million de tokens), le même bot ne coûterait que ~120 ¥/mois — toujours moins de 17 $. En heures creuses, on retombe à 60 ¥/mois. Et tout ça, c'est avec V4 Pro. Si vous basculez ce genre de charge sur V4 Flash, la sortie tombe à ¥2–4 / million de tokens. Le bot qui coûtait 60 ¥ en V4 Pro ne vaut plus que ¥10–20 en V4 Flash creuses. Soit 1,40–2,80 $ pour un mois complet d'automatisation. OpenAI, sur la même charge, facture GPT-4o entre 100 $ et 200 $ et plus.

⚠️ Risques et points de vigilance

1. Conditions d'utilisation

Revendre l'accès à une API peut enfreindre les conditions d'utilisation de DeepSeek. Avant de bâtir un business là-dessus, lisez les petits caractères. Au minimum, ne le vendez pas comme du « resale DeepSeek » — positionnez-le comme un service à valeur ajoutée qui, par hasard, s'appuie sur DeepSeek. Ajoutez votre propre UI, votre gestion de file, votre couche de cache ou votre optimisation de prompts : vous vendez un produit, pas un accès nu à l'API.

2. Latence

Le proxy à file d'attente induit de la latence. Si un utilisateur occidental soumet un job à 9 h heure du Pacifique (minuit à Pékin — creuses), traitez-le immédiatement. Mais s'il soumet à 18 h Pacific (9 h à Pékin — pleines), il faudra attendre 3 heures (la pause déjeuner de Pékin) ou 9 heures (18 h Pékin, retour des creuses). Soyez limpide là-dessus avec vos clients. Le temps réel n'est pas le bon cas d'usage ici — traitements par lots, tâches asynchrones et charges de nuit, oui.

3. La grille tarifaire peut bouger

DeepSeek s'engage à prévenir par e-mail 24 heures avant tout changement de prix. C'est honnête, mais ça signifie que vos marges peuvent bouger du jour au lendemain. Concevez votre business avec assez de marge pour qu'un doublement de tarif ne vous tue pas. Autre point : le ratio heures pleines/creuses peut évoluer dans le temps. On démarre à ×2, mais ça pourra passer à ×3 ou ×1,5 selon la façon dont DeepSeek ajuste son tir. Ne construisez pas un modèle économique qui ne tient qu'à un ratio pile de ×2.

4. Barrière à l'entrée du compte

Pour l'instant, l'ouverture d'un compte DeepSeek au tarif le plus bas exige un numéro de téléphone chinois. Depuis l'étranger, il vous faut un contact en Chine ou un service de numéro virtuel. C'est le point de friction principal pour les développeurs occidentaux qui voudraient exécuter la direction 1. À l'inverse, si vous êtes en Chine ou que vous avez un partenaire chinois, vous détenez une asymétrie d'information que la plupart des devs occidentaux n'ont pas — exploitez-la.

⏳ Conclusion

La tarification horaire de DeepSeek n'est pas qu'une bizarrerie de facturation expérimentale — c'est un changement structurel qui ouvre de vraies opportunités d'arbitrage. L'économie est triviale : quand votre coût de calcul baisse de 50 % pendant la moitié du temps, et que cette moitié s'aligne avec le rythme de vos clients, vous avez trouvé un différentiel à exploiter.

Maintenant, faites trois choses :

  1. Ouvrez un compte DeepSeek avant la sortie de la version stable de V4 — verrouillez l'accès tant que c'est encore facile. Après juillet, à mesure que la prise de conscience s'élargira, la politique d'enregistrement pourrait se durcir.
  2. Montez un pipeline de lots pour le week-end — même sans aucun arbitrage ni revente, le simple fait de décaler vos grosses charges vers le week-end vous fait économiser 50 % immédiatement.
  3. Surveillez la politique des plages régionales — si DeepSeek sort des plages calées sur la région d'enregistrement, la direction 2 se débloque et l'arbitrage devient pleinement bidirectionnel.

La fenêtre d'opportunité est limitée. Les autres acteurs de l'IA regardent de près l'expérience DeepSeek. Si la tarification horaire s'avère gagnante (fort probable — c'est juste l'économie de l'offre et de la demande appliquée à un cluster de GPU), OpenAI et Anthropic suivront probablement dans les 12 à 18 mois. À ce moment-là, l'espace d'arbitrage se réduira, car tout le monde jouera au même jeu. Les premiers de cordée — ceux qui montent leur infrastructure de proxy maintenant, tant que le terrain est vierge — rafleront les marges les plus grasses.

Le décalage horaire est votre avantage. Exploitez-le avant que tout le monde ne le comprenne.