Que signifie « rétro-calcul du quota »
Les pages officielles publient rarement un plafond fixe de tokens. Nous le déduisons : quota total ≈ tokens déjà consommés ÷ pourcentage affiché. Par ex. 15 M de tokens à 37,3 % de la barre 5 h implique ~40 M pour cette fenêtre. On recoupe avec les barres 5 h, 7 jours et mensuelle.
Pourquoi aucun plafond fixe officiel n'est publié
Les plafonds sont dynamiques : ils varient avec la version du modèle, la charge serveur et la stratégie commerciale. Un chiffre publié devient une promesse et une cible d'abus, les fournisseurs les gardent donc volontairement flous. Considérez chaque chiffre ici comme un instantané, pas un contrat.
Comment le taux de cache modifie la consommation réelle
Dans les flux codage/agent, le même contexte est renvoyé sans cesse. Un utilisateur a relevé 93,7 % de taux de cache — seuls ~6 % des entrées étaient facturées au plein tarif. Le quota « ressenti » est donc bien plus grand que ne le suggère le nombre brut de tokens.
Abonnement vs API à l'usage
Un abonnement échange la flexibilité contre un prix forfaitaire dans des fenêtres glissantes. L'API à l'usage facture chaque token mais ne vous limite jamais en débit. Si votre usage est régulier et prévisible, l'abonnement gagne ; s'il est sporadique ou nécessite de la concurrence, l'API gagne.