Was „Rückrechnung des Kontingents“ bedeutet
Offizielle Seiten veröffentlichen selten eine feste Token-Obergrenze. Wir leiten sie ab: Gesamtkontingent ≈ bereits verbrauchte Token ÷ angezeigter Nutzungsprozentsatz. Z. B. 15 Mio. Token bei 37,3 % der 5-Stunden-Leiste bedeutet ~40 Mio. für dieses Fenster. Wir gleichen über die 5-Stunden-, 7-Tage- und Monatsleisten ab.
Warum keine offizielle feste Obergrenze veröffentlicht wird
Kontingente sind dynamisch: Sie ändern sich mit Modellversion, Serverlast und Geschäftsstrategie. Eine veröffentlichte Zahl wird zum Versprechen und zum Missbrauchsziel, deshalb halten Anbieter sie absichtlich vage. Behandeln Sie jede Zahl hier als Momentaufnahme, nicht als Vertrag.
Wie die Cache-Trefferquote den realen Verbrauch verändert
Bei Codier-/Agenten-Workflows wird derselbe Kontext immer wieder gesendet. Ein Nutzer protokollierte eine Cache-Trefferquote von 93,7 % — nur ~6 % der Eingabe wurden also voll preisberechnet. Das Kontingent, das man „spürt“, ist daher weit größer, als die reine Token-Zahl vermuten lässt.
Abo vs. nutzungsabhängige API
Ein Abo tauscht Flexibilität gegen einen Festpreis innerhalb rollierender Fenster. Eine nutzungsabhängige API berechnet jedes Token, drosselt Sie aber nie. Bei gleichmäßiger, vorhersehbarer Nutzung gewinnt das Abo; bei spitzenhafter Nutzung oder nötigem Parallelismus die API.