Co oznacza „wsteczne wyliczenie puli”
Oficjalne strony rzadko publikują twardy limit tokenów. Wyliczamy go: Łączna pula ≈ zużyte tokeny ÷ wyświetlany procent użycia. Np. 15M tokenów przy 37.3% paska 5h oznacza ~40M dla tego okna. Krzyżujemy dane z pasków 5h, 7-dniowych i miesięcznych.
Dlaczego nie publikuje się oficjalnego stałego limitu
Limity są dynamiczne: zmieniają się wraz z wersją modelu, obciążeniem serwera i strategią biznesową. Opublikowanie konkretnej liczby staje się obietnicą i celem do nadużyć, dlatego dostawcy celowo utrzymują je w niejasności. Traktuj każdą liczbę tutaj jako migawkę, a nie umowę.
Jak wskaźnik trafień w cache zmienia rzeczywiste zużycie
W przepływach pracy związanych z programowaniem/agentami ten sam kontekst jest wysyłany w kółko. Jeden z użytkowników zanotował wskaźnik trafień w cache na poziomie 93.7% — co oznacza, że tylko ~6% danych wejściowych rozliczano w pełnej cenie. Pula, którą „czujesz”, jest więc znacznie większa, niż sugeruje surowa liczba tokenów.
Subskrypcja vs API pay-as-you-go
Subskrypcja wymienia elastyczność na stałą cenę w obrębie przesuwnych okien. API pay-as-you-go rozlicza każdy token, ale nigdy nie ogranicza Cię prędkością. Przy stabilnym, przewidywalnym użyciu wygrywa subskrypcja; przy skokowym użyciu lub gdy potrzebujesz współbieżności, wygrywa API.