Echter Token-Kontingentvergleich der KI-Modelle

Echte Kontingente, rückgerechnet aus Community-Tests und Redaktionsläufen — keine offiziellen Aufkleber-Obergrenzen.

Es gibt keinen einzelnen „besten“ Tarif – es hängt von Ihrem Rhythmus ab. Bei intensiver Nutzung nachts ist Alibabas Qwen 3.8 Max Token-Plan (~1,5 Mrd. Token/Monat für ¥39) unübertroffen. Für ganztägiges Programmieren ist Kimi K3 Allegretto (¥159/Monat, ~950 Mio. Token) die verlässlichere Wahl.

Zuletzt geprüft:

Kontingente im Seitenvergleich

ModellMin./MonatMonatskontingentToken/¥5-Std-FensterNachtrabattIdeal fürDetails
Kimi K3 (Allegretto)Moonshot AI¥159~950 Mio.~6 Mio.~40 Mio.KeineGanztägiges Coden & AgentenDetails →
Qwen 3.8 Max Token-PlanAlibaba Cloud¥39~1,5 Mrd. (nachts)~38 Mio. (nachts)700 Credits / 5h0,2 折 (nachts)Nachaktive Power-UserDetails →
GLM 5.2Zhipu AI

Daten sind rückgerechnet aus realer Nutzung von Community-Nutzern, keine offiziellen festen Obergrenzen. Anbieter können Kontingente dynamisch anpassen. Auf eine Spaltenüberschrift klicken zum Sortieren.

Welcher Tarif passt?

Gelegentliche Fragen / leichte Nutzung
Kostenlos starten — Qoder oder die Kimi-Free-Stufe. Erst upgraden, wenn Limits erreicht werden.

Wie wir das Kontingent schätzen

Was „Rückrechnung des Kontingents“ bedeutet

Offizielle Seiten veröffentlichen selten eine feste Token-Obergrenze. Wir leiten sie ab: Gesamtkontingent ≈ bereits verbrauchte Token ÷ angezeigter Nutzungsprozentsatz. Z. B. 15 Mio. Token bei 37,3 % der 5-Stunden-Leiste bedeutet ~40 Mio. für dieses Fenster. Wir gleichen über die 5-Stunden-, 7-Tage- und Monatsleisten ab.

Warum keine offizielle feste Obergrenze veröffentlicht wird

Kontingente sind dynamisch: Sie ändern sich mit Modellversion, Serverlast und Geschäftsstrategie. Eine veröffentlichte Zahl wird zum Versprechen und zum Missbrauchsziel, deshalb halten Anbieter sie absichtlich vage. Behandeln Sie jede Zahl hier als Momentaufnahme, nicht als Vertrag.

Wie die Cache-Trefferquote den realen Verbrauch verändert

Bei Codier-/Agenten-Workflows wird derselbe Kontext immer wieder gesendet. Ein Nutzer protokollierte eine Cache-Trefferquote von 93,7 % — nur ~6 % der Eingabe wurden also voll preisberechnet. Das Kontingent, das man „spürt“, ist daher weit größer, als die reine Token-Zahl vermuten lässt.

Abo vs. nutzungsabhängige API

Ein Abo tauscht Flexibilität gegen einen Festpreis innerhalb rollierender Fenster. Eine nutzungsabhängige API berechnet jedes Token, drosselt Sie aber nie. Bei gleichmäßiger, vorhersehbarer Nutzung gewinnt das Abo; bei spitzenhafter Nutzung oder nötigem Parallelismus die API.

Branchen-Einblicke

Warum chinesische Modelle Abos statt reiner API pushen

Abos sichern monatliche Einnahmen und senken die Abrechnungsreibung für Nutzer, die die Unberechenbarkeit der Token-Abrechnung scheuen. Sie ermöglichen Anbietern auch, Nachfrage über Kontingentfenster zu glätten statt über reine Preisspitzen.

Die Rechenplanungs-Logik hinter Nachtrabatten

Inferenz-Cluster sind für Tagespitzen überdimensioniert und nachts leer. Ein steiler Nachtrabatt (Qwens 0,2 折) macht einfach die Leerlaufkapazität bezahlbar — sie kostet den Anbieter fast nichts extra und füllt sonst verschwendete GPUs.

Woher die Lücke zwischen „Preis“ und „gefühltem Wert“ kommt

Drei versteckte Hebel entscheiden, was Sie tatsächlich bekommen: Cache-Trefferquote, das Eingabe-/Ausgabeverhältnis Ihrer Last und Tageszeit-Rabatte. Zwei Nutzer im selben Tarif können 50× unterschiedlichen realen Durchsatz erleben — deshalb rechnen wir zurück statt dem Aufkleber zu trauen.

Schnellkarten der Modelle

Kimi K3 (Allegretto)Top-Wahl fürs Coden

Die ausgewogenste Wahl für tägliche Entwickler: ~950 Mio. Token/Monat, ein 5-Stunden-Fenster von ~40 Mio. und 20-faches Code-Kontingent. Rund um die Uhr nutzbar, kein Nachttarif-Zwang.

Ab/Monat
¥159
Monatlich
~950 Mio.
5-Std-Fenster
~40 Mio.
Vollständigen Test lesen →
Qwen 3.8 Max Token-PlanBestes Preis-Leistungs-Verhältnis — nachts

Unschlagbarer Wert, WENN man nachts (22:00–08:00) rechenintensive Jobs fährt: ~1,5 Mrd. Token/Monat für ¥39. Bei Tag Nutzung sinkt der Wert auf ~300 Mio., ohne Rabatt auf ~30 Mio.

Ab/Monat
¥39
Monatlich
~1,5 Mrd. (nachts)
5-Std-Fenster
700 Credits / 5h
Vollständigen Test lesen →

FAQ

Was ist preiswerter, Kimi K3 oder Qwen 3.8 Max?

Es hängt von Ihren Zeiten ab. Qwen 3.8 Max ist pro Token deutlich billiger, WENN Sie nachts arbeiten (~38 Mio. Token/Yuan vs. ~6 Mio. bei Kimi) — tagsüber fällt Qwen aber auf ~300 Mio./Monat. Kimi K3 liefert rund um die Uhr stabile ~950 Mio./Monat ohne Zeitbeschränkung. Nachteulen: Qwen. Ganztags-Coder: Kimi.

Welcher chinesische KI-Tarif bietet insgesamt das beste Preis-Leistungs-Verhältnis?

Rein nach Token pro Yuan ist Qwen 3.8 Max nachts unübertroffen. Für Verlässlichkeit und eine codierungsorientierte Toolchain ist Kimi K3 Allegretto der stärkste Allrounder. Zum Ausprobieren starten Sie mit Qoders kostenlosem Qwen-3.8-Max-Kontingent, bevor Sie etwas bezahlen.

Was passiert, wenn ich das Kontingentlimit erreiche?

Meist erscheint ein Hinweis, dass das Kontingent erschöpft ist; Sie warten, bis das rollierende Fenster freigibt (5-Stunden-Fenster stündlich, 7-Tage-Fenster täglich), oder Sie upgraden. Manche Anbieter drosseln eher Qualität oder Geschwindigkeit, als hart zu sperren.

Was wird zuerst erschöpft — das 5-Stunden- oder das Monatskontingent?

Bei intensiven, spitzenhaften Sessions (Agenten-Coden, große Refactors) ist die 5-Stunden-Leiste fast immer der Flaschenhals — sie erschöpft sich lange vor der Monatsleiste. Bei gleichmäßigem Tropfen-Nutzen beobachten Sie die Monatsleiste.

Gibt es kostenlose chinesische Large Models?

Ja. Qoder bietet einen kostenlosen Tarif mit Qwen 3.8 Max, und Kimi hat eine (begrenzte) Gratisstufe. Sie sind der beste Weg, Ihren realen Verbrauch zu messen, bevor Sie ein Abo bezahlen.

Weiterlesen