什么是「额度反推」
官方页面很少公布固定 token 上限。我们用反推:总额度 ≈ 已使用 token ÷ 进度条显示的百分比。例如 5 小时窗口用了 1500 万 token、进度 37.3%,意味着该窗口总额度约 4000 万。我们再用 5 小时、7 天、月度三个窗口交叉验证。
数据来自社区实测与编辑反推,不是官方标价上限。
没有唯一「最好」的套餐,取决于你的作息:夜间重度使用,阿里千问 3.8 Max 月卡(¥39,约 15 亿 token/月)性价比几乎没有对手;白天全时段编程,Kimi K3 Allegretto(¥159/月,约 9.5 亿 token/月)更稳。
| 模型 | 最低/月↕ | 月额度↕ | 每元Token↕ | 5h窗口 | 夜间折扣 | 适合场景 | 详情 |
|---|---|---|---|---|---|---|---|
| Kimi K3(Allegretto 档)月之暗面 | ¥159 | ~9.5亿 | ~600万 | ~4000万 | 无 | 全时段编程 / Agent | 详情 → |
| 千问 3.8 Max Token Plan阿里云 | ¥39 | ~15亿(夜间) | ~3800万(夜间) | 700 credits / 5h | 0.2折(夜间) | 夜间重度用户 | 详情 → |
| GLM 5.2智谱 AI | — | — | — | — | — | — | — |
数据来自社区用户实测反推,非官方固定上限,模型方可能动态调整额度策略。点击列名可排序。
官方页面很少公布固定 token 上限。我们用反推:总额度 ≈ 已使用 token ÷ 进度条显示的百分比。例如 5 小时窗口用了 1500 万 token、进度 37.3%,意味着该窗口总额度约 4000 万。我们再用 5 小时、7 天、月度三个窗口交叉验证。
额度是动态的:会随模型版本、服务器负载和商业策略变化。公开一个数字就等于做了承诺,也给了薅羊毛的目标,所以厂商有意保持模糊。请把这里的每个数字当作快照,而非合同。
编程 / Agent 场景下,相同的上下文会反复发送。有用户记录到 93.7% 的缓存命中率 —— 意味着只有约 6% 的输入按全价计费。所以你「体感」到的额度,远大于原始 token 数显示的量。
订阅制用灵活性换取滚动窗口内的固定价。按量计费 API 每个 token 都计费,但不会对你限速。用量稳定可预测时,订阅更划算;用量波动大或需要并发时,API 更划算。
订阅制锁定月度收入,也降低了消费者对按 token 计费不可预测性的抵触。同时让厂商用额度窗口来削峰填谷,而不是单纯涨价。
推理集群按白天峰值超额配置,夜间闲置。 steep 夜间折扣(千问的 0.2 折)本质上是在给闲置算力定价 —— 厂商几乎没有额外成本,却填满了本会浪费的 GPU。
你实际能用多少,由三个隐藏杠杆决定:缓存命中率、你的负载的输入输出比、以及时段折扣。同一套餐的两个用户,实际吞吐量可能相差 50 倍 —— 这正是我们反推而非只看标价的原因。
取决于你的作息。夜间使用,千问 3.8 Max 每元 token 数高得多(约 3800 万 vs Kimi 约 600 万)—— 但白天千问降到约 3 亿/月。Kimi K3 全天稳定约 9.5 亿/月,没有时段限制。夜猫子选千问,全天编程选 Kimi。
纯看每元 token 数,夜间千问 3.8 Max 没有对手。要稳定 + 面向编程的工具链,Kimi K3 Allegretto 是最强的全能选手。想先试水,从 Qoder 的免费千问 3.8 Max 额度开始,先不花钱。
通常会提示额度已用完;你需要等滚动窗口释放(5 小时窗口逐小时释放、7 天窗口逐天释放),或升级套餐。部分厂商会降低质量或速度,而不是硬性拦截。
对高强度突发会话(Agent 编程、大型重构),5 小时额度几乎总是瓶颈 —— 月度额度还没怎么动,5 小时就先触顶了。对细水长流的使用,你盯的会是月度额度。
有。Qoder 提供运行千问 3.8 Max 的免费档,Kimi 也有(受限的)免费版。这是付费订阅前衡量你真实用量的最佳方式。