⚡ 一句话先说清楚

前两篇文章发出去之后——美团 CatPaw 那篇、阿里 QoderWork 那篇——后台私信留言很多。但有一条我印象特别深,大意是:这些工具虽然免费,可都有额度限制,CatPaw 500 次,QoderWork 2000 积分用 30 天,有没有办法不限额度地白嫖 GLM-5.2 的 API。

说实话我第一反应是:这要求有点高了吧。顶级模型的 API 调用,算力摆在那里,哪有真正无限白嫖的好事。

然后我去查了一下。还真有。

TL;DR · 一句话总结
提供这个渠道的不是中国公司,是英伟达——就是做显卡的那个英伟达,全球市值最高的芯片公司。它在自己的开发者平台 build.nvidia.com 上挂了一个 GLM-5.2 的免费 API 端点,OpenAI 兼容格式,能直接接进 Claude Code。注册五分钟,不绑卡。

我的判断:这是「GLM-5.2 免费三部曲」里最值得动手的一篇——美团做产品层,阿里做产品层,英伟达直接做到了基础设施层。一层比一层往底下扎。

📰 免费的钥匙在哪:build.nvidia.com 上 77 个模型不要钱

英伟达有一个开发者平台叫 build.nvidia.com,上面托管了 141 个 AI 模型,其中 77 个提供免费 API 端点。你没看错,77 个免费模型。DeepSeek-V4-Pro 在里面,Kimi-K2.6 在里面,MiniMax-M2.7 在里面,Qwen3.5 也在里面。

build.nvidia.com 模型市场,141 个模型中 77 个提供免费 API 端点

GLM-5.2 也在里面。标签写着 Free EndpointDownloadable,提供方是 Z.ai(智谱),排在最新模型列表的第一位。上线才 1 天,下载量就冲到了 200 万。

GLM-5.2 模型卡,标注 Free Endpoint 与 Downloadable,提供方 Z.ai 智谱

这个免费 API 跟前两篇文章里的工具有一个根本区别。CatPaw 和 QoderWork 都是成型的产品,下载安装打开就能用,但模型被封装在产品内部,你只能在它们的界面里调用。英伟达给你的是纯的 API 接口,它兼容 OpenAI 的格式,你可以把它接入任何支持这个格式的工具里。

任何工具。包括 Claude Code。

我知道读到这里有些人可能会觉得:API 这种东西离我太远了,我又不是程序员。别急,往下看。有一个叫 CC Switch 的图形化工具,帮你点几下鼠标就能完成所有配置。

🧬 三个参数:base_url、api_key、model

先说技术底子。打开 GLM-5.2 在英伟达平台上的模型页面,你会看到它列出了三个关键参数:

GLM-5.2 模型页列出 base_url、api_key、model 三个接入参数

  • base_url:https://integrate.api.nvidia.com/v1(后续实际测试,这个 /v1 不需要填写)
  • api_key:就是下一步要生成的那个 nvapi- 开头的密钥
  • model:z-ai/glm-5.2

如果你是程序员,到这一步其实就结束了——拿着这三个参数去调用 OpenAI 兼容格式的 API 就行,Python、Node、Shell 的示例代码页面上都有。但大多数人不是程序员,也不想折腾命令行。所以英伟达给你的是原材料,不是成品。你拿到 API Key 之后,可以接入 Claude Code,也可以接入 Cursor,也可以接入 VS Code 的各种 AI 插件,甚至可以接入你自己写的任何程序。工具是你自己选的,模型是免费的,组合方式由你决定。

这才是真正的自由度。接下来先说怎么拿到这把 Key,再说怎么接进 Claude Code。

⚖️ 免费三兄弟 & 它的代价

把三个免费渠道放一起看,差别一目了然:

渠道免费额度限制模型形态
CatPaw(美团)500 次用完要提交表单申请重置,等审核封装在 IDE 里
QoderWork(阿里)2000 积分30 天有效期,过期作废(留言区反馈几天就可能用完)封装在桌面应用里
NVIDIA NIM无限 Key约 40 RPM、高峰期排队纯 API,接入任意工具

对比一下就很清楚:CatPaw 的 500 次额度用完了要提交表单申请重置,等审核;QoderWork 的 2000 积分只有 30 天有效期,过期作废,留言区很多网友反馈根本用不满一个月。英伟达直接给你一把无限用钥匙,验证页面上写的是 Unlimited API requests without daily limits,没有每日请求上限。

免费层说明:Unlimited API requests without daily limits,无每日请求上限

当然,「无限」这个词要打个问号——免费的东西背后通常都有隐性限制。英伟达的免费层有一个众所周知的问题:高峰期慢。这不是我一个人的感受,根据海外开发者社区的反馈,繁忙时段请求会排队等待,或直接 429 无法连接,响应时间可能从几秒拉长到十几秒甚至更久。有人在 Threads 上说得很直白:Peak hours, you queue up and wait,翻译过来就是「排队等着吧」。非高峰期体验还不错,凌晨和周末跑任务速度其实挺可以的;但如果你指望它在工作日白天稳定扛住高频调用,大概率会失望。

速率限制大约在每分钟 40 个请求左右。对个人开发者日常写代码来说够用了,但如果你想拿它跑自动化批处理任务——比如批量生成文档、批量分析代码仓库——这个速率可能会卡脖子。

还有一点必须说清楚:GLM-5.2 终究不是 Claude。它没有 Claude 的系统提示词、没有 Claude 的对话人格、没有 Claude 在复杂长程推理任务上的那种稳定性。你通过 CC Switch 把它接进 Claude Code 之后,界面看着一模一样,但回答的味道是不一样的。有些任务它会比你预期的好,有些会比你预期的差。具体哪些场景更强、哪些更弱,需要你自己跑几个真实项目去判断,别人的测评替代不了你自己的体感。

🛠️ 五分钟拿 Key + 接入 Claude Code

第一步:五分钟拿到 API Key

打开 build.nvidia.com,注册账号。如果你有 Google 账号或 GitHub 账号,可以直接授权登录,不用单独注册。登录之后,你需要验证手机号才能生成 API Key——重点来了:它支持中国大陆手机号。Location 下拉菜单里选 China,填 +86 开头的号码,点 Send Code to Phone,手机上收到一个六位数的验证码,输入进去,验证通过。

注册页 Location 下拉选择 China,支持 +86 中国大陆手机号验证

手机收到六位数验证码,Send Code to Phone 验证通过

这一步很多人以为中国手机号不行,其实完全没问题。我亲测的,短信几秒就到了。

验证完手机号之后,在页面右上角找到个人中心,进入 API Keys 管理页面,点 Generate API Key。给你的 Key 起个名字,比如 freeapi,系统会生成一个以 nvapi- 开头的密钥字符串。注意,这个密钥只显示一次,页面关了就再也看不到了,一定要立刻复制保存好。

API Keys 管理页,Generate API Key 生成 nvapi- 开头的密钥

看到有效期了吗——2027 年 7 月 5 号。我给这个 Key 有效期设置了一年。当前也有永不过期的选项,只是不知道这个活动啥时候就给「拉闸」了,所以设个一年更稳妥。这个端点跑在英伟达的全球基础设施上,没有地区锁、不用翻墙,海外(包括日本)开发者拿一个邮箱注册就能直接用。

第二步:用 CC Switch 接入 Claude Code

Key 拿到了,接下来是关键的一步:怎么把这个 Key 用起来。

如果你是程序员,拿着前面三个参数去调 OpenAI 兼容格式的 API 就行。但大多数人不想折腾命令行——这时候 CC Switch 就派上用场了。它是一个图形化的模型供应商管理工具,专门用来切换 Claude Code 的底层模型。打开它你会看到一个密密麻麻的供应商列表,几十个选项,SiliconFlow、OpenRouter、GitHub Copilot、Codex 都在里面,英伟达也是其中之一。你在列表里点 Nvidia 那个蓝色按钮,它就帮你把请求地址预填好了,你只需要粘贴自己的 API Key。

CC Switch 供应商列表,点 Nvidia 蓝色按钮自动预填请求地址

CC Switch 配置四要点:API Key、请求地址、OpenAI Chat Completions 格式、模型映射

配置有四个要点:

  1. API Key:填你的 nvapi- 密钥。
  2. 请求地址:填 https://integrate.api.nvidia.com,这个 CC Switch 已经帮你预填了。
  3. API 格式:一定要选 OpenAI Chat Completions(需开启路由),不选这个的话请求格式对不上。
  4. 模型映射(最关键):把 Sonnet、Opus、Haiku 三个角色全部映射到 z-ai/glm-5.2。这样不管 Claude Code 用哪个模型角色发请求,实际跑的都是 GLM-5.2。

保存之后,打开 Claude Code,输入 /model,你会看到模型列表里原来写着 Sonnet 4.6、Opus 的位置,现在都变成了 z-ai/glm-5.2。选中「Custom Sonnet model」,打个 hi 测试一下。

Claude Code 输入 /model,Sonnet、Opus 位置已变为 z-ai/glm-5.2

流程跑通了。

你现在拥有的是 Claude Code 的完整界面和 Agent 工作流,但底下跑的是英伟达免费提供的 GLM-5.2。Claude Code 的多文件编辑、自动化执行、上下文管理、工具调用这些能力全都还在,只是推理引擎换成了 GLM-5.2。反正你不说,别人从界面上是完全看不出来的——终端里一样显示 Claude Code 的 logo,一样的交互方式,一样的 /model 命令。但每一次对话请求走的都是英伟达的 GPU 集群,调用的都是智谱的 GLM-5.2。

这笔账怎么算
Claude Code 正常使用的话,最低也要 Max 套餐 100 美元一个月,或者走 API Usage Billing 按量付费。现在你用英伟达的免费 API 加上 CC Switch,同样的界面、同样的工作流,底层模型的调用费用是。对想体验 Claude Code 工作流但预算有限的人来说,这是一个相当实用的替代方案。

🌍 免费背后的生意经:三层免费,同一个模型

三篇文章写下来,我想聊的已经不只是 GLM-5.2 这一个模型了。把三篇放一起看,会发现一个清晰的三层结构:

  • 第一层,应用层——美团和阿里。它们把 GLM-5.2 塞进自己的产品里(CatPaw 是 IDE,QoderWork 是桌面搭子),用免费模型圈终端用户。模型好不好用,很大程度上取决于产品本身做得怎么样。
  • 第二层,基础设施层——英伟达。它把 GLM-5.2 放在自己的 GPU 云上,免费提供 API 端点,用免费算力圈开发者。
  • 第三层,模型层——智谱自己。它把 GLM-5.2 完全开源出去(MIT 协议),让所有人来分发。

三层,三种商业逻辑,三个完全不同的免费。但底下流动的是同一个东西。

为什么英伟达要做这件事?它又不是模型公司。你想想看英伟达的生意是什么——它卖 GPU。它的 H200、B200 这些 AI 芯片,一块就要好几万美元。它最大的客户,是那些需要大规模推理算力的公司。免费 API 这件事,表面上看是英伟达在贴钱帮别人跑模型,实际上是在做一件事:让更多开发者在英伟达的基础设施上写代码、测试模型、搭建原型。一旦你的项目在这个平台上跑通了,需要上生产环境的时候,你最自然的选择就是买英伟达的 GPU,或者用英伟达的付费推理服务。

免费 API 是鱼饵。GPU 销售和付费推理服务才是鱼竿。这个逻辑一想就通。

这在以前是不可想象的。以前的模型是封闭的:GPT-4 只能在 OpenAI 的平台上用,Claude 只能在 Anthropic 的平台上用,你想用谁的模型,就必须进谁的生态。现在 GLM-5.2 打破了这个规则——它是开源的,MIT 协议,谁都可以拿来用。所以美团拿它做 IDE,阿里拿它做办公工具,英伟达拿它做免费 API 引流。每一家都在用同一个模型去争夺自己的用户入口,但没有任何一家拥有这个模型

智谱做了一件很聪明的事:它不跟这些大公司争终端用户,它做水源。你们谁想引水灌溉都行,水是免费的。但只要所有人的田里流的都是我的水,这条河就是基础设施——你想绕开它,你得自己打井。这就是开源模型的真正威力:不在于免费本身,在于它让所有的竞争者都变成了你的分销渠道。你越开放,别人越离不开你。

1911 年,标准石油被美国最高法院裁定垄断,强制拆分成 34 家独立公司。当时华尔街一片哀嚎,所有人以为洛克菲勒完了。结果讽刺的是,这 34 家公司后来各自成长为石油行业的巨头——埃克森、美孚、雪佛龙、阿莫科,个个都是世界五百强。洛克菲勒因为持有所有拆分公司的原始股份,个人财富反而比拆分前翻了好几倍。

把一个东西拆散送出去,有时候不是失去控制。是让它长成了所有人都离不开的基础设施。

📝 写在最后

趁现在活动还在,去 build.nvidia.com 注册一个试试。反正不要钱,五分钟搞定,CC Switch 帮你把剩下的配置都点完了。

GLM-5.2 免费三部曲,美团做产品层,阿里做产品层,英伟达做基础设施层,一层比一层往底下扎。你要的是哪一层,自己挑。


本文操作步骤与页面截图均为作者亲测(截至 2026 年 7 月);免费层额度、速率限制与活动有效期可能随时调整,以 build.nvidia.com 官方页面为准;文章观点仅代表作者本人。