⚡ Uma frase antes de tudo
Para quem usa Claude Code todo dia e se arrepia com o preço do plano Max, a mudança é direta: dá para trocar o motor de inferência por uma chave gratuita e sem teto diário, mantendo a mesma interface, o mesmo comando /model, o mesmo fluxo de agente. E a chave não vem de uma startup chinesa — vem da NVIDIA. A fabricante de GPU. A empresa de chip mais valiosa do planeta.
Para entender o tamanho disso, recuo um passo. Depois de publicar os dois textos anteriores — o da CatPaw, da Meituan, e o da QoderWork, da Alibaba — a caixa de entrada encheu. Mas uma mensagem ficou na cabeça, e o ponto era simples: as duas ferramentas até são gratuitas, mas vivem de cota. CatPaw te dá 500 chamadas; QoderWork te dá 2000 créditos válidos por 30 dias. Existe um jeito de rodar o GLM-5.2 sem teto, de verdade?
Minha primeira reação foi de ceticismo. Inferência de modelo de ponta tem custo de computação embutido, e "API ilimitada de graça" tem cheiro de lenda urbana.
Fui verificar. Existe.
Quem está oferecendo esse canal não é uma empresa chinesa. É a NVIDIA — a fabricante de GPU, a empresa de chip mais valiosa do mundo. Ela publicou um endpoint gratuito do GLM-5.2 no seu portal para desenvolvedores, o
build.nvidia.com, no formato compatível com OpenAI, que entra direto no Claude Code. Cinco minutos de cadastro, sem cartão de crédito.Meu julgamento: é o capítulo mais decisivo da "trilogia grátis do GLM-5.2". A Meituan operou na camada de produto. A Alibaba operou na camada de produto. A NVIDIA desceu até a camada de infraestrutura. Cada nível mais fundo que o outro.
📰 A chave gratuita: 77 modelos sem custo no build.nvidia.com
A NVIDIA mantém um portal para desenvolvedores chamado build.nvidia.com. Lá estão hospedados 141 modelos de IA, e 77 deles oferecem endpoint de API gratuito. Sim, 77 modelos de graça. O DeepSeek-V4-Pro está lá. O Kimi-K2.6 está lá. O MiniMax-M2.7 está lá. O Qwen3.5 também.

O GLM-5.2 também está lá. As etiquetas dizem Free Endpoint e Downloadable, o fornecedor é a Z.ai (Zhipu), e ele aparece em primeiro lugar na lista de novidades. Com um dia no ar, já tinha acumulado 2 milhões de downloads.

Aqui mora a diferença crucial em relação aos dois textos anteriores. CatPaw e QoderWork são produtos fechados — você instala, abre e usa, mas o modelo fica preso dentro da interface deles. A NVIDIA te entrega a API crua, no formato compatível com OpenAI. Você conecta em qualquer ferramenta que aceite esse padrão.
Qualquer ferramenta. Inclusive o Claude Code.
Se isso parece distante demais — "API não é comigo, não sou desenvolvedor" — calma. Mais abaixo mostro uma ferramenta gráfica chamada CC Switch que cuida de toda a configuração em poucos cliques.
🧬 Três parâmetros: base_url, api_key, model
Vamos ao concreto. Abrindo a página do GLM-5.2 no portal da NVIDIA, você vê três parâmetros listados:

- base_url:
https://integrate.api.nvidia.com/v1(em testes reais, o/v1ao final é dispensável) - api_key: é a chave com prefixo
nvapi-que você vai gerar no passo seguinte - model:
z-ai/glm-5.2
Se você é desenvolvedor, acabou por aqui — é pegar esses três valores e chamar a API no formato OpenAI; a página traz exemplos em Python, Node e Shell. A maioria das pessoas não quer mexer em linha de comando, e o ponto importante é este: a NVIDIA entrega matéria-prima, não produto acabado. Com a chave em mãos você pode plugar no Claude Code, no Cursor, em plugins de IA do VS Code ou em qualquer programa que você mesmo escreva. A ferramenta é sua escolha, o modelo é de graça, a combinação é por sua conta.
Essa é a liberdade real. Antes de plugar em algo, vamos pegar a chave.
⚖️ Os três irmãos gratuitos & o preço escondido
Colocando os três canais lado a lado, a diferença salta aos olhos:
| Canal | Cota gratuita | Limite | Formato do modelo |
|---|---|---|---|
| CatPaw (Meituan) | 500 chamadas | Acabou: envie formulário para resetar e aguarde aprovação | Embutido na IDE |
| QoderWork (Alibaba) | 2000 créditos | Válido por 30 dias, expira e perde (relatos de acabar em dias) | Embutido no app desktop |
| NVIDIA NIM | Chave ilimitada | Cerca de 40 RPM, fila no pico | API pura, conecta em qualquer ferramenta |
Compare e fica claro: as 500 chamadas da CatPaw exigem formulário de reset e aprovação; os 2000 créditos da QoderWork só valem por 30 dias e expiram — nos comentários, muita gente relata que nem chega ao fim do mês. A NVIDIA te entrega uma chave sem teto. A própria página diz Unlimited API requests without daily limits, sem limite diário de requisições.

Mas "ilimitado" merece um asterisco. Tudo que é grátis costuma ter um freio escondido, e o da NVIDIA é bem documentado: em horário de pico, fica lento. Não é impressão minha — nas comunidades de desenvolvedores lá fora, o relato é de filas, erros 429 e tempo de resposta que escorrega de poucos segundos para dez ou mais. Alguém resumiu numa frase no Threads: Peak hours, you queue up and wait, "no pico, você entra na fila e espera". Fora do pico — madrugada e fim de semana — até vai bem; quem conta com a API para aguentar chamadas de alta frequência durante o dia útil, na prática, vai se frustrar.
E é preciso dizer com clareza: GLM-5.2 não é Claude. Ele não tem o prompt de sistema do Claude, não tem a personalidade de conversa do Claude, não tem a estabilidade de raciocínio de longo alcance do Claude em tarefas complexas. Depois do CC Switch, a interface fica idêntica, mas o sabor das respostas muda. Em algumas tarefas supera a expectativa; em outras, fica aquém. Onde brilha e onde tropeça você só descobre rodando projetos reais — avaliação de terceiro não substitui a sua própria percepção.
🛠️ Cinco minutos para a chave + conexão no Claude Code
Passo 1: pegar a API Key em cinco minutos
Abra build.nvidia.com e cadastre-se. Quem tem conta Google ou GitHub entra por autorização direta, sem formulário. Depois do login, é preciso validar o telefone para gerar a chave — e aqui vem o ponto que interessa: ele aceita número chinês, o +86. Em Location, selecione China, preencha o número com +86, clique em Send Code to Phone. O SMS chega em segundos com um código de seis dígitos; digite e está validado.


Muita gente supõe que número chinês não funciona — funciona, e eu testei: o SMS chegou em segundos.
Depois de validar o telefone, vá até o centro de conta no canto superior direito, abra a página de API Keys e clique em Generate API Key. Dê um nome para a chave (por exemplo, freeapi) e o sistema gera uma string que começa com nvapi-. Atenção: essa chave aparece uma única vez. Se você fechar a página, ela some para sempre — copie e guarde na hora.

Repare na data de validade: 5 de julho de 2027. Eu defini a chave com validade de um ano. Há também uma opção "nunca expira", mas como ninguém sabe quando a campanha pode ser cortada, um ano é a escolha mais segura. O endpoint roda na infraestrutura global da NVIDIA, sem bloqueio regional e sem VPN; desenvolvedores de outros países (incluindo do Japão) entram com um e-mail e saem usando.
Passo 2: plugar no Claude Code com o CC Switch
Com a chave na mão, vem a parte que realmente interessa: como usá-la.
Se você é desenvolvedor, é só levar os três parâmetros e chamar a API no formato OpenAI. Para quem não quer brigar com linha de comando, entra o CC Switch: um utilitário gráfico que gerencia fornecedores de modelo e troca o motor por baixo do Claude Code. Ao abrir, aparece uma lista densa de fornecedores — SiliconFlow, OpenRouter, GitHub Copilot, Codex e dezenas de outros, com a NVIDIA no meio. Basta clicar no botão azul da Nvidia e ele já pré-preenche o endereço de requisição; você só cola a sua chave.


A configuração tem quatro pontos:
- API Key: cole sua chave
nvapi-. - Endereço de requisição:
https://integrate.api.nvidia.com, já pré-preenchido pelo CC Switch. - Formato da API: obrigatoriamente OpenAI Chat Completions (com roteamento ativado). Errar aqui quebra o formato da chamada.
- Mapeamento de modelo (o passo mais importante): mapeie Sonnet, Opus e Haiku — todos os três — para
z-ai/glm-5.2. Assim, qualquer papel que o Claude Code acionar, quem responde é o GLM-5.2.
Salve. Abra o Claude Code, digite /model. As posições que antes mostravam Sonnet 4.6 e Opus agora exibem z-ai/glm-5.2. Selecione "Custom Sonnet model" e mande um "oi" de teste.

Fluxo completo.
Você passa a ter a interface inteira do Claude Code e o fluxo de agente, mas quem raciocina por baixo é o GLM-5.2 gratuito da NVIDIA. Edição multi-arquivo, execução automatizada, gestão de contexto, chamadas de ferramentas — tudo permanece; só o motor de inferência foi trocado. De fora, ninguém percebe: o terminal continua com o logo do Claude Code, as mesmas interações, o mesmo /model. Mas cada turno da conversa passa pelo cluster de GPU da NVIDIA e chama o GLM-5.2 da Zhipu.
O Claude Code, no uso normal, parte do plano Max a US$ 100 por mês — ou do API Usage Billing medido por consumo. Combinando a API gratuita da NVIDIA com o CC Switch, mesma interface, mesmo fluxo de trabalho, e o custo do modelo por baixo vai para zero. Para quem quer experimentar o fluxo do Claude Code com orçamento apertado, é uma alternativa pragmaticamente boa.
🌍 A economia por trás do grátis: três camadas, um modelo
Depois de três textos, o que quero discutir não é mais só o GLM-5.2. Lendo os três juntos, aparece uma estrutura clara de três camadas:
- Primeira camada, aplicação — Meituan e Alibaba. Elas embutem o GLM-5.2 nos próprios produtos (CatPaw como IDE, QoderWork como assistente de desktop) e usam o modelo grátis para capturar usuários finais. A qualidade da experiência depende muito mais do produto do que do modelo.
- Segunda camada, infraestrutura — NVIDIA. Hospeda o GLM-5.2 na própria nuvem de GPU e abre endpoint gratuito para capturar desenvolvedores com computação de graça.
- Terceira camada, modelo — a própria Zhipu. Abriu o GLM-5.2 em licença MIT, deixando qualquer um redistribuir.
Três camadas, três lógicas de negócio, três tipos muito diferentes de "grátis". Mas o que flui por baixo é o mesmo.
E por que a NVIDIA faria isso? Ela não é empresa de modelo. Pense no negócio dela: a NVIDIA vende GPU. Um chip H200 ou B200 custa dezenas de milhares de dólares a unidade. Os maiores clientes são exatamente quem precisa de inferência em escala. Dar API de graça parece caridade; na prática é uma jogada — atrair desenvolvedores para escrever código, testar modelos e montar protótipos em cima da infraestrutura dela. Quando o projeto amadurece e vai para produção, o caminho mais natural é comprar GPU da NVIDIA ou contratar o serviço pago de inferência dela.
Isso seria impensável há pouco tempo. Os modelos de ponta eram fechados: GPT-4 só na plataforma da OpenAI, Claude só na da Anthropic — para usar o modelo, você tinha que entrar no ecossistema do dono. O GLM-5.2 quebra essa regra: é código aberto, licença MIT, qualquer um pega. Por isso a Meituan faz IDE com ele, a Alibaba faz ferramenta de escritório, e a NVIDIA faz API grátis para atrair tráfego. Cada uma disputa o próprio ponto de entrada com o mesmo modelo — mas nenhuma delas é dona dele.
A Zhipu fez uma jogada esperta: em vez de brigar com os gigantes pelo usuário final, virou a nascente de água. Quem quiser irrigar a própria lavoura, leve a água — é de graça. Mas se a água de todo mundo passar pelo seu rio, o rio vira infraestrutura. Para desviar, é preciso cavar o próprio poço. Esse é o poder real do modelo aberto: não está em ser grátis, está em transformar todos os concorrentes em canal de distribuição. Quanto mais aberto, mais dependentes.
Em 1911, a Standard Oil foi julgada monopolista pela Suprema Corte dos EUA e obrigada a se partir em 34 companhias independentes. Wall Street chorou, todo mundo achou que Rockefeller tinha acabado. A ironia veio depois: essas 34 empresas viraram gigantes do petróleo — Exxon, Mobil, Chevron, Amoco, todas na Fortune 500. Como Rockefeller manteve ações originais em cada pedaço, a fortuna pessoal dele terminou multiplicada várias vezes em relação ao que existia antes da dissolução.
Desmontar algo e espalhar os pedaços, às vezes, não é perder controle. É transformar aquilo em infraestrutura da qual ninguém mais consegue sair.
📝 Para fechar
Enquanto a campanha durar, vá em build.nvidia.com e cadastre-se. Não custa nada, dá cinco minutos, e o CC Switch resolve o resto da configuração em poucos cliques.
A trilogia grátis do GLM-5.2, recapitulando: a Meituan fez a camada de produto, a Alibaba fez a camada de produto, a NVIDIA desceu até a camada de infraestrutura. Cada uma mais funda que a outra. Qual camada te interessa, a escolha é sua.
Os passos de operação e as capturas de tela foram verificados pelo autor (julho de 2026); cotas, limites de taxa e prazo da campanha gratuita podem mudar a qualquer momento — consulte sempre a página oficial em build.nvidia.com. As opiniões aqui expressas são do autor.