⚡ Avis rapide
Pour les développeurs qui voulaient faire tourner GLM-5.2 en illimité dans Claude Code sans se battre avec un quota, la porte vient de s'ouvrir. Et c'est NVIDIA qui l'ouvre — pas une société chinoise.
Depuis les deux articles précédents — Meituan CatPaw, Alibaba QoderWork — les messages affluent en privé. Un revient sans cesse :ces outils sont gratuits, mais plafonnés. CatPaw tient 500 appels, QoderWork 2 000 crédits sur 30 jours. Existe-t-il un canal pour pousser du GLM-5.2 sans limite de quota ?
Ma première réaction :ça demande beaucoup. Un modèle frontier, l'API, le compute derrière — pas de déjeuner illimité et gratuit, ça n'existe pas.
J'ai vérifié. Ça existe.
Le canal n'est pas offert par une société chinoise, mais par NVIDIA — le fabricant de cartes graphiques, la société de semi-conducteurs la plus valorisée au monde. Sur sa plateforme développeur
build.nvidia.com, elle a posé un endpoint API gratuit pour GLM-5.2, format compatible OpenAI, branchable directement dans Claude Code. Cinq minutes pour s'inscrire, pas de carte bancaire.Mon avis :c'est le volet de la « trilogie gratuite GLM-5.2 » qui mérite le plus qu'on s'y attelle. Meituan fait couche produit, Alibaba fait couche produit, NVIDIA descend directement à la couche infrastructure. À chaque fois, une couche plus profonde.
📰 Où est la clé gratuite :77 modèles gratuits sur build.nvidia.com
NVIDIA tient une plateforme développeur, build.nvidia.com, qui héberge 141 modèles d'IA — dont 77 avec un endpoint API gratuit. Lisez deux fois :77 modèles gratuits. DeepSeek-V4-Pro y est, Kimi-K2.6 y est, MiniMax-M2.7 y est, Qwen3.5 aussi.

GLM-5.2 aussi. L'étiquette affiche Free Endpoint + Downloadable, le fournisseur est Z.ai (Zhipu), et il pointe en tête de la liste des modèles récents. En ligne depuis un jour, déjà 2 millions de téléchargements.

Cet API gratuit a une différence de fond avec les outils des deux articles précédents. CatPaw et QoderWork sont des produits finis :on installe, on ouvre, on utilise — mais le modèle est encapsulé, on ne peut l'appeler que depuis leur interface. NVIDIA, elle, vous file l'API brute, compatible OpenAI, à brancher dans n'importe quel outil qui parle ce format.
N'importe quel outil. Y compris Claude Code.
Je sais que certains, en lisant ça, se disent :API, c'est trop loin de moi, je ne suis pas développeur. Attendez, lisez la suite. Il existe un outil graphique qui s'appelle CC Switch et qui règle toute la config en quelques clics.
🧬 Trois paramètres :base_url, api_key, model
Le socle technique. Sur la page modèle de GLM-5.2 chez NVIDIA, trois paramètres sont listés en clair :

- base_url :
https://integrate.api.nvidia.com/v1(à l'usage, le/v1final n'est pas nécessaire). - api_key :la clé qui commence par
nvapi-, générée à l'étape suivante. - model :
z-ai/glm-5.2.
Si vous êtes développeur, l'histoire s'arrête là — prenez ces trois paramètres et appelez l'API au format OpenAI, les exemples Python, Node et Shell sont sur la page. Mais la plupart des lecteurs ne veulent pas trifouiller la CLI. NVIDIA vous file une matière première, pas un produit fini. Une fois la clé en poche, vous la branchez dans Claude Code, dans Cursor, dans n'importe quel plugin IA de VS Code, voire dans un programme maison. L'outil, c'est vous qui choisissez. Le modèle est gratuit. La combinaison est votre affaire.
Ça, c'est la vraie latitude. D'abord, comment récupérer la clé. Ensuite, comment la brancher dans Claude Code.
⚖️ Les trois frères gratuits & le prix à payer
Mettez les trois canaux gratuits côte à côte, les différences sautent aux yeux :
| Canal | Quota gratuit | Limite | Forme du modèle |
|---|---|---|---|
| CatPaw (Meituan) | 500 appels | Sur épuisement, formulaire de reset, attente de validation | Encapsulé dans l'IDE |
| QoderWork (Alibaba) | 2 000 crédits | Validité 30 jours, expiration sèche (retours :peut s'épuiser en quelques jours) | Encapsulé dans l'app desktop |
| NVIDIA NIM | Clé illimitée | ~40 RPM, files aux heures de pointe | API brute, brancheable partout |
La comparaison parle d'elle-même. CatPaw :500 appels épuisés, formulaire de reset, attente de validation. QoderWork :2 000 crédits, 30 jours, expiration, et les retours en commentaires disent que beaucoup ne tiennent pas un mois complet. NVIDIA, elle, vous file une clé illimitée — la page indique noir sur blanc Unlimited API requests without daily limits, pas de plafond quotidien.

Évidemment, « illimité » se prend avec des pincettes — ce qui est gratuit cache presque toujours une limite. Le sujet bien connu du gratuit NVIDIA : lent aux heures de pointe. Pas qu'une impression. Côté communauté développeur à l'étranger, on signale qu'aux heures chargées les requêtes s'empilent en file ou tombent en 429 pur, et le temps de réponse peut passer de quelques secondes à une quinzaine, voire pire. Quelqu'un sur Threads le résume crûment :Peak hours, you queue up and wait — « aux heures de pointe, tu fais la queue et tu patientes ». Hors pointe, ça tient :petit matin et week-end pour faire tourner des tâches, le débit est correct ; mais pour encaisser un appel intensif en pleine journée de semaine, ça va décevoir.
Et un point à poser noir sur blanc : GLM-5.2 n'est pas Claude. Pas de system prompt façon Claude, pas la personnalité de dialogue de Claude, pas la stabilité de raisonnement long de Claude. Une fois branché dans Claude Code via CC Switch, l'interface est identique au pixel près, mais le goût des réponses change. Sur certaines tâches, mieux que prévu ; sur d'autres, moins. Lesquelles exactement ? À vous de le mesurer sur vos vrais projets — le test de quelqu'un d'autre ne remplace jamais le ressenti du vôtre.
🛠️ Cinq minutes pour la clé + branchement dans Claude Code
Étape 1 :récupérer la clé API en cinq minutes
Ouvrez build.nvidia.com et inscrivez-vous. Compte Google ou GitHub ? Connexion directe, pas d'inscription séparée. Une fois connecté, il faut valider un numéro de mobile pour pouvoir générer la clé — et là, attention :les numéros chinois continentaux en +86 passent. Dans le menu déroulant Location, choisissez China, renseignez votre numéro en +86, cliquez Send Code to Phone, vous recevez un code à six chiffres par SMS, saisissez-le, c'est validé.


Beaucoup pensent qu'un numéro chinois ne passe pas. Faux. Testé moi-même :le SMS arrive en quelques secondes.
Mobile validé. En haut à droite, espace personnel, page API Keys, cliquez Generate API Key. Donnez un nom à la clé, par exemple freeapi ; le système crache une chaîne qui commence par nvapi-. Attention, cette clé ne s'affiche qu'une fois — fermez la page, elle est perdue, copiez-la tout de suite.

Regardez la date d'expiration : 5 juillet 2027. J'ai réglé cette clé sur un an. Il existe aussi une option « sans expiration », mais comme personne ne sait quand NVIDIA fermera le robinet, un an reste plus prudent. L'endpoint tourne sur l'infrastructure mondiale de NVIDIA — pas de verrou régional, pas de VPN. Un développeur hors de Chine, Japon inclus, s'inscrit avec un e-mail et l'utilise direct.
Étape 2 :brancher dans Claude Code via CC Switch
La clé en poche, reste la question :comment la faire vivre.
Si vous êtes développeur, les trois paramètres suffisent à appeler l'API au format OpenAI. Mais la plupart d'entre nous ne veut pas bricoler la CLI — c'est là que CC Switch entre en scène. Outil graphique de gestion de fournisseurs de modèles, conçu pour basculer le modèle sous-jacent de Claude Code. À l'ouverture, une liste dense de fournisseurs :SiliconFlow, OpenRouter, GitHub Copilot, Codex… et NVIDIA. Cliquez sur le bouton bleu Nvidia, l'URL de requête est pré-remplie, il ne reste qu'à coller votre clé API.


La config tient en quatre points :
- API Key :collez votre clé
nvapi-. - URL de requête :
https://integrate.api.nvidia.com, déjà pré-remplie par CC Switch. - Format d'API :choisissez impérativement OpenAI Chat Completions (avec routing activé). Sans ça, le format de requête ne colle pas.
- Mapping de modèles (le plus critique) :mappez Sonnet, Opus et Haiku sur
z-ai/glm-5.2. Ainsi, peu importe le rôle de modèle que Claude Code sollicite, tout atterrit sur GLM-5.2.
Après sauvegarde, ouvrez Claude Code, tapez /model :les emplacements Sonnet 4.6 et Opus affichent désormais z-ai/glm-5.2. Sélectionnez « Custom Sonnet model », envoyez un hi pour tester.

Le circuit est en place.
Vous avez désormais l'interface complète de Claude Code, les flux d'agent, l'édition multifichier, l'exécution automatique, la gestion de contexte, les appels d'outils — sauf que le moteur de raisonnement, en dessous, c'est GLM-5.2 servi gratuit par NVIDIA. Personne ne le verra depuis l'interface :même logo Claude Code dans le terminal, mêmes interactions, même commande /model. Mais chaque requête file sur les clusters GPU de NVIDIA et appelle le GLM-5.2 de Zhipu.
Claude Code en usage normal, c'est minimum l'abonnement Max à 100 $/mois, ou API Usage Billing à la consommation. Avec l'API gratuite NVIDIA + CC Switch :même interface, mêmes flux, coût d'appel du modèle sous-jacent : zéro. Pour qui veut goûter au flux Claude Code sans exploser le budget, c'est l'alternative la plus concrète à ce jour.
🌍 Le business derrière le gratuit :trois couches, un même modèle
Trois articles plus tard, ce n'est plus seulement de GLM-5.2 que je veux parler. Relisez les trois ensemble, une structure à trois couches apparaît :
- Première couche, applicative — Meituan et Alibaba. Ils glissent GLM-5.2 dans leur produit (CatPaw en IDE, QoderWork en companion desktop) et utilisent le modèle gratuit pour capter l'utilisateur final. La qualité dépend beaucoup du produit lui-même.
- Deuxième couche, infrastructure — NVIDIA. Elle pose GLM-5.2 sur son cloud GPU, endpoint API gratuit, et capte les développeurs avec du compute offert.
- Troisième couche, modèle — Zhipu elle-même. GLM-5.2 ouvert sous licence MIT, distribuable par quiconque.
Trois couches, trois logiques commerciales, trois gratuités différentes. Mais en bas, c'est la même eau qui coule.
Pourquoi NVIDIA fait-elle ça ? Elle n'est pas une société de modèles. Repensez à son business :elle vend des GPU. Ses H200, B200 — ces puces IA à plusieurs dizaines de milliers de dollars pièce. Ses plus gros clients :ceux qui ont besoin de compute d'inférence massif. Offrir une API gratuite, en surface, c'est NVIDIA qui subventionne le run de modèles tiers ; en réalité, elle fait une seule chose :mettre le maximum de développeurs à coder, tester et prototyper sur son infrastructure. Une fois votre projet mûr pour la prod, le choix le plus naturel, c'est d'acheter du GPU NVIDIA, ou de prendre le service d'inférence payant de NVIDIA.
Impensable, il y a encore peu. Les modèles étaient fermés :GPT-4 ne tournait que chez OpenAI, Claude que chez Anthropic — pour utiliser un modèle, il fallait entrer dans l'écosystème de son propriétaire. GLM-5.2 casse la règle :ouvert, licence MIT, n'importe qui peut le prendre. Alors Meituan en fait un IDE, Alibaba un outil de bureau, NVIDIA un appât API gratuit. Chacun lutte pour sa porte d'entrée avec le même modèle, mais aucun ne possède ce modèle.
Zhipu a joué malin :elle ne se bat pas avec ces géants pour l'utilisateur final, elle est la source. Vous voulez irriguer vos champs avec son eau ? L'eau est gratuite. Mais dès lors que tous les champs boivent à la même source, la rivière devient infrastructure — pour la contourner, il faut creuser son propre puits. Voilà la vraie puissance d'un modèle ouvert :pas le gratuit en soi, mais le fait de transformer tous ses concurrents en canaux de distribution. Plus vous ouvrez, plus les autres dépendent de vous.
En 1911, Standard Oil est condamnée par la Cour suprême des États-Unis pour monopole et démemelée en 34 sociétés indépendantes. Wall Street hurle à la mort, tout le monde croit Rockefeller fini. Ironie :ces 34 sociétés ont grandi en géants du pétrole — Exxon, Mobil, Chevron, Amoco —, toutes devenues des mastodontes du Fortune 500. Rockefeller, parce qu'il conservait des parts originales dans chacune, a vu sa fortune personnelle multipliée après la scission.
Démonter une chose pour la distribuer, parfois, ce n'est pas perdre le contrôle. C'est en faire une infrastructure dont plus personne ne peut se passer.
📝 En conclusion
Tant que l'offre tient, allez vous inscrire sur build.nvidia.com. C'est gratuit, cinq minutes, et CC Switch règle le reste de la config à coups de clics.
Trilogie gratuite de GLM-5.2 :Meituan fait couche produit, Alibaba fait couche produit, NVIDIA fait couche infrastructure — une couche plus profonde à chaque fois. Vous voulez laquelle ? À vous de choisir.
Étapes opérationnelles et captures d'écran testées par l'auteur (à jour de juillet 2026) ; quotas, limites de débit et durée de l'offre gratuite peuvent changer à tout moment, référez-vous à la page officielle build.nvidia.com ; les opinions exprimées sont celles de l'auteur.