⚡ Nói thẳng một câu
Hai bài trước về CatPaw của Meituan và QoderWork của Alibaba vừa đăng xong thì inbox tôi nổ: ai cũng hỏi giống nhau — miễn phí thì miễn phí, nhưng CatPaw có 500 lần, QoderWork có 2000 credit 30 ngày, dùng hết thì phải đi xin thêm. Có cách nào xài GLM-5.2 mà không bị gò hạn mức không?
Nói thẳng: nghe câu hỏi này tôi cứ nghĩ người ta đùa. API của mô hình top-tier tốn token, tốn GPU, đào đâu ra chuyện «không giới hạn» mà không mất tiền.
Rồi tôi mới vào tra. Hóa ra có thật.
Kẻ cho API này không phải công ty Trung Quốc — là NVIDIA, đúng cái hãng làm GPU lớn nhất thế giới. Nó treo một endpoint GLM-5.2 miễn phí trên nền tảng developer
build.nvidia.com, chuẩn tương thích OpenAI, cắm thẳng vào Claude Code được. Đăng ký năm phút, không cần liên kết thẻ.Đánh giá của tôi: đây là phần đáng làm nhất trong «bộ ba miễn phí GLM-5.2» — Meituan làm tầng sản phẩm, Alibaba làm tầng sản phẩm, NVIDIA đi thẳng xuống tầng hạ tầng. Càng xuống sâu càng đáng giá.
📰 Chìa miễn phí nằm ở đâu: 77 model không tính tiền trên build.nvidia.com
NVIDIA có một nền tảng developer tên build.nvidia.com, host 141 mô hình AI, trong đó 77 mô hình có endpoint API miễn phí. Đúng vậy, 77 model không tốn tiền. DeepSeek-V4-Pro nằm trong đó, Kimi-K2.6 nằm trong đó, MiniMax-M2.7 nằm trong đó, Qwen3.5 cũng nằm trong đó.

GLM-5.2 cũng nằm trong đó. Nhãn ghi Free Endpoint kèm Downloadable, nhà phát hành là Z.ai (Zhipu), xếp ngay vị trí số một trong danh sách model mới nhất. Lên sàn mới đúng một ngày, lượt tải đã vọt lên 2 triệu.

Channel miễn phí này khác hẳn hai công cụ ở hai bài trước. CatPaw và QoderWork là sản phẩm đóng gói: tải về, cài đặt, mở lên là chạy, nhưng model bị nhốt bên trong sản phẩm, bạn chỉ gọi được từ giao diện của họ. NVIDIA đưa cho bạn thứ khác — một API trần, chuẩn tương thích OpenAI, muốn cắm vào công cụ nào hỗ trợ chuẩn đó cũng được.
Bất kỳ công cụ nào. Kể cả Claude Code.
Tôi biết vài bạn đọc tới đây sẽ than: «API thì xa xôi quá, tôi có phải dev đâu.» Cứ đọc tiếp. Có một tool đồ họa tên CC Switch, vài cú click chuột là xong toàn bộ cấu hình.
🧬 Ba tham số: base_url, api_key, model
Nói phần kỹ thuật trước cho rõ. Mở trang mô hình GLM-5.2 trên nền tảng NVIDIA, bạn sẽ thấy nó liệt kê ba tham số quan trọng:

- base_url:
https://integrate.api.nvidia.com/v1(khi dùng thực tế thì đoạn/v1cuối cùng có thể bỏ) - api_key: chính là chuỗi khóa bắt đầu bằng
nvapi-mà bạn sẽ sinh ra ở bước kế tiếp - model:
z-ai/glm-5.2
Nếu bạn là dev thì tới đây là xong — cầm ba tham số đó gọi API chuẩn OpenAI, ví dụ Python/Node/Shell đều có sẵn trên trang. Nhưng phần lớn người dùng không phải dev và cũng không muốn đụng tới command line. Vậy nên NVIDIA đưa cho bạn nguyên liệu, không phải thành phẩm. Cầm API Key xong, bạn cắm vào Claude Code cũng được, vào Cursor cũng được, vào các plugin AI của VS Code cũng được, thậm chí nhúng vào chương trình tự viết cũng không ai cản. Tool bạn chọn, model miễn phí, cách phối do bạn quyết.
Đó mới là tự do thật. Tiếp theo tôi sẽ nói cách lấy Key trước, rồi mới nói cách cắm vào Claude Code.
⚖️ «Bộ ba miễn phí» & cái giá phải trả
Đặt ba kênh miễn phí cạnh nhau thì khác biệt hiện ra ngay:
| Kênh | Hạn mức miễn phí | Giới hạn | Hình thái mô hình |
|---|---|---|---|
| CatPaw (Meituan) | 500 lần | Hết thì nộp form xin reset, chờ duyệt | Bọc trong IDE |
| QoderWork (Alibaba) | 2000 credit | 30 ngày hiệu lực, hết hạn mất (khu bình luận phản hồi vài ngày là cạn) | Bọc trong app desktop |
| NVIDIA NIM | Key không giới hạn | Khoảng 40 RPM, xếp hàng giờ cao điểm | API trần, cắm vào tool nào cũng được |
So sánh thế là rõ: 500 lần CatPaw hết thì nộp form xin reset rồi chờ duyệt; 2000 credit của QoderWork chỉ có 30 ngày, hết hạn là mất, khu bình luận nhiều người phản hồi rằng chưa đầy tháng đã cạn. NVIDIA thì thẳng tay đưa bạn một chìa không giới hạn, trang xác minh ghi rõ Unlimited API requests without daily limits, không có trần số request mỗi ngày.

Nhưng mà, chữ «không giới hạn» này phải để trong ngoặc — đồ free thường đi kèm cái giá ẩn. Tầng miễn phí của NVIDIA có một vấn đề ai cũng biết: chậm vào giờ cao điểm. Không phải cảm nhận của riêng tôi; theo phản hồi từ cộng đồng dev hải ngoại, lúc đông request sẽ bị xếp hàng chờ, hoặc ăn luôn lỗi 429 không kết nối được, thời gian phản hồi có thể từ vài giây kéo ra chục giây hoặc lâu hơn. Có người trên Threads nói thẳng: Peak hours, you queue up and wait, dịch ra chính là «xếp hàng chờ đi». Ngoài giờ cao điểm thì dùng khá ổn, sáng sớm hay cuối tuần chạy tác vụ tốc độ thực ra rất chấp nhận được; nhưng nếu bạn định để nó gánh tải cao ổn định trong giờ hành chính ngày thường, khả năng cao là sẽ thất vọng.
Còn một điều phải nói rõ: GLM-5.2 rốt cuộc không phải Claude. Nó không có system prompt kiểu Claude, không có «tính cách hội thoại» của Claude, không có độ ổn định suy luận dài hạn trên tác vụ phức tạp như Claude. Bạn cắm nó vào Claude Code qua CC Switch thì giao diện nhìn y hệt, nhưng «vị» câu trả lời là khác. Có tác vụ nó làm tốt hơn bạn tưởng, có tác vụ lại kém hơn. Cụ thể cái nào mạnh hơn, cái nào yếu hơn, bạn phải tự chạy vài dự án thật để biết, review của người khác không thay thế được cảm giác của chính bạn.
🛠️ Năm phút lấy Key + cắm vào Claude Code
Bước một: Năm phút lấy API Key
Mở build.nvidia.com, đăng ký tài khoản. Có Google hoặc GitHub thì đăng nhập qua OAuth luôn, khỏi tạo mới. Đăng nhập xong, bạn phải xác minh số điện thoại mới sinh được API Key — đây là điểm quan trọng: nó chấp nhận số điện thoại Trung Quốc đại lục +86. Trong menu Location chọn China, điền số đầu +86, bấm Send Code to Phone, điện thoại nhận một mã xác nhận sáu chữ số, nhập vào, xong.


Nhiều người tưởng số Trung Quốc không được, thực ra không vấn đề gì. Tôi tự test, SMS tới trong vài giây.
Xác minh số xong, vào trung tâm cá nhân ở góc trên bên phải, mở trang quản lý API Keys, bấm Generate API Key. Đặt tên cho khóa, ví dụ freeapi, hệ thống sinh ra một chuỗi bắt đầu bằng nvapi-. Chú ý: khóa này chỉ hiển thị một lần, đóng trang là mất tăm, phải copy lưu lại ngay.

Thấy hạn hiệu lực chưa — 5 tháng 7 năm 2027. Tôi đặt khóa này có hạn một năm. Trên trang cũng có option «không bao giờ hết hạn», nhưng không biết chiến dịch này khi nào sẽ bị «rút phích», nên để một năm cho chắc. Endpoint này chạy trên hạ tầng toàn cầu của NVIDIA, không khóa vùng, không cần VPN; dev hải ngoại (kể cả ở Nhật) lấy một email đăng ký là dùng được luôn.
Bước hai: Cắm vào Claude Code qua CC Switch
Lấy được Key rồi, tới bước quan trọng: biến Key đó thành thứ gì đó dùng được.
Nếu bạn là dev thì cầm ba tham số ở trên mà gọi API chuẩn OpenAI. Nhưng phần lớn người không muốn đụng command line — và đây là lúc CC Switch phát huy tác dụng. Nó là công cụ đồ họa quản lý nhà cung cấp model, chuyên dùng để đổi model nền tảng bên dưới Claude Code. Mở ra bạn thấy một danh sách dài dằng dặc mấy chục nhà cung cấp: SiliconFlow, OpenRouter, GitHub Copilot, Codex đều có mặt, NVIDIA cũng nằm trong số đó. Bạn bấm vào nút màu xanh «Nvidia» trong danh sách, nó tự điền sẵn request URL cho bạn, việc của bạn chỉ là paste API Key vào.


Cấu hình có bốn điểm:
- API Key: điền khóa
nvapi-của bạn. - Request URL: điền
https://integrate.api.nvidia.com, CC Switch đã tự điền sẵn cái này rồi. - Định dạng API: chắc chắn phải chọn OpenAI Chat Completions (cần bật routing), không chọn thì format request lệch nhau.
- Model map (quan trọng nhất): map cả ba vai Sonnet, Opus, Haiku vào
z-ai/glm-5.2. Thế thì dù Claude Code gọi với vai nào, mô hình thực tế chạy đều là GLM-5.2.
Lưu lại, mở Claude Code, gõ /model, bạn sẽ thấy trong danh sách mô hình chỗ cũ ghi Sonnet 4.6, Opus giờ đều chuyển thành z-ai/glm-5.2. Chọn «Custom Sonnet model», gõ một chữ «hi» để test.

Pipeline chạy thông.
Giờ bạn sở hữu giao diện Claude Code đầy đủ và workflow agent nguyên vẹn, nhưng bên dưới chạy là GLM-5.2 do NVIDIA cung miễn phí. Khả năng edit đa file, thực thi tự động, quản lý context, tool calling của Claude Code vẫn còn nguyên, chỉ là động cơ suy luận bị đổi thành GLM-5.2. Bạn không nói thì ai cũng tưởng — terminal vẫn hiện logo Claude Code, vẫn cùng cách tương tác, vẫn cùng lệnh /model. Nhưng mỗi request hội thoại đều đi qua cụm GPU của NVIDIA, mỗi lần gọi đều là GLM-5.2 của Zhipu.
Dùng Claude Code bình thường thì rẻ nhất cũng phải lấy gói Max 100 USD một tháng, hoặc đi API Usage Billing trả theo lượng dùng. Giờ bạn dùng API miễn phí của NVIDIA cộng với CC Switch, cùng giao diện, cùng workflow, phí gọi model bên dưới là không. Với ai muốn trải nghiệm workflow Claude Code mà ngân sách eo hẹp, đây là phương án thay thế rất thực dụng.
🌍 Kinh tế đằng sau sự miễn phí: ba tầng, cùng một model
Viết ba bài rồi, cái tôi muốn nói tới không chỉ còn là mỗi model GLM-5.2 nữa. Đặt ba bài cạnh nhau, sẽ thấy một cấu trúc ba tầng rõ ràng:
- Tầng một — tầng ứng dụng: Meituan và Alibaba. Họ nhét GLM-5.2 vào sản phẩm của mình (CatPaw là IDE, QoderWork là trợ lý desktop), dùng model miễn phí để kéo user cuối. Model xài có ngon hay không phụ thuộc rất nhiều vào chính sản phẩm đó làm tốt cỡ nào.
- Tầng hai — tầng hạ tầng: NVIDIA. Họ đặt GLM-5.2 lên đám mây GPU của mình, cấp endpoint API miễn phí, dùng sức tính toán miễn phí để kéo dev.
- Tầng ba — tầng model: chính Zhipu. Họ mở nguồn hoàn toàn GLM-5.2 theo giấy MIT, để ai cũng lấy mà phân phối được.
Ba tầng, ba logic kinh doanh, ba kiểu miễn phí hoàn toàn khác nhau. Nhưng thứ chảy bên dưới là một.
Tại sao NVIDIA lại làm chuyện này? Họ có phải công ty model đâu. Nghĩ xem kinh doanh của NVIDIA là gì — họ bán GPU. Những con chip AI như H200, B200, mỗi con giá vài chục nghìn USD. Khách hàng lớn nhất của họ là những công ty cần sức tính toán inference quy mô lớn. Chuyện API miễn phí, bề mặt có vẻ như NVIDIA đốt tiền chạy hộ model cho người khác, thực ra là đang làm một việc: kéo thêm dev viết code, test model, dựng nguyên mẫu trên hạ tầng của NVIDIA. Một khi dự án của bạn chạy thông trên nền này, khi cần lên môi trường production, lựa chọn tự nhiên nhất là mua GPU của NVIDIA, hoặc dùng dịch vụ inference trả phí của NVIDIA.
Điều này trước đây không tưởng nổi. Model ngày xưa là đóng: GPT-4 chỉ xài được trên nền OpenAI, Claude chỉ trên nền Anthropic, muốn dùng model nhà ai thì phải vào vườn nhà đó. Giờ GLM-5.2 phá luật này — nó mở nguồn, giấy MIT, ai cũng lấy mà dùng. Nên Meituan lấy nó làm IDE, Alibaba lấy nó làm tool văn phòng, NVIDIA lấy nó làm mồi kéo traffic API miễn phí. Mỗi nhà đều dùng cùng một model để giành cửa ngõ user của mình, nhưng không nhà nào thực sự sở hữu model đó.
Zhipu làm một chuyện rất thông minh: họ không đọ user cuối với mấy ông lớn, họ làm nguồn nước. Ai muốn dẫn nước về tưới đồng đều được cả, nước thì miễn phí. Nhưng chỉ cần ruộng của tất cả mọi người đều tưới nước của tôi, dòng sông này liền biến thành hạ tầng — muốn lách nó, bạn phải tự khoan giếng. Đó mới là sức mạnh thật của model mở: không nằm ở chữ «miễn phí» bản thân nó, mà nằm ở chỗ nó biến tất cả đối thủ cạnh tranh thành kênh phân phối của bạn. Bạn càng mở, người khác càng phụ thuộc vào bạn.
Năm 1911, Standard Oil bị Tòa án Tối cao Mỹ phán là độc quyền, ép buộc tháo ra thành 34 công ty độc lập. Khi đó Wall Street la ó, ai cũng tưởng Rockefeller xong. Nhưng trớ trêu thay, 34 công ty đó sau này mỗi cái đều trưởng thành thành quái vật ngành dầu — Exxon, Mobil, Chevron, Amoco, cái nào cũng nằm trong Fortune 500. Vì Rockefeller giữ cổ phần gốc của tất cả các công ty bị tách, tài sản cá nhân của ông không những không giảm mà còn nhân lên vài lần so với trước khi tách.
Tháo một thứ ra để phát đi, có khi không phải mất kiểm soát. Mà là để nó biến thành hạ tầng mà ai cũng không thể rời.
📝 Lời cuối
Trong khi chiến dịch còn đang mở, hãy vào build.nvidia.com đăng ký một phát thử. Phí thì không có, năm phút xong, CC Switch lo phần cấu hình còn lại cho bạn.
«Bộ ba miễn phí GLM-5.2»: Meituan làm tầng sản phẩm, Alibaba làm tầng sản phẩm, NVIDIA làm tầng hạ tầng, càng xuống sâu càng đáng giá. Bạn cần tầng nào thì tự chọn.
Toàn bộ thao tác và ảnh chụp trong bài đều do tác giả tự kiểm chứng (tính đến tháng 7 năm 2026); hạn mức tầng miễn phí, rate limit và thời hạn chiến dịch có thể thay đổi bất cứ lúc nào, vui lòng lấy trang build.nvidia.com làm chuẩn; quan điểm trong bài chỉ đại diện cho tác giả.