Ghi chú nội bộ MiniMax — mô hình thế hệ mới, kiến trúc MSA, tốc độ coding, hạ tầng tính toán

📋 Ghi chú nội bộ bị rò rỉ

Một bộ ghi chú nội bộ từ MiniMax — một trong những phòng thí nghiệm AI bị đánh giá thấp nhất Trung Quốc — vừa bị rò rỉ. Tài liệu đề cập bốn mảng: phát triển mô hình thế hệ mới, định vị cạnh tranh trên benchmark coding, chiến lược hạ tầng tính toán, và triển vọng biên gộp. Ghép lại, nó phác họa một công ty đang chuẩn bị tiến một nước cờ nghiêm túْc trong cuộc đua mô hình tiên tiến — và có khả năng làm lại toàn bộ bức tranh giá của API AI Trung Quốc.

MiniMax chưa phải cái tên quen thuộc ngoài Trung Quốc. Nhưng trong ngành, họ được biết đến qua hai thứ: cơ chế Lightning Attention (nay tiến hóa thành MSA) giúp chi phí inference cho context dài giảm mạnh; và một mô hình coding mạnh bất ngờ (M3) vượt ngoài tầm cỡ của nó. Những ghi chú này gợi ý rằng cả hai lợi thế sắp được khuếch đại lên nhiều lần.

🧬 Thế hệ mới: 2,5–3 nghìn tỷ tham số

Con số nổi bật: mô hình thế hệ mới của MiniMax nhắm mức 2,5–3 nghìn tỷ tham số. Để có cơ sở so sánh, GPT-4 ước tính khoảng 1,8T, còn DeepSeek V4 được cho nằm trong khoảng 1–2T. Nếu MiniMax chạm mốc 3T, nó sẽ lọt vào nhóm các mô hình dense/MoE lớn nhất từng được train.

Pre-training của mô hình mới đã chạy được khoảng nửa tháng, và theo ghi chú thì quá trình hội tụ đang vượt kỳ vọng. Mô hình dùng kiến trúc MSA 2.0 (chi tiết bên dưới) với số tham số và lượng kích hoạt tăng khoảng gấp đôi so với thế hệ M2 hiện tại.

Lộ trình: mô hình mới dự kiến ra mắt sau hè 2026 (khoảng tháng 9–10). Theo tin đồn, team nội bộ rất tự tin về cả hiệu năng lẫn mức độ hoàn thiện, khẳng định sẽ dẫn đầu thị trường nội địa (Trung Quốc).

⚡ MSA 2.0: vũ khí bí mật về hiệu quả chi phí

MSA là viết tắt của Multi-Scale Attention — kiến trúc độc quyền của MiniMax, tiến hóa từ công trình Lightning Attention trước đó. Lợi thế cốt lõi: giảm đáng kể overhead tính toán của Attention mà vẫn giữ nguyên chất lượng mô hình.

Vì sao điều này quan trọng với giá:

  • Hiệu quả training: MSA 2.0 giúp MiniMax train mô hình 3T tham số với chi phí chỉ bằng một phần nhỏ so với Transformer tiêu chuẩn. Training rẻ hơn = cần thu hồi vốn ít hơn = nhiều dư địa để đưa ra mức giá API agresive.
  • Hiệu quả inference: MSA hỗ trợ chuỗi siêu dài với overhead tính toán giảm cả một bậc số. Nghĩa là MiniMax có thể cung cấp cửa sổ context 1M+ với chi phí biên thấp hơn hẳn các đối thủ dùng Attention nguyên bản.
  • Biên gộp: Ghi chú nói rõ rằng dù số tham số và lượng kích hoạt nhân đôi, biên gộp của mô hình mới dự kiến vượt M2. Điều này chỉ khả thi nếu MSA 2.0 thực sự giảm chi phí trên mỗi token.
💡 Thông tin chính: Đa số phòng thí nghiệm AI Trung Quốc cạnh tranh về giá bằng cách đốt tiền. MiniMax có vẻ đang cạnh tranh bằng kiến trúc — đạt chi phí thấp nhờ kỹ thuật chứ không phải nhờ trợ cấp. Đây là hào nước phòng thủ bền vững hơn nhiều.

🚀 Hiệu năng và tốc độ coding

Ghi chú tiết lộ một số chi tiết thú vị về chiến lược coding của MiniMax:

  • M3 là mô hình nhanh nhất trong lineup chính — khoảng 100 TPS (token mỗi giây), được cho là nhanh hơn mọi đối thủ. Với quy trình coding mà developer theo dõi output stream theo thời gian thực, lợi thế tốc độ này trực tiếp mang lại UX tốt hơn.
  • Triết lý training của MiniMax thiên về dữ liệu code chuyên nghiệp chất lượng cao hơn là chỉ đẩy объема. Ghi chú nhấn mạnh "chất lượng dữ liệu và phương pháp training quan trọng hơn số lượng" — một quan điểm ngược dòng trong ngành đang ám ảnh với quy mô dataset.
  • M3.1 là bản nâng cấp lớn so với M3 (bản bị thiệt thòi do post-training gấp rút). Bằng cách tối ưu chất lượng dữ liệu và bổ sung dữ liệu task dài hạn, M3.1 đạt được cải thiện năng lực cả một bậc số trên các bài toán coding phức tạp.

Với độc giả China AI Arbitrage: mô hình coding của MiniMax hiện có giá khoảng $1,20/M output token — đã ngang ngửa Qwen và rẻ hơn GLM. Nếu mô hình thế hệ mới giữ đúng lời hứa, MiniMax có thể trở thành lựa chọn có giá trị coding tốt nhất trên thị trường AI Trung Quốc.

🏗️ Hạ tầng tính toán: lợi thế ở nước ngoài

Một trong những phần đáng chú ý nhất: MiniMax đã đảm bảo quyền truy cập hợp lệ tới GPU ở nước ngoài, vượt lên trước phần lớn đối thủ AI Trung Quốc đang loay hoay tìm giải pháp thay thế nội địa.

  • Tự xây mạng: MiniMax tự xây hạ tầng network liên kết giữa các GPU thay vì phụ thuộc giải pháp của nhà cung cấp. Được cho là đã tiết kiệm cả chi phí lẫn thời gian, với độ ổn định "vượt kỳ vọng".
  • Đường ống tính toán nội địa: GPU nội địa (sản xuất tại Trung Quốc) dùng được nhưng công suất hạn chế. MiniMax dự kiến cluster GPU nội địa đầu tiên đi vào hoạt động trong quý 3 năm 2026, bắt đầu với workload inference.
  • Chiến lược song song: GPU nước ngoài dùng cho training (nơi cần hiệu năng đỉnh), GPU nội địa dùng cho inference (nơi cần quy mô và hiệu quả chi phí). Đây là hướng thực dụng mà đa số phòng thí nghiệm AI Trung Quốc hằng ao ước — MiniMax có vẻ đã đi xa hơn trong khâu thực thi.

💰 Ý nghĩa với giá AI

Hãy nối các điểm lại để thấy hệ quả giá:

Yếu tốHiện tại (M3/M3.1)Thế hệ mới (mô hình 3T)Tác động tới giá
Tham số~1,5T (ước tính)2,5–3TTrần năng lực cao hơn
Kiến trúcMSA 1.0MSA 2.0Chi phí tính toán trên mỗi token thấp hơn
Biên gộpCơ sởDự kiến vượt M2Có dư địa giảm giá hoặc cải thiện biên
Tốc độ inference~100 TPSChưa rõ (có thể nhanh hơn)UX tốt hơn với cùng chi phí
Giá output~$1,20/M tokenChưa rõÁp lực cạnh tranh lên DeepSeek/Qwen

Kết luận chính: MiniMax đang xây một mô hình vừa lớn hơn vừa hiệu quả hơn. Trong thị trường mà DeepSeek V4 Flash đã cung cấp output với giá $0,28/M token, MiniMax không thể chỉ đấu về giá — họ cần sự khác biệt. Ghi chú gợi ý hướng đi của họ là: chất lượng tầm tiên tiến + tốc độ tốt nhất + biên bền vững nhờ đổi mới kiến trúc.

🌍 Góc nhìn arbitrage

Với độc giả China AI Arbitrage, đây là lý do nó quan trọng:

1. Cạnh tranh đẩy giá toàn ngành xuống.
Mỗi khi một phòng thí nghiệm AI Trung Quốc chứng minh được kiến trúc hiệu quả hơn, nó tạo áp lực lên tất cả những người còn lại — DeepSeek, Qwen, GLM, Kimi — hoặc là theo kịp hiệu quả, hoặc là phải giảm giá. Cuộc đua xuống đáy này có lợi cho developer phương Tây có thể truy cập các API này với giá chỉ bằng một phần nhỏ của giá Mỹ.
2. Quyền truy cập GPU nước ngoài của MiniMax = nguồn cung ổn định.
Nhiều phòng thí nghiệm AI Trung Quốc đối mặt với sự bất định về tài nguyên tính toán do lệnh kiểm soát xuất khẩu của Mỹ. "Quyền truy cập hợp lệ ở nước ngoài" của MiniMax nghĩa là API của họ ít có nguy cơ bị giới hạn dung lượng đột ngột — một rủi ro thực sự với các lab chỉ dựa vào GPU nội địa. Nguồn cung ổn định = nền arbitrage tin cậy.
3. Lợi thế tốc độ 100 TPS là chất xúc tác arbitrage.
Nếu bạn đang xây sản phẩm bán lại tài nguyên tính toán AI Trung Quốc cho người dùng phương Tây, độ trễ rất quan trọng. 100 TPS của MiniMax nghĩa là người dùng cuối của bạn có trải nghiệm mượt hơn — giúp bạn thu phí premium so với các giải pháp chậm hơn. Tốc độ là một giá trị gia tăng có thể tiền hóa được.

⏳ Tổng kết

MiniMax không phải phòng thí nghiệm AI ồn ào nhất Trung Quốc — đó là DeepSeek. Cũng không phải nơi gọi vốn nhiều nhất — đó là Zhipu hoặc ByteDance. Nhưng những ghi chú nội bộ này cho thấy họ có thể là nơi có định vị chiến lược tốt nhất: một kiến trúc độc quyền thực sự giảm chi phí, nguồn tài nguyên tính toán nước ngoài mang lại sự ổn định, và một mô hình coding vốn đã cạnh tranh và sắp được nâng cấp mạnh.

Ba thứ cần theo dõi:

  1. Tháng 9–10 năm 2026: Mô hình 3T mới ra mắt. Nếu đúng lời hứa "dẫn đầu thị trường nội địa", giá API của MiniMax có thể làm rung chuyển toàn bộ bức tranh cạnh tranh.
  2. Thay đổi giá API MiniMax: Nếu MiniMax giảm giá sau khi mô hình mới ra mắt (rất có thể, vì biên được cải thiện), họ sẽ trở thành một lựa chọn thay thế nghiêm túْc cho DeepSeek với workload hàng loạt.
  3. Mã nguồn mở MSA 2.0: MiniMax chưa open-source MSA. Nếu có, nó sẽ giảm đáng kể chi phí training trong toàn hệ sinh thái AI Trung Quốc — và đẩy nhanh cuộc đua giá về zero.

Chiến tranh giá AI Trung Quốc đã có thêm một chiến binh mới. Và chiến binh này có một kiến trúc thực sự đột phá để chống lưng.

Nguồn: Ghi chú nội bộ MiniMax (tháng 7 năm 2026), đã đối chiếu với giá API công khai và dữ liệu benchmark của MiniMax.