
📋 Nota Dalaman
Satu set nota dalaman dari MiniMax — salah satu makmal AI China yang paling kurang dihargai — baru-baru ini muncul. Dokumen itu merangkumi empat bidang: pembangunan model generasi akan datang, kedudukan kompetitif dalam penanda aras pengekodan, strategi infrastruktur komputer, dan prospek margin kasar. Secara keseluruhannya, ia melukiskan gambaran syarikat yang bakal bergerak serius dalam perlumbaan model frontier — dan berpotensi membentuk semula landskap harga untuk API AI China.
MiniMax bukan nama yang dikenali di luar China. Tetapi dalam industri, ia dikenali kerana dua perkara: mekanisme Lightning Attention (kini berkembang menjadi MSA) yang menjadikan inferens konteks panjang jauh lebih murah, dan model pengekodan (M3) yang mengejutkan kuat untuk saiznya. Nota ini mencadangkan kedua-dua kelebihan itu akan menjadi jauh lebih besar.
🧬 Generasi Akan Datang: 2.5–3 Trilion Parameter
Nombor utama: model generasi akan datang MiniMax menyasarkan 2.5–3 trilion parameter. Untuk konteks, GPT-4 dianggarkan ~1.8T, dan DeepSeek V4 dipercayai berada dalam julat 1–2T. Jika MiniMax mencapai 3T, ia akan menjadi antara model dense/MoE terbesar yang pernah dilatih.
Pra-latihan pada model baharu telah berjalan selama lebih kurang separuh bulan, dan menurut nota tersebut, penumpuan melebihi jangkaan. Model ini menggunakan seni bina MSA 2.0 (lebih lanjut di bawah) dan telah meningkat dua kali ganda dari segi bilangan parameter dan pengaktifan berbanding generasi M2 semasa.
Garis masa: model baharu dijangka dilancarkan selepas musim panas 2026 (kemungkinan September–Oktober). Pasukan dalaman dilaporkan sangat yakin terhadap prestasi dan tahap penyiapan, mendakwa ia akan memimpin pasaran domestik (China).
⚡ MSA 2.0: Senjata Rahsia Kecekapan Kos
MSA bermaksud Multi-Scale Attention — seni bina proprietari MiniMax yang berkembang daripada kerja Lightning Attention terdahulu. Kelebihan utama: ia mengurangkan secara drastik overhead pengiraan Attention sambil mengekalkan kualiti model.
Kenapa ini penting untuk harga:
- Kecekapan latihan: MSA 2.0 membolehkan MiniMax melatih model 3T-parameter pada sebahagian kecil daripada kos Transformer standard. Kos latihan lebih rendah = kurang modal untuk dipulihkan = lebih banyak ruang untuk harga API yang agresif.
- Kecekapan inferens: MSA menyokong jujukan ultra-panjang dengan pengurangan overhead pengiraan satu susunan magnitud. Ini bermakna MiniMax boleh menawarkan tetingkap konteks 1M+ pada kos marginal jauh lebih rendah berbanding pesaing yang menggunakan Attention vanila.
- Margin kasar: Nota itu secara eksplisit menyatakan bahawa walaupun parameter dan pengaktifan berganda, margin kasar model baharu dijangka melebihi M2. Itu hanya mungkin jika MSA 2.0 memberikan penjimatan kos setiap token yang sebenar.
🚀 Prestasi & Kelajuan Pengekodan
Nota itu mendedahkan butiran menarik tentang strategi pengekodan MiniMax:
- M3 ialah model terpantas dalam barisan utama — lebih kurang 100 token sesaat (TPS), yang nota itu mendakwa lebih cepat daripada mana-mana pesaing. Untuk aliran kerja pengekodan yang mana pembangun menonton strim output secara langsung, kelebihan kelajuan ini terjemah terus kepada UX yang lebih baik.
- Falsafah latihan MiniMax condong ke arah data kod profesional berkualiti tinggi berbanding isi padu semata-mata. Nota itu menekankan bahawa "kualiti data dan metodologi latihan lebih penting daripada kuantiti" — pendirian berlawanan dalam industri yang obses dengan skala set data.
- M3.1 ialah peningkatan besar ke atas M3 (yang terjejas akibat pasca-latihan yang tergesa-gesa). Dengan mengoptimumkan kualiti data dan menambah data tugas cakrawala panjang, M3.1 mencapai peningkatan keupayaan satu susunan magnitud pada masalah pengekodan kompleks.
Untuk pembaca China AI Arbitrage: model pengekodan MiniMax buat masa ini dikenakan harga lebih kurang $1.20/M token output — sudah kompetitif dengan Qwen dan lebih murah daripada GLM. Jika model generasi akan datang menunaikan janjinya, MiniMax boleh menjadi cadangan nilai pengekodan terbaik di pasaran AI China.
🏗️ Infrastruktur Komputer: Kelebihan Luar Negara
Salah satu bahagian paling mendedahkan: MiniMax telah mendapatkan akses patuh kepada komputer GPU luar negara, meletakkannya di hadapan kebanyakan pesaing AI China yang sedang berjuang mencari alternatif domestik.
- Rangkaian buatan sendiri: MiniMax membina infrastruktur rangkaian antara-GPU sendiri berbanding bergantung pada penyelesaian vendor. Nota itu mendakwa ini menjimatkan kos dan masa, dengan kestabilan "melebihi jangkaan".
- Saluran komputer domestik: GPU domestik (buatan China) boleh digunakan tetapi terhad dari segi kapasiti. MiniMax menjangkakan kluster GPU domestik pertamanya beroperasi dalam Q3 2026, bermula dengan beban kerja inferens.
- Strategi dwi-trek: GPU luar negara untuk latihan (yang memerlukan prestasi tajam), GPU domestik untuk inferens (yang memerlukan skala dan kecekapan kos). Ini pendekatan pragmatik yang dicita-citakan kebanyakan makmal China — MiniMax nampaknya lebih jauh dari segi pelaksanaan.
💰 Apa Maknanya untuk Harga AI
Mari hubungkan titik-titik pada implikasi harga:
| Faktor | Semasa (M3/M3.1) | Generasi Akan Datang (Model 3T) | Impak pada Harga |
|---|---|---|---|
| Parameter | ~1.5T (anggaran) | 2.5–3T | Siling keupayaan lebih tinggi |
| Seni bina | MSA 1.0 | MSA 2.0 | Kos komputer setiap token lebih rendah |
| Margin kasar | Garis asas | Dijangka melebihi M2 | Ruang untuk potong harga atau baik pulih margin |
| Kelajuan inferens | ~100 TPS | Belum ditentukan (mungkin lebih cepat) | UX lebih baik pada kos sama |
| Harga output | ~$1.20/M token | Belum ditentukan | Tekanan kompetitif ke atas DeepSeek/Qwen |
Intipati: MiniMax sedang membina model yang lebih besar DAN lebih cekap. Dalam pasaran yang mana DeepSeek V4 Flash sudah menawarkan output pada $0.28/M token, MiniMax tak boleh hanya menyamai pada harga — mereka perlu tawarkan sesuatu yang berbeza. Nota itu mencadangkan sudut mereka ialah: kualiti tahap frontier + kelajuan terbaik dalam kelas + margin mampan melalui inovasi seni bina.
🌍 Sudut Arbitraj
Untuk pembaca China AI Arbitrage, inilah sebabnya ia penting:
Setiap kali makmal China menunjukkan seni bina yang lebih cekap, ia memberi tekanan kepada semua pihak lain — DeepSeek, Qwen, GLM, Kimi — untuk sama ada menandingi kecekapan atau memotong harga. Perlumbaan ke bawah memberi manfaat kepada pembangun Barat yang boleh mengakses API ini pada sebahagian kecil daripada harga AS.
Banyak makmal AI China menghadapi ketidakpastian komputer akibat kawalan eksport AS. "Akses patuh luar negara" MiniMax bermaksud API mereka kurang berkemungkinan menghadapi kekangan kapasiti secara mengejut — risiko sebenar bagi makmal yang bergantung semata-mata pada GPU domestik. Bekalan stabil = substrat arbitraj yang boleh dipercayai.
Jika anda membina produk yang menjual semula kapasiti AI China kepada pengguna Barat, kependaman penting. 100 TPS MiniMax bermaksud pengguna akhir anda dapat pengalaman lebih responsif — yang membolehkan anda mengenakan premium berbanding alternatif yang lebih perlahan. Kelajuan ialah nilai tambah yang boleh dimonetkan.
⏳ Kesimpulan
MiniMax bukan makmal AI China yang paling bising — itu DeepSeek. Ia bukan yang paling banyak pembiayaan — itu Zhipu atau ByteDance. Tetapi nota dalaman ini mencadangkan ia mungkin yang paling strategik diletakkan: seni bina proprietari yang benar-benar mengurangkan kos, akses komputer luar negara yang memberi kestabilan, dan model pengekodan yang sudah kompetitif dan bakal menjadi jauh lebih besar.
Tiga perkara untuk ditonton:
- September–Oktober 2026: Pelancaran model 3T baharu. Jika ia menunaikan janji "memimpin pasaran domestik", harga API MiniMax boleh mengubah seluruh landskap kompetitif.
- Perubahan harga API MiniMax: Jika MiniMax memotong harga selepas pelancaran model baharu (kemungkinan, memandangkan margin bertambah baik), ia menjadi alternatif serius kepada DeepSeek untuk beban kerja batch.
- Sumber terbuka MSA 2.0: MiniMax belum membuka sumber MSA lagi. Jika mereka lakukannya, ia boleh mengurangkan kos latihan secara dramatik di seluruh ekosistem AI China — dan mempercepatkan perlumbaan harga ke sifar.
Perang harga AI China ada peserta baharu. Dan yang ini ada seni bina benar-benar baharu untuk menyokong langkahnya.
Sumber: Nota dalaman MiniMax (Julai 2026), disahkan terhadap harga API MiniMax awam dan data penanda aras.