MiniMax sisäpiiritietoja — seuraavan sukupolven malli, MSA-arkkitehtuuri, koodausnopeus, laskentainfrastruktuuri

📋 Sisäpiiritiedot tulevat julkisuuteen

Pieni nippu sisäpiiritietoja MiniMaxilta — yhdeltä Kiinan aliarvostetuimmista tekoälylaboratorioista — on juuri päätynyt julkisuuteen. Dokumentti käsittelee neljää aluetta: seuraavan sukupolven mallin kehitys, kilpailullinen asema koodaustesteissä, laskentainfrastruktuurin strategia ja bruttokatteennuste. Kokonaisuudessaan ne piirtävät kuvaa yhtiöstä, joka on tekemässä vakavaa siirtoa eturintaman mallikilvassa — ja saattaa muokata koko kiinalaisten tekoäly-API-rajapintojen hintakenttää.

MiniMax ei ole kovin tunnettu Kiinan ulkopuolella. Alan sisällä se tunnetaan kuitenkin kahdesta asiasta: Lightning Attention -mekanismista (joka on nyt kehittynyt MSA:ksi), joka tekee pitkän kontekstin päättelystä huomattavasti halvempaa, sekä yllättävän vahvasta koodausmallista (M3), joka lyö omaa painoluokkaansa. Näiden tietojen valossa molemmat edut ovat juuri kasvamassa merkittävästi.

🧬 Seuraava sukupolvi: 2,5–3 biljoonaa parametriä

Suurin luku: MiniMaxin seuraavan sukupolven malli tähtää 2,5–3 biljoonaan parametriin. Vertailun vuoksi GPT-4:n arvellaan olevan noin 1,8T ja DeepSeek V4:n 1–2T luokkaa. Jos MiniMax saavuttaa 3T:n lukeman, siitä tulee yksi suurimmista koskaan koulutetuista dense- tai MoE-malleista.

Uuden mallin esikoulutus on ollut käynnissä noin puolikuukauden ajan, ja tietojen mukaan kovergenssi ylittää odotukset. Malli käyttää MSA 2.0 -arkkitehtuuria (lisää alla), ja niin parametrien kuin aktivoinnin määrä ovat suunnilleen kaksinkertaistuneet nykyiseen M2-sukupolveen verrattuna.

Aikataulu: uuden mallin odotetaan julkaistavan kesän 2026 jälkeen (todennäköisesti syys–lokakuussa). Sisäisen tiimin kerrotaan olevan erittäin luottavainen sekä suorituskyvyn että valmiusasteen suhteen, ja sen väitetään johtavan kotimarkkinaa (Kiinaa).

⚡ MSA 2.0: Kustannustehokkuuden salainen ase

MSA tulee sanoista Multi-Scale Attention — MiniMaxin patentsoidun arkkitehtuuri, joka on kehittynyt heidän aiemmasta Lightning Attention -työstään. Keskeinen etu: se vähentää radikaalisti Attention-laskennan overheadia säilyttäen mallin laadun.

Miksi tämä on ratkaisevaa hinnoittelun kannalta:

  • Koulutustehokkuus: MSA 2.0 antaa MiniMaxin kouluttaa 3T-parametrinen malli murto-osalla siitä, mitä tavallinen Transformer maksaisi. Alhaisempi koulutuskustannus = vähemmän takaisin maksettavaa pääomaa = enemmän tilaa aggressiiviselle API-hinnoittelulle.
  • Päättelytehokkuus: MSA tukee äärimmäisen pitkiä sekvenssejä yhden kertaluokan laskenta-ohjelman pienenemisellä. Tämä tarkoittaa, että MiniMax voi tarjota yli miljoonan konteksti-ikkunoita paljon pienemmällä marginaalikustannuksella kuin kilpailijat, jotka käyttävät perinteistä Attention-mekanismia.
  • Bruttokate: Tiedot sanovat suoraan, että parametrien ja aktivointien kaksinkertaistumisesta huolimatta uuden mallin bruttokatteen odotetaan ylittävän M2:n. Se on mahdollista vain, jos MSA 2.0 tuo oikeita token-kohtaisia kustannussäästöjä.
💡 Keskeinen oivallus: Useimmat kiinalaiset tekoälylaboratoriot kilpailevat hinnalla polttamalla käteistä. MiniMax näyttää kilpailevan arkkitehtuurilla — saavuttaen alhaisempia kustannuksia suunnittelun eikä tukiaisten kautta. Se on paljon kestävämpi vallihauta.

🚀 Koodausteho ja nopeus

Tiedot paljastavat mielenkiintoisia yksityiskohtia MiniMaxin koodausstrategiasta:

  • M3 on nopein malli päävalikoimassa — noin 100 tokenia sekunnissa (TPS), ja tietojen mukaan nopeampi kuin yksikään kilpailija. Koodaustyönkuluissa, joissa kehittäjät seuraavat tulosteen virtaista reaaliajassa, tämä nopeusetu näkyy suoraan parempana käyttökokemuksena.
  • MiniMaxin koulutusfilosofia nojaa korkealaatuiseen ammattimaiseen koodidataan pelkän määrän sijaan. Tiedot korostavat, että "datan laatu ja koulutusmetodologia merkitsevät enemmän kuin määrä" — vastakkainen kanta toimialalla, joka on pakkomielle datasettien koosta.
  • M3.1 oli merkittävä päivitys M3:een (joka kärsi kiireellisestä jälkikoulutuksesta). Optimoidulla datan laadulla ja pitkän aikavälin tehtävädatalla M3.1 saavutti kertaluokan suorituskyvyn parannuksia monimutkaisissa koodaustehtävissä.

China AI Arbitrangen lukijoille: MiniMaxin koodausmalli on tällä hetkellä hinnoiteltu noin $1.20/M tulostetokenia — jo kilpailukykyinen Qwenin kanssa ja halvempi kuin GLM. Jos seuraavan sukupolven malli lunastaa lupauksensa, MiniMaxista voi tulla paras koodauksen hinta-laatusuhde koko Kiinan tekoälymarkkinalla.

🏗️ Laskentainfrastruktuuri: Ulkomainen etu

Yksi paljastavimmista osioista: MiniMax on hankkinut sääntöjen mukaista pääsyn ulkomaiseen GPU-laskentatehoon, mikä asettaa sen useimpien kiinalaisten tekoälykilpailijoiden edelle, jotka kamppailevat kotimaisten korvaavien vaihtoehtojen kanssa.

  • Itse rakennettu verkko: MiniMax rakensi oman GPU- välisen verkko-infrastruktuurinsa sen sijaan, että se olisi luottanut toimittajien ratkaisuihin. Tiedot väittävät tämän säästäneen sekä kustannuksia että aikaa, ja vakaudeksi on kuvattu "odotuksia paremmaksi".
  • Kotimainen laskentaputki: Kotimaiset (kiinalaiset) GPU:t ovat käytettävissä, mutta kapasiteetiltaan rajoitettuja. MiniMax odottaa ensimmäisen kotimaisen GPU-klusterinsa käyvän päälle vuoden 2026 kolmannella neljänneksellä, aluksi päättelykuormissa.
  • Kaksijalkainen strategia: Ulkomaiset GPU:t koulutukseen (jossa tarvitaan huippusuorituskykyä), kotimaiset GPU:t päättelyyn (jossa tarvitaan mittakaavaa ja kustannustehokkuutta). Tämä on pragmaattinen lähestymistapa, johon useimmat kiinalaiset laboratoriot pyrkivät — MiniMax näyttää olevan toteutuksessa pidemmällä.

💰 Mitä tämä tarkoittaa tekoälyn hinnoittelulle

Yhdistetään pisteet hinnoitteluvaikutusten suhteen:

TekijäNykyinen (M3/M3.1)Seuraava sukupolvi (3T-malli)Vaikutus hinnoitteluun
Parametrit~1,5T (arvio)2,5–3TKorkeampi suorituskykyn katto
ArkkitehtuuriMSA 1.0MSA 2.0Matalampi token-kohtainen laskentakustannus
BruttokatePerustasoOdotettu M2:ta korkeammaksiTilaa leikata hintoja tai parantaa katteita
Päättelynopeus~100 TPSAvoin (todennäköisesti nopeampi)Parempi käyttökokemus samalla kustannuksella
Tulostehinta~$1.20/M tokeniaAvoinKilpailupaine DeepSeekiä/Qweniä kohtaan

Keskeinen johtopäätös: MiniMax rakennuttaa mallia, joka on yhtäaikaa suurempi JA tehokkaampi. Markkinassa, jossa DeepSeek V4 Flash jo tarjoaa tulosteen $0.28/M tokenilta, MiniMax ei voi vain vastata hintaa — sen tarjoaa jotain erilaista. Tiedot viittaavat, että heidän kulmansa on: eturintaman laatu + parhaan luokan nopeus + kestävät katteet arkkitehtuuri-innovaation kautta.

🌍 Arbitrasikulma

China AI Arbitrangen lukijoille tässä on syy, miksi tämä merkitsee:

1. Kilpailu ajaa hintoja alas kaikkialla.
Aina kun jokin kiinalainen laboratorio esittelee tehokkaamman arkkitehtuurin, se asettaa paineen kaikille muille — DeepSeek, Qwen, GLM, Kimi — joko vastata tehokkuudella tai leikata hintoja. Tämä kilpajuoksu pohjalle hyödyttää länsimaisia kehittäjiä, jotka pääsevät näihin API-rajapintoihin murto-osalla Yhdysvaltojen hinnoista.
2. MiniMaxin ulkomainen GPU-pääsy = vakaa tarjonta.
Monet kiinalaiset tekoälylaboratoriot kohtaavat laskentavarmuuteen liittyvää epävarmuutta Yhdysvaltojen vientirajoitusten takia. MiniMaxin "sääntöjen mukainen ulkomainen pääsy" tarkoittaa, että sen API on vähemmän alttiina yllättäville kapasiteettirajoituksille — todellinen riski laboratorioille, jotka luottavat pelkästään kotimaisiin GPU:ihin. Vakaa tarjonta = luotettava arbitrasialusta.
3. 100 TPS:n nopeusetu on arbitrasin mahdollistaja.
Jos rakennat tuotetta, joka jälleenmyy kiinalaista tekoälykapasiteettia länsimaisille käyttäjille, viive merkitsee. MiniMaxin 100 TPS tarkoittaa, että loppukäyttäjiesi kokemus on sujuvampi — mikä antaa sinun veloittaa premiota hitaampiin vaihtoehtoihin verrattuna. Nopeus on lisäarvo, jonka voit muuttaa rahaksi.

⏳ Yhteenveto

MiniMax ei ole äänekkäin kiinalainen tekoälylaboratorio — se on DeepSeek. Se ei ole rahoitukseltaan suurin — se on Zhipu tai ByteDance. Nämä sisäpiiritiedot viittaavat kuitenkin, että se saattaa olla strategisesti parhaiten positioitunut: patentsoiduttu arkkitehtuuri, joka aidosti laskee kustannuksia; ulkomainen laskentaolo, joka tuo vakautta; sekä koodausmalli, joka on jo kilpailukykyinen ja on juuri kasvamassa paljon suuremmaksi.

Kolme asiaa, joita kannattaa seurata:

  1. Syys–lokakuu 2026: Uuden 3T-mallin julkaisu. Jos se lunastaa "johtaa kotimarkkinaa" -lupauksen, MiniMaxin API-hinnoittelu saattaa siirtää koko kilpakentän painopistettä.
  2. MiniMaxin API-hintojen muutokset: Jos MiniMax laskee hintoja uuden mallin julkaisun jälkeen (todennäköistä parantuneiden katteiden ansiosta), siitä tulee vakava vaihtoehto DeepSeekille eräkuormissa.
  3. MSA 2.0:n avaussulkeminen: MiniMax ei ole vielä avannut MSA:ta. Jos se tekee sen, se voisi dramaattisesti laskea koulutuskustannuksia koko kiinalaisessa tekoälyekosysteemissä — ja nopeuttaa hintakilpaa kohti nollaa.

Kiinalaisten tekoälymallien hintasodassa on uusi taistelija. Ja tällä on aidosti uudenlainen arkkitehtuuri tukemassa siirtojaan.

Lähde: MiniMaxin sisäpiiritiedot (heinäkuu 2026), ristiintarkistettu MiniMaxin julkista API-hinnoittelua ja vertailudataa vastaan.