MiniMax internnotater — neste generasjons modell, MSA-arkitektur, kodehastighet, regnekraft-infrastruktur

📋 Internnotatene

Et sett med internnotater fra MiniMax — et av Kinas mest undervurderte AI-lab — har dukket opp. Dokumentet dekker fire områder: utvikling av neste generasjons modell, konkurranseposisjonering på kode-benchmarks, strategi for regnekraft-infrastruktur og utsiktene for bruttomargin. Tatt sammen tegner de et bilde av et selskap som er i ferd med å gjøre et seriøst trekk i kappløpet om frontier-modeller — og potensielt omforme prislandskapet for kinesiske AI-API-er.

MiniMax er ikke et kjent navn utenfor Kina. Men i bransjen er de kjent for to ting: Lightning Attention-mekanismen (nå videreutviklet til MSA) som gjør langkontekst-inferens dramatisk billigere, og en overraskende sterk kodemodell (M3) som slår over sin egen vektklasse. Notatene tyder på at begge disse fordelene er i ferd med å bli mye større.

🧬 Neste generasjon: 2,5–3 billioner parametere

Hodetallet: MiniMax sin neste generasjons modell sikter mot 2,5–3 billioner parametere. Til sammenligning er GPT-4 anslått til rundt 1,8T, og DeepSeek V4 antas å ligge i området 1–2T. Hvis MiniMax treffer 3T, blir modellen en av de største dense/MoE-modellene som noensinne er trent.

Fortrentningen på den nye modellen har allerede pågått i omtrent en halv måned, og ifølge notatene konvergerer den bedre enn forventet. Modellen bruker MSA 2.0-arkitektur (mer om dette nedenfor) og har omtrent doblet både parametertallet og aktiveringsantallet sammenlignet med dagens M2-generasjon.

Tidslinje: den nye modellen forventes lansert etter sommeren 2026 (trolig september–oktober). Det interne teamet visstnok svært selvsikkert på både ytelse og ferdigstillelsesgrad, og hevder den vil lede det innenlandske (kinesiske) markedet.

⚡ MSA 2.0: Hemmeligheten bak kostnadseffektiviteten

MSA står for Multi-Scale Attention — MiniMax sin proprietære arkitektur, utviklet fra deres tidligere Lightning Attention-arbeid. Den viktigste fordelen: den reduserer Attention-beregningskostnaden drastisk uten å gå på bekostning av modellkvalitet.

Hvorfor dette betyr noe for prising:

  • Trenings-effektivitet: MSA 2.0 lar MiniMax trene en 3T-parametermodell til en brøkdel av hva en standard Transformer ville kostet. Lavere treningskostnad = mindre kapital å tjene inn = mer rom for aggressiv API-prising.
  • Inferens-effektivitet: MSA støtter ultra-lange sekvenser med en størrelsesordens reduksjon i beregningskostnad. Det betyr at MiniMax kan tilby kontekstvinduer på 1M+ til langt lavere marginalkostnad enn konkurrenter som bruker vanlig Attention.
  • Bruttomargin: Notatene sier eksplisitt at bruttomarginen på den nye modellen, til tross for dobling av parametere og aktiveringer, forventes å overgå M2. Det er kun mulig hvis MSA 2.0 gir reelle besparelser per token.
💡 Hovedinnsikt: De fleste kinesiske AI-lab konkurrerer på pris ved å brenne penger. MiniMax ser ut til å konkurrere på arkitektur — oppnår lavere kostnader gjennom ingeniørarbeid, ikke subsidier. Det er et mye mer bærekraftig voldgrav.

🚀 Kodeevne og hastighet

Notatene avslører interessante detaljer om MiniMax sin kodestrategi:

  • M3 er den raskeste modellen i hovedserien — omtrent 100 TPS (tokens per second), som notatene hevder er raskere enn noen konkurrent. For kodearbeidsflyter der utviklere ser utdatastrømmen i sanntid, gir denne hastighetsfordelen direkte bedre brukeropplevelse.
  • MiniMax sin treningsfilosofi vektlegger profesjonell kodedata av høy kvalitet framfor rent volum. Notatene understreker at «datakvalitet og treningsmetode betyr mer enn mengde» — et motstrømsstandpunkt i en bransje besatt av datasett-størrelse.
  • M3.1 var en stor oppgradering fra M3 (som slet med overilt post-trening). Ved å optimalisere datakvalitet og legge til data for oppgaver med lang horisont, oppnådde M3.1 forbedringer på en størrelsesorden på komplekse kodeproblemer.

For China AI Arbitrage-publikummet: MiniMax sin kodemodell er priset til omtrent $1.20 per million utdata-tokens — allerede konkurransedyktig med Qwen og billigere enn GLM. Hvis neste generasjons modell innfrir løftene, kan MiniMax bli det beste kode-tilbudet i det kinesiske AI-markedet.

🏗️ Regnekraft-infrastruktur: Fordelen med ressurser i utlandet

En av de mest avslørende seksjonene: MiniMax har sikret lovlig tilgang til GPU-regnekraft i utlandet, noe som setter dem foran de fleste kinesiske AI-konkurrenter som kjemper med å finne innenlandske alternativer.

  • Selvbygd nettverk: MiniMax bygde sitt eget nettverk mellom GPU-ene i stedet for å stole på leverandørløsninger. Notatene hevder dette sparte både kostnad og tid, med stabilitet «utover forventning».
  • Innenlandsk regnekraft-pipeline: Kinesiskproduserte GPU-er er brukbare, men kapasitetsbegrensede. MiniMax forventer at sitt første kinesiske GPU-klynge kommer på nett i Q3 2026, med inferens først.
  • Tvsporet strategi: GPU-er i utlandet til trening (der du trenger toppytelse), innenlandske GPU-er til inferens (der du trenger skala og kostnadseffektivitet). Dette er den pragmatiske tilnærmingen de fleste kinesiske lab aspirerer mot — MiniMax ser ut til å ligge lengre framme i gjennomføringen.

💰 Hva betyr dette for AI-prising?

La oss trekke linjene for priseffektene:

FaktorNå (M3/M3.1)Neste gen (3T-modell)Betydning for prising
Parametere~1,5T (ansl.)2,5–3THøyere evnetak
ArkitekturMSA 1.0MSA 2.0Lavere beregningskostnad per token
BruttomarginBaselinjaVentet høyere enn M2Rom for å kutte priser eller bedre marginer
Inferens-hastighet~100 TPSIkke fastsatt (trolig raskere)Bedre UX til samme kostnad
Utdatapris~$1.20/M tokensIkke fastsattKonkurransepress på DeepSeek/Qwen

Hovedbudskapet: MiniMax bygger en modell som er både større OG mer effektiv. I et marked der DeepSeek V4 Flash allerede leverer utdata til $0.28/M tokens, kan MiniMax ikke bare matche på pris — de må tilby noe annet. Notatene tyder på at vinkelen er: frontier-kvalitet + beste hastighet i klassen + bærekraftige marginer gjennom arkitekturinnovasjon.

🌍 Arbitrage-perspektivet

For lesere av China AI Arbitrage, her er hvorfor dette betyr noe:

1. Konkurranse presser prisene ned over hele linja.
Hver gang et kinesisk lab demonstrerer en mer effektiv arkitektur, øker presset på alle andre — DeepSeek, Qwen, GLM, Kimi — om å enten matche effektiviteten eller kutte priser. Kappløpet mot bunnen gagner vestlige utviklere som kan få tilgang til disse API-ene til en brøkdel av amerikanske priser.
2. MiniMax sin utenlandske GPU-tilgang = stabil forsyning.
Mange kinesiske AI-lab står overfor usikkerhet om regnekraft på grunn av amerikanske eksportkontroller. MiniMax sin «lovlig tilgang i utlandet» betyr at API-et deres er mindre sannsynlig å få plutselige kapasitetsbegrensninger — en reell risiko for lab som utelukkende baserer seg på innenlandske GPU-er. Stabil forsyning = pålitelig arbitrage-grunnlag.
3. 100 TPS-hastigheten er en arbitrage-multiplikator.
Bygger du et produkt som videreselger kinesisk AI-kapasitet til vestlige brukere, har ventetid mye å si. MiniMax sine 100 TPS betyr at sluttbrukerne dine får en mer responsiv opplevelse — noe som lar deg ta høyere pris enn tregere alternativer. Hastighet er merverdi du kan ta betalt for.

⏳ Konklusjon

MiniMax er ikke det høyest ropa kinesiske AI-lab-et — det er DeepSeek. De er heller ikke de med mest finansiering — det er Zhipu eller ByteDance. Men disse internnotatene tyder på at de kan være best strategisk posisjonert: en proprietær arkitektur som reelt sett reduserer kostnader, regnekraft-tilgang i utlandet som gir stabilitet, og en kodemodell som allerede er konkurransedyktig og i ferd med å bli mye større.

Tre ting å følge med på:

  1. September–oktober 2026: Lansering av den nye 3T-modellen. Lever den på løftet om å «lede det innenlandske markedet», kan MiniMax sin API-prising endre hele det konkurransedrevne landskapet.
  2. MiniMax API-prisendringer: Hvis MiniMax kutter priser etter lansering av den nye modellen (sannsynlig, gitt forbedrede marginer), blir de et reelt alternativ til DeepSeek for batch-arbeidsbelastninger.
  3. Open-sourcing av MSA 2.0: MiniMax har ikke åpnet MSA ennå. Gjør de det, kan det dramatisk senke treningskostnadene i hele det kinesiske AI-økosystemet — og akselerere prisløpet mot null.

Den kinesiske AI-priskrigen har fått en ny deltaker. Og denne har en genuint nyskapende arkitektur å støtte seg på.

Kilde: MiniMax internnotater (juli 2026), verifisert mot offentlige MiniMax API-priser og benchmark-data.