
📋 Internnotatene
Et sett med internnotater fra MiniMax — et av Kinas mest undervurderte AI-lab — har dukket opp. Dokumentet dekker fire områder: utvikling av neste generasjons modell, konkurranseposisjonering på kode-benchmarks, strategi for regnekraft-infrastruktur og utsiktene for bruttomargin. Tatt sammen tegner de et bilde av et selskap som er i ferd med å gjøre et seriøst trekk i kappløpet om frontier-modeller — og potensielt omforme prislandskapet for kinesiske AI-API-er.
MiniMax er ikke et kjent navn utenfor Kina. Men i bransjen er de kjent for to ting: Lightning Attention-mekanismen (nå videreutviklet til MSA) som gjør langkontekst-inferens dramatisk billigere, og en overraskende sterk kodemodell (M3) som slår over sin egen vektklasse. Notatene tyder på at begge disse fordelene er i ferd med å bli mye større.
🧬 Neste generasjon: 2,5–3 billioner parametere
Hodetallet: MiniMax sin neste generasjons modell sikter mot 2,5–3 billioner parametere. Til sammenligning er GPT-4 anslått til rundt 1,8T, og DeepSeek V4 antas å ligge i området 1–2T. Hvis MiniMax treffer 3T, blir modellen en av de største dense/MoE-modellene som noensinne er trent.
Fortrentningen på den nye modellen har allerede pågått i omtrent en halv måned, og ifølge notatene konvergerer den bedre enn forventet. Modellen bruker MSA 2.0-arkitektur (mer om dette nedenfor) og har omtrent doblet både parametertallet og aktiveringsantallet sammenlignet med dagens M2-generasjon.
Tidslinje: den nye modellen forventes lansert etter sommeren 2026 (trolig september–oktober). Det interne teamet visstnok svært selvsikkert på både ytelse og ferdigstillelsesgrad, og hevder den vil lede det innenlandske (kinesiske) markedet.
⚡ MSA 2.0: Hemmeligheten bak kostnadseffektiviteten
MSA står for Multi-Scale Attention — MiniMax sin proprietære arkitektur, utviklet fra deres tidligere Lightning Attention-arbeid. Den viktigste fordelen: den reduserer Attention-beregningskostnaden drastisk uten å gå på bekostning av modellkvalitet.
Hvorfor dette betyr noe for prising:
- Trenings-effektivitet: MSA 2.0 lar MiniMax trene en 3T-parametermodell til en brøkdel av hva en standard Transformer ville kostet. Lavere treningskostnad = mindre kapital å tjene inn = mer rom for aggressiv API-prising.
- Inferens-effektivitet: MSA støtter ultra-lange sekvenser med en størrelsesordens reduksjon i beregningskostnad. Det betyr at MiniMax kan tilby kontekstvinduer på 1M+ til langt lavere marginalkostnad enn konkurrenter som bruker vanlig Attention.
- Bruttomargin: Notatene sier eksplisitt at bruttomarginen på den nye modellen, til tross for dobling av parametere og aktiveringer, forventes å overgå M2. Det er kun mulig hvis MSA 2.0 gir reelle besparelser per token.
🚀 Kodeevne og hastighet
Notatene avslører interessante detaljer om MiniMax sin kodestrategi:
- M3 er den raskeste modellen i hovedserien — omtrent 100 TPS (tokens per second), som notatene hevder er raskere enn noen konkurrent. For kodearbeidsflyter der utviklere ser utdatastrømmen i sanntid, gir denne hastighetsfordelen direkte bedre brukeropplevelse.
- MiniMax sin treningsfilosofi vektlegger profesjonell kodedata av høy kvalitet framfor rent volum. Notatene understreker at «datakvalitet og treningsmetode betyr mer enn mengde» — et motstrømsstandpunkt i en bransje besatt av datasett-størrelse.
- M3.1 var en stor oppgradering fra M3 (som slet med overilt post-trening). Ved å optimalisere datakvalitet og legge til data for oppgaver med lang horisont, oppnådde M3.1 forbedringer på en størrelsesorden på komplekse kodeproblemer.
For China AI Arbitrage-publikummet: MiniMax sin kodemodell er priset til omtrent $1.20 per million utdata-tokens — allerede konkurransedyktig med Qwen og billigere enn GLM. Hvis neste generasjons modell innfrir løftene, kan MiniMax bli det beste kode-tilbudet i det kinesiske AI-markedet.
🏗️ Regnekraft-infrastruktur: Fordelen med ressurser i utlandet
En av de mest avslørende seksjonene: MiniMax har sikret lovlig tilgang til GPU-regnekraft i utlandet, noe som setter dem foran de fleste kinesiske AI-konkurrenter som kjemper med å finne innenlandske alternativer.
- Selvbygd nettverk: MiniMax bygde sitt eget nettverk mellom GPU-ene i stedet for å stole på leverandørløsninger. Notatene hevder dette sparte både kostnad og tid, med stabilitet «utover forventning».
- Innenlandsk regnekraft-pipeline: Kinesiskproduserte GPU-er er brukbare, men kapasitetsbegrensede. MiniMax forventer at sitt første kinesiske GPU-klynge kommer på nett i Q3 2026, med inferens først.
- Tvsporet strategi: GPU-er i utlandet til trening (der du trenger toppytelse), innenlandske GPU-er til inferens (der du trenger skala og kostnadseffektivitet). Dette er den pragmatiske tilnærmingen de fleste kinesiske lab aspirerer mot — MiniMax ser ut til å ligge lengre framme i gjennomføringen.
💰 Hva betyr dette for AI-prising?
La oss trekke linjene for priseffektene:
| Faktor | Nå (M3/M3.1) | Neste gen (3T-modell) | Betydning for prising |
|---|---|---|---|
| Parametere | ~1,5T (ansl.) | 2,5–3T | Høyere evnetak |
| Arkitektur | MSA 1.0 | MSA 2.0 | Lavere beregningskostnad per token |
| Bruttomargin | Baselinja | Ventet høyere enn M2 | Rom for å kutte priser eller bedre marginer |
| Inferens-hastighet | ~100 TPS | Ikke fastsatt (trolig raskere) | Bedre UX til samme kostnad |
| Utdatapris | ~$1.20/M tokens | Ikke fastsatt | Konkurransepress på DeepSeek/Qwen |
Hovedbudskapet: MiniMax bygger en modell som er både større OG mer effektiv. I et marked der DeepSeek V4 Flash allerede leverer utdata til $0.28/M tokens, kan MiniMax ikke bare matche på pris — de må tilby noe annet. Notatene tyder på at vinkelen er: frontier-kvalitet + beste hastighet i klassen + bærekraftige marginer gjennom arkitekturinnovasjon.
🌍 Arbitrage-perspektivet
For lesere av China AI Arbitrage, her er hvorfor dette betyr noe:
Hver gang et kinesisk lab demonstrerer en mer effektiv arkitektur, øker presset på alle andre — DeepSeek, Qwen, GLM, Kimi — om å enten matche effektiviteten eller kutte priser. Kappløpet mot bunnen gagner vestlige utviklere som kan få tilgang til disse API-ene til en brøkdel av amerikanske priser.
Mange kinesiske AI-lab står overfor usikkerhet om regnekraft på grunn av amerikanske eksportkontroller. MiniMax sin «lovlig tilgang i utlandet» betyr at API-et deres er mindre sannsynlig å få plutselige kapasitetsbegrensninger — en reell risiko for lab som utelukkende baserer seg på innenlandske GPU-er. Stabil forsyning = pålitelig arbitrage-grunnlag.
Bygger du et produkt som videreselger kinesisk AI-kapasitet til vestlige brukere, har ventetid mye å si. MiniMax sine 100 TPS betyr at sluttbrukerne dine får en mer responsiv opplevelse — noe som lar deg ta høyere pris enn tregere alternativer. Hastighet er merverdi du kan ta betalt for.
⏳ Konklusjon
MiniMax er ikke det høyest ropa kinesiske AI-lab-et — det er DeepSeek. De er heller ikke de med mest finansiering — det er Zhipu eller ByteDance. Men disse internnotatene tyder på at de kan være best strategisk posisjonert: en proprietær arkitektur som reelt sett reduserer kostnader, regnekraft-tilgang i utlandet som gir stabilitet, og en kodemodell som allerede er konkurransedyktig og i ferd med å bli mye større.
Tre ting å følge med på:
- September–oktober 2026: Lansering av den nye 3T-modellen. Lever den på løftet om å «lede det innenlandske markedet», kan MiniMax sin API-prising endre hele det konkurransedrevne landskapet.
- MiniMax API-prisendringer: Hvis MiniMax kutter priser etter lansering av den nye modellen (sannsynlig, gitt forbedrede marginer), blir de et reelt alternativ til DeepSeek for batch-arbeidsbelastninger.
- Open-sourcing av MSA 2.0: MiniMax har ikke åpnet MSA ennå. Gjør de det, kan det dramatisk senke treningskostnadene i hele det kinesiske AI-økosystemet — og akselerere prisløpet mot null.
Den kinesiske AI-priskrigen har fått en ny deltaker. Og denne har en genuint nyskapende arkitektur å støtte seg på.
Kilde: MiniMax internnotater (juli 2026), verifisert mot offentlige MiniMax API-priser og benchmark-data.