MiniMax insider-uppgifter — nästa generations modell, MSA-arkitektur, kodhastighet, beräkningsinfrastruktur

📋 Insider-uppgifterna

En samling insider-uppgifter från MiniMax — ett av Kinas mest undervärderade AI-labb — har just kommit i dagen. Dokumentet täcker fyra områden: utveckling av nästa generations modell, konkurrenspositionering på kodnings-benchmark, strategi för beräkningsinfrastruktur och utblick för bruttomarginalen. Tillsammans ritar de upp bilden av ett företag som är på väg att göra ett allvarligt drag i kapplöpningen om frontlinjemodeller — och som potentiellt kan omforma prissättningslandskapet för kinesiska AI-API:er.

MiniMax är inget känt namn utanför Kina. Men inom branschen är de kända för två saker: Lightning Attention-mekanismen (nu vidareutvecklad till MSA) som gör långkontext-inferens dramatiskt billigare, och en överraskande stark kodmodell (M3) som slår över sin viktklass. Uppgifterna tyder på att båda fördelarna snart blir avsevärt större.

🧬 Nästa generation: 2,5–3 biljoner parametrar

Den stora siffran: MiniMax nästa generations modell siktar på 2,5–3 biljoner parametrar. Som jämförelse uppskattas GPT-4 till ungefär 1,8T, och DeepSeek V4 tros ligga i spannet 1–2T. Om MiniMax når 3T blir det en av de största dense/MoE-modellerna som någonsin tränats.

Förträning på den nya modellen har pågått i ungefär en halv månad, och enligt uppgifterna överstiger konvergensen förväntningarna. Modellen använder MSA 2.0-arkitekturen (mer om den nedan) och har ungefär fördubblat både parameterantal och aktiveringsantal jämfört med den nuvarande M2-generationen.

Tidslinje: den nya modellen förväntas lanseras efter sommaren 2026 (sannolikt september–oktober). Det interna teamet lär vara mycket självsäkert både gällande prestanda och färdigställandegrad, och hävdar att den kommer att leda den inhemska (kinesiska) marknaden.

⚡ MSA 2.0: Hemlighetsvapnet för kostnadseffektivitet

MSA står för Multi-Scale Attention — MiniMax proprietära arkitektur som vuxit fram ur deras tidigare Lightning Attention-arbete. Den stora fördelen: den drastiskt sänker beräkningskostnaden för Attention samtidigt som modellkvaliteten bevaras.

Varför det här spelar roll för prissättningen:

  • Träningseffektivitet: MSA 2.0 låter MiniMax träna en 3T-parametermodell till en bråkdel av vad en standard-Transformer skulle kosta. Lägre träningskostnad = mindre kapital att tjäna in = mer utrymme för aggressiv API-prissättning.
  • Inferenseffektivitet: MSA stöder ultralånga sekvenser med en storleksordnings lägre beräkningskostnad. Det innebär att MiniMax kan erbjuda kontextfönster på 1 miljon+ till betydligt lägre marginalkostnad än konkurrenter som använder vanlig Attention.
  • Bruttomarginal: Uppgifterna säger uttryckligen att bruttomarginalen på den nya modellen, trots fördubblade parametrar och aktiveringar, förväntas överstiga M2. Det är bara möjligt om MSA 2.0 levererar verkliga besparingar per token.
💡 Nyckelinsikt: De flesta kinesiska AI-labb tävlar på pris genom att bränna kontanter. MiniMax verkar tävla på arkitektur — uppnår lägre kostnader genom ingenjörskonst, inte subventioner. Det är en betydligt mer hållbar vallgrav.

🚀 Kodningsprestanda och hastighet

Uppgifterna avslöjar intressanta detaljer om MiniMax kodningsstrategi:

  • M3 är den snabbaste modellen i huvudsortimentet — ungefär 100 token per sekund (TPS), vilket uppgifterna hävdar är snabbare än någon konkurrent. För kodningsarbetsflöden där utvecklare följer utdataströmmen i realtid översätts den hastighetsfördelen direkt till bättre UX.
  • MiniMax träningsfilosofi lutar åt högkvalitativ professionell koddata framför ren volym. Uppgifterna betonar att «datakvalitet och träningsmetodik väger tyngre än kvantitet» — en konträr ståndpunkt i en bransch besatt av datamängd.
  • M3.1 var en stor uppgradering av M3 (som led av förhastad post-träning). Genom att optimera datakvaliteten och lägga till data för långa horisontuppgifter uppnådde M3.1 storleksordningar bättre förmåga på komplexa kodningsproblem.

För China AI Arbitrages läsare: MiniMax kodmodell är för närvarande prissatt till ungefär $1.20 per miljon utdatatoken — redan i nivå med Qwen och billigare än GLM. Om nästa generations modell håller vad den lovar kan MiniMax bli det överlägset bästa värdet för kodning på den kinesiska AI-marknaden.

🏗️ Beräkningsinfrastruktur: Fördelen utomlands

Ett av de mest avslöjande avsnitten: MiniMax har säkrat efterlevnadsgodkänd tillgång till utländsk GPU-beräkning, vilket placerar dem före de flesta kinesiska AI-konkurrenter som kämpar med inhemska alternativ.

  • Egent byggt nätverk: MiniMax byggde sin egen nätverksinfrastruktur mellan GPU:er istället för att förlita sig på leverantörslösningar. Uppgifterna hävdar att det sparade både kostnad och tid, med stabilitet som «överträffar förväntningarna».
  • Inhemsk beräkningspipeline: Inhemska (kinesisktillverkade) GPU:er är användbara men kapacitetsbegränsade. MiniMax förväntar sig att deras första inhemska GPU-kluster tas i drift i slutet av Q3 2026, med inferensarbetsbelastningar först.
  • Tvåspårsstrategin: Utländska GPU:er för träning (där topprestanda krävs), inhemska GPU:er för inferens (där skala och kostnadseffektivitet krävs). Det är den pragmatiska linje som de flesta kinesiska labb strävar efter — MiniMax verkar ligga längre fram i genomförandet.

💰 Vad det betyder för AI-prissättningen

Låt oss knyta ihop konsekvenserna för prissättningen:

FaktorNuvarande (M3/M3.1)Nästa gen (3T-modell)Påverkan på priset
Parametrar~1.5T (uppsk.)2.5–3THögre tak för förmågan
ArkitekturMSA 1.0MSA 2.0Lägre beräkningskostnad per token
BruttomarginalBaslinjeFörväntas överstiga M2Utrymme att sänka priset eller höja marginalen
Inferenshastighet~100 TPSTBD (sannolikt snabbare)Bättre UX till oförändrad kostnad
Utdatapris~$1.20/M tokenTBDKonkurrenstryck på DeepSeek/Qwen

Huvudbudskapet: MiniMax bygger en modell som är både större OCH mer effektiv. På en marknad där DeepSeek V4 Flash redan erbjuder utdata till $0.28/M token kan MiniMax inte bara matcha på pris — de måste erbjuda något annat. Uppgifterna antyder att deras vinkel är: frontlinjeklass kvalitet + bäst-i-klass hastighet + hållbara marginaler genom arkitekturinnovation.

🌍 Arbitrage-vinkeln

För China AI Arbitrages läsare, så här spelar det in:

1. Konkurrens driver ner priserna över hela linjen.
Varje gång ett kinesiskt labb visar upp en mer effektiv arkitektur sätts press på alla andra — DeepSeek, Qwen, GLM, Kimi — att antingen matcha effektiviteten eller sänka priserna. Kapplöpningen mot botten gynnar västerländska utvecklare som kan nå dessa API:er för en bråkdel av amerikanska priser.
2. MiniMax utländska GPU-tillgång = stabil leverans.
Många kinesiska AI-labb brottas med beräkningsosäkerhet till följd av amerikanska exportkontroller. MiniMax «efterlevnadsgodkända utländska tillgång» innebär att deras API är mindre benäget att drabbas av plötsliga kapacitetsbegränsningar — en verklig risk för labb som förlitar sig enbart på inhemska GPU:er. Stabil leverans = pålitligt arbitrageunderlag.
3. 100 TPS-fördelen är en arbitragemöjlighetsgörare.
Om du bygger en produkt som säljer vidare kinesisk AI-kapacitet till västerländska användare spelar latens roll. MiniMax 100 TPS innebär att dina slutanvändare får en snappigare upplevelse — vilket låter dig ta ut en premie jämfört med långsammare alternativ. Hastighet är ett mervärde du kan ta betalt för.

⏳ Slutsats

MiniMax är inte det högljuddaste kinesiska AI-labbet — det är DeepSeek. Det är inte det bäst finansierade — det är Zhipu eller ByteDance. Men dessa insider-uppgifter tyder på att det kan vara det strategiskt bäst positionerade: en proprietär arkitektur som genuint sänker kostnaderna, utländsk beräkningstillgång som ger stabilitet, och en kodmodell som redan är konkurrenskraftig och som blir avsevärt större.

Tre saker att bevaka:

  1. September–oktober 2026: Lanseringen av den nya 3T-modellen. Om den håller löftet att «leda den inhemska marknaden» kan MiniMax API-prissättning skifta hela konkurrenslandskapet.
  2. MiniMax API-prisändringar: Om MiniMax sänker priserna i samband med den nya modellans lansering (sannolikt, med hänsyn till förbättrade marginaler), blir de ett reellt alternativ till DeepSeek för batcharbetsbelastningar.
  3. MSA 2.0 som öppen källkod: MiniMax har inte öppnakällkodskodat MSA ännu. Om de gör det skulle det dramatiskt kunna sänka träningskostnaderna i hela det kinesiska AI-ekosystemet — och påskynda kapplöpningen mot nollpris.

Det kinesiska AI-priskriget har fått en ny stridspart. Och den här har en genuint ny arkitektur att backa upp sina drag med.

Källa: MiniMax insider-uppgifter (juli 2026), verifierade mot offentliga MiniMax API-priser och benchmark-data.