
📋 Insider-uppgifterna
En samling insider-uppgifter från MiniMax — ett av Kinas mest undervärderade AI-labb — har just kommit i dagen. Dokumentet täcker fyra områden: utveckling av nästa generations modell, konkurrenspositionering på kodnings-benchmark, strategi för beräkningsinfrastruktur och utblick för bruttomarginalen. Tillsammans ritar de upp bilden av ett företag som är på väg att göra ett allvarligt drag i kapplöpningen om frontlinjemodeller — och som potentiellt kan omforma prissättningslandskapet för kinesiska AI-API:er.
MiniMax är inget känt namn utanför Kina. Men inom branschen är de kända för två saker: Lightning Attention-mekanismen (nu vidareutvecklad till MSA) som gör långkontext-inferens dramatiskt billigare, och en överraskande stark kodmodell (M3) som slår över sin viktklass. Uppgifterna tyder på att båda fördelarna snart blir avsevärt större.
🧬 Nästa generation: 2,5–3 biljoner parametrar
Den stora siffran: MiniMax nästa generations modell siktar på 2,5–3 biljoner parametrar. Som jämförelse uppskattas GPT-4 till ungefär 1,8T, och DeepSeek V4 tros ligga i spannet 1–2T. Om MiniMax når 3T blir det en av de största dense/MoE-modellerna som någonsin tränats.
Förträning på den nya modellen har pågått i ungefär en halv månad, och enligt uppgifterna överstiger konvergensen förväntningarna. Modellen använder MSA 2.0-arkitekturen (mer om den nedan) och har ungefär fördubblat både parameterantal och aktiveringsantal jämfört med den nuvarande M2-generationen.
Tidslinje: den nya modellen förväntas lanseras efter sommaren 2026 (sannolikt september–oktober). Det interna teamet lär vara mycket självsäkert både gällande prestanda och färdigställandegrad, och hävdar att den kommer att leda den inhemska (kinesiska) marknaden.
⚡ MSA 2.0: Hemlighetsvapnet för kostnadseffektivitet
MSA står för Multi-Scale Attention — MiniMax proprietära arkitektur som vuxit fram ur deras tidigare Lightning Attention-arbete. Den stora fördelen: den drastiskt sänker beräkningskostnaden för Attention samtidigt som modellkvaliteten bevaras.
Varför det här spelar roll för prissättningen:
- Träningseffektivitet: MSA 2.0 låter MiniMax träna en 3T-parametermodell till en bråkdel av vad en standard-Transformer skulle kosta. Lägre träningskostnad = mindre kapital att tjäna in = mer utrymme för aggressiv API-prissättning.
- Inferenseffektivitet: MSA stöder ultralånga sekvenser med en storleksordnings lägre beräkningskostnad. Det innebär att MiniMax kan erbjuda kontextfönster på 1 miljon+ till betydligt lägre marginalkostnad än konkurrenter som använder vanlig Attention.
- Bruttomarginal: Uppgifterna säger uttryckligen att bruttomarginalen på den nya modellen, trots fördubblade parametrar och aktiveringar, förväntas överstiga M2. Det är bara möjligt om MSA 2.0 levererar verkliga besparingar per token.
🚀 Kodningsprestanda och hastighet
Uppgifterna avslöjar intressanta detaljer om MiniMax kodningsstrategi:
- M3 är den snabbaste modellen i huvudsortimentet — ungefär 100 token per sekund (TPS), vilket uppgifterna hävdar är snabbare än någon konkurrent. För kodningsarbetsflöden där utvecklare följer utdataströmmen i realtid översätts den hastighetsfördelen direkt till bättre UX.
- MiniMax träningsfilosofi lutar åt högkvalitativ professionell koddata framför ren volym. Uppgifterna betonar att «datakvalitet och träningsmetodik väger tyngre än kvantitet» — en konträr ståndpunkt i en bransch besatt av datamängd.
- M3.1 var en stor uppgradering av M3 (som led av förhastad post-träning). Genom att optimera datakvaliteten och lägga till data för långa horisontuppgifter uppnådde M3.1 storleksordningar bättre förmåga på komplexa kodningsproblem.
För China AI Arbitrages läsare: MiniMax kodmodell är för närvarande prissatt till ungefär $1.20 per miljon utdatatoken — redan i nivå med Qwen och billigare än GLM. Om nästa generations modell håller vad den lovar kan MiniMax bli det överlägset bästa värdet för kodning på den kinesiska AI-marknaden.
🏗️ Beräkningsinfrastruktur: Fördelen utomlands
Ett av de mest avslöjande avsnitten: MiniMax har säkrat efterlevnadsgodkänd tillgång till utländsk GPU-beräkning, vilket placerar dem före de flesta kinesiska AI-konkurrenter som kämpar med inhemska alternativ.
- Egent byggt nätverk: MiniMax byggde sin egen nätverksinfrastruktur mellan GPU:er istället för att förlita sig på leverantörslösningar. Uppgifterna hävdar att det sparade både kostnad och tid, med stabilitet som «överträffar förväntningarna».
- Inhemsk beräkningspipeline: Inhemska (kinesisktillverkade) GPU:er är användbara men kapacitetsbegränsade. MiniMax förväntar sig att deras första inhemska GPU-kluster tas i drift i slutet av Q3 2026, med inferensarbetsbelastningar först.
- Tvåspårsstrategin: Utländska GPU:er för träning (där topprestanda krävs), inhemska GPU:er för inferens (där skala och kostnadseffektivitet krävs). Det är den pragmatiska linje som de flesta kinesiska labb strävar efter — MiniMax verkar ligga längre fram i genomförandet.
💰 Vad det betyder för AI-prissättningen
Låt oss knyta ihop konsekvenserna för prissättningen:
| Faktor | Nuvarande (M3/M3.1) | Nästa gen (3T-modell) | Påverkan på priset |
|---|---|---|---|
| Parametrar | ~1.5T (uppsk.) | 2.5–3T | Högre tak för förmågan |
| Arkitektur | MSA 1.0 | MSA 2.0 | Lägre beräkningskostnad per token |
| Bruttomarginal | Baslinje | Förväntas överstiga M2 | Utrymme att sänka priset eller höja marginalen |
| Inferenshastighet | ~100 TPS | TBD (sannolikt snabbare) | Bättre UX till oförändrad kostnad |
| Utdatapris | ~$1.20/M token | TBD | Konkurrenstryck på DeepSeek/Qwen |
Huvudbudskapet: MiniMax bygger en modell som är både större OCH mer effektiv. På en marknad där DeepSeek V4 Flash redan erbjuder utdata till $0.28/M token kan MiniMax inte bara matcha på pris — de måste erbjuda något annat. Uppgifterna antyder att deras vinkel är: frontlinjeklass kvalitet + bäst-i-klass hastighet + hållbara marginaler genom arkitekturinnovation.
🌍 Arbitrage-vinkeln
För China AI Arbitrages läsare, så här spelar det in:
Varje gång ett kinesiskt labb visar upp en mer effektiv arkitektur sätts press på alla andra — DeepSeek, Qwen, GLM, Kimi — att antingen matcha effektiviteten eller sänka priserna. Kapplöpningen mot botten gynnar västerländska utvecklare som kan nå dessa API:er för en bråkdel av amerikanska priser.
Många kinesiska AI-labb brottas med beräkningsosäkerhet till följd av amerikanska exportkontroller. MiniMax «efterlevnadsgodkända utländska tillgång» innebär att deras API är mindre benäget att drabbas av plötsliga kapacitetsbegränsningar — en verklig risk för labb som förlitar sig enbart på inhemska GPU:er. Stabil leverans = pålitligt arbitrageunderlag.
Om du bygger en produkt som säljer vidare kinesisk AI-kapacitet till västerländska användare spelar latens roll. MiniMax 100 TPS innebär att dina slutanvändare får en snappigare upplevelse — vilket låter dig ta ut en premie jämfört med långsammare alternativ. Hastighet är ett mervärde du kan ta betalt för.
⏳ Slutsats
MiniMax är inte det högljuddaste kinesiska AI-labbet — det är DeepSeek. Det är inte det bäst finansierade — det är Zhipu eller ByteDance. Men dessa insider-uppgifter tyder på att det kan vara det strategiskt bäst positionerade: en proprietär arkitektur som genuint sänker kostnaderna, utländsk beräkningstillgång som ger stabilitet, och en kodmodell som redan är konkurrenskraftig och som blir avsevärt större.
Tre saker att bevaka:
- September–oktober 2026: Lanseringen av den nya 3T-modellen. Om den håller löftet att «leda den inhemska marknaden» kan MiniMax API-prissättning skifta hela konkurrenslandskapet.
- MiniMax API-prisändringar: Om MiniMax sänker priserna i samband med den nya modellans lansering (sannolikt, med hänsyn till förbättrade marginaler), blir de ett reellt alternativ till DeepSeek för batcharbetsbelastningar.
- MSA 2.0 som öppen källkod: MiniMax har inte öppnakällkodskodat MSA ännu. Om de gör det skulle det dramatiskt kunna sänka träningskostnaderna i hela det kinesiska AI-ekosystemet — och påskynda kapplöpningen mot nollpris.
Det kinesiska AI-priskriget har fått en ny stridspart. Och den här har en genuint ny arkitektur att backa upp sina drag med.
Källa: MiniMax insider-uppgifter (juli 2026), verifierade mot offentliga MiniMax API-priser och benchmark-data.