MiniMax insider-noter — næste generations model, MSA-arkitektur, kodningshastighed, regnekraft-infrastruktur

📋 Insider-noterne

Et sæt insider-noter fra MiniMax — et af Kinas mest undervurderede AI-laboratorier — er netop lækket. Dokumentet dækker fire områder: udvikling af næste generations model, konkurrenceplacering på kodnings-benchmarks, strategi for regnekraft-infrastruktur og udsigter for bruttomarginen. Samlet tegner de billedet af en virksomhed, der er ved at foretage et alvorligt ryk i frontlinje-modelløbet — og potentielt omforme prismarkedet for kinesiske AI-API'er.

MiniMax er ikke et navn, de fleste kender uden for Kina. Men i branchen er de kendt for to ting: Lightning Attention-mekanismen (nu videreudviklet til MSA), der gør inferens med lang kontekst markant billigere, og en overraskende stærk kodningsmodel (M3), der slår over sin vægtklasse. Noterne tyder på, at begge fordele er ved at blive meget større.

🧬 Næste generation: 2,5–3 billioner parametre

Hovedtallet: MiniMax' næste generations model sigter mod 2,5–3 billioner parametre. Til sammenligning anslås GPT-4 til ~1,8T, og DeepSeek V4 menes at ligge i 1–2T-området. Hvis MiniMax rammer 3T, vil det være blandt de største dense/MoE-modeller, der nogensinde er trænet.

For-træningen af den nye model har allerede kørt i cirka en halv måned, og ifølge noterne overgår konvergensen forventningerne. Modellen bruger MSA 2.0-arkitektur (mere om det nedenfor) og har cirka fordoblet både antallet af parametre og aktiveringer i forhold til den nuværende M2-generation.

Tidslinje: den nye model forventes at blive udgivet efter sommeren 2026 (sandsynligvis september–oktober). Det interne team er angiveligt meget selvsikkert om både ydeevne og modenhed og hævder, at den vil lede det indenlandske (kinesiske) marked.

⚡ MSA 2.0: Hemmeligheden bag omkostningseffektiviteten

MSA står for Multi-Scale Attention — MiniMax' proprietære arkitektur, der er udviklet fra deres tidligere Lightning Attention-arbejde. Den vigtigste fordel: den reducerer Attention-beregningsoverhead drastisk, mens modellens kvalitet opretholdes.

Hvorfor det betyder noget for prissætning:

  • Træningseffektivitet: MSA 2.0 lader MiniMax træne en 3T-parameter-model til en brøkdel af, hvad en standard Transformer ville koste. Lavere træningsomkostning = mindre kapital at tjene ind = mere plads til aggressive API-priser.
  • Inferenseffektivitet: MSA understøtter ultralange sekvenser med en størrelsesordenss reduceret beregningsoverhead. Det betyder, at MiniMax kan tilbyde 1M+ kontekstvinduer til meget lavere marginalomkostning end konkurrenter, der bruger vanilla Attention.
  • Bruttomargin: Noterne siger udtrykkeligt, at bruttomarginen på den nye model på trods af fordoblede parametre og aktiveringer forventes at overgå M2. Det er kun muligt, hvis MSA 2.0 leverer reelle besparelser pr. token.
💡 Nøjeindsigt: De fleste kinesiske AI-laboratorier konkurrerer på pris ved at brænde penge af. MiniMax lader til at konkurrere på arkitektur — de opnår lavere omkostninger gennem ingeniørarbejde, ikke subsidier. Det er en langt mere bæredygtig voldgrav.

🚀 Kodningsydelse og hastighed

Noterne afslører interessante detaljer om MiniMax' kodestrategi:

  • M3 er den hurtigste model i hovedporteføljen — cirka 100 tokens per sekund (TPS), hvilket noterne hævder er hurtigere end enhver konkurrent. Til kodeworkflows hvor udviklere ser output-strømmen i realtid, oversætter den fartfordel sig direkte til bedre UX.
  • MiniMax' træningsfilosofi lægger vægt på højkvalitets professionel kodningsdata frem for bare volumen. Noterne understreger, at "datakvalitet og træningsmetodologi betyder mere end kvantitet" — en kontrarian holdning i en branche, der er besat af datasæt-størrelse.
  • M3.1 var en stor opgradering i forhold til M3 (som led under forsinket post-træning). Ved at optimere datakvalitet og tilføje data om lang horisont-opgaver opnåede M3.1 forbedringer på størrelsesordenen på komplekse kodeproblemer.

For læserne af China AI Arbitrage: MiniMax' kodemodel koster i øjeblikket ~$1.20/M output-tokens — allerede konkurrencedygtig med Qwen og billigere end GLM. Hvis næste generations model indløser løfterne, kan MiniMax blive det bedste kode-tilbud på det kinesiske AI-marked.

🏗️ Regnekraft-infrastruktur: Fordelen ved overseas adgang

En af de mest afslørende sektioner: MiniMax har sikret sig kompatibel adgang til overseas GPU-regnekraft, hvilket sætter dem foran de fleste kinesiske AI-konkurrenter, der kæmper med at finde indenlandske alternativer.

  • Selvbygget netværk: MiniMax har bygget deres egen inter-GPU-netværksinfrastruktur i stedet for at stole på leverandørløsninger. Noterne hævder, at det sparede både omkostninger og tid, med stabilitet "der overgik forventningerne".
  • Indenlandsk regnekraft-pipeline: Indenlandske (kinesiske) GPU'er er brugbare, men kapacitetsbegrænsede. MiniMax forventer, at deres første indenlandske GPU-cluster kommer online i Q3 2026, startende med inferens-arbejdsbelastninger.
  • Tospors-strategien: Overseas GPU'er til træning (hvor der er brug for toppræstation), indenlandske GPU'er til inferens (hvor der er brug for skala og omkostningseffektivitet). Det er den pragmatiske tilgang, de fleste kinesiske laboratorier stræber efter — MiniMax lader til at være længere fremme i udførelsen.

💰 Hvad det betyder for AI-prissætning

Lad os forbinde prikkerne om prisimplikationerne:

FaktorNu (M3/M3.1)Næste gen (3T-model)Indvirkning på prisen
Parametre~1,5T (est.)2,5–3THøjere evnetag
ArkitekturMSA 1.0MSA 2.0Lavere beregningsomkostning pr. token
BruttomarginBaselineForventes højere end M2Plads til at sænke priser eller forbedre marginer
Inferenshastighed~100 TPSTBD (sandsynligvis hurtigere)Bedre UX til samme omkostning
Output-pris~$1.20/M tokensTBDKonkurrencepres på DeepSeek/Qwen

Nøje-konklusionen: MiniMax bygger en model, der både er større OG mere effektiv. På et marked, hvor DeepSeek V4 Flash allerede tilbyder output til $0.28/M tokens, kan MiniMax ikke bare matche på pris — de skal tilbyde noget andet. Noterne antyder, at deres vinkel er: frontier-kvalitet + bedst-i-klassen hastighed + bæredygtige marginer gennem arkitektonisk innovation.

🌍 Arbitrage-vinklen

For læserne af China AI Arbitrage er her hvorfor det er vigtigt:

1. Konkurrence presser priserne ned overalt.
Hver gang et kinesisk laboratorium demonstrerer en mere effektiv arkitektur, sætter det pres på alle andre — DeepSeek, Qwen, GLM, Kimi — for enten at matche effektiviteten eller sænke priserne. Dette kapløb mod bunden gavner vestlige udviklere, der kan få adgang til disse API'er til en brøkdel af amerikanske priser.
2. MiniMax' overseas GPU-adgang = stabil forsyning.
Mange kinesiske AI-laboratorier står over for usikkerhed om regnekraft på grund af amerikanske eksportkontroller. MiniMax' "kompatible overseas adgang" betyder, at deres API er mindre udsat for pludselige kapacitetsbegrænsninger — en reel risiko for laboratorier, der udelukkende er afhængige af indenlandske GPU'er. Stabil forsyning = pålideligt arbitrage-substrat.
3. 100 TPS-fartfordelen er en arbitrage-muliggører.
Hvis du bygger et produkt, der videresælger kinesisk AI-kapacitet til vestlige brugere, betyder ventetid noget. MiniMax' 100 TPS betyder, at dine slutbrugere får en hurtigere oplevelse — hvilket lader dig tage et tillæg i forhold til langsommere alternativer. Hastighed er en merværdi, du kan tjene penge på.

⏳ Konklusion

MiniMax er ikke det mest højtråbende kinesiske AI-laboratorium — det er DeepSeek. Det er heller ikke det med mest finansiering — det er Zhipu eller ByteDance. Men disse insider-noter antyder, at det kan være det bedst strategisk positionerede: en proprietær arkitektur, der reelt sænker omkostningerne, overseas regnekraft-adgang, der giver stabilitet, og en kodemodel, der allerede er konkurrencedygtig og bliver meget større.

Tre ting at holde øje med:

  1. September–oktober 2026: Lanceringen af den nye 3T-model. Hvis den indløser løftet om at "lede det indenlandske marked", kan MiniMax' API-priser skifte hele det konkurrencemæssige landskab.
  2. MiniMax API-prisændringer: Hvis MiniMax sænker priserne efter lanceringen af den nye model (sandsynligt, givet de forbedrede marginer), bliver det et seriøst alternativ til DeepSeek til batch-arbejdsbelastninger.
  3. Open-sourcing af MSA 2.0: MiniMax har ikke open-source MSA endnu. Hvis de gør det, kan det dramatisk sænke træningsomkostningerne i hele det kinesiske AI-økosystem — og accelerere kapløbet mod nul-pris.

Den kinesiske AI-priskrig har fået en ny deltager. Og denne har en reelt nyskabende arkitektur at bakke sine træk op med.

Kilde: MiniMax insider-noter (juli 2026), verificeret mod offentlige MiniMax API-priser og benchmark-data.