MiniMax-intern notities — next-gen model, MSA-architectuur, programmeersnelheid, compute-infrastructuur

📋 De interne notities

Er is een set interne notities van MiniMax — een van de meest onderschatte AI-labs van China — uitgelekt. Het document behandelt vier terreinen: ontwikkeling van het next-gen model, concurrerende positionering op programmeerbenchmarks, strategie voor compute-infrastructuur en het brutomargeperspectief. Samen schetsen ze een bedrijf dat op het punt staat een serieuze stap te zetten in de race om frontier-modellen — en mogelijk de prijslandschap voor Chinese AI-API's hertekent.

MiniMax is buiten China geen bekende naam. Binnen de sector staat het echter om twee dingen: het Lightning Attention-mechanisme (inmiddels geëvolueerd tot MSA), dat inferentie met lange context dramatisch goedkoper maakt, en een verrassend sterk programmeermodel (M3) dat boven zijn gewichtsklasse uitstijgt. Deze notities suggereren dat beide voordelen op het punt staan veel groter te worden.

🧬 Next-gen: 2,5–3 biljoen parameters

Het sleutelgetal: het next-gen model van MiniMax richt op 2,5–3 biljoen (trillion) parameters. Ter context: GPT-4 wordt geschat op ~1,8T en DeepSeek V4 op de 1–2T. Als MiniMax de 3T haalt, behoort het tot de grootste dense/MoE-modellen die ooit zijn getraind.

De pre-training van het nieuwe model loopt inmiddels zo'n halve maand en volgens de notities verloopt de convergentie beter dan verwacht. Het model gebruikt de MSA 2.0-architectuur (hieronder meer) en heeft zowel qua parameteraantal als activatieaantal ruwweg verdubbeld ten opzichte van de huidige M2-generatie.

Tijdlijn: het nieuwe model wordt verwacht na de zomer van 2026 (waarschijnlijk september–oktober). Het interne team is naar verluidt erg zelfverzekerd over zowel prestaties als volwassenheid, en stelt dat het model de binnenlandse (Chinese) markt zal aanvoeren.

⚡ MSA 2.0: het geheime wapen voor kostenefficiëntie

MSA staat voor Multi-Scale Attention — MiniMax' propriëtaire architectuur, voortgekomen uit hun eerdere Lightning Attention-werk. Het belangrijkste voordeel: het vermindert de rekent overhead van Attention aanzienlijk zonder de modelkwaliteit in gevaar te brengen.

Waarom dit cruciaal is voor de prijsstelling:

  • Trainingsefficiëntie: MSA 2.0 stelt MiniMax in staat een 3T-parametermodel te trainen voor een fractie van wat een standaard-Transformer zou kosten. Lagere trainingskosten = minder kapitaal terug te verdienen = meer ruimte voor agressieve API-prijsstelling.
  • Inferentie-efficiëntie: MSA ondersteunt ultralange sequenties met een reductie van de compute-overhead met een orde van grootte. Daardoor kan MiniMax contextvensters van 1M+ tegen veel lagere marginale kosten aanbieden dan concurrenten die vanilla Attention gebruiken.
  • Brutomarge: De notities stellen expliciet dat ondanks de verdubbeling van parameters en activaties de brutomarge op het nieuwe model naar verwachting hoger zal liggen dan bij M2. Dat is alleen mogelijk als MSA 2.0 werkelijke per-token kostenbesparingen oplevert.
💡 Kerninzicht: De meeste Chinese AI-labs concurreren op prijs door geld te verbranden. MiniMax lijkt te concurreren op architectuur — lagere kosten bereikt via engineering, niet via subsidies. Dat is een veel duurzamere gracht.

🚀 Programmeerprestaties en inferentiesnelheid

De notities onthullen interessante details over de programmeerstrategie van MiniMax:

  • M3 is het snelste model in de hoofdlijn — ruwweg 100 tokens per seconde (TPS), wat volgens de notities sneller is dan elke concurrent. Voor programmeerworkflows waarbij ontwikkelaars de uitvoer in realtime zien binnenstromen, vertaalt dit snelheidsvoordeel zich direct in betere UX.
  • De trainingsfilosofie van MiniMax leunt op hoogwaardige professionele codeerdata in plaats van pure volume. De notities benadrukken dat "datakwaliteit en trainingsmethodologie meer uitmaken dan kwantiteit" — een contrariante positie in een branche die geobsedeerd is door de schaal van datasets.
  • M3.1 was een flinke upgrade ten opzichte van M3 (dat leed onder een gehaaste post-training). Door de datakwaliteit te optimaliseren en gegevens voor langetermijntaken toe te voegen, realiseerde M3.1 capaciteitsverbeteringen van een orde van grootte op complexe programmeerproblemen.

Voor het publiek van China AI Arbitrage: het programmeermodel van MiniMax staat momenteel op ~$1,20/M output-tokens — al concurrerend met Qwen en goedkoper dan GLM. Als het next-gen model zijn beloften waarmaakt, kan MiniMax de beste prijs-kwaliteitverhouding voor programmeren van de Chinese AI-markt worden.

🏗️ Compute-infrastructuur: het buitenlandse voordeel

Een van de meest onthullende secties: MiniMax heeft compliante toegang tot buitenlandse GPU-compute verworven, waarmee het de meeste Chinese AI-concurrenten vooruit is die nog zoeken naar binnenlandse alternatieven.

  • Eigen netwerk: MiniMax bouwde zijn eigen inter-GPU-netwerkinfrastructuur in plaats van te leunen op leveranciersoplossingen. Naar verluidt bespaarde dat zowel kosten als tijd, met een stabiliteit die "de verwachtingen overtreft".
  • Binnenlandse compute-pijplijn: Binnenlandse (Chinese) GPU's zijn bruikbaar maar beperkt in capaciteit. MiniMax verwacht in Q3 2026 zijn eerste binnenlandse GPU-cluster in productie te nemen, beginnend met inferentie-workloads.
  • Tweesporenstrategie: Buitenlandse GPU's voor training (waar je topprestaties nodig hebt), binnenlandse GPU's voor inferentie (waar schaal en kostenefficiëntie tellen). Dit is de pragmatische aanpak die de meeste Chinese labs nastreven — MiniMax lijkt in uitvoering een stap verder.

💰 Wat dit betekent voor AI-prijsstelling

Laten we de lijnen verbinden voor de prijsimpact:

FactorHuidig (M3/M3.1)Next-gen (3T-model)Impact op prijsstelling
Parameters~1,5T (geschat)2,5–3THoger plafond aan capaciteit
ArchitectuurMSA 1.0MSA 2.0Lagere rekenkosten per token
BrutomargeBaselineNaar verwachting hoger dan M2Ruimte voor prijsprikkel of margeverbetering
Inferentiesnelheid~100 TPSTBD (waarschijnlijk sneller)Betere UX tegen dezelfde kosten
Uitvoerprijs~$1,20/M tokensTBDConcurrentiedruk op DeepSeek/Qwen

De belangrijkste conclusie: MiniMax bouwt een model dat zowel groter áls efficiënter is. In een markt waar DeepSeek V4 Flash output al levert tegen $0,28/M tokens, kan MiniMax niet alleen op prijs meegaan — ze moeten onderscheidend zijn. De notities suggereren dat hun invalshoek is: frontier-kwaliteit + de beste snelheid in zijn klasse + duurzame marges via architectuurinnovatie.

🌍 Het arbitrage-perspectief

Voor de lezers van China AI Arbitrage is dit waarom het ertoe doet:

1. Concurrentie drijft alle prijzen omlaag.
Telkens wanneer een Chinees lab een efficiëntere architectuur demonstreert, legt dat druk op alle anderen — DeepSeek, Qwen, GLM, Kimi — om ofwel de efficiëntie te evenaren ofwel de prijzen te verlagen. Deze race naar de bodem komt westerse ontwikkelaars ten goede die via deze API's toegang krijgen voor een fractie van de Amerikaanse prijzen.
2. MiniMax' buitenlandse GPU-toegang = stabiele aanvoer.
Veel Chinese AI-labs kampen met compute-onzekerheid door Amerikaanse exportcontroles. De "compliante buitenlandse toegang" van MiniMax betekent dat hun API minder snel plotseling capaciteitsbeperkingen oploopt — een reëel risico voor labs die uitsluitend op binnenlandse GPU's leunen. Stabiele aanvoer = betrouwbaar arbitrage-substraat.
3. Het snelheidsvoordeel van 100 TPS is een arbitrage-versneller.
Als je een product bouwt dat Chinese AI-capaciteit doorverkoopt aan westerse gebruikers, doet latentie ertoe. De 100 TPS van MiniMax betekent dat je eindgebruikers een vlottere ervaring krijgen — waardoor je een premie kunt vragen ten opzichte van tragere alternatieven. Snelheid is meerwaarde die je kunt verzilveren.

⏳ Conclusie

MiniMax is niet het luidruchtigste Chinese AI-lab — dat is DeepSeek. Het is niet het best gefinancierde — dat is Zhipu of ByteDance. Maar deze interne notities suggereren dat het misschien wel het strategisch best gepositioneerd is: een propriëtaire architectuur die de kosten werkelijk verlaagt, toegang tot buitenlandse compute die stabiliteit biedt, en een programmeermodel dat al concurrerend is en veel groter wordt.

Drie dingen om in de gaten te houden:

  1. September–oktober 2026: De lancering van het nieuwe 3T-model. Als het de belofte "de binnenlandse markt aanvoeren" waarmaakt, kan de API-prijsstelling van MiniMax het volledige concurrentieveld verschuiven.
  2. Prijsveranderingen van de MiniMax-API: Als MiniMax na de lancering van het nieuwe model de prijzen verlaagt (waarschijnlijk, gelet op de verbeterde marges), wordt het een serieus alternatief voor DeepSeek voor batch-workloads.
  3. Open-sourcing van MSA 2.0: MiniMax heeft MSA nog niet open-source gemaakt. Doen ze dat wel, dan dalen de trainingskosten in het hele Chinese AI-ecosysteem fors — en dat versnelt de prijzenrace naar nul.

De Chinese AI-prijsenoorlog heeft een nieuwe strijder erbij. En deze heeft een werkelijk vernieuwende architectuur om zijn zetten kracht bij te zetten.

Bron: interne notities van MiniMax (juli 2026), geverifieerd tegen openbare MiniMax-API-prijzen en benchmarkdata.