MiniMax leak interno — modelli di nuova generazione, architettura MSA, velocità di coding, infrastruttura di calcolo

📋 Leak interno

Una serie di informazioni interne da MiniMax — uno dei laboratori di AI cinesi più sottovalutati — è appena trapelata. Il documento copre quattro fronti: sviluppo dei modelli di nuova generazione, posizionamento sui benchmark di coding, strategia sull'infrastruttura di calcolo e proiezioni sui margini. L'insieme delinea un'azienda prossima a una spinta seria sui modelli di frontiera — e con il potenziale per ridefinire le dinamiche di prezzo delle API cinesi.

Fuori dalla Cina, MiniMax è poco conosciuta. Ma all'interno del settore si distingue per due cose: il meccanismo di Lightning Attention (ora evoluto in MSA), che abbatte drasticamente il costo dell'inferenza a contesto lungo; e un modello di coding (M3) sorprendentemente solido per la sua fascia. Le informazioni trapelate suggeriscono che entrambi i vantaggi stiano per amplificarsi.

🧬 Nuova generazione: 2,5–3 trilioni di parametri

Il numero chiave: il prossimo modello di MiniMax punta a 2,5–3 trilioni di parametri. Per confronto, GPT-4 si stima intorno a 1,8T e DeepSeek V4 nella fascia 1–2T. Se MiniMax raggiunge i 3T, entrerà nella ristretta cerchia dei modelli dense/MoE più grandi mai costruiti.

Il pre-training del nuovo modello è iniziato circa due settimane fa e, secondo le informazioni interne, la convergenza supera le attese. Il modello adotta l'architettura MSA 2.0 (dettagliata più sotto), con numero di parametri e parametri attivi circa raddoppiati rispetto all'attuale generazione M2.

Timeline: il nuovo modello è atteso dopo l'estate 2026 (circa settembre–ottobre). Il team interno si dice molto sicuro sulle prestazioni e sullo stato di avanzamento, con l'obiettivo dichiarato di guidare il mercato cinese.

⚡ MSA 2.0: l'arma segreta dell'efficienza dei costi

MSA sta per Multi-Scale Attention — l'architettura proprietaria di MiniMax, evoluta a partire dalla originale Lightning Attention. Il vantaggio fondamentale: ridurre drasticamente il costo computazionale dell'attention mantenendo invariata la qualità del modello.

Perché questo conta per il prezzo:

  • Efficienza di training: MSA 2.0 consente a MiniMax di addestrare un modello da 3T a una frazione del costo di un Transformer standard. Costi di training più bassi = meno capitale da recuperare = più margine per un pricing aggressivo delle API.
  • Efficienza di inferenza: MSA supporta sequenze lunghissime con un overhead computazionale ridotto di un ordine di grandezza. Questo significa che MiniMax può offrire finestre di contesto oltre 1 milione di token a un costo marginale molto inferiore a quello dei concorrenti.
  • Margine lordo: le informazioni interne indicano esplicitamente che, nonostante il raddoppio di parametri e attivazione, il margine del nuovo modello è atteso superiore a quello di M2. Possibile solo se MSA 2.0 porta a una reale riduzione del costo per token.
💡 Insight chiave: la maggior parte dei laboratori cinesi combatte le guerre di prezzo bruciando capitali. MiniMax sembra competere tramite innovazione architetturale — costi più bassi ottenuti con l'ingegneria, non con i sussidi. È un fossato difensivo molto più sostenibile.

🚀 Capacità di coding e velocità di inferenza

Le informazioni interne rivelano dettagli interessanti sulla strategia coding di MiniMax:

  • M3 è il più veloce tra i modelli principali — circa 100 TPS (token al secondo), dichiarato superiore a tutti i concorrenti. Per i flussi di lavoro di coding in cui lo sviluppatore osserva lo stream in tempo reale, questo vantaggio di velocità si traduce direttamente in un'esperienza migliore.
  • La filosofia di training di MiniMax privilegia dati di codice specializzato di alta qualità rispetto al puro volume. Le note interne sottolineano che "qualità dei dati e pipeline di training contano più della quantità" — una posizione controcorrente in un'industria ossessionata dalla dimensione dei dataset.
  • M3.1 è un upgrade consistente di M3 (M3 presentava alcune limitazioni a causa dei tempi stretti di post-training). Ottimizzando la qualità dei dati e inserendo compiti a lungo orizzonte, M3.1 ottiene un miglioramento di un ordine di grandezza sui problemi di coding più complessi.

Per i lettori di China AI Arbitrage: il modello di coding di MiniMax è attualmente prezzato intorno a 1,20 $/milione di token in output — già in linea con Qwen e più economico di GLM. Se il modello di nuova generazione mantiene le promesse, MiniMax potrebbe diventare la migliore scelta qualità/prezzo per il coding sul mercato cinese.

🏗️ Infrastruttura di calcolo: il vantaggio sulle risorse oltreoceano

Uno degli aspetti più degni di nota: MiniMax ha ottenuto in modo conforme risorse GPU oltreoceano, in vantaggio rispetto a gran parte dei concorrenti cinesi che si stanno affannando con le alternative domestiche.

  • Rete di interconnessione proprietaria: MiniMax ha costruito in casa la propria infrastruttura di interconnessione tra GPU, invece di affidarsi a soluzioni dei vendor. Si stima un risparmio in costi e tempi, con una stabilità "oltre le attese".
  • Pipeline di calcolo domestico: le GPU cinesi sono disponibili ma con capacità limitata. MiniMax prevede di portare online il primo cluster di GPU domestiche entro la fine del Q3 2026, a partire dall'inferenza.
  • Strategia a doppio binario: GPU oltreoceano per il training (dove serve la massima prestazione), GPU domestiche per l'inferenza (dove servono scala ed efficienza di costo). È la traiettoria pragmatica a cui mirano molti laboratori cinesi — MiniMax è semplicemente più avanti nell'esecuzione.

💰 Impatto sul pricing delle AI

Mettendo insieme tutti i fili per valutare l'impatto sul prezzo:

DimensioneOggi (M3/M3.1)Nuova generazione (modello 3T)Impatto sul prezzo
Parametri~1,5T (stimato)2,5–3TSoffitto di capacità più alto
ArchitetturaMSA 1.0MSA 2.0Costo computazionale per token più basso
Margine lordoBaselineAtteso superiore a M2Spazio per ridurre i prezzi o aumentare i margini
Velocità di inferenza~100 TPSDa definire (potrebbe crescere)Esperienza migliore a parità di costo
Prezzo in output~1,20 $/milione di tokenDa definirePressione competitiva su DeepSeek/Qwen

Conclusione chiave: MiniMax sta costruendo un modello sia più grande sia più efficiente. In un mercato dove DeepSeek V4 Flash offre già output a 0,28 $/milione di token, MiniMax non può competere solo sul prezzo — serve differenziazione. Le informazioni interne suggeriscono l'angolo d'attacco: qualità da frontiera + velocità migliore della categoria + margini sostenibili grazie all'innovazione architetturale.

🌍 La prospettiva dell'arbitraggio

Per i lettori di China AI Arbitrage, perché tutto questo conta:

1. La competizione spinge i prezzi verso il basso per l'intero settore.
Ogni volta che un laboratorio cinese dimostra un'architettura più efficiente, fa pressione su tutti gli altri — DeepSeek, Qwen, GLM, Kimi — perché pareggino l'efficienza o taglino i prezzi. Questa corsa agli armamenti avvantaggia gli sviluppatori occidentali che hanno accesso a queste API, a una frazione del pricing statunitense.
2. Le GPU oltreoceano di MiniMax = fornitura stabile.
Molti laboratori cinesi affrontano incertezza sul calcolo a causa delle restrizioni statunitensi all'esportazione. Le "risorse oltreoceano conformi" di MiniMax significano che le sue API hanno meno probabilità di subire limitazioni di capacità improvvise — un rischio reale per chi si affida esclusivamente a GPU domestiche. Fornitura stabile = base affidabile per l'arbitraggio.
3. Il vantaggio di velocità a 100 TPS è un moltiplicatore per l'arbitraggio.
Se stai costruendo un prodotto che rivende calcolo AI cinese agli utenti occidentali, la latenza conta. I 100 TPS di MiniMax si traducono in un'esperienza più fluida per i tuoi utenti finali — e ti permettono di chiedere un premium rispetto ad alternative più lente. La velocità è un valore aggiunto che si può monetizzare.

⏳ In sintesi

MiniMax non è il laboratorio cinese più vistoso — quello è DeepSeek. Né il più finanziato — quelli sono Zhipu o ByteDance. Ma le informazioni interne suggeriscono che potrebbe essere il miglior posizionato a livello strategico: un'architettura proprietaria che riduce davvero i costi, risorse di calcolo oltreoceano che offrono stabilità e un modello di coding già competitivo e prossimo a un upgrade sostanziale.

Tre cose da tenere d'occhio:

  1. Settembre–ottobre 2026: lancio del nuovo modello da 3T. Se mantiene la promessa di "guidare il mercato cinese", il pricing delle API di MiniMax potrebbe riaprire l'intero scenario competitivo.
  2. Movimenti di prezzo delle API MiniMax: se MiniMax taglia i prezzi dopo il lancio (probabile, visto il miglioramento dei margini), diventerà una valida alternativa a DeepSeek per i carichi batch.
  3. Open-source di MSA 2.0: MiniMax non ha ancora rilasciato MSA. Se lo aprisse, abbasserebbe drasticamente i costi di training per l'intero ecosistema AI cinese — accelerando la corsa verso prezzi a zero.

La guerra dei prezzi dell'AI cinese ha un nuovo contendente. E questo è sostenuto da un'architettura davvero innovativa.

Fonte: informazioni interne MiniMax (luglio 2026), verificate incrociando i prezzi pubblici delle API MiniMax e i dati dei benchmark.