
📋 Leak interno
Una serie di informazioni interne da MiniMax — uno dei laboratori di AI cinesi più sottovalutati — è appena trapelata. Il documento copre quattro fronti: sviluppo dei modelli di nuova generazione, posizionamento sui benchmark di coding, strategia sull'infrastruttura di calcolo e proiezioni sui margini. L'insieme delinea un'azienda prossima a una spinta seria sui modelli di frontiera — e con il potenziale per ridefinire le dinamiche di prezzo delle API cinesi.
Fuori dalla Cina, MiniMax è poco conosciuta. Ma all'interno del settore si distingue per due cose: il meccanismo di Lightning Attention (ora evoluto in MSA), che abbatte drasticamente il costo dell'inferenza a contesto lungo; e un modello di coding (M3) sorprendentemente solido per la sua fascia. Le informazioni trapelate suggeriscono che entrambi i vantaggi stiano per amplificarsi.
🧬 Nuova generazione: 2,5–3 trilioni di parametri
Il numero chiave: il prossimo modello di MiniMax punta a 2,5–3 trilioni di parametri. Per confronto, GPT-4 si stima intorno a 1,8T e DeepSeek V4 nella fascia 1–2T. Se MiniMax raggiunge i 3T, entrerà nella ristretta cerchia dei modelli dense/MoE più grandi mai costruiti.
Il pre-training del nuovo modello è iniziato circa due settimane fa e, secondo le informazioni interne, la convergenza supera le attese. Il modello adotta l'architettura MSA 2.0 (dettagliata più sotto), con numero di parametri e parametri attivi circa raddoppiati rispetto all'attuale generazione M2.
Timeline: il nuovo modello è atteso dopo l'estate 2026 (circa settembre–ottobre). Il team interno si dice molto sicuro sulle prestazioni e sullo stato di avanzamento, con l'obiettivo dichiarato di guidare il mercato cinese.
⚡ MSA 2.0: l'arma segreta dell'efficienza dei costi
MSA sta per Multi-Scale Attention — l'architettura proprietaria di MiniMax, evoluta a partire dalla originale Lightning Attention. Il vantaggio fondamentale: ridurre drasticamente il costo computazionale dell'attention mantenendo invariata la qualità del modello.
Perché questo conta per il prezzo:
- Efficienza di training: MSA 2.0 consente a MiniMax di addestrare un modello da 3T a una frazione del costo di un Transformer standard. Costi di training più bassi = meno capitale da recuperare = più margine per un pricing aggressivo delle API.
- Efficienza di inferenza: MSA supporta sequenze lunghissime con un overhead computazionale ridotto di un ordine di grandezza. Questo significa che MiniMax può offrire finestre di contesto oltre 1 milione di token a un costo marginale molto inferiore a quello dei concorrenti.
- Margine lordo: le informazioni interne indicano esplicitamente che, nonostante il raddoppio di parametri e attivazione, il margine del nuovo modello è atteso superiore a quello di M2. Possibile solo se MSA 2.0 porta a una reale riduzione del costo per token.
🚀 Capacità di coding e velocità di inferenza
Le informazioni interne rivelano dettagli interessanti sulla strategia coding di MiniMax:
- M3 è il più veloce tra i modelli principali — circa 100 TPS (token al secondo), dichiarato superiore a tutti i concorrenti. Per i flussi di lavoro di coding in cui lo sviluppatore osserva lo stream in tempo reale, questo vantaggio di velocità si traduce direttamente in un'esperienza migliore.
- La filosofia di training di MiniMax privilegia dati di codice specializzato di alta qualità rispetto al puro volume. Le note interne sottolineano che "qualità dei dati e pipeline di training contano più della quantità" — una posizione controcorrente in un'industria ossessionata dalla dimensione dei dataset.
- M3.1 è un upgrade consistente di M3 (M3 presentava alcune limitazioni a causa dei tempi stretti di post-training). Ottimizzando la qualità dei dati e inserendo compiti a lungo orizzonte, M3.1 ottiene un miglioramento di un ordine di grandezza sui problemi di coding più complessi.
Per i lettori di China AI Arbitrage: il modello di coding di MiniMax è attualmente prezzato intorno a 1,20 $/milione di token in output — già in linea con Qwen e più economico di GLM. Se il modello di nuova generazione mantiene le promesse, MiniMax potrebbe diventare la migliore scelta qualità/prezzo per il coding sul mercato cinese.
🏗️ Infrastruttura di calcolo: il vantaggio sulle risorse oltreoceano
Uno degli aspetti più degni di nota: MiniMax ha ottenuto in modo conforme risorse GPU oltreoceano, in vantaggio rispetto a gran parte dei concorrenti cinesi che si stanno affannando con le alternative domestiche.
- Rete di interconnessione proprietaria: MiniMax ha costruito in casa la propria infrastruttura di interconnessione tra GPU, invece di affidarsi a soluzioni dei vendor. Si stima un risparmio in costi e tempi, con una stabilità "oltre le attese".
- Pipeline di calcolo domestico: le GPU cinesi sono disponibili ma con capacità limitata. MiniMax prevede di portare online il primo cluster di GPU domestiche entro la fine del Q3 2026, a partire dall'inferenza.
- Strategia a doppio binario: GPU oltreoceano per il training (dove serve la massima prestazione), GPU domestiche per l'inferenza (dove servono scala ed efficienza di costo). È la traiettoria pragmatica a cui mirano molti laboratori cinesi — MiniMax è semplicemente più avanti nell'esecuzione.
💰 Impatto sul pricing delle AI
Mettendo insieme tutti i fili per valutare l'impatto sul prezzo:
| Dimensione | Oggi (M3/M3.1) | Nuova generazione (modello 3T) | Impatto sul prezzo |
|---|---|---|---|
| Parametri | ~1,5T (stimato) | 2,5–3T | Soffitto di capacità più alto |
| Architettura | MSA 1.0 | MSA 2.0 | Costo computazionale per token più basso |
| Margine lordo | Baseline | Atteso superiore a M2 | Spazio per ridurre i prezzi o aumentare i margini |
| Velocità di inferenza | ~100 TPS | Da definire (potrebbe crescere) | Esperienza migliore a parità di costo |
| Prezzo in output | ~1,20 $/milione di token | Da definire | Pressione competitiva su DeepSeek/Qwen |
Conclusione chiave: MiniMax sta costruendo un modello sia più grande sia più efficiente. In un mercato dove DeepSeek V4 Flash offre già output a 0,28 $/milione di token, MiniMax non può competere solo sul prezzo — serve differenziazione. Le informazioni interne suggeriscono l'angolo d'attacco: qualità da frontiera + velocità migliore della categoria + margini sostenibili grazie all'innovazione architetturale.
🌍 La prospettiva dell'arbitraggio
Per i lettori di China AI Arbitrage, perché tutto questo conta:
Ogni volta che un laboratorio cinese dimostra un'architettura più efficiente, fa pressione su tutti gli altri — DeepSeek, Qwen, GLM, Kimi — perché pareggino l'efficienza o taglino i prezzi. Questa corsa agli armamenti avvantaggia gli sviluppatori occidentali che hanno accesso a queste API, a una frazione del pricing statunitense.
Molti laboratori cinesi affrontano incertezza sul calcolo a causa delle restrizioni statunitensi all'esportazione. Le "risorse oltreoceano conformi" di MiniMax significano che le sue API hanno meno probabilità di subire limitazioni di capacità improvvise — un rischio reale per chi si affida esclusivamente a GPU domestiche. Fornitura stabile = base affidabile per l'arbitraggio.
Se stai costruendo un prodotto che rivende calcolo AI cinese agli utenti occidentali, la latenza conta. I 100 TPS di MiniMax si traducono in un'esperienza più fluida per i tuoi utenti finali — e ti permettono di chiedere un premium rispetto ad alternative più lente. La velocità è un valore aggiunto che si può monetizzare.
⏳ In sintesi
MiniMax non è il laboratorio cinese più vistoso — quello è DeepSeek. Né il più finanziato — quelli sono Zhipu o ByteDance. Ma le informazioni interne suggeriscono che potrebbe essere il miglior posizionato a livello strategico: un'architettura proprietaria che riduce davvero i costi, risorse di calcolo oltreoceano che offrono stabilità e un modello di coding già competitivo e prossimo a un upgrade sostanziale.
Tre cose da tenere d'occhio:
- Settembre–ottobre 2026: lancio del nuovo modello da 3T. Se mantiene la promessa di "guidare il mercato cinese", il pricing delle API di MiniMax potrebbe riaprire l'intero scenario competitivo.
- Movimenti di prezzo delle API MiniMax: se MiniMax taglia i prezzi dopo il lancio (probabile, visto il miglioramento dei margini), diventerà una valida alternativa a DeepSeek per i carichi batch.
- Open-source di MSA 2.0: MiniMax non ha ancora rilasciato MSA. Se lo aprisse, abbasserebbe drasticamente i costi di training per l'intero ecosistema AI cinese — accelerando la corsa verso prezzi a zero.
La guerra dei prezzi dell'AI cinese ha un nuovo contendente. E questo è sostenuto da un'architettura davvero innovativa.
Fonte: informazioni interne MiniMax (luglio 2026), verificate incrociando i prezzi pubblici delle API MiniMax e i dati dei benchmark.