Información interna de MiniMax — modelo de próxima generación, arquitectura MSA, velocidad en código, infraestructura de cómputo

📋 Filtración interna

Acaba de salir a la luz una filtración procedente de MiniMax, uno de los laboratorios de IA más infravalorados de China. El documento abarca cuatro frentes: I+D del próximo modelo, posicionamiento competitivo en benchmarks de código, estrategia de infraestructura de cómputo y perspectivas de margen bruto. En su conjunto, dibuja a una empresa a punto de dar un empujón serio en la carrera de modelos frontera — y con potencial para reconfigurar el mapa de precios de las APIs de IA china.

MiniMax no goza de mucha notoriedad fuera de China. Pero dentro del sector es conocido por dos cosas: el mecanismo Lightning Attention (hoy evolucionado hacia MSA), que recorta drásticamente el coste de la inferencia en contextos largos; y un modelo de código (M3) sorprendentemente potente que juega por encima de su categoría. Esta filtración sugiere que ambas ventajas están a punto de escalarse de forma notable.

🧬 Próxima generación: 2,5–3 billones de parámetros

La cifra clave: el próximo modelo de MiniMax apunta a 2,5–3 billones de parámetros. Para ponerlo en contexto, GPT-4 se estima en torno a 1,8 billones, y DeepSeek V4 en el rango de 1–2 billones. Si MiniMax alcanza los 3 billones, se situaría entre los modelos dense/MoE más grandes jamás construidos.

El preentrenamiento del nuevo modelo lleva arrancado unas dos semanas y, según la filtración, la convergencia supera las previsiones. El modelo emplea la arquitectura MSA 2.0 (detalle más abajo), con un número de parámetros y de activaciones aproximadamente duplicado frente a la actual generación M2.

Cronograma: el nuevo modelo está previsto para después del verano de 2026 (en torno a septiembre–octubre). Los equipos internos se muestran seguros tanto del rendimiento como del grado de madurez, y afirman que liderará el mercado nacional.

⚡ MSA 2.0: el arma secreta de la eficiencia

MSA significa Multi-Scale Attention, la arquitectura propietaria de MiniMax, evolucionada desde el Lightning Attention original. Su ventaja central: reducción drástica del coste computacional del mecanismo de atención sin sacrificar calidad de modelo.

Por qué esto es decisivo para el pricing:

  • Eficiencia en entrenamiento: MSA 2.0 permite a MiniMax entrenar un modelo de 3 billones de parámetros por una fracción del coste de un Transformer estándar. Menor coste de entrenamiento = menos capital que recuperar = más margen para un pricing de API agresivo.
  • Eficiencia en inferencia: MSA soporta secuencias ultralargas con una reducción de cómputo de un orden de magnitud. Eso significa que MiniMax puede ofrecer ventanas de contexto de más de 1 millón de tokens con un coste marginal muy por debajo de la competencia.
  • Margen bruto: la filtración afirma de forma explícita que, pese a duplicar parámetros y activaciones, el margen bruto del nuevo modelo se prevé superior al del M2. Solo es posible si MSA 2.0 recorta de verdad el coste por token.
💡 Idea clave: la mayoría de los laboratorios chinos de IA libran la guerra de precios quemando dinero. MiniMax parece competir mediante innovación de arquitectura: abaratar vía ingeniería, no vía subvención. Ese foso defensivo es muchísimo más sostenible.

🚀 Capacidad de código y velocidad de inferencia

La filtración revela detalles relevantes de la estrategia de MiniMax en programación:

  • M3 es el más rápido entre los modelos principales: alrededor de 100 TPS (tokens por segundo), por delante, según se afirma, de todos los rivales. En flujos de código donde el desarrollador ve el stream de salida en tiempo real, esa ventaja de velocidad se traduce directamente en mejor experiencia de uso.
  • La filosofía de entrenamiento de MiniMax privilegia datos de código especializado de alta calidad frente al volumen puro. La filtración insiste en que "la calidad de los datos y la receta de entrenamiento importan más que la cantidad": una postura contracorriente en un sector obsesionado con el tamaño del dataset.
  • M3.1 es una actualización mayor respecto a M3 (M3 adolecía de lagunas por falta de tiempo en el post-entrenamiento). Mejorando la calidad de los datos y añadiendo tareas de largo alcance, M3.1 logra un salto de capacidad de un orden de magnitud en problemas de código complejos.

Para los lectores de China AI Arbitrage: el modelo de código de MiniMax se sitúa hoy en torno a 1,20 $/millón de tokens de salida, ya a la par de Qwen y más barato que GLM. Si el próximo modelo cumple lo prometido, MiniMax podría convertirse en la mejor relación calidad-precio para código del mercado de IA chino.

🏗️ Infraestructura de cómputo: ventaja en recursos en el extranjero

Una de las partes más destacables: MiniMax ha asegurado de forma conforme recursos de GPU en el extranjero, adelantándose a la mayoría de competidores chinos, que pelean con los sustitutos nacionales.

  • Red propia: MiniMax se ha construido su propia infraestructura de interconexión entre GPUs, en lugar de depender de soluciones de proveedor. Supuestamente ahorra coste y tiempo, con una estabilidad "por encima de lo esperado".
  • Pipeline de cómputo nacional: las GPUs locales están disponibles, pero con capacidad limitada. MiniMax prevé que el primer clúster con GPU nacional entre en servicio a finales del Q3 de 2026, empezando por inferencia.
  • Estrategia de doble vía: GPUs en el extranjero para entrenamiento (donde hace falta rendimiento de vanguardia); GPUs nacionales para inferencia (donde importan la escala y el coste). Es el camino pragmático al que aspiran casi todos los labs chinos: MiniMax está claramente más avanzado en su ejecución.

💰 Impacto en el pricing de la IA

Poniendo en fila todas las pistas, así se perfila el impacto en precios:

DimensiónActual (M3/M3.1)Próxima generación (modelo 3T)Impacto en el pricing
Parámetros~1,5T (est.)2,5–3TMayor techo de capacidad
ArquitecturaMSA 1.0MSA 2.0Reducción del coste por token
Margen brutoLínea baseSe prevé superior al de M2Margen para bajar precios o mejorar el beneficio
Velocidad de inferencia~100 TPSPor confirmar (probablemente superior)Mejor experiencia al mismo coste
Precio de salida~1,20 $/millón de tokensPor confirmarPresión competitiva sobre DeepSeek/Qwen

Conclusión clave: MiniMax está construyendo un modelo a la vez más grande y más eficiente. En un mercado donde DeepSeek V4 Flash ya ofrece salida a 0,28 $/millón de tokens, MiniMax no puede competir solo por precio: necesita diferenciación. La filtración apunta a su ángulo: calidad de frontera + mejor velocidad de su clase + márgenes sostenibles gracias a la innovación de arquitectura.

🌍 El ángulo del arbitrage

Para los lectores de China AI Arbitrage, por qué importa esto:

1. La competencia empuja a toda la industria a bajar precios.
Cada vez que un laboratorio chino de IA muestra una arquitectura más eficiente, presiona al resto —DeepSeek, Qwen, GLM, Kimi— a igualar esa eficiencia o recortar precios. Esta carrera armamentista beneficia a los desarrolladores occidentales con acceso a estas APIs, que pagan una fracción del pricing estadounidense.
2. Los recursos de GPU de MiniMax en el extranjero = suministro estable.
Muchos labs chinos arrastran incertidumbre de cómputo por las restricciones de exportación de EE. UU. Los "recursos en el extranjero conformes a norma" de MiniMax hacen poco probable que su API sufra cortes de capacidad súbitos: un riesgo real para quien depende solo de GPU nacional. Suministro estable = base fiable para arbitrage.
3. La ventaja de los 100 TPS es un multiplicador para el arbitrage.
Si estás montando un producto que revende capacidad de IA china a usuarios occidentales, la latencia cuenta. Los 100 TPS de MiniMax se traducen en una experiencia más fluida para tu usuario final, lo que permite cobrar un sobreprecio frente a alternativas más lentas. La velocidad es valor añadido monetizable.

⏳ Conclusión

MiniMax no es el laboratorio chino más vistoso —ese es DeepSeek—. Tampoco el que más capital levanta —ese es Zhipu o ByteDance—. Pero esta filtración sugiere que podría ser el mejor posicionado estratégicamente: una arquitectura propietaria que reduce costes de verdad, recursos de cómputo en el extranjero que aportan estabilidad y un modelo de código ya competitivo a punto de dar un salto importante.

Tres cosas a vigilar:

  1. Septiembre–octubre de 2026: lanzamiento del nuevo modelo de 3T. Si cumple la promesa de "liderar el mercado nacional", el pricing del API de MiniMax puede sacudir el panorama competitivo entero.
  2. Movimientos de precio del API de MiniMax: si tras el lanzamiento MiniMax baja precios (bastante probable, dado el margen mejorado), se convertirá en una alternativa seria a DeepSeek para cargas masivas.
  3. Apertura de MSA 2.0: MiniMax todavía no ha abierto MSA. Si lo hace, abaratará de golpe el coste de entrenamiento de todo el ecosistema de IA chino y acelerará la carrera hacia precios de cero.

La guerra de precios de la IA china tiene un nuevo contendiente. Y este viene respaldado por una arquitectura de verdad innovadora.

Fuente: filtración interna de MiniMax (julio de 2026), cruzada con el pricing público de la API de MiniMax y datos de benchmarks.