Informações internas do MiniMax — modelo de próxima geração, arquitetura MSA, velocidade de código e infraestrutura de computação

📋 Vazamento de informação interna

Uma informação interna do MiniMax — um dos laboratórios de IA mais subestimados da China — acabou de vir à tona. O documento cobre quatro frentes: pesquisa do modelo de próxima geração, posicionamento competitivo em benchmarks de código, estratégia de infraestrutura de computação e perspectivas de margem bruta. Em conjunto, o quadro é de uma empresa prestes a fazer uma investida séria na corrida de modelos de fronteira — e possivelmente redesenhar o cenário de preços das APIs de IA chinesa.

O MiniMax não é muito conhecido fora da China. Mas, dentro da indústria, é famoso por duas coisas: o mecanismo de Lightning Attention (agora evoluído para MSA), que reduz drasticamente o custo de inferência em contexto longo; e um modelo de código surpreendentemente forte (o M3), que se destaca na sua faixa de porte. Estas informações sugerem que essas duas vantagens estão prestes a ser ampliadas em larga escala.

🧬 Próxima geração: 2,5–3 trilhões de parâmetros

O número central: o modelo de próxima geração do MiniMax mira 2,5–3 trilhões de parâmetros. Para comparação, o GPT-4 é estimado em cerca de 1,8T, e o DeepSeek V4 na faixa de 1–2T. Se o MiniMax alcançar 3T, terá um dos maiores modelos dense/MoE já construídos.

A pré-treinagem do novo modelo começou há cerca de quinze dias e, segundo a informação interna, a convergência está superando as expectativas. O modelo adota a arquitetura MSA 2.0 (detalhada adiante), com número de parâmetros e ativações aproximadamente duplicados em relação ao atual M2.

Cronograma: o novo modelo deve ser lançado após as férias de verão de 2026 (por volta de setembro–outubro). A equipe interna demonstra confiança no desempenho e na maturidade, afirmando que será líder no mercado nacional.

⚡ MSA 2.0: a arma secreta da eficiência de custo

MSA significa Multi-Scale Attention — a arquitetura proprietária do MiniMax, evoluída a partir da Lightning Attention original. A vantagem central: reduzir drasticamente o custo computacional da atenção sem sacrificar a qualidade do modelo.

Por que isso é decisivo para o preço:

  • Eficiência de treino: o MSA 2.0 permite ao MiniMax treinar um modelo de 3T por uma fração do custo de um Transformer padrão. Treino mais barato = menos capital a recuperar = mais margem para uma precificação agressiva de API.
  • Eficiência de inferência: o MSA suporta sequências ultralongas com redução de uma ordem de grandeza no custo computacional. Ou seja, o MiniMax consegue oferecer janelas de contexto de mais de 1 milhão de tokens com custo marginal bem inferior ao dos concorrentes.
  • Margem bruta: a informação interna afirma explicitamente que, apesar de dobrar parâmetros e ativações, a margem do novo modelo deve superar a do M2. Isso só é possível se o MSA 2.0 entregar uma queda real no custo por token.
💡 Insight central: a maioria dos laboratórios chineses de IA disputa preço queimando dinheiro. O MiniMax parece competir por inovação de arquitetura — alcançando custo menor via engenharia, não via subsídio. Esse é um fosso defensivo muito mais sustentável.

🚀 Capacidade de código e velocidade de inferência

A informação interna revela detalhes interessantes da estratégia de código do MiniMax:

  • O M3 é o mais rápido entre os modelos principais — cerca de 100 TPS (tokens por segundo), supostamente à frente de todos os concorrentes. Em fluxos de trabalho de programação, onde o desenvolvedor acompanha o fluxo de saída em tempo real, essa vantagem de velocidade vira diretamente uma experiência melhor.
  • A filosofia de treino do MiniMax privilegia dados de código especializado de alta qualidade em vez de empilhar volume. A mensagem interna enfatiza que "qualidade dos dados e plano de treino importam mais do que quantidade" — numa indústria obcecada com o tamanho do dataset, é uma posição contrária.
  • O M3.1 é um upgrade pesado sobre o M3 (que havia ficado aquém por causa do tempo apertado de pós-treinamento). Com dados mais bem curados e a adição de dados de tarefas de longa duração, o M3.1 entrega um salto de capacidade de uma ordem de grandeza em problemas difíceis de código.

Para os leitores do China AI Arbitrage: o modelo de código do MiniMax hoje custa cerca de $1,20 por milhão de tokens de saída — já empatou com o Tongyi Qianwen e é mais barato que o GLM. Se o modelo de próxima geração cumprir o prometido, o MiniMax pode se tornar a melhor relação custo-benefício para código no mercado de IA chinês.

🏗️ Infraestrutura de computação: a vantagem de recursos no exterior

Uma das partes mais relevantes: o MiniMax já garantiu, de forma conforme, recursos de GPU no exterior, à frente da maioria dos concorrentes chineses — que estão atolados tentando migrar para alternativas nacionais.

  • Rede própria: o MiniMax construiu sua própria infraestrutura de interconexão entre GPUs, em vez de depender de solução de fornecedor. Diz-se que isso economizou custo e tempo, com estabilidade "além do esperado".
  • Pipeline de computação nacional: GPUs domésticas existem, mas a capacidade é limitada. O MiniMax prevê o primeiro cluster nacional de GPU entrando em operação no fim do Q3 de 2026, com inferência em primeiro lugar.
  • Estratégia de duas frentes: GPUs estrangeiras para treino (que exige desempenho de ponta), GPUs nacionais para inferência (que exige escala e eficiência de custo). É a rota pragmática que a maioria dos laboratórios chineses almeja — o MiniMax claramente está mais à frente na execução.

💰 O impacto no preço da IA

Costurando todos os fios para enxergar o impacto no preço:

DimensãoAtual (M3/M3.1)Próxima geração (modelo 3T)Impacto no preço
Parâmetros~1,5T (est.)2,5–3TTeto de capacidade sobe
ArquiteturaMSA 1.0MSA 2.0Custo computacional por token cai
Margem brutaLinha de baseEsperada acima do M2Espaço para cortar preço ou ampliar margem
Velocidade de inferência~100 TPSA definir (provavelmente mais rápida)Experiência melhor pelo mesmo custo
Preço de saída~$1,20/milhão de tokensA definirPressão competitiva sobre DeepSeek/Tongyi

Conclusão central: o MiniMax está construindo um modelo que é, ao mesmo tempo, maior e mais eficiente. Num mercado onde o DeepSeek V4 Flash já entrega saída a $0,28 por milhão de tokens, o MiniMax não pode competir só por preço — precisa de diferenciação. A informação interna sugere que o ângulo deles é: qualidade de fronteira + melhor velocidade + margem sustentável via inovação de arquitetura.

🌍 O ângulo da arbitragem

Para os leitores do China AI Arbitrage, eis por que isso importa:

1. A concorrência empurra a queda de preços de toda a indústria.
Toda vez que um laboratório chinês de IA demonstra uma arquitetura mais eficiente, isso pressiona todos os outros — DeepSeek, Tongyi, GLM, Kimi — a equiparar a eficiência ou baixar o preço. Essa corrida armamentista beneficia os desenvolvedores ocidentais com acesso a essas APIs, que pagam uma fração do preço americano.
2. GPUs no exterior do MiniMax = fornecimento estável.
Vários laboratórios chineses enfrentam incerteza de capacidade por causa das restrições de exportação dos EUA. O "recurso externo conforme" do MiniMax significa que a API dele tem menos risco de sofrer cortes súbitos de capacidade — um risco real para quem depende apenas de GPU nacional. Fornecimento estável = base confiável para arbitragem.
3. A vantagem de 100 TPS é um acelerador de arbitragem.
Se você está montando um produto que revende capacidade de IA chinesa para usuários ocidentais, latência importa. Os 100 TPS do MiniMax significam que seu usuário final tem uma experiência mais fluida — o que permite cobrar um prêmio maior do que alternativas mais lentas. Velocidade é valor agregado que se converte em receita.

⏳ Conclusão

O MiniMax não é o laboratório chinês de IA mais barulhento — esse é o DeepSeek. Nem o que mais capta recursos — esses são a Zhipu ou a ByteDance. Mas esta informação interna sugere que ele pode ser o melhor posicionado estrategicamente: uma arquitetura proprietária que de fato reduz custo, recursos de computação no exterior que dão estabilidade e um modelo de código já competitivo prestes a dar um salto grande.

Três coisas para acompanhar:

  1. Setembro–outubro de 2026: lançamento do novo modelo de 3T. Se cumprir a promessa de "liderar o mercado nacional", o preço da API do MiniMax pode sacudir todo o cenário competitivo.
  2. Mudança no preço da API do MiniMax: se, após o lançamento, o MiniMax baixar o preço (provável, dada a melhora de margem), ele se torna uma alternativa forte ao DeepSeek para cargas em lote.
  3. Abertura do MSA 2.0: o MiniMax ainda não abriu o MSA. Se abrir, vai reduzir drasticamente o custo de treino de todo o ecossistema de IA chinês — acelerando a corrida dos preços a zero.

A guerra de preços da IA chinesa tem um novo contender. E este tem uma arquitetura de verdade nas costas.

Fonte: informação interna do MiniMax (julho de 2026), cruzada com a precificação pública da API do MiniMax e dados de benchmark.