Notatki wewnętrzne MiniMax — model nowej generacji, architektura MSA, szybkość w kodowaniu, infrastruktura obliczeniowa

📋 Notatki wewnętrzne

Wypłynęły właśnie notatki wewnętrzne z MiniMax — jednego z najbardziej niedocenianych chińskich laboratoriów AI. Dokument obejmuje cztery obszary: rozwój modelu nowej generacji, pozycjonowanie w rankingach kodowania, strategię infrastruktury obliczeniowej oraz prognozę marży brutto. Razem rysują obraz firmy, która zaraz wykona poważny ruch w wyścigu modeli granicznych — i potencjalnie przebuduje krajobraz cenowy chińskich API dla AI.

MiniMax nie jest nazwą rozpoznawalną poza Chinami. W branży znany jest jednak z dwóch rzeczy: mechanizmu Lightning Attention (obecnie ewoluowanego w MSA), który drastycznie obniża koszt wnioskowania z długim kontekstem, oraz zaskakująco mocnego modelu do kodowania (M3), który uderza powyżej swojej kategorii wagowej. Notatki sugerują, że obie te przewagi wkrótce mocno urosną.

🧬 Nowa generacja: 2,5–3 biliony parametrów

Kluczowa liczba: cel modelu MiniMax nowej generacji to 2,5–3 biliony parametrów. Dla kontekstu — GPT-4 szacuje się na ~1,8T, a DeepSeek V4 podobno mieści się w przedziale 1–2T. Jeśli MiniMax dobije do 3T, będzie to jeden z największych modeli typu dense/MoE w ogóle wytrenowanych.

Pre-trening nowego modelu trwa już od około pół miesiąca i według notatek zbieżność prześciega oczekiwania. Model korzysta z architektury MSA 2.0 (więcej o niej poniżej), a liczba parametrów i aktywacji wzrosła mniej więcej dwukrotnie względem obecnej generacji M2.

Oś czasu: nowy model ma zadebiutować po lecie 2026 (najpewniej we wrześniu–październiku). Zespół wewnętrzny jest podobno bardzo pewien zarówno wydajności, jak i stopnia ukończenia, deklarując, że model będzie prowadził w chińskim (krajowym) rynku.

⚡ MSA 2.0: tajna broń efektywności kosztowej

MSA to skrót od Multi-Scale Attention — autorska architektura MiniMax, która wyewoluowała z ich wcześniejszych prac nad Lightning Attention. Kluczowa zaleta: drastycznie redukuje narzut obliczeniowy Attention przy zachowaniu jakości modelu.

Dlaczego to ma znaczenie dla cen:

  • Efektywność treningu: MSA 2.0 pozwala MiniMax wytrenować model o 3T parametrów za ułamek tego, co kosztowałby standardowy Transformer. Niższy koszt treningu = mniej kapitału do odrobienia = więcej pola na agresywne ceny API.
  • Efektywność wnioskowania: MSA obsługuje sekwencje ultra-długie ze spadkiem narzutu obliczeniowego o rząd wielkości. Dzięki temu MiniMax może oferować okna kontekstowe 1M+ przy znacznie niższym koszcie krańcowym niż konkurencja na czystym Attention.
  • Marża brutto: Notatki wprost mówią, że mimo podwojenia parametrów i aktywacji marża brutto nowego modelu ma przekroczyć M2. To możliwe tylko wtedy, gdy MSA 2.0 realnie tn ie koszt przypadający na token.
💡 Kluczowy wniosek: Większość chińskich laboratoriów AI konkuruje na cenę, paląc gotówkę. MiniMax wydaje się konkurować na architekturę — osiągając niższe koszty inżynierią, nie dotacjami. To znacznie trwalsza fosa.

🚀 Wydajność i szybkość w kodowaniu

Notatki ujawniają ciekawe szczegóły strategii kodowania MiniMax:

  • M3 to najszybszy model w głównej ofercie — około 100 tokenów na sekundę (TPS), co według notatek uderza całą konkurencję. W workflow kodowania, gdzie deweloperzy podglądają strumień wyjścia w czasie rzeczywistym, ta przewaga w szybkości przekłada się wprost na lepszy UX.
  • Filozofia treningu MiniMax przechyla się ku wysokiej jakości profesjonalnych danych kodu ponad samą objętość. Notatki podkreślają, że „jakość danych i metodologia treningu znaczą więcej niż ilość" — kontrastowa postawa w branży zafiksowanej na skali zbiorów danych.
  • M3.1 był dużym skokiem względem M3 (który cierpiał na pospieszny post-training). Dzięki optymalizacji jakości danych i dodaniu danych zadań długohoryzontowych M3.1 osiągnął skok możliwości o rząd wielkości na trudnych problemach kodowania.

Dla czytelników China AI Arbitrage: model do kodowania MiniMax kosztuje obecnie około $1.20/M tokenów wyjścia — już teraz dorównuje Qwenowi i jest tańszy od GLM. Jeśli model nowej generacji dotrzyma słów, MiniMax może stać się najlepszą ofertą cenowo-skończoną do kodowania na chińskim rynku AI.

🏗️ Infrastruktura obliczeniowa: zagraniczna przewaga

Jeden z najbardziej ujawniających fragmentów: MiniMax zapewnił sobie zgodny dostęp do zagranicznych zasobów GPU, wyprzedzając większość chińskiej konkurencji, która desperacko poszukuje alternatyw krajowych.

  • Sieć własnej budowy: MiniMax postawił własną infrastrukturę połączeń międzygpu zamiast polegać na rozwiązaniach dostawcy. Notatki twierdzą, że oszczędziło to koszty i czas, a stabilność „prześcignęła oczekiwania".
  • Krajowy potok obliczeniowy: Chińskie (krajowe) GPU nadają się do użytku, ale mają ograniczoną przepustowość. MiniMax spodziewa się uruchomienia pierwszego krajowego klastra GPU w trzecim kwartale 2026, początkowo dla wnioskowania.
  • Strategia dwutorowa: Zagraniczne GPU do treningu (gdzie liczy się najwyższa wydajność), krajowe GPU do wnioskowania (gdzie liczy się skala i efektywność kosztowa). To pragmatyczne podejście, do którego aspiruje większość chińskich laboratoriów — MiniMax wydaje się być w realizacji krok z przodu.

💰 Co to oznacza dla cen AI

Połączmy kropki w implikacje cenowe:

CzynnikObecnie (M3/M3.1)Nowa generacja (model 3T)Wpływ na ceny
Parametry~1,5T (szac.)2,5–3TWyższy sufit możliwości
ArchitekturaMSA 1.0MSA 2.0Niższy koszt obliczeniowy na token
Marża bruttoPunkt odniesieniaSpodziewana powyżej M2Pole na obniżki cen lub wyższą marżę
Szybkość wnioskowania~100 TPSTBD (pewnie szybciej)Lepszy UX przy tym samym koszcie
Cena wyjścia~$1.20/M tokenówTBDPresja konkurencyjna na DeepSeek/Qwen

Kluczowy wniosek: MiniMax buduje model zarówno większy, jak i wydajniejszy. Na rynku, gdzie DeepSeek V4 Flash już daje wyjście po $0.28/M tokenów, MiniMax nie może tylko dorównać ceną — musi zaoferować coś innego. Notatki sugerują taki kąt: jakość klasy granicznej + szybkość najlepsza w klasie + trwałe marże dzięki innowacji architektonicznej.

🌍 Perspektywa arbitrażu

Dla czytelników China AI Arbitrage — oto dlaczego to ma znaczenie:

1. Konkurencja spycha ceny w dół na całym rynku.
Za każdym razem, gdy chińskie laboratorium pokazuje wydajniejszą architekturę, rośnie presja na wszystkich pozostałych — DeepSeek, Qwen, GLM, Kimi — by dorównali efektywnością albo obcięli ceny. Ten wyścig na dno pomaga zachodnim deweloperom, którzy dostają te API za ułamek cen z USA.
2. Zagraniczne GPU u MiniMax = stabilna podaż.
Wiele chińskich laboratoriów AI mierzy się niepewnością obliczeniową z powodu amerykańskich restrykcji eksportowych. „Zgodny dostęp zagraniczny" u MiniMax oznacza, że ich API rzadziej wpadnie w nagłe limity przepustowości — realne ryzyko dla laboratoriów opartych wyłącznie o krajowe GPU. Stabilna podaż = wiarygodne podłoże do arbitrażu.
3. Przewaga 100 TPS to katalizator arbitrażu.
Jeśli budujesz produkt, który odsprzedaje chińskie moce obliczeniowe AI użytkownikom na Zachodzie, latencja ma znaczenie. 100 TPS u MiniMax oznacza, że końcowi użytkownicy dostają bardziej responsywne doświadczenie — co pozwala liczyć sobie premię względem wolniejszych alternatyw. Szybkość to wartość dodana, którą można zmonetyzować.

⏳ Podsumowanie

MiniMax nie jest najgłośniejszym chińskim laboratorium AI — tym jest DeepSeek. Nie jest najlepiej finansowanym — to Zhipu lub ByteDance. Ale notatki sugerują, że może być najlepiej ulokowany strategicznie: autorska architektura, która realnie tnie koszty, dostęp do zagranicznych mocy obliczeniowych dający stabilność i model do kodowania już konkurencyjny, zaraz znacząco ulepszony.

Trzy rzeczy do obserwacji:

  1. Wrzesień–październik 2026: Premiere nowego modelu 3T. Jeśli dotrzyma obietnicy „przewodzi na rynku krajowym", ceny API MiniMax mogą przesunąć cały krajobraz konkurencyjny.
  2. Zmiany cen API MiniMax: Jeśli MiniMax obetnie ceny po premierze nowego modelu (prawdopodobne, przy poprawionej marży), stanie się realną alternatywą dla DeepSeeka w zadaniach batchowych.
  3. Otwarcie kodu MSA 2.0: MiniMax jeszcze nie otworzył MSA. Jeśli to zrobi, może drastycznie obniżyć koszty treningu w całym chińskim ekosystemie AI — i przyspieszyć wyścig cen do zera.

Chińska wojna cenowa AI ma nowego uczestnika. A ten ma za sobą naprawdę nowatorską architekturę.

Źródło: notatki wewnętrzne MiniMax (lipiec 2026), zweryfikowane względem publicznych cen API MiniMax i danych rankingowych.