
📋 Notatki wewnętrzne
Wypłynęły właśnie notatki wewnętrzne z MiniMax — jednego z najbardziej niedocenianych chińskich laboratoriów AI. Dokument obejmuje cztery obszary: rozwój modelu nowej generacji, pozycjonowanie w rankingach kodowania, strategię infrastruktury obliczeniowej oraz prognozę marży brutto. Razem rysują obraz firmy, która zaraz wykona poważny ruch w wyścigu modeli granicznych — i potencjalnie przebuduje krajobraz cenowy chińskich API dla AI.
MiniMax nie jest nazwą rozpoznawalną poza Chinami. W branży znany jest jednak z dwóch rzeczy: mechanizmu Lightning Attention (obecnie ewoluowanego w MSA), który drastycznie obniża koszt wnioskowania z długim kontekstem, oraz zaskakująco mocnego modelu do kodowania (M3), który uderza powyżej swojej kategorii wagowej. Notatki sugerują, że obie te przewagi wkrótce mocno urosną.
🧬 Nowa generacja: 2,5–3 biliony parametrów
Kluczowa liczba: cel modelu MiniMax nowej generacji to 2,5–3 biliony parametrów. Dla kontekstu — GPT-4 szacuje się na ~1,8T, a DeepSeek V4 podobno mieści się w przedziale 1–2T. Jeśli MiniMax dobije do 3T, będzie to jeden z największych modeli typu dense/MoE w ogóle wytrenowanych.
Pre-trening nowego modelu trwa już od około pół miesiąca i według notatek zbieżność prześciega oczekiwania. Model korzysta z architektury MSA 2.0 (więcej o niej poniżej), a liczba parametrów i aktywacji wzrosła mniej więcej dwukrotnie względem obecnej generacji M2.
Oś czasu: nowy model ma zadebiutować po lecie 2026 (najpewniej we wrześniu–październiku). Zespół wewnętrzny jest podobno bardzo pewien zarówno wydajności, jak i stopnia ukończenia, deklarując, że model będzie prowadził w chińskim (krajowym) rynku.
⚡ MSA 2.0: tajna broń efektywności kosztowej
MSA to skrót od Multi-Scale Attention — autorska architektura MiniMax, która wyewoluowała z ich wcześniejszych prac nad Lightning Attention. Kluczowa zaleta: drastycznie redukuje narzut obliczeniowy Attention przy zachowaniu jakości modelu.
Dlaczego to ma znaczenie dla cen:
- Efektywność treningu: MSA 2.0 pozwala MiniMax wytrenować model o 3T parametrów za ułamek tego, co kosztowałby standardowy Transformer. Niższy koszt treningu = mniej kapitału do odrobienia = więcej pola na agresywne ceny API.
- Efektywność wnioskowania: MSA obsługuje sekwencje ultra-długie ze spadkiem narzutu obliczeniowego o rząd wielkości. Dzięki temu MiniMax może oferować okna kontekstowe 1M+ przy znacznie niższym koszcie krańcowym niż konkurencja na czystym Attention.
- Marża brutto: Notatki wprost mówią, że mimo podwojenia parametrów i aktywacji marża brutto nowego modelu ma przekroczyć M2. To możliwe tylko wtedy, gdy MSA 2.0 realnie tn ie koszt przypadający na token.
🚀 Wydajność i szybkość w kodowaniu
Notatki ujawniają ciekawe szczegóły strategii kodowania MiniMax:
- M3 to najszybszy model w głównej ofercie — około 100 tokenów na sekundę (TPS), co według notatek uderza całą konkurencję. W workflow kodowania, gdzie deweloperzy podglądają strumień wyjścia w czasie rzeczywistym, ta przewaga w szybkości przekłada się wprost na lepszy UX.
- Filozofia treningu MiniMax przechyla się ku wysokiej jakości profesjonalnych danych kodu ponad samą objętość. Notatki podkreślają, że „jakość danych i metodologia treningu znaczą więcej niż ilość" — kontrastowa postawa w branży zafiksowanej na skali zbiorów danych.
- M3.1 był dużym skokiem względem M3 (który cierpiał na pospieszny post-training). Dzięki optymalizacji jakości danych i dodaniu danych zadań długohoryzontowych M3.1 osiągnął skok możliwości o rząd wielkości na trudnych problemach kodowania.
Dla czytelników China AI Arbitrage: model do kodowania MiniMax kosztuje obecnie około $1.20/M tokenów wyjścia — już teraz dorównuje Qwenowi i jest tańszy od GLM. Jeśli model nowej generacji dotrzyma słów, MiniMax może stać się najlepszą ofertą cenowo-skończoną do kodowania na chińskim rynku AI.
🏗️ Infrastruktura obliczeniowa: zagraniczna przewaga
Jeden z najbardziej ujawniających fragmentów: MiniMax zapewnił sobie zgodny dostęp do zagranicznych zasobów GPU, wyprzedzając większość chińskiej konkurencji, która desperacko poszukuje alternatyw krajowych.
- Sieć własnej budowy: MiniMax postawił własną infrastrukturę połączeń międzygpu zamiast polegać na rozwiązaniach dostawcy. Notatki twierdzą, że oszczędziło to koszty i czas, a stabilność „prześcignęła oczekiwania".
- Krajowy potok obliczeniowy: Chińskie (krajowe) GPU nadają się do użytku, ale mają ograniczoną przepustowość. MiniMax spodziewa się uruchomienia pierwszego krajowego klastra GPU w trzecim kwartale 2026, początkowo dla wnioskowania.
- Strategia dwutorowa: Zagraniczne GPU do treningu (gdzie liczy się najwyższa wydajność), krajowe GPU do wnioskowania (gdzie liczy się skala i efektywność kosztowa). To pragmatyczne podejście, do którego aspiruje większość chińskich laboratoriów — MiniMax wydaje się być w realizacji krok z przodu.
💰 Co to oznacza dla cen AI
Połączmy kropki w implikacje cenowe:
| Czynnik | Obecnie (M3/M3.1) | Nowa generacja (model 3T) | Wpływ na ceny |
|---|---|---|---|
| Parametry | ~1,5T (szac.) | 2,5–3T | Wyższy sufit możliwości |
| Architektura | MSA 1.0 | MSA 2.0 | Niższy koszt obliczeniowy na token |
| Marża brutto | Punkt odniesienia | Spodziewana powyżej M2 | Pole na obniżki cen lub wyższą marżę |
| Szybkość wnioskowania | ~100 TPS | TBD (pewnie szybciej) | Lepszy UX przy tym samym koszcie |
| Cena wyjścia | ~$1.20/M tokenów | TBD | Presja konkurencyjna na DeepSeek/Qwen |
Kluczowy wniosek: MiniMax buduje model zarówno większy, jak i wydajniejszy. Na rynku, gdzie DeepSeek V4 Flash już daje wyjście po $0.28/M tokenów, MiniMax nie może tylko dorównać ceną — musi zaoferować coś innego. Notatki sugerują taki kąt: jakość klasy granicznej + szybkość najlepsza w klasie + trwałe marże dzięki innowacji architektonicznej.
🌍 Perspektywa arbitrażu
Dla czytelników China AI Arbitrage — oto dlaczego to ma znaczenie:
Za każdym razem, gdy chińskie laboratorium pokazuje wydajniejszą architekturę, rośnie presja na wszystkich pozostałych — DeepSeek, Qwen, GLM, Kimi — by dorównali efektywnością albo obcięli ceny. Ten wyścig na dno pomaga zachodnim deweloperom, którzy dostają te API za ułamek cen z USA.
Wiele chińskich laboratoriów AI mierzy się niepewnością obliczeniową z powodu amerykańskich restrykcji eksportowych. „Zgodny dostęp zagraniczny" u MiniMax oznacza, że ich API rzadziej wpadnie w nagłe limity przepustowości — realne ryzyko dla laboratoriów opartych wyłącznie o krajowe GPU. Stabilna podaż = wiarygodne podłoże do arbitrażu.
Jeśli budujesz produkt, który odsprzedaje chińskie moce obliczeniowe AI użytkownikom na Zachodzie, latencja ma znaczenie. 100 TPS u MiniMax oznacza, że końcowi użytkownicy dostają bardziej responsywne doświadczenie — co pozwala liczyć sobie premię względem wolniejszych alternatyw. Szybkość to wartość dodana, którą można zmonetyzować.
⏳ Podsumowanie
MiniMax nie jest najgłośniejszym chińskim laboratorium AI — tym jest DeepSeek. Nie jest najlepiej finansowanym — to Zhipu lub ByteDance. Ale notatki sugerują, że może być najlepiej ulokowany strategicznie: autorska architektura, która realnie tnie koszty, dostęp do zagranicznych mocy obliczeniowych dający stabilność i model do kodowania już konkurencyjny, zaraz znacząco ulepszony.
Trzy rzeczy do obserwacji:
- Wrzesień–październik 2026: Premiere nowego modelu 3T. Jeśli dotrzyma obietnicy „przewodzi na rynku krajowym", ceny API MiniMax mogą przesunąć cały krajobraz konkurencyjny.
- Zmiany cen API MiniMax: Jeśli MiniMax obetnie ceny po premierze nowego modelu (prawdopodobne, przy poprawionej marży), stanie się realną alternatywą dla DeepSeeka w zadaniach batchowych.
- Otwarcie kodu MSA 2.0: MiniMax jeszcze nie otworzył MSA. Jeśli to zrobi, może drastycznie obniżyć koszty treningu w całym chińskim ekosystemie AI — i przyspieszyć wyścig cen do zera.
Chińska wojna cenowa AI ma nowego uczestnika. A ten ma za sobą naprawdę nowatorską architekturę.
Źródło: notatki wewnętrzne MiniMax (lipiec 2026), zweryfikowane względem publicznych cen API MiniMax i danych rankingowych.