⚡ Przegląd
Sprawdziliśmy trzy graniczne modele AI na brutalnym wyzwaniu programistycznym: wygenerowanie kompletnego, filmowej jakości symulatora Układu Słonecznego w Three.js w jednym pliku HTML — wszystkie tekstury proceduralne, własne shadery, post-processing bloom i interaktywne sterowanie, bez żadnych zasobów zewnętrznych.
Ten sam prompt, trzy modele, pojedynek twarzą w twarz. Prompt precyzował 15+ ciał niebieskich z dokładnymi wymogami shaderów (wielowarstwowy szum FBM, szum wirowy, szum komórkowy), 3 warstwy poświaty na Słońcu, Wielką Czerwoną Plamę Jowisza z spiralnymi krawędziami, przerwę Cassiniego w pierścieniach Saturna, światła miast po ciemnej stronie Ziemi i więcej. Bez skrótów.
🤖 Testowane modele
| Model | Narzędzie | Zadanie 1: Układ Słoneczny | Zadanie 2: Renderer miasta |
|---|---|---|---|
| GPT-5.6 Sol | Codex | 11 min | 11 + 33 min (dwie rundy) |
| Kimi K3 | Kimi Code | 45 min | 3+ godz., druga runda porzucona |
| Qwen3.8Max | Bezpośrednio | — | <10 min (dwie rundy) |
To nie jest formalny benchmark — to rzeczywisty test obciążeniowy wykonany przez użytkownika GitHub OBdangshang07. Ten sam prompt, te same oczekiwania, mierzony czas zegarowy od wywołania narzędzia do kompletnego wyjścia. Jakość oceniana przez wierność wizualną i kompletność kodu.
🌌 Zadanie 1: Symulator Układu Słonecznego
Wymagał się Układ Słoneczny klasy filmowej z 15+ ciałami niebieskimi, każde z własnym ShaderMaterial z wielowarstwowym szumem. Kluczowe wymagania:
- Słońce: dynamiczna tekstura plazmy z 3 warstwami poświaty, plamy słoneczne, cząstki wiatru słonecznego
- Jowisz: wielowarstwowe rozciągnięte pasma szumowe, Wielka Czerwona Plama z spiralnymi krawędziami, 3+ mniejsze wiry
- Saturn: wielowarstwowe półprzezroczyste pierścienie z przerwą Cassiniego, rozpraszanie cząstek przez shaderowy
discard - Ziemia: specularne refleksy na oceanach, światła miast po ciemnej stronie, powłoka atmosferyczna Fresnela
- Księżyce: 4 księżyce galileuszowe + 4 księżyce Saturna, każdy z unikalną teksturą proceduralną
Wyniki
| Aspekt | GPT-5.6 Sol (11 min) | Kimi K3 (45 min) |
|---|---|---|
| Wierność wizualna | ⭐⭐⭐⭐⭐ Świetne shadery, pasma Jowisza wyglądają organicznie | ⭐⭐⭐⭐ Dobrze, ale niektóre ciała mają prostszy szum |
| Kompletność kodu | Wszystkie 15+ ciał, wszystkie księżyce obecne | Wszystkie ciała obecne, część księżyców uproszczona |
| Interaktywność | Płynne sterowanie orbitą, panele info, przyspieszenie czasu | Podobne sterowanie, lekko mniej dopracowane UI |
| Post-processing | UnrealBloomPass dobrze dostrojony | Bloom obecny, ale mniej wyrafinowany |
| Stabilność | Stabilne 60 fps | Sporadyczne spadki klatek na słabszych GPU |
🏙️ Zadanie 2: Renderer miasta
Trudniejsze wyzwanie: wygenerowanie renderera metropolii w czasie rzeczywistym z 50+ parametrami do regulacji, proceduralnym nieskończonym miastem, dynamicznym cyklem dnia i nocy, rozpraszaniem atmosferycznym i gęstymi klastrami budynków 3D o unikalnych teksturach.
Wyniki
| Model | Runda 1 | Runda 2 (dopracowanie) | Gęstość zabudowy | Jakość tekstur |
|---|---|---|---|---|
| Qwen3.8Max | <10 min | <10 min | ⭐⭐⭐⭐⭐ Gęsto, zróżnicowanie | ⭐⭐⭐⭐ Dobre proceduralne |
| GPT-5.6 Sol | 11 min | 33 min | ⭐⭐⭐⭐ Gęsto | ⭐⭐⭐⭐⭐ Świetne detale |
| Kimi K3 | 3+ godz. | ❌ Porzucone | ⭐⭐⭐ Umiarkowana | ⭐⭐⭐ Poprawne |
Kimi K3 potrzebował ponad 3 godzin na pierwszą rundę i nie dokończył drugiej. Zadanie renderera miasta obnażyło słabość K3 w generowaniu złożonego, wrażliwego na wydajność kodu 3D z wieloma powiązanymi systemami (drogi, ruch, oświetlenie, generowanie budynków).
📊 Kluczowe ustalenia
🏎️ Szybkość
Qwen3.8Max jest królem szybkości — obie rundy łącznie w poniżej 10 minut. GPT-5.6 Sol trzyma stały poziom (~11 min na zadanie). Kimi K3 jest 3–4× wolniejszy przy złożonych zadaniach.
🎨 Jakość
GPT-5.6 Sol daje najlepszą jakość wizualną — shadery są bardziej wyrafinowane, warstwy szumu bardziej organiczne, a post-processing lepiej dostrojony. Qwen3.8Max wymienia część polotu wizualnego na surową szybkość. Wyjście Kimi K3 jest używalne, ale mniej filmowe.
🔧 Niezawodność
GPT-5.6 Sol jest najbardziej niezawodny — w pełni ukończył oba zadania. Qwen3.8Max jest szybki, ale może wymagać rundy dopracowania. Kimi K3 potrafi się wykosztować na złożonych zadaniach wielosystemowych.
🎮 Demo na żywo — sprawdź sam
Poniżej faktyczne wyjścia każdego modelu. Otwórz w przeglądarce i porównaj jakość wizualną, interaktywność i wydajność:
☀️ Symulator Układu Słonecznego
| Model | Czas generowania | Demo |
|---|---|---|
| GPT-5.6 Sol | 11 min | 🚀 Otwórz demo → |
| Kimi K3 | 45 min | 🚀 Otwórz demo → |
🌃 Renderer miasta
| Model | Czas generowania | Demo |
|---|---|---|
| GPT-5.6 Sol | 11 + 33 min | 🚀 Otwórz demo → |
| Kimi K3 | 3+ godz. | 🚀 Otwórz demo → |
| Qwen3.8Max | <10 min × 2 | 🚀 Otwórz demo → |
🎯 Co to oznacza dla deweloperów
- Potrzebujesz najlepszej jakości wizualnej? → GPT-5.6 Sol (Codex). Najlepsze shadery, najbardziej dopracowane wyjście.
- Potrzebujesz szybkości? → Qwen3.8Max. Błyskawiczny, a jakość wystarcza do prototypowania.
- Złożone 3D wielosystemowe? → Na razie omijaj Kimi K3. Błyszczy w prostszych zadaniach, ale słabnie przy systemach powiązanych.
- Wrażliwy na koszt? → Qwen3.8Max daje najlepszy stosunek czasu do jakości.
Różnica między modelami to nie tylko szybkość — chodzi o sufit złożoności. GPT-5.6 Sol radzi sobie z promptami o 15+ powiązanych systemach shaderów. Qwen3.8Max jest szybki, ale może wymagać przebiegów dopracowania. Kimi K3 ma niższy sufit przy złożonych zadaniach 3D.
Dla generacji HTML w pojedynczym pliku — nowego testu „vibe coding" — GPT-5.6 Sol obecnie prowadzi jakością, a Qwen3.8Max prowadzi przepustowością. Wybieraj według priorytetu.
📎 Źródło
Cały kod, prompty i wyniki testów są open source: github.com/OBdangshang07/AI_project
Test przeprowadził użytkownik GitHub OBdangshang07. Demo odtworzone z oryginalnych plików wyjściowych HTML.