⚡ Przegląd

Sprawdziliśmy trzy graniczne modele AI na brutalnym wyzwaniu programistycznym: wygenerowanie kompletnego, filmowej jakości symulatora Układu Słonecznego w Three.js w jednym pliku HTML — wszystkie tekstury proceduralne, własne shadery, post-processing bloom i interaktywne sterowanie, bez żadnych zasobów zewnętrznych.

🎯 Wyzwanie
Ten sam prompt, trzy modele, pojedynek twarzą w twarz. Prompt precyzował 15+ ciał niebieskich z dokładnymi wymogami shaderów (wielowarstwowy szum FBM, szum wirowy, szum komórkowy), 3 warstwy poświaty na Słońcu, Wielką Czerwoną Plamę Jowisza z spiralnymi krawędziami, przerwę Cassiniego w pierścieniach Saturna, światła miast po ciemnej stronie Ziemi i więcej. Bez skrótów.

🤖 Testowane modele

ModelNarzędzieZadanie 1: Układ SłonecznyZadanie 2: Renderer miasta
GPT-5.6 SolCodex11 min11 + 33 min (dwie rundy)
Kimi K3Kimi Code45 min3+ godz., druga runda porzucona
Qwen3.8MaxBezpośrednio<10 min (dwie rundy)
⚠️ Uwaga o metodologii
To nie jest formalny benchmark — to rzeczywisty test obciążeniowy wykonany przez użytkownika GitHub OBdangshang07. Ten sam prompt, te same oczekiwania, mierzony czas zegarowy od wywołania narzędzia do kompletnego wyjścia. Jakość oceniana przez wierność wizualną i kompletność kodu.

🌌 Zadanie 1: Symulator Układu Słonecznego

Wymagał się Układ Słoneczny klasy filmowej z 15+ ciałami niebieskimi, każde z własnym ShaderMaterial z wielowarstwowym szumem. Kluczowe wymagania:

  • Słońce: dynamiczna tekstura plazmy z 3 warstwami poświaty, plamy słoneczne, cząstki wiatru słonecznego
  • Jowisz: wielowarstwowe rozciągnięte pasma szumowe, Wielka Czerwona Plama z spiralnymi krawędziami, 3+ mniejsze wiry
  • Saturn: wielowarstwowe półprzezroczyste pierścienie z przerwą Cassiniego, rozpraszanie cząstek przez shaderowy discard
  • Ziemia: specularne refleksy na oceanach, światła miast po ciemnej stronie, powłoka atmosferyczna Fresnela
  • Księżyce: 4 księżyce galileuszowe + 4 księżyce Saturna, każdy z unikalną teksturą proceduralną

Wyniki

AspektGPT-5.6 Sol (11 min)Kimi K3 (45 min)
Wierność wizualna⭐⭐⭐⭐⭐ Świetne shadery, pasma Jowisza wyglądają organicznie⭐⭐⭐⭐ Dobrze, ale niektóre ciała mają prostszy szum
Kompletność koduWszystkie 15+ ciał, wszystkie księżyce obecneWszystkie ciała obecne, część księżyców uproszczona
InteraktywnośćPłynne sterowanie orbitą, panele info, przyspieszenie czasuPodobne sterowanie, lekko mniej dopracowane UI
Post-processingUnrealBloomPass dobrze dostrojonyBloom obecny, ale mniej wyrafinowany
StabilnośćStabilne 60 fpsSporadyczne spadki klatek na słabszych GPU

🏙️ Zadanie 2: Renderer miasta

Trudniejsze wyzwanie: wygenerowanie renderera metropolii w czasie rzeczywistym z 50+ parametrami do regulacji, proceduralnym nieskończonym miastem, dynamicznym cyklem dnia i nocy, rozpraszaniem atmosferycznym i gęstymi klastrami budynków 3D o unikalnych teksturach.

Wyniki

ModelRunda 1Runda 2 (dopracowanie)Gęstość zabudowyJakość tekstur
Qwen3.8Max<10 min<10 min⭐⭐⭐⭐⭐ Gęsto, zróżnicowanie⭐⭐⭐⭐ Dobre proceduralne
GPT-5.6 Sol11 min33 min⭐⭐⭐⭐ Gęsto⭐⭐⭐⭐⭐ Świetne detale
Kimi K33+ godz.❌ Porzucone⭐⭐⭐ Umiarkowana⭐⭐⭐ Poprawne
🚨 Kimi K3 się pogubił
Kimi K3 potrzebował ponad 3 godzin na pierwszą rundę i nie dokończył drugiej. Zadanie renderera miasta obnażyło słabość K3 w generowaniu złożonego, wrażliwego na wydajność kodu 3D z wieloma powiązanymi systemami (drogi, ruch, oświetlenie, generowanie budynków).

📊 Kluczowe ustalenia

🏎️ Szybkość

Qwen3.8Max jest królem szybkości — obie rundy łącznie w poniżej 10 minut. GPT-5.6 Sol trzyma stały poziom (~11 min na zadanie). Kimi K3 jest 3–4× wolniejszy przy złożonych zadaniach.

🎨 Jakość

GPT-5.6 Sol daje najlepszą jakość wizualną — shadery są bardziej wyrafinowane, warstwy szumu bardziej organiczne, a post-processing lepiej dostrojony. Qwen3.8Max wymienia część polotu wizualnego na surową szybkość. Wyjście Kimi K3 jest używalne, ale mniej filmowe.

🔧 Niezawodność

GPT-5.6 Sol jest najbardziej niezawodny — w pełni ukończył oba zadania. Qwen3.8Max jest szybki, ale może wymagać rundy dopracowania. Kimi K3 potrafi się wykosztować na złożonych zadaniach wielosystemowych.

🎮 Demo na żywo — sprawdź sam

Poniżej faktyczne wyjścia każdego modelu. Otwórz w przeglądarce i porównaj jakość wizualną, interaktywność i wydajność:

☀️ Symulator Układu Słonecznego

ModelCzas generowaniaDemo
GPT-5.6 Sol11 min🚀 Otwórz demo →
Kimi K345 min🚀 Otwórz demo →

🌃 Renderer miasta

ModelCzas generowaniaDemo
GPT-5.6 Sol11 + 33 min🚀 Otwórz demo →
Kimi K33+ godz.🚀 Otwórz demo →
Qwen3.8Max<10 min × 2🚀 Otwórz demo →

🎯 Co to oznacza dla deweloperów

💡 Przewodnik wyboru modelu
  • Potrzebujesz najlepszej jakości wizualnej? → GPT-5.6 Sol (Codex). Najlepsze shadery, najbardziej dopracowane wyjście.
  • Potrzebujesz szybkości? → Qwen3.8Max. Błyskawiczny, a jakość wystarcza do prototypowania.
  • Złożone 3D wielosystemowe? → Na razie omijaj Kimi K3. Błyszczy w prostszych zadaniach, ale słabnie przy systemach powiązanych.
  • Wrażliwy na koszt? → Qwen3.8Max daje najlepszy stosunek czasu do jakości.

Różnica między modelami to nie tylko szybkość — chodzi o sufit złożoności. GPT-5.6 Sol radzi sobie z promptami o 15+ powiązanych systemach shaderów. Qwen3.8Max jest szybki, ale może wymagać przebiegów dopracowania. Kimi K3 ma niższy sufit przy złożonych zadaniach 3D.

Dla generacji HTML w pojedynczym pliku — nowego testu „vibe coding" — GPT-5.6 Sol obecnie prowadzi jakością, a Qwen3.8Max prowadzi przepustowością. Wybieraj według priorytetu.

📎 Źródło

Cały kod, prompty i wyniki testów są open source: github.com/OBdangshang07/AI_project

Test przeprowadził użytkownik GitHub OBdangshang07. Demo odtworzone z oryginalnych plików wyjściowych HTML.