⚡ Overzicht

We hebben drie frontier-AI-modellen op een meedogenloze programmeeruitdaging gezet: genereer een filmwaardige Three.js-zonnestelselsimulator in één enkel HTML-bestand — volledig procedurele texturen, custom shaders, bloom-postprocessing en interactieve besturing, zonder externe assets.

🎯 De uitdaging
Dezelfde prompt, drie modellen, head-to-head. De prompt specificeerde 15+ hemellichamen met exacte shader-eisen (meerlaagse FBM-ruis, vortex-ruis, cellulaire ruis), 3 gloedlagen op de zon, de Grote Rode Vlek van Jupiter met spiraalranden, de Cassini-scheiding van Saturnus, de stadslichten van de aarde aan de nachtzijde, en meer. Snelkookpunt-gedoe was niet toegestaan.

🤖 Geteste modellen

ModelToolTaak 1: ZonnestelselTaak 2: Stad-renderer
GPT-5.6 SolCodex11 min11 + 33 min (2 ronden)
Kimi K3Kimi Code45 min3+ uur, ronde 2 opgegeven
Qwen3.8MaxDirect<10 min (2 ronden)
⚠️ Methodologische noot
Dit is geen formele benchmark — het is een realistische stresstest door GitHub-gebruiker OBdangshang07. Dezelfde prompt, dezelfde verwachtingen, gemeten als wandkloktijd van tool-aanroep tot complete output. Kwaliteit beoordeeld op visuele getrouwheid en code-volledigheid.

🌌 Taak 1: Zonnestelselsimulator

De prompt eiste een zonnestelsel van cinematografische kwaliteit met 15+ hemellichamen, elk met een eigen ShaderMaterial met meerlaagse ruis. Belangrijkste eisen:

  • Zon: Dynamische plasma-textuur met 3 gloedlagen, zonnevlekken, zonnewinddeeltjes
  • Jupiter: Meerlaagse uitgerekte ruisbanden, Grote Rode Vlek met spiraalranden, 3+ kleinere vortexen
  • Saturnus: Meerlaagse doorzichtige ringen met Cassini-scheiding, deeltjesverstrooiing via shader-discard
  • Aarde: Spiegelende hooglichten op oceanen, stadslichten aan de nachtzijde, Fresnel-atmosfeerschil
  • Manen: 4 Galileïsche manen + 4 Saturnus-manen, elk met unieke procedurele texturen

Resultaten

AspectGPT-5.6 Sol (11 min)Kimi K3 (45 min)
Visuele getrouwheid⭐⭐⭐⭐⭐ Uitstekende shaders, Jupiter-banden lijken organisch⭐⭐⭐⭐ Goed, maar sommige hemellichamen gebruiken eenvoudigere ruis
Code-volledigheidAlle 15+ hemellichamen, alle manen inbegrepenAlle hemellichamen aanwezig, sommige manen vereenvoudigd
InteractiviteitVloeiende baanbesturing, infopanelen, tijdvervormingVergelijkbare besturing, ietwat minder gepolijste UI
PostprocessingUnrealBloomPass mooi afgesteldBloom aanwezig maar minder verfijnd
StabiliteitStabiel op 60fpsSoms frame-daling op zwakkere GPU's

🏙️ Taak 2: Stad-renderer

Een zwaardere uitdaging: genereer een real-time metropool-renderer met 50+ instelbare parameters, een procedurele oneindige stad, een dynamische dag/nacht-cyclus, atmosferische verstrooiing en dichte 3D-gebouwenclusters met unieke texturen.

Resultaten

ModelRonde 1Ronde 2 (verfijning)GebouwdichtheidTextuurkwaliteit
Qwen3.8Max<10 min<10 min⭐⭐⭐⭐⭐ Dicht, gevarieerd⭐⭐⭐⭐ Goede procedurele texturen
GPT-5.6 Sol11 min33 min⭐⭐⭐⭐ Dicht⭐⭐⭐⭐⭐ Uitstekend detail
Kimi K33+ uur❌ Opgegeven⭐⭐⭐ Gematigd⭐⭐⭐ Redelijk
🚨 Kimi K3 had het zwaar
Kimi K3 had meer dan 3 uur nodig voor de eerste ronde en kon de tweede niet afmaken. De taak van de stad-renderer legde de zwakte van K3 bloot bij het genereren van complexe, prestatiegevoelige 3D-code met veel onderling afhankelijke systemen (wegen, verkeer, verlichting, gebouwgeneratie).

📊 Belangrijkste bevindingen

🏎️ Snelheid

Qwen3.8Max is de snelheidskoning — beide ronden samen onder de 10 minuten. GPT-5.6 Sol is consistent (~11 min per taak). Kimi K3 is 3–4× trager bij complexe taken.

🎨 Kwaliteit

GPT-5.6 Sol levert de beste visuele kwaliteit — de shaders zijn verfijnder, de ruislagen organischer en de postprocessing beter afgesteld. Qwen3.8Max ruilt wat visuele polish in voor brute snelheid. De output van Kimi K3 werkt, maar is minder filmisch.

🔧 Betrouwbaarheid

GPT-5.6 Sol is het meest betrouwbaar — het rondde beide taken volledig af. Qwen3.8Max is snel maar kan een verfijningsronde nodig hebben. Kimi K3 kan bij complexe multisysteem-taken time-outen.

🎮 Live demo's — probeer ze zelf

Hieronder de werkelijke output van elk model. Open ze in je browser en vergelijk visuele kwaliteit, interactiviteit en prestaties:

☀️ Zonnestelselsimulator

ModelGeneratietijdDemo
GPT-5.6 Sol11 min🚀 Demo starten →
Kimi K345 min🚀 Demo starten →

🌃 Stad-renderer

ModelGeneratietijdDemo
GPT-5.6 Sol11 + 33 min🚀 Demo starten →
Kimi K33+ uur🚀 Demo starten →
Qwen3.8Max<10 min × 2🚀 Demo starten →

🎯 Wat dit voor ontwikkelaars betekent

💡 Modelkeuze-handleiding
  • De beste visuele kwaliteit nodig? → GPT-5.6 Sol (Codex). Beste shaders, meest gepolijste output.
  • Snelheid nodig? → Qwen3.8Max. Bliksemsnel, voldoende kwaliteit voor prototyping.
  • Complexe multisysteem-3D? → Vermijd Kimi K3 voorlopig. Het blinkt uit bij eenvoudigere taken, maar worstelt met onderling verbonden systemen.
  • Kostenbewust? → Qwen3.8Max levert de beste tijd-tot-kwaliteit-verhouding.

Het verschil tussen de modellen gaat niet alleen over snelheid — het gaat over het complexiteitsplafond. GPT-5.6 Sol kan prompts aan met 15+ onderling afhankelijke shadersystemen. Qwen3.8Max is snel maar kan verfijningsronden nodig hebben. Kimi K3 heeft een lager plafond bij complexe 3D-taken.

Voor het genereren van HTML in één bestand — de opkomende "vibe coding"-benchmark — leidt GPT-5.6 Sol momenteel in kwaliteit, terwijl Qwen3.8Max leidt in doorvoer. Kies op basis van je prioriteit.

📎 Bron

Alle code, prompts en testresultaten zijn open source: github.com/OBdangshang07/AI_project

Test uitgevoerd door GitHub-gebruiker OBdangshang07. Demo's gereproduceerd met de originele HTML-outputbestanden.