⚡ Overzicht
We hebben drie frontier-AI-modellen op een meedogenloze programmeeruitdaging gezet: genereer een filmwaardige Three.js-zonnestelselsimulator in één enkel HTML-bestand — volledig procedurele texturen, custom shaders, bloom-postprocessing en interactieve besturing, zonder externe assets.
Dezelfde prompt, drie modellen, head-to-head. De prompt specificeerde 15+ hemellichamen met exacte shader-eisen (meerlaagse FBM-ruis, vortex-ruis, cellulaire ruis), 3 gloedlagen op de zon, de Grote Rode Vlek van Jupiter met spiraalranden, de Cassini-scheiding van Saturnus, de stadslichten van de aarde aan de nachtzijde, en meer. Snelkookpunt-gedoe was niet toegestaan.
🤖 Geteste modellen
| Model | Tool | Taak 1: Zonnestelsel | Taak 2: Stad-renderer |
|---|---|---|---|
| GPT-5.6 Sol | Codex | 11 min | 11 + 33 min (2 ronden) |
| Kimi K3 | Kimi Code | 45 min | 3+ uur, ronde 2 opgegeven |
| Qwen3.8Max | Direct | — | <10 min (2 ronden) |
Dit is geen formele benchmark — het is een realistische stresstest door GitHub-gebruiker OBdangshang07. Dezelfde prompt, dezelfde verwachtingen, gemeten als wandkloktijd van tool-aanroep tot complete output. Kwaliteit beoordeeld op visuele getrouwheid en code-volledigheid.
🌌 Taak 1: Zonnestelselsimulator
De prompt eiste een zonnestelsel van cinematografische kwaliteit met 15+ hemellichamen, elk met een eigen ShaderMaterial met meerlaagse ruis. Belangrijkste eisen:
- Zon: Dynamische plasma-textuur met 3 gloedlagen, zonnevlekken, zonnewinddeeltjes
- Jupiter: Meerlaagse uitgerekte ruisbanden, Grote Rode Vlek met spiraalranden, 3+ kleinere vortexen
- Saturnus: Meerlaagse doorzichtige ringen met Cassini-scheiding, deeltjesverstrooiing via shader-
discard - Aarde: Spiegelende hooglichten op oceanen, stadslichten aan de nachtzijde, Fresnel-atmosfeerschil
- Manen: 4 Galileïsche manen + 4 Saturnus-manen, elk met unieke procedurele texturen
Resultaten
| Aspect | GPT-5.6 Sol (11 min) | Kimi K3 (45 min) |
|---|---|---|
| Visuele getrouwheid | ⭐⭐⭐⭐⭐ Uitstekende shaders, Jupiter-banden lijken organisch | ⭐⭐⭐⭐ Goed, maar sommige hemellichamen gebruiken eenvoudigere ruis |
| Code-volledigheid | Alle 15+ hemellichamen, alle manen inbegrepen | Alle hemellichamen aanwezig, sommige manen vereenvoudigd |
| Interactiviteit | Vloeiende baanbesturing, infopanelen, tijdvervorming | Vergelijkbare besturing, ietwat minder gepolijste UI |
| Postprocessing | UnrealBloomPass mooi afgesteld | Bloom aanwezig maar minder verfijnd |
| Stabiliteit | Stabiel op 60fps | Soms frame-daling op zwakkere GPU's |
🏙️ Taak 2: Stad-renderer
Een zwaardere uitdaging: genereer een real-time metropool-renderer met 50+ instelbare parameters, een procedurele oneindige stad, een dynamische dag/nacht-cyclus, atmosferische verstrooiing en dichte 3D-gebouwenclusters met unieke texturen.
Resultaten
| Model | Ronde 1 | Ronde 2 (verfijning) | Gebouwdichtheid | Textuurkwaliteit |
|---|---|---|---|---|
| Qwen3.8Max | <10 min | <10 min | ⭐⭐⭐⭐⭐ Dicht, gevarieerd | ⭐⭐⭐⭐ Goede procedurele texturen |
| GPT-5.6 Sol | 11 min | 33 min | ⭐⭐⭐⭐ Dicht | ⭐⭐⭐⭐⭐ Uitstekend detail |
| Kimi K3 | 3+ uur | ❌ Opgegeven | ⭐⭐⭐ Gematigd | ⭐⭐⭐ Redelijk |
Kimi K3 had meer dan 3 uur nodig voor de eerste ronde en kon de tweede niet afmaken. De taak van de stad-renderer legde de zwakte van K3 bloot bij het genereren van complexe, prestatiegevoelige 3D-code met veel onderling afhankelijke systemen (wegen, verkeer, verlichting, gebouwgeneratie).
📊 Belangrijkste bevindingen
🏎️ Snelheid
Qwen3.8Max is de snelheidskoning — beide ronden samen onder de 10 minuten. GPT-5.6 Sol is consistent (~11 min per taak). Kimi K3 is 3–4× trager bij complexe taken.
🎨 Kwaliteit
GPT-5.6 Sol levert de beste visuele kwaliteit — de shaders zijn verfijnder, de ruislagen organischer en de postprocessing beter afgesteld. Qwen3.8Max ruilt wat visuele polish in voor brute snelheid. De output van Kimi K3 werkt, maar is minder filmisch.
🔧 Betrouwbaarheid
GPT-5.6 Sol is het meest betrouwbaar — het rondde beide taken volledig af. Qwen3.8Max is snel maar kan een verfijningsronde nodig hebben. Kimi K3 kan bij complexe multisysteem-taken time-outen.
🎮 Live demo's — probeer ze zelf
Hieronder de werkelijke output van elk model. Open ze in je browser en vergelijk visuele kwaliteit, interactiviteit en prestaties:
☀️ Zonnestelselsimulator
| Model | Generatietijd | Demo |
|---|---|---|
| GPT-5.6 Sol | 11 min | 🚀 Demo starten → |
| Kimi K3 | 45 min | 🚀 Demo starten → |
🌃 Stad-renderer
| Model | Generatietijd | Demo |
|---|---|---|
| GPT-5.6 Sol | 11 + 33 min | 🚀 Demo starten → |
| Kimi K3 | 3+ uur | 🚀 Demo starten → |
| Qwen3.8Max | <10 min × 2 | 🚀 Demo starten → |
🎯 Wat dit voor ontwikkelaars betekent
- De beste visuele kwaliteit nodig? → GPT-5.6 Sol (Codex). Beste shaders, meest gepolijste output.
- Snelheid nodig? → Qwen3.8Max. Bliksemsnel, voldoende kwaliteit voor prototyping.
- Complexe multisysteem-3D? → Vermijd Kimi K3 voorlopig. Het blinkt uit bij eenvoudigere taken, maar worstelt met onderling verbonden systemen.
- Kostenbewust? → Qwen3.8Max levert de beste tijd-tot-kwaliteit-verhouding.
Het verschil tussen de modellen gaat niet alleen over snelheid — het gaat over het complexiteitsplafond. GPT-5.6 Sol kan prompts aan met 15+ onderling afhankelijke shadersystemen. Qwen3.8Max is snel maar kan verfijningsronden nodig hebben. Kimi K3 heeft een lager plafond bij complexe 3D-taken.
Voor het genereren van HTML in één bestand — de opkomende "vibe coding"-benchmark — leidt GPT-5.6 Sol momenteel in kwaliteit, terwijl Qwen3.8Max leidt in doorvoer. Kies op basis van je prioriteit.
📎 Bron
Alle code, prompts en testresultaten zijn open source: github.com/OBdangshang07/AI_project
Test uitgevoerd door GitHub-gebruiker OBdangshang07. Demo's gereproduceerd met de originele HTML-outputbestanden.