⚡ Overblik
Vi testede tre frontier AI-modeller på en brutal kodeudfordring: generér en komplet, filmkvalitets Three.js-solsystem-simulator i en enkelt HTML-fil — alle procedurale teksturer, custom-shaders, bloom-post-processing og interaktive kontroller, nul eksterne ressourcer.
Samme prompt, tre modeller, ansigt-til-ansigt. Prompten specificerede 15+ himmellegemer med præcise shader-krav (multi-lag FBM-støj, hvirvel-støj, cellulær støj), 3 glow-lag på solen, Jupiters store røde plet med spiralkanter, Saturns Cassini-opdeling, Jordens bylys på den mørke side og mere. Ingen genveje tilladt.
🤖 Testede modeller
| Model | Værktøj | Opgave 1: Solsystem | Opgave 2: By-rendering |
|---|---|---|---|
| GPT-5.6 Sol | Codex | 11 min | 11 + 33 min (2 runder) |
| Kimi K3 | Kimi Code | 45 min | 3+ timer, runde 2 opgivet |
| Qwen3.8Max | Direkte | — | <10 min (2 runder) |
Dette er ikke en formel benchmark — det er en virkelig stresstest foretaget af GitHub-brugeren OBdangshang07. Samme prompt, samme forventninger, målt wall-clock-tid fra værktøjsaktivering til fuldendt output. Kvalitet bedømt ud fra visuel lighed og kodefuldstændighed.
🌌 Opgave 1: Solsystem-simulator
Prompten krævede et solsystem i filmkvalitet med 15+ himmellegemer, som hvert krævede custom ShaderMaterial med multi-lag-støj. Nøglekrav:
- Solen: Dynamisk plasma-tekstur med 3 glow-lag, solpletter, solvindspartikler
- Jupiter: Multi-lag strakt støj-bånd, store røde plet med spiralkanter, 3+ mindre hvirvler
- Saturn: Multi-lag gennemsigtige ringe med Cassini-opdeling, partikelspredning via shader
discard - Jorden: Hav-spejlglimt, bylys på den mørke side, Fresnel-atmosfæreskal
- Måner: 4 galileiske måner + 4 saturnske måner, hver med unik procedural tekstur
Resultater
| Aspekt | GPT-5.6 Sol (11 min) | Kimi K3 (45 min) |
|---|---|---|
| Visuel lighed | ⭐⭐⭐⭐⭐ Fremragende shaders, Jupiters bånd fremstår organiske | ⭐⭐⭐⭐ Godt, men nogle legemer bruger simplere støj |
| Kodefuldstændighed | Alle 15+ legemer, alle måner inkluderet | Alle legemer til stede, nogle måner simplificeret |
| Interaktivitet | Glatte bane-kontroller, infopaneler, tidsforvrængning | Lignende kontroller, lidt mindre poleret UI |
| Post-processing | UnrealBloomPass velindstillet | Bloom til stede, men mindre raffineret |
| Stabilitet | Stabil ved 60 fps | Lejlighedsvise billedfald på svagere GPU'er |
🏙️ Opgave 2: By-rendering
En sværere udfordring: generér en realtids metropol-rendering med 50+ justerbare parametre, procedural uendelig by, dynamisk dag/natt-cyklus, atmosfærisk spredning og tætte 3D-bygningsklynger med unikke teksturer.
Resultater
| Model | Runde 1 | Runde 2 (forfining) | Bygningstæthed | Teksturkvalitet |
|---|---|---|---|---|
| Qwen3.8Max | <10 min | <10 min | ⭐⭐⭐⭐⭐ Tæt, varieret | ⭐⭐⭐⭐ God procedural |
| GPT-5.6 Sol | 11 min | 33 min | ⭐⭐⭐⭐ Tæt | ⭐⭐⭐⭐⭐ Fremragende detalje |
| Kimi K3 | 3+ timer | ❌ Opgivet | ⭐⭐⭐ Moderat | ⭐⭐⭐ Anstændig |
Kimi K3 brugte over 3 timer på første runde og kunne ikke fuldføre den anden. By-renderingsopgaven afslørede K3's svaghed ved generering af kompleks, ydeevne-følsom 3D-kode med mange indbyrdes afhængige systemer (veje, trafik, belysning, bygningsgenerering).
📊 Vigtigste fund
🏎️ Hastighed
Qwen3.8Max er farten-kongen — begge runder på under 10 minutter totalt. GPT-5.6 Sol er konsistent (~11 min pr. opgave). Kimi K3 er 3-4 gange langsommere på komplekse opgaver.
🎨 Kvalitet
GPT-5.6 Sol producerer den bedste visuelle kvalitet — dens shaders er mere raffinerede, støjlagene mere organiske, og post-processing er bedre indstillet. Qwen3.8Max bytter noget visuel polering ud med rå fart. Kimi K3's output er funktionelt, men mindre filmisk.
🔧 Pålidelighed
GPT-5.6 Sol er den mest pålidelige — den fuldførte begge opgaver fuldt ud. Qwen3.8Max er hurtig, men kan kræve en forfiningsrunde. Kimi K3 kan timeoute på komplekse multisystem-opgaver.
🎮 Live demos — prøv dem selv
Herunder er de faktiske output fra hver model. Åbn dem i din browser og sammenlign visuel kvalitet, interaktivitet og ydeevne:
☀️ Solsystem-simulator
| Model | Genereringstid | Demo |
|---|---|---|
| GPT-5.6 Sol | 11 min | 🚀 Start demo → |
| Kimi K3 | 45 min | 🚀 Start demo → |
🌃 By-rendering
| Model | Genereringstid | Demo |
|---|---|---|
| GPT-5.6 Sol | 11 + 33 min | 🚀 Start demo → |
| Kimi K3 | 3+ timer | 🚀 Start demo → |
| Qwen3.8Max | <10 min × 2 | 🚀 Start demo → |
🎯 Hvad det betyder for udviklere
- Brug for den bedste visuelle kvalitet? → GPT-5.6 Sol (Codex). Bedste shaders, mest poleret output.
- Brug for fart? → Qwen3.8Max. Lynhurtig, god nok kvalitet til prototyping.
- Kompleks multisystem-3D? → Undgå Kimi K3 indtil videre. Den er stærk til simplere opgaver, men kæmper med indbyrdes forbundne systemer.
- Prisfølsom? → Qwen3.8Max leverer det bedste tid-til-kvalitet-forhold.
Forskellen mellem modellerne er ikke kun hastighed — det handler om kompleksitetstaget. GPT-5.6 Sol kan håndtere prompts med 15+ indbyrdes afhængige shadersystemer. Qwen3.8Max er hurtig, men kan kræve forfiningsrunder. Kimi K3 har et lavere tag på komplekse 3D-opgaver.
Til generering af enkeltfil-HTML — det fremvoksende "vibe coding"-benchmark — leder GPT-5.6 Sol i øjeblikket på kvalitet, mens Qwen3.8Max leder på gennemløb. Vælg ud fra din prioritet.
📎 Kilde
Al kode, prompts og testresultater er open source: github.com/OBdangshang07/AI_project
Test udført af GitHub-brugeren OBdangshang07. Demoer reproduceret med originale HTML-outputfiler.