⚡ Overblik

Vi testede tre frontier AI-modeller på en brutal kodeudfordring: generér en komplet, filmkvalitets Three.js-solsystem-simulator i en enkelt HTML-fil — alle procedurale teksturer, custom-shaders, bloom-post-processing og interaktive kontroller, nul eksterne ressourcer.

🎯 Udfordringen
Samme prompt, tre modeller, ansigt-til-ansigt. Prompten specificerede 15+ himmellegemer med præcise shader-krav (multi-lag FBM-støj, hvirvel-støj, cellulær støj), 3 glow-lag på solen, Jupiters store røde plet med spiralkanter, Saturns Cassini-opdeling, Jordens bylys på den mørke side og mere. Ingen genveje tilladt.

🤖 Testede modeller

ModelVærktøjOpgave 1: SolsystemOpgave 2: By-rendering
GPT-5.6 SolCodex11 min11 + 33 min (2 runder)
Kimi K3Kimi Code45 min3+ timer, runde 2 opgivet
Qwen3.8MaxDirekte<10 min (2 runder)
⚠️ Metode-note
Dette er ikke en formel benchmark — det er en virkelig stresstest foretaget af GitHub-brugeren OBdangshang07. Samme prompt, samme forventninger, målt wall-clock-tid fra værktøjsaktivering til fuldendt output. Kvalitet bedømt ud fra visuel lighed og kodefuldstændighed.

🌌 Opgave 1: Solsystem-simulator

Prompten krævede et solsystem i filmkvalitet med 15+ himmellegemer, som hvert krævede custom ShaderMaterial med multi-lag-støj. Nøglekrav:

  • Solen: Dynamisk plasma-tekstur med 3 glow-lag, solpletter, solvindspartikler
  • Jupiter: Multi-lag strakt støj-bånd, store røde plet med spiralkanter, 3+ mindre hvirvler
  • Saturn: Multi-lag gennemsigtige ringe med Cassini-opdeling, partikelspredning via shader discard
  • Jorden: Hav-spejlglimt, bylys på den mørke side, Fresnel-atmosfæreskal
  • Måner: 4 galileiske måner + 4 saturnske måner, hver med unik procedural tekstur

Resultater

AspektGPT-5.6 Sol (11 min)Kimi K3 (45 min)
Visuel lighed⭐⭐⭐⭐⭐ Fremragende shaders, Jupiters bånd fremstår organiske⭐⭐⭐⭐ Godt, men nogle legemer bruger simplere støj
KodefuldstændighedAlle 15+ legemer, alle måner inkluderetAlle legemer til stede, nogle måner simplificeret
InteraktivitetGlatte bane-kontroller, infopaneler, tidsforvrængningLignende kontroller, lidt mindre poleret UI
Post-processingUnrealBloomPass velindstilletBloom til stede, men mindre raffineret
StabilitetStabil ved 60 fpsLejlighedsvise billedfald på svagere GPU'er

🏙️ Opgave 2: By-rendering

En sværere udfordring: generér en realtids metropol-rendering med 50+ justerbare parametre, procedural uendelig by, dynamisk dag/natt-cyklus, atmosfærisk spredning og tætte 3D-bygningsklynger med unikke teksturer.

Resultater

ModelRunde 1Runde 2 (forfining)BygningstæthedTeksturkvalitet
Qwen3.8Max<10 min<10 min⭐⭐⭐⭐⭐ Tæt, varieret⭐⭐⭐⭐ God procedural
GPT-5.6 Sol11 min33 min⭐⭐⭐⭐ Tæt⭐⭐⭐⭐⭐ Fremragende detalje
Kimi K33+ timer❌ Opgivet⭐⭐⭐ Moderat⭐⭐⭐ Anstændig
🚨 Kimi K3 havde det svært
Kimi K3 brugte over 3 timer på første runde og kunne ikke fuldføre den anden. By-renderingsopgaven afslørede K3's svaghed ved generering af kompleks, ydeevne-følsom 3D-kode med mange indbyrdes afhængige systemer (veje, trafik, belysning, bygningsgenerering).

📊 Vigtigste fund

🏎️ Hastighed

Qwen3.8Max er farten-kongen — begge runder på under 10 minutter totalt. GPT-5.6 Sol er konsistent (~11 min pr. opgave). Kimi K3 er 3-4 gange langsommere på komplekse opgaver.

🎨 Kvalitet

GPT-5.6 Sol producerer den bedste visuelle kvalitet — dens shaders er mere raffinerede, støjlagene mere organiske, og post-processing er bedre indstillet. Qwen3.8Max bytter noget visuel polering ud med rå fart. Kimi K3's output er funktionelt, men mindre filmisk.

🔧 Pålidelighed

GPT-5.6 Sol er den mest pålidelige — den fuldførte begge opgaver fuldt ud. Qwen3.8Max er hurtig, men kan kræve en forfiningsrunde. Kimi K3 kan timeoute på komplekse multisystem-opgaver.

🎮 Live demos — prøv dem selv

Herunder er de faktiske output fra hver model. Åbn dem i din browser og sammenlign visuel kvalitet, interaktivitet og ydeevne:

☀️ Solsystem-simulator

ModelGenereringstidDemo
GPT-5.6 Sol11 min🚀 Start demo →
Kimi K345 min🚀 Start demo →

🌃 By-rendering

ModelGenereringstidDemo
GPT-5.6 Sol11 + 33 min🚀 Start demo →
Kimi K33+ timer🚀 Start demo →
Qwen3.8Max<10 min × 2🚀 Start demo →

🎯 Hvad det betyder for udviklere

💡 Guide til modelvalg
  • Brug for den bedste visuelle kvalitet? → GPT-5.6 Sol (Codex). Bedste shaders, mest poleret output.
  • Brug for fart? → Qwen3.8Max. Lynhurtig, god nok kvalitet til prototyping.
  • Kompleks multisystem-3D? → Undgå Kimi K3 indtil videre. Den er stærk til simplere opgaver, men kæmper med indbyrdes forbundne systemer.
  • Prisfølsom? → Qwen3.8Max leverer det bedste tid-til-kvalitet-forhold.

Forskellen mellem modellerne er ikke kun hastighed — det handler om kompleksitetstaget. GPT-5.6 Sol kan håndtere prompts med 15+ indbyrdes afhængige shadersystemer. Qwen3.8Max er hurtig, men kan kræve forfiningsrunder. Kimi K3 har et lavere tag på komplekse 3D-opgaver.

Til generering af enkeltfil-HTML — det fremvoksende "vibe coding"-benchmark — leder GPT-5.6 Sol i øjeblikket på kvalitet, mens Qwen3.8Max leder på gennemløb. Vælg ud fra din prioritet.

📎 Kilde

Al kode, prompts og testresultater er open source: github.com/OBdangshang07/AI_project

Test udført af GitHub-brugeren OBdangshang07. Demoer reproduceret med originale HTML-outputfiler.