⚡ Översikt

Vi testade tre frontlinje-AI-modeller på en brutal kodningsutmaning: generera en komplett, filmkvalitativ Three.js-solsystemsimulator i en enda HTML-fil — alla procedurella texturer, anpassade shaders, bloom-efterbearbetning och interaktiva kontroller, och noll externa tillgångar.

🎯 Utmaningen
Samma prompt, tre modeller, ansikte mot ansikte. Prompten specificerade 15+ himlakroppar med exakta shader-krav (flerskikts FBM-brus, virvelbrus, cellulärt brus), tre glödlager på solen, Jupiters stora röda fläck med spiralkanter, Saturnus Cassini-delning, jordens stadsbelysning på nattsidan och mer därtill. Inga genvägar tillåtna.

🤖 Testade modeller

ModellVerktygUppgift 1: SolsystemUppgift 2: Stadrenderare
GPT-5.6 SolCodex11 min11 + 33 min (två omgångar)
Kimi K3Kimi Code45 min3+ timmar, omgång 2 övergiven
Qwen3.8MaxDirekt<10 min (två omgångar)
⚠️ Metodnotis
Det här är inte ett formellt benchmark — det är ett verkligt stresstest av GitHub-användaren OBdangshang07. Samma prompt, samma förväntningar, mätt väggklockstid från verktygsanrop till komplett utdata. Kvaliteten bedömdes utifrån visuell trohet och kodkompletthet.

🌌 Uppgift 1: Solsystemsimulatorn

Prompten krävde ett solsystem i filmklass med 15+ himlakroppar, där var och en krävde anpassad ShaderMaterial med flerskiktsbrus. Nyckelkrav:

  • Solen: Dynamisk plasmaturering med 3 glödlager, solfläckar, solvindspartiklar
  • Jupiter: Flerskikts utsträckta brusband, stora röda fläcken med spiralkanter, 3+ mindre virvlar
  • Saturnus: Flerskikts halvgenomskinliga ringar med Cassini-delning, partikelspridning via shader-discard
  • Jorden: Speglande högdagrar på haven, stadsbelysning på nattsidan, Fresnel-atmosfärsskal
  • Månar: 4 galileiska månar + 4 saturniska månar, var och en med unika procedurella texturer

Resultat

AspektGPT-5.6 Sol (11 min)Kimi K3 (45 min)
Visuell trohet⭐⭐⭐⭐⭐ Utmärkta shaders, Jupiters band känns organiska⭐⭐⭐⭐ Bra, men vissa kroppar använder enklare brus
KodkompletthetAlla 15+ kroppar, alla månar inkluderadeAlla kroppar närvarande, vissa månar förenklade
InteraktivitetMjuka omloppsbanekontroller, infopaneler, tidsförskjutningLiknande kontroller, något mindre polerat UI
EfterbearbetningVälavstämt UnrealBloomPassBloom finns men mindre raffinerat
StabilitetStabil vid 60 fpsTillfälliga tappade bildrutor på svagare GPU:er

🏙️ Uppgift 2: Stadrenderaren

En svårare utmaning: generera en realtidsrenderare av en storstad med 50+ justerbara parametrar, procedurell oändlig stad, dynamisk dag/natt-cykel, atmosfärisk spridning och täta 3D-byggnadskluster med unika texturer.

Resultat

ModellOmgång 1Omgång 2 (förädling)ByggnadstäthetTexturkvalitet
Qwen3.8Max<10 min<10 min⭐⭐⭐⭐⭐ Tät, varierad⭐⭐⭐⭐ Bra procedurell
GPT-5.6 Sol11 min33 min⭐⭐⭐⭐ Tät⭐⭐⭐⭐⭐ Utmärkta detaljer
Kimi K33+ timmar❌ Övergiven⭐⭐⭐ Måttlig⭐⭐⭐ Hyfsad
🚨 Kimi K3 kämpade
Kimi K3 tog över 3 timmar för den första omgången och kunde inte slutföra den andra. Stadrenderaruppgiften blottlade K3:s svaghet i att generera komplex, prestandakänslig 3D-kod med många sinsemellan beroende system (vägar, trafik, belysning, byggnadsgenerering).

📊 Huvudfynd

🏎️ Hastighet

Qwen3.8Max är hastighetskungen — båda omgångarna på under 10 minuter totalt. GPT-5.6 Sol är konsekvent (~11 min per uppgift). Kimi K3 är 3–4× långsammare på komplexa uppgifter.

🎨 Kvalitet

GPT-5.6 Sol producerar den bästa visuella kvaliteten — dess shaders är mer raffinerade, bruslagren mer organiska och efterbearbetningen bättre avstämd. Qwen3.8Max byter bort viss visuell polering mot rå hastighet. Kimi K3:s utdata är funktionell men mindre filmisk.

🔧 Pålitlighet

GPT-5.6 Sol är den mest pålitliga — den slutförde båda uppgifterna fullt ut. Qwen3.8Max är snabb men kan behöva en förädlingsomgång. Kimi K3 kan timeouta på komplexa flersystemsuppgifter.

🎮 Live-demoer — testa själv

Nedan är de faktiska utdata från varje modell. Öppna dem i din webbläsare och jämför visuell kvalitet, interaktivitet och prestanda:

☀️ Solsystemsimulatorn

ModellGenerationstidDemo
GPT-5.6 Sol11 min🚀 Starta demo →
Kimi K345 min🚀 Starta demo →

🌃 Stadrenderaren

ModellGenerationstidDemo
GPT-5.6 Sol11 + 33 min🚀 Starta demo →
Kimi K33+ timmar🚀 Starta demo →
Qwen3.8Max<10 min × 2🚀 Starta demo →

🎯 Vad det betyder för utvecklare

💡 Guide för modellval
  • Behöver du bästa visuella kvalitet? → GPT-5.6 Sol (Codex). Bäst shaders, mest polerad utdata.
  • Behöver du hastighet? → Qwen3.8Max. Blixtsnabb, tillräckligt bra kvalitet för prototypanvändning.
  • Komplex flersystems-3D? → Undvik Kimi K3 tills vidare. Den utmärker sig på enklare uppgifter men kämpar med sammankopplade system.
  • Kostnadskänsligt? → Qwen3.8Max levererar bästa förhållandet mellan tid och kvalitet.

Mellanrummet mellan modellerna handlar inte bara om hastighet — det handlar om komplexitetstaket. GPT-5.6 Sol kan hantera promptar med 15+ sinsemellan beroende shadersystem. Qwen3.8Max är snabb men kan behöva förädlingsomgångar. Kimi K3 har ett lägre tak på komplexa 3D-uppgifter.

När det gäller generering i en enda HTML-fil — den framväxande "vibe coding"-benchmarket — leder GPT-5.6 Sol för närvarande i kvalitet, medan Qwen3.8Max leder i dataflöde. Välj utifrån din prioritet.

📎 Källa

All kod, alla promptar och testresultat är öppen källkod: github.com/OBdangshang07/AI_project

Testet genomfördes av GitHub-användaren OBdangshang07. Demoerna återskapades med de ursprungliga HTML-utdatafilerna.