⚡ Översikt
Vi testade tre frontlinje-AI-modeller på en brutal kodningsutmaning: generera en komplett, filmkvalitativ Three.js-solsystemsimulator i en enda HTML-fil — alla procedurella texturer, anpassade shaders, bloom-efterbearbetning och interaktiva kontroller, och noll externa tillgångar.
Samma prompt, tre modeller, ansikte mot ansikte. Prompten specificerade 15+ himlakroppar med exakta shader-krav (flerskikts FBM-brus, virvelbrus, cellulärt brus), tre glödlager på solen, Jupiters stora röda fläck med spiralkanter, Saturnus Cassini-delning, jordens stadsbelysning på nattsidan och mer därtill. Inga genvägar tillåtna.
🤖 Testade modeller
| Modell | Verktyg | Uppgift 1: Solsystem | Uppgift 2: Stadrenderare |
|---|---|---|---|
| GPT-5.6 Sol | Codex | 11 min | 11 + 33 min (två omgångar) |
| Kimi K3 | Kimi Code | 45 min | 3+ timmar, omgång 2 övergiven |
| Qwen3.8Max | Direkt | — | <10 min (två omgångar) |
Det här är inte ett formellt benchmark — det är ett verkligt stresstest av GitHub-användaren OBdangshang07. Samma prompt, samma förväntningar, mätt väggklockstid från verktygsanrop till komplett utdata. Kvaliteten bedömdes utifrån visuell trohet och kodkompletthet.
🌌 Uppgift 1: Solsystemsimulatorn
Prompten krävde ett solsystem i filmklass med 15+ himlakroppar, där var och en krävde anpassad ShaderMaterial med flerskiktsbrus. Nyckelkrav:
- Solen: Dynamisk plasmaturering med 3 glödlager, solfläckar, solvindspartiklar
- Jupiter: Flerskikts utsträckta brusband, stora röda fläcken med spiralkanter, 3+ mindre virvlar
- Saturnus: Flerskikts halvgenomskinliga ringar med Cassini-delning, partikelspridning via shader-
discard - Jorden: Speglande högdagrar på haven, stadsbelysning på nattsidan, Fresnel-atmosfärsskal
- Månar: 4 galileiska månar + 4 saturniska månar, var och en med unika procedurella texturer
Resultat
| Aspekt | GPT-5.6 Sol (11 min) | Kimi K3 (45 min) |
|---|---|---|
| Visuell trohet | ⭐⭐⭐⭐⭐ Utmärkta shaders, Jupiters band känns organiska | ⭐⭐⭐⭐ Bra, men vissa kroppar använder enklare brus |
| Kodkompletthet | Alla 15+ kroppar, alla månar inkluderade | Alla kroppar närvarande, vissa månar förenklade |
| Interaktivitet | Mjuka omloppsbanekontroller, infopaneler, tidsförskjutning | Liknande kontroller, något mindre polerat UI |
| Efterbearbetning | Välavstämt UnrealBloomPass | Bloom finns men mindre raffinerat |
| Stabilitet | Stabil vid 60 fps | Tillfälliga tappade bildrutor på svagare GPU:er |
🏙️ Uppgift 2: Stadrenderaren
En svårare utmaning: generera en realtidsrenderare av en storstad med 50+ justerbara parametrar, procedurell oändlig stad, dynamisk dag/natt-cykel, atmosfärisk spridning och täta 3D-byggnadskluster med unika texturer.
Resultat
| Modell | Omgång 1 | Omgång 2 (förädling) | Byggnadstäthet | Texturkvalitet |
|---|---|---|---|---|
| Qwen3.8Max | <10 min | <10 min | ⭐⭐⭐⭐⭐ Tät, varierad | ⭐⭐⭐⭐ Bra procedurell |
| GPT-5.6 Sol | 11 min | 33 min | ⭐⭐⭐⭐ Tät | ⭐⭐⭐⭐⭐ Utmärkta detaljer |
| Kimi K3 | 3+ timmar | ❌ Övergiven | ⭐⭐⭐ Måttlig | ⭐⭐⭐ Hyfsad |
Kimi K3 tog över 3 timmar för den första omgången och kunde inte slutföra den andra. Stadrenderaruppgiften blottlade K3:s svaghet i att generera komplex, prestandakänslig 3D-kod med många sinsemellan beroende system (vägar, trafik, belysning, byggnadsgenerering).
📊 Huvudfynd
🏎️ Hastighet
Qwen3.8Max är hastighetskungen — båda omgångarna på under 10 minuter totalt. GPT-5.6 Sol är konsekvent (~11 min per uppgift). Kimi K3 är 3–4× långsammare på komplexa uppgifter.
🎨 Kvalitet
GPT-5.6 Sol producerar den bästa visuella kvaliteten — dess shaders är mer raffinerade, bruslagren mer organiska och efterbearbetningen bättre avstämd. Qwen3.8Max byter bort viss visuell polering mot rå hastighet. Kimi K3:s utdata är funktionell men mindre filmisk.
🔧 Pålitlighet
GPT-5.6 Sol är den mest pålitliga — den slutförde båda uppgifterna fullt ut. Qwen3.8Max är snabb men kan behöva en förädlingsomgång. Kimi K3 kan timeouta på komplexa flersystemsuppgifter.
🎮 Live-demoer — testa själv
Nedan är de faktiska utdata från varje modell. Öppna dem i din webbläsare och jämför visuell kvalitet, interaktivitet och prestanda:
☀️ Solsystemsimulatorn
| Modell | Generationstid | Demo |
|---|---|---|
| GPT-5.6 Sol | 11 min | 🚀 Starta demo → |
| Kimi K3 | 45 min | 🚀 Starta demo → |
🌃 Stadrenderaren
| Modell | Generationstid | Demo |
|---|---|---|
| GPT-5.6 Sol | 11 + 33 min | 🚀 Starta demo → |
| Kimi K3 | 3+ timmar | 🚀 Starta demo → |
| Qwen3.8Max | <10 min × 2 | 🚀 Starta demo → |
🎯 Vad det betyder för utvecklare
- Behöver du bästa visuella kvalitet? → GPT-5.6 Sol (Codex). Bäst shaders, mest polerad utdata.
- Behöver du hastighet? → Qwen3.8Max. Blixtsnabb, tillräckligt bra kvalitet för prototypanvändning.
- Komplex flersystems-3D? → Undvik Kimi K3 tills vidare. Den utmärker sig på enklare uppgifter men kämpar med sammankopplade system.
- Kostnadskänsligt? → Qwen3.8Max levererar bästa förhållandet mellan tid och kvalitet.
Mellanrummet mellan modellerna handlar inte bara om hastighet — det handlar om komplexitetstaket. GPT-5.6 Sol kan hantera promptar med 15+ sinsemellan beroende shadersystem. Qwen3.8Max är snabb men kan behöva förädlingsomgångar. Kimi K3 har ett lägre tak på komplexa 3D-uppgifter.
När det gäller generering i en enda HTML-fil — den framväxande "vibe coding"-benchmarket — leder GPT-5.6 Sol för närvarande i kvalitet, medan Qwen3.8Max leder i dataflöde. Välj utifrån din prioritet.
📎 Källa
All kod, alla promptar och testresultat är öppen källkod: github.com/OBdangshang07/AI_project
Testet genomfördes av GitHub-användaren OBdangshang07. Demoerna återskapades med de ursprungliga HTML-utdatafilerna.