⚡ Oversikt
Vi testet tre frontier-AI-modeller på en brutal kode-utfordring: generere en komplett, filmkvalitets Three.js-solsystem-simulator i én enkelt HTML-fil — alle prosedyriske teksturer, egendefinerte shaders, bloom-postprosessering og interaktive kontroller, null eksterne ressurser.
Samme prompt, tre modeller, mann-mot-mann. Prompten spesifiserte 15+ himmellegemer med nøyaktige shader-krav (flerlags FBM-støy, virvelstøy, cellulær støy), tre glowlag på solen, Jupiters store røde flekk med spiral-kanter, Saturns Cassini-skille, bylysene på jordens nattside og mer. Ingen snarveier tillatt.
🤖 Modeller som ble testet
| Modell | Verktøy | Oppgave 1: Solsystem | Oppgave 2: By-renderer |
|---|---|---|---|
| GPT-5.6 Sol | Codex | 11 min | 11 + 33 min (to runder) |
| Kimi K3 | Kimi Code | 45 min | 3+ timer, runde 2 oppgitt |
| Qwen3.8Max | Direkte | — | <10 min (to runder) |
Dette er ikke en formell benchmark — det er en reell stresstest av GitHub-brukeren OBdangshang07. Samme prompt, samme forventninger, målt veggklokke-tid fra verktøykall til komplett utdata. Kvalitet bedømt etter visuelt innhold og kodefullstendighet.
🌌 Oppgave 1: Solsystem-simulator
Prompten krevde et filmkvalitets-solsystem med 15+ himmellegemer, der hvert krever egendefinert ShaderMaterial med flerlags støy. Hovedkrav:
- Solen: Dynamisk plasmatekstur med tre glowlag, solflekker, solvind-partikler
- Jupiter: Flerlags strekt støy-bånd, store røde flekk med spiral-kanter, 3+ mindre virvler
- Saturn: Flerlags halvgjennomsiktige ringer med Cassini-skille, partikkelspredning via shader-
discard - Jorden: Spekulære høylys på hav, bylys på nattsiden, Fresnel-atmosfæriskall
- Måner: 4 galileiske måner + 4 saturnmåner, hver med unike prosedyriske teksturer
Resultater
| Aspekt | GPT-5.6 Sol (11 min) | Kimi K3 (45 min) |
|---|---|---|
| Visuell kvalitet | ⭐⭐⭐⭐⭐ Utmerkede shadere, Jupiters bånd ser organiske ut | ⭐⭐⭐⭐ Bra, men noen legemer bruker enklere støy |
| Kodefullstendighet | Alle 15+ legemer, alle måner inkludert | Alle legemer til stede, noen måner forenklet |
| Interaktivitet | Smidige bane-kontroller, infopaneler, tidsforvrengning | Lignende kontroller, noe mindre pussa UI |
| Postprosessering | UnrealBloomPass velinnstilt | Bloom til stede, men mindre raffinert |
| Stabilitet | Stabil på 60 fps | Av og til billedfall på svakere GPU-er |
🏙️ Oppgave 2: By-renderer
En vanskeligere utfordring: generere en sanntids metropol-renderer med 50+ justerbare parametere, prosedyrisk uendelig by, dynamisk dag/natt-syklus, atmosfærisk spredning og tette 3D-bygningsklynger med unike teksturer.
Resultater
| Modell | Runde 1 | Runde 2 (finpuss) | Bygningstetthet | Teksturkvalitet |
|---|---|---|---|---|
| Qwen3.8Max | <10 min | <10 min | ⭐⭐⭐⭐⭐ Tett, variert | ⭐⭐⭐⭐ God prosedyrisk |
| GPT-5.6 Sol | 11 min | 33 min | ⭐⭐⭐⭐ Tett | ⭐⭐⭐⭐⭐ Utmerket detalj |
| Kimi K3 | 3+ timer | ❌ Oppgitt | ⭐⭐⭐ Middels | ⭐⭐⭐ Akseptabel |
Kimi K3 brukte over 3 timer på første runde og klarte ikke å fullføre den andre. By-renderer-oppgaven avslørte K3 sin svakhet i å generere kompleks, ytelsesfølsom 3D-kode med mange gjensidig avhengige systemer (veier, trafikk, lys, bygningsgenerering).
📊 Hovedfunn
🏎️ Hastighet
Qwen3.8Max er hastighetskongen — begge runder til sammen under 10 minutter. GPT-5.6 Sol er stabil (~11 min per oppgave). Kimi K3 er 3–4 ganger tregere på komplekse oppgaver.
🎨 Kvalitet
GPT-5.6 Sol gir best visuell kvalitet — shaderne er mer raffinerte, støylagene mer organiske, og postprosesseringen bedre innstilt. Qwen3.8Max bytter bort noe visuelt puss mot rå fart. Kimi K3 sin utdata fungerer, men er mindre filmatisk.
🔧 Pålitelighet
GPT-5.6 Sol er den mest pålitelige — fullførte begge oppgavene i sin helhet. Qwen3.8Max er rask, men kan trenge en finpuss-runde. Kimi K3 kan få tidsavbrudd på komplekse multisystem-oppgaver.
🎮 Direkte-demoer — prøv selv
Nedenfor er de faktiske utdataene fra hver modell. Åpne dem i nettleseren og sammenlikn visuell kvalitet, interaktivitet og ytelse:
☀️ Solsystem-simulator
| Modell | Genereringstid | Demo |
|---|---|---|
| GPT-5.6 Sol | 11 min | 🚀 Start demo → |
| Kimi K3 | 45 min | 🚀 Start demo → |
🌃 By-renderer
| Modell | Genereringstid | Demo |
|---|---|---|
| GPT-5.6 Sol | 11 + 33 min | 🚀 Start demo → |
| Kimi K3 | 3+ timer | 🚀 Start demo → |
| Qwen3.8Max | <10 min × 2 | 🚀 Start demo → |
🎯 Hva dette betyr for utviklere
- Trenger du best visuell kvalitet? → GPT-5.6 Sol (Codex). Beste shadere, mest pussa utdata.
- Trenger du fart? → Qwen3.8Max. Lynrask, god nok kvalitet for prototyping.
- Kompleks multisystem-3D? → Unngå Kimi K3 foreløpig. Den utmerker seg på enklere oppgaver, men sliter med sammenkoblede systemer.
- Kostnadsfølsom? → Qwen3.8Max gir best forhold mellom tid og kvalitet.
Forskjellen mellom modellene er ikke bare hastighet — det handler om kompleksitetstaket. GPT-5.6 Sol kan håndtere prompter med 15+ gjensidig avhengige shadersystemer. Qwen3.8Max er rask, men kan trenge finpuss-runder. Kimi K3 har lavere tak på komplekse 3D-oppgaver.
For generering av enkeltfil-HTML — det fremvoksende "vibe coding"-benchmarket — leder GPT-5.6 Sol foreløpig på kvalitet, mens Qwen3.8Max leder på gjennomstrømming. Velg ut fra prioritet.
📎 Kilde
All kode, prompter og testresultater er åpen kildekode: github.com/OBdangshang07/AI_project
Test utført av GitHub-brukeren OBdangshang07. Demoer reprodusert med de opprinnelige HTML-utdatafilene.