⚡ Oversikt

Vi testet tre frontier-AI-modeller på en brutal kode-utfordring: generere en komplett, filmkvalitets Three.js-solsystem-simulator i én enkelt HTML-fil — alle prosedyriske teksturer, egendefinerte shaders, bloom-postprosessering og interaktive kontroller, null eksterne ressurser.

🎯 Utfordringen
Samme prompt, tre modeller, mann-mot-mann. Prompten spesifiserte 15+ himmellegemer med nøyaktige shader-krav (flerlags FBM-støy, virvelstøy, cellulær støy), tre glowlag på solen, Jupiters store røde flekk med spiral-kanter, Saturns Cassini-skille, bylysene på jordens nattside og mer. Ingen snarveier tillatt.

🤖 Modeller som ble testet

ModellVerktøyOppgave 1: SolsystemOppgave 2: By-renderer
GPT-5.6 SolCodex11 min11 + 33 min (to runder)
Kimi K3Kimi Code45 min3+ timer, runde 2 oppgitt
Qwen3.8MaxDirekte<10 min (to runder)
⚠️ Metodenotat
Dette er ikke en formell benchmark — det er en reell stresstest av GitHub-brukeren OBdangshang07. Samme prompt, samme forventninger, målt veggklokke-tid fra verktøykall til komplett utdata. Kvalitet bedømt etter visuelt innhold og kodefullstendighet.

🌌 Oppgave 1: Solsystem-simulator

Prompten krevde et filmkvalitets-solsystem med 15+ himmellegemer, der hvert krever egendefinert ShaderMaterial med flerlags støy. Hovedkrav:

  • Solen: Dynamisk plasmatekstur med tre glowlag, solflekker, solvind-partikler
  • Jupiter: Flerlags strekt støy-bånd, store røde flekk med spiral-kanter, 3+ mindre virvler
  • Saturn: Flerlags halvgjennomsiktige ringer med Cassini-skille, partikkelspredning via shader-discard
  • Jorden: Spekulære høylys på hav, bylys på nattsiden, Fresnel-atmosfæriskall
  • Måner: 4 galileiske måner + 4 saturnmåner, hver med unike prosedyriske teksturer

Resultater

AspektGPT-5.6 Sol (11 min)Kimi K3 (45 min)
Visuell kvalitet⭐⭐⭐⭐⭐ Utmerkede shadere, Jupiters bånd ser organiske ut⭐⭐⭐⭐ Bra, men noen legemer bruker enklere støy
KodefullstendighetAlle 15+ legemer, alle måner inkludertAlle legemer til stede, noen måner forenklet
InteraktivitetSmidige bane-kontroller, infopaneler, tidsforvrengningLignende kontroller, noe mindre pussa UI
PostprosesseringUnrealBloomPass velinnstiltBloom til stede, men mindre raffinert
StabilitetStabil på 60 fpsAv og til billedfall på svakere GPU-er

🏙️ Oppgave 2: By-renderer

En vanskeligere utfordring: generere en sanntids metropol-renderer med 50+ justerbare parametere, prosedyrisk uendelig by, dynamisk dag/natt-syklus, atmosfærisk spredning og tette 3D-bygningsklynger med unike teksturer.

Resultater

ModellRunde 1Runde 2 (finpuss)BygningstetthetTeksturkvalitet
Qwen3.8Max<10 min<10 min⭐⭐⭐⭐⭐ Tett, variert⭐⭐⭐⭐ God prosedyrisk
GPT-5.6 Sol11 min33 min⭐⭐⭐⭐ Tett⭐⭐⭐⭐⭐ Utmerket detalj
Kimi K33+ timer❌ Oppgitt⭐⭐⭐ Middels⭐⭐⭐ Akseptabel
🚨 Kimi K3 slet
Kimi K3 brukte over 3 timer på første runde og klarte ikke å fullføre den andre. By-renderer-oppgaven avslørte K3 sin svakhet i å generere kompleks, ytelsesfølsom 3D-kode med mange gjensidig avhengige systemer (veier, trafikk, lys, bygningsgenerering).

📊 Hovedfunn

🏎️ Hastighet

Qwen3.8Max er hastighetskongen — begge runder til sammen under 10 minutter. GPT-5.6 Sol er stabil (~11 min per oppgave). Kimi K3 er 3–4 ganger tregere på komplekse oppgaver.

🎨 Kvalitet

GPT-5.6 Sol gir best visuell kvalitet — shaderne er mer raffinerte, støylagene mer organiske, og postprosesseringen bedre innstilt. Qwen3.8Max bytter bort noe visuelt puss mot rå fart. Kimi K3 sin utdata fungerer, men er mindre filmatisk.

🔧 Pålitelighet

GPT-5.6 Sol er den mest pålitelige — fullførte begge oppgavene i sin helhet. Qwen3.8Max er rask, men kan trenge en finpuss-runde. Kimi K3 kan få tidsavbrudd på komplekse multisystem-oppgaver.

🎮 Direkte-demoer — prøv selv

Nedenfor er de faktiske utdataene fra hver modell. Åpne dem i nettleseren og sammenlikn visuell kvalitet, interaktivitet og ytelse:

☀️ Solsystem-simulator

ModellGenereringstidDemo
GPT-5.6 Sol11 min🚀 Start demo →
Kimi K345 min🚀 Start demo →

🌃 By-renderer

ModellGenereringstidDemo
GPT-5.6 Sol11 + 33 min🚀 Start demo →
Kimi K33+ timer🚀 Start demo →
Qwen3.8Max<10 min × 2🚀 Start demo →

🎯 Hva dette betyr for utviklere

💡 Veileder for modellvalg
  • Trenger du best visuell kvalitet? → GPT-5.6 Sol (Codex). Beste shadere, mest pussa utdata.
  • Trenger du fart? → Qwen3.8Max. Lynrask, god nok kvalitet for prototyping.
  • Kompleks multisystem-3D? → Unngå Kimi K3 foreløpig. Den utmerker seg på enklere oppgaver, men sliter med sammenkoblede systemer.
  • Kostnadsfølsom? → Qwen3.8Max gir best forhold mellom tid og kvalitet.

Forskjellen mellom modellene er ikke bare hastighet — det handler om kompleksitetstaket. GPT-5.6 Sol kan håndtere prompter med 15+ gjensidig avhengige shadersystemer. Qwen3.8Max er rask, men kan trenge finpuss-runder. Kimi K3 har lavere tak på komplekse 3D-oppgaver.

For generering av enkeltfil-HTML — det fremvoksende "vibe coding"-benchmarket — leder GPT-5.6 Sol foreløpig på kvalitet, mens Qwen3.8Max leder på gjennomstrømming. Velg ut fra prioritet.

📎 Kilde

All kode, prompter og testresultater er åpen kildekode: github.com/OBdangshang07/AI_project

Test utført av GitHub-brukeren OBdangshang07. Demoer reprodusert med de opprinnelige HTML-utdatafilene.