⚡ Panoramica
Abbiamo sottoposto tre modelli AI di frontiera a una sfida di coding estrema: generare un simulatore del sistema solare in Three.js con qualità cinematografica all'interno di un singolo file HTML — texture interamente procedurali, shader personalizzati, post-processing bloom, controlli interattivi e zero asset esterni.
Lo stesso prompt, tre modelli, testa a testa. Il prompt specificava 15+ corpi celesti con requisiti shader esatti (rumore FBM multistrato, rumore vortice, rumore cellulare), 3 livelli di alone solare, la Grande Macchia Rossa di Giove con bordi a spirale, la divisione di Cassini su Saturno, le luci cittadine sul lato in ombra della Terra e altro ancora. Niente scorciatoie.
🤖 Modelli testati
| Modello | Strumento | Task 1: Sistema solare | Task 2: City renderer |
|---|---|---|---|
| GPT-5.6 Sol | Codex | 11 min | 11 + 33 min (2 round) |
| Kimi K3 | Kimi Code | 45 min | 3+ ore, 2° round abbandonato |
| Qwen3.8Max | Chiamata diretta | — | <10 min (2 round) |
Non è un benchmark formale: è uno stress test nel mondo reale condotto da OBdangshang07 su GitHub. Stesso prompt, stesse aspettative, tempo wall-clock misurato dall'avvio dello strumento all'output completo. La qualità è valutata su fedeltà visiva e completezza del codice.
🌌 Task 1: Simulatore del sistema solare
Il prompt esigeva un sistema solare di qualità cinematografica con 15+ corpi celesti, ciascuno con un ShaderMaterial personalizzato e rumore multistrato. Requisiti chiave:
- Sole: texture al plasma dinamica con 3 livelli di alone, macchie solari, particelle di vento solare
- Giove: bande di rumore multistrato stirate, Grande Macchia Rossa con bordi a spirale, 3+ vortici minori
- Saturno: anelli traslucidi multistrato con divisione di Cassini, scatter di particelle via
discardnello shader - Terra: highlight speculare degli oceani, luci cittadine sul lato in ombra, atmosfera con guscio Fresnel
- Lune: 4 lune galileiane + 4 lune di Saturno, ognuna con texture procedurale unica
Risultati
| Dimensione | GPT-5.6 Sol (11 min) | Kimi K3 (45 min) |
|---|---|---|
| Fedeltà visiva | ⭐⭐⭐⭐⭐ Shader eccellenti, le bande di Giove sembrano organiche | ⭐⭐⭐⭐ Buono, ma alcuni corpi usano rumore più semplice |
| Completezza del codice | Tutti i 15+ corpi, tutte le lune presenti | Tutti i corpi presenti, alcune lune semplificate |
| Interattività | Controlli orbitali fluidi, pannelli informativi, time warp | Controlli simili, UI leggermente meno rifinita |
| Post-processing | UnrealBloomPass calibrato bene | Bloom presente ma meno raffinato |
| Stabilità | Stabile a 60fps | Calo di frame occasionale su GPU più deboli |
🏙️ Task 2: City renderer
Una sfida ancora più dura: generare un renderer metropolitano in tempo reale con 50+ parametri regolabili, città infinita procedurale, ciclo din/notte dinamico, scattering atmosferico e aggregati densi di edifici 3D con texture uniche.
Risultati
| Modello | Round 1 | Round 2 (rifinitura) | Densità edifici | Qualità texture |
|---|---|---|---|---|
| Qwen3.8Max | <10 min | <10 min | ⭐⭐⭐⭐⭐ Denso e vario | ⭐⭐⭐⭐ Buona procedurale |
| GPT-5.6 Sol | 11 min | 33 min | ⭐⭐⭐⭐ Denso | ⭐⭐⭐⭐⭐ Dettaglio eccellente |
| Kimi K3 | 3+ ore | ❌ Abbandonato | ⭐⭐⭐ Moderata | ⭐⭐⭐ Discreta |
Kimi K3 ha impiegato più di 3 ore per il primo round e non è riuscito a completare il secondo. Il task del city renderer ha messo in luce il punto debole di K3 nel generare codice 3D complesso e performance-critico con molti sistemi interdipendenti (strade, traffico, illuminazione, generazione degli edifici).
📊 Risultati chiave
🏎️ Velocità
Qwen3.8Max è il re della velocità — entrambi i round in meno di 10 minuti totali. GPT-5.6 Sol è costante (~11 min a task). Kimi K3 è 3-4 volte più lento sui task complessi.
🎨 Qualità
GPT-5.6 Sol produce la qualità visiva migliore — shader più rifiniti, strati di rumore più organici e post-processing meglio calibrato. Qwen3.8Max sacrifica un po' di rifinitura visiva in nome della velocità pura. L'output di Kimi K3 è funzionale ma meno cinematografico.
🔧 Affidabilità
GPT-5.6 Sol è il più affidabile — ha completato entrambi i task per intero. Qwen3.8Max è veloce ma può richiedere un round di rifinitura. Kimi K3 può andare in timeout sui task multi-sistema complessi.
🎮 Demo live — provali tu
Qui sotto ci sono gli output reali di ciascun modello. Aprili nel browser e confronta qualità visiva, interattività e prestazioni:
☀️ Simulatore del sistema solare
| Modello | Tempo di generazione | Demo |
|---|---|---|
| GPT-5.6 Sol | 11 min | 🚀 Apri la demo → |
| Kimi K3 | 45 min | 🚀 Apri la demo → |
🌃 City renderer
| Modello | Tempo di generazione | Demo |
|---|---|---|
| GPT-5.6 Sol | 11 + 33 min | 🚀 Apri la demo → |
| Kimi K3 | 3+ ore | 🚀 Apri la demo → |
| Qwen3.8Max | <10 min × 2 | 🚀 Apri la demo → |
🎯 Cosa significa per gli sviluppatori
- Vuoi la migliore qualità visiva? → GPT-5.6 Sol (Codex). Shader superiori, output più rifinito.
- Vuoi velocità? → Qwen3.8Max. Fulmineo, qualità sufficiente per i prototipi.
- 3D multi-sistema complesso? → Per ora evita Kimi K3. Brilla nei task semplici ma fatica con sistemi interconnessi.
- Budget sensitivo? → Qwen3.8Max offre il miglior rapporto tempo/qualità.
Il divario tra i modelli non è solo di velocità — è questione di soffitto di complessità. GPT-5.6 Sol regge prompt con 15+ sistemi shader interdipendenti. Qwen3.8Max è veloce ma può richiedere passaggi di rifinitura. Kimi K3 ha un soffitto più basso sui task 3D complessi.
Per la generazione di HTML a file singolo — il nuovo benchmark del "vibe coding" — GPT-5.6 Sol guida in qualità, mentre Qwen3.8Max guida in throughput. Scegli in base alla tua priorità.
📎 Sorgente
Tutto il codice, i prompt e i risultati dei test sono open source: github.com/OBdangshang07/AI_project
Test condotto dall'utente GitHub OBdangshang07. Le demo sono riprodotte con i file HTML di output originali.