⚡ Gambaran Keseluruhan
Kami menguji tiga model AI frontier pada cabaran pengekodan brutal: jana simulator sistem solar Three.js berkualiti wayang gambar dalam satu fail HTML tunggal — semua tekstur prosedural, shader tersuai, pemprosesan pasca bloom, dan kawalan interaktif, sifar aset luaran.
Prompt yang sama, tiga model, berdepan terus. Prompt menetapkan 15+ jasad cakerawala dengan keperluan shader tepat (hingar FBM berbilang lapisan, hingar pusaran, hingar sel), 3 lapisan kalimah pada matahari, Bintik Merah Besar Musytari dengan tepi pilin, pembahagian Cassini Zuhal, lampu bandar di sisi gelap Bumi, dan banyak lagi. Tiada pintasan dibenarkan.
🤖 Model Diuji
| Model | Alat | Tugasan 1: Sistem Solar | Tugasan 2: Pemapar Bandar |
|---|---|---|---|
| GPT-5.6 Sol | Codex | 11 minit | 11 + 33 minit (2 pusingan) |
| Kimi K3 | Kimi Code | 45 minit | 3+ jam, pusingan 2 ditinggalkan |
| Qwen3.8Max | Terus | — | <10 minit (2 pusingan) |
Ini bukan penanda aras formal — ia ujian tekanan dunia sebenar oleh pengguna GitHub OBdangshang07. Prompt yang sama, jangkaan yang sama, mengukur masa jam dinding dari panggilan alat hingga output lengkap. Kualiti dinilai berdasarkan kesetiaan visual dan kelengkapan kod.
🌌 Tugasan 1: Simulator Sistem Solar
Prompt menuntut sistem solar berskala sinematik dengan 15+ jasad cakerawala, setiap satu memerlukan ShaderMaterial tersuai dengan hingar berbilang lapisan. Keperluan utama:
- Matahari: Tekstur plasma dinamik dengan 3 lapisan kalimah, tompok matahari, zarah angin solar
- Musytari: Jalur hingar regang berbilang lapisan, Bintik Merah Besar dengan tepi pilin, 3+ pusaran lebih kecil
- Zuhal: Cincin separuh telus berbilang lapisan dengan pembahagian Cassini, serakan zarah melalui shader
discard - Bumi: Sorotan specular lautan, lampu bandar di sisi gelap, selubung atmosfera Fresnel
- Bulan: 4 bulan Galilean + 4 bulan Zuhal, setiap satu dengan tekstur prosedural unik
Keputusan
| Aspek | GPT-5.6 Sol (11 minit) | Kimi K3 (45 minit) |
|---|---|---|
| Kesetiaan visual | ⭐⭐⭐⭐⭐ Shader cemerlang, jalur Musytari nampak organik | ⭐⭐⭐⭐ Baik tetapi sesetengah jasad guna hingar lebih mudah |
| Kelengkapan kod | Semua 15+ jasad, semua bulan termasuk | Semua jasad ada, sesetengah bulan dipermudahkan |
| Keinteraktifan | Kawalan orbit lancar, panel maklumat, lenturan masa | Kawalan serupa, UI kurang berkilau sedikit |
| Pemprosesan pasca | UnrealBloomPass ditala dengan baik | Bloom ada tetapi kurang halus |
| Kestabilan | Stabil pada 60fps | Kejatuhan bingkai kadang-kadang pada GPU lebih rendah |
🏙️ Tugasan 2: Pemapar Bandar
Cabaran lebih sukar: jana pemapar metropolitan langsung dengan 50+ parameter boleh laras, bandar tak terhingga prosedural, kitaran siang/malam dinamik, serakan atmosfera, dan kelompok bangunan 3D tebal dengan tekstur unik.
Keputusan
| Model | Pusingan 1 | Pusingan 2 (Penghalusan) | Ketumpatan Bangunan | Kualiti Tekstur |
|---|---|---|---|---|
| Qwen3.8Max | <10 minit | <10 minit | ⭐⭐⭐⭐⭐ Tebal, pelbagai | ⭐⭐⭐⭐ Prosedural baik |
| GPT-5.6 Sol | 11 minit | 33 minit | ⭐⭐⭐⭐ Tebal | ⭐⭐⭐⭐⭐ Detail cemerlang |
| Kimi K3 | 3+ jam | ❌ Ditinggalkan | ⭐⭐⭐ Sederhana | ⭐⭐⭐ Memadai |
Kimi K3 mengambil masa lebih 3 jam untuk pusingan pertama dan tak dapat menyiapkan pusingan kedua. Tugasan pemapar bandar mendedahkan kelemahan K3 dalam menjana kod 3D kompleks sensitif-prestasi dengan banyak sistem saling bergantung (jalan, trafik, pencahayaan, penjanaan bangunan).
📊 Penemuan Utama
🏎️ Kelajuan
Qwen3.8Max ialah raja kelajuan — kedua-dua pusingan dalam kurang 10 minit jumlahnya. GPT-5.6 Sol konsisten (~11 minit setiap tugas). Kimi K3 3-4 kali lebih perlahan pada tugasan kompleks.
🎨 Kualiti
GPT-5.6 Sol menghasilkan kualiti visual terbaik — shader lebih halus, lapisan hingar lebih organik, dan pemprosesan pasca lebih baik ditala. Qwen3.8Max mengorbankan sedikit kilauan visual untuk kelajuan mentah. Output Kimi K3 berfungsi tetapi kurang sinematik.
🔧 Kebolehpercayaan
GPT-5.6 Sol paling boleh dipercayai — ia menyiapkan kedua-dua tugas sepenuhnya. Qwen3.8Max pantas tetapi mungkin perlu pusingan penghalusan. Kimi K3 boleh tamat masa pada tugasan pelbagai sistem kompleks.
🎮 Demo Langsung — Cuba Sendiri
Berikut ialah output sebenar dari setiap model. Buka dalam pelayar anda dan bandingkan kualiti visual, keinteraktifan, dan prestasi:
☀️ Simulator Sistem Solar
| Model | Masa Penjanaan | Demo |
|---|---|---|
| GPT-5.6 Sol | 11 minit | 🚀 Lancar Demo → |
| Kimi K3 | 45 minit | 🚀 Lancar Demo → |
🌃 Pemapar Bandar
| Model | Masa Penjanaan | Demo |
|---|---|---|
| GPT-5.6 Sol | 11 + 33 minit | 🚀 Lancar Demo → |
| Kimi K3 | 3+ jam | 🚀 Lancar Demo → |
| Qwen3.8Max | <10 minit × 2 | 🚀 Lancar Demo → |
🎯 Apa Maknanya untuk Pembangun
- Perlu kualiti visual terbaik? → GPT-5.6 Sol (Codex). Shader terbaik, output paling berkilau.
- Perlu kelajuan? → Qwen3.8Max. Sangat pantas, kualiti cukup baik untuk pembuatan prototaip.
- 3D pelbagai sistem kompleks? → Elak Kimi K3 buat masa ini. Ia cemerlang pada tugasan lebih mudah tetapi bergelut dengan sistem saling berkaitan.
- Sensitif kos? → Qwen3.8Max memberikan nisbah masa-ke-kualiti terbaik.
Jurang antara model bukan sekadar kelajuan — ia tentang siling kompleksiti. GPT-5.6 Sol boleh uruskan prompt dengan 15+ sistem shader saling bergantung. Qwen3.8Max pantas tetapi mungkin perlu laluan penghalusan. Kimi K3 mempunyai siling lebih rendah pada tugasan 3D kompleks.
Untuk penjanaan fail HTML tunggal — penanda aras "vibe coding" yang baharu — GPT-5.6 Sol buat masa ini mendahului dari segi kualiti, manakala Qwen3.8Max mendahului dari segi throughput. Pilih berdasarkan keutamaan anda.
📎 Sumber
Semua kod, prompt, dan keputusan ujian ialah sumber terbuka: github.com/OBdangshang07/AI_project
Ujian dijalankan oleh pengguna GitHub OBdangshang07. Demo dihasilkan semula dengan fail output HTML asal.