⚡ Gambaran Keseluruhan

Kami menguji tiga model AI frontier pada cabaran pengekodan brutal: jana simulator sistem solar Three.js berkualiti wayang gambar dalam satu fail HTML tunggal — semua tekstur prosedural, shader tersuai, pemprosesan pasca bloom, dan kawalan interaktif, sifar aset luaran.

🎯 Cabaran
Prompt yang sama, tiga model, berdepan terus. Prompt menetapkan 15+ jasad cakerawala dengan keperluan shader tepat (hingar FBM berbilang lapisan, hingar pusaran, hingar sel), 3 lapisan kalimah pada matahari, Bintik Merah Besar Musytari dengan tepi pilin, pembahagian Cassini Zuhal, lampu bandar di sisi gelap Bumi, dan banyak lagi. Tiada pintasan dibenarkan.

🤖 Model Diuji

ModelAlatTugasan 1: Sistem SolarTugasan 2: Pemapar Bandar
GPT-5.6 SolCodex11 minit11 + 33 minit (2 pusingan)
Kimi K3Kimi Code45 minit3+ jam, pusingan 2 ditinggalkan
Qwen3.8MaxTerus<10 minit (2 pusingan)
⚠️ Nota Metodologi
Ini bukan penanda aras formal — ia ujian tekanan dunia sebenar oleh pengguna GitHub OBdangshang07. Prompt yang sama, jangkaan yang sama, mengukur masa jam dinding dari panggilan alat hingga output lengkap. Kualiti dinilai berdasarkan kesetiaan visual dan kelengkapan kod.

🌌 Tugasan 1: Simulator Sistem Solar

Prompt menuntut sistem solar berskala sinematik dengan 15+ jasad cakerawala, setiap satu memerlukan ShaderMaterial tersuai dengan hingar berbilang lapisan. Keperluan utama:

  • Matahari: Tekstur plasma dinamik dengan 3 lapisan kalimah, tompok matahari, zarah angin solar
  • Musytari: Jalur hingar regang berbilang lapisan, Bintik Merah Besar dengan tepi pilin, 3+ pusaran lebih kecil
  • Zuhal: Cincin separuh telus berbilang lapisan dengan pembahagian Cassini, serakan zarah melalui shader discard
  • Bumi: Sorotan specular lautan, lampu bandar di sisi gelap, selubung atmosfera Fresnel
  • Bulan: 4 bulan Galilean + 4 bulan Zuhal, setiap satu dengan tekstur prosedural unik

Keputusan

AspekGPT-5.6 Sol (11 minit)Kimi K3 (45 minit)
Kesetiaan visual⭐⭐⭐⭐⭐ Shader cemerlang, jalur Musytari nampak organik⭐⭐⭐⭐ Baik tetapi sesetengah jasad guna hingar lebih mudah
Kelengkapan kodSemua 15+ jasad, semua bulan termasukSemua jasad ada, sesetengah bulan dipermudahkan
KeinteraktifanKawalan orbit lancar, panel maklumat, lenturan masaKawalan serupa, UI kurang berkilau sedikit
Pemprosesan pascaUnrealBloomPass ditala dengan baikBloom ada tetapi kurang halus
KestabilanStabil pada 60fpsKejatuhan bingkai kadang-kadang pada GPU lebih rendah

🏙️ Tugasan 2: Pemapar Bandar

Cabaran lebih sukar: jana pemapar metropolitan langsung dengan 50+ parameter boleh laras, bandar tak terhingga prosedural, kitaran siang/malam dinamik, serakan atmosfera, dan kelompok bangunan 3D tebal dengan tekstur unik.

Keputusan

ModelPusingan 1Pusingan 2 (Penghalusan)Ketumpatan BangunanKualiti Tekstur
Qwen3.8Max<10 minit<10 minit⭐⭐⭐⭐⭐ Tebal, pelbagai⭐⭐⭐⭐ Prosedural baik
GPT-5.6 Sol11 minit33 minit⭐⭐⭐⭐ Tebal⭐⭐⭐⭐⭐ Detail cemerlang
Kimi K33+ jam❌ Ditinggalkan⭐⭐⭐ Sederhana⭐⭐⭐ Memadai
🚨 Kimi K3 Bergelut
Kimi K3 mengambil masa lebih 3 jam untuk pusingan pertama dan tak dapat menyiapkan pusingan kedua. Tugasan pemapar bandar mendedahkan kelemahan K3 dalam menjana kod 3D kompleks sensitif-prestasi dengan banyak sistem saling bergantung (jalan, trafik, pencahayaan, penjanaan bangunan).

📊 Penemuan Utama

🏎️ Kelajuan

Qwen3.8Max ialah raja kelajuan — kedua-dua pusingan dalam kurang 10 minit jumlahnya. GPT-5.6 Sol konsisten (~11 minit setiap tugas). Kimi K3 3-4 kali lebih perlahan pada tugasan kompleks.

🎨 Kualiti

GPT-5.6 Sol menghasilkan kualiti visual terbaik — shader lebih halus, lapisan hingar lebih organik, dan pemprosesan pasca lebih baik ditala. Qwen3.8Max mengorbankan sedikit kilauan visual untuk kelajuan mentah. Output Kimi K3 berfungsi tetapi kurang sinematik.

🔧 Kebolehpercayaan

GPT-5.6 Sol paling boleh dipercayai — ia menyiapkan kedua-dua tugas sepenuhnya. Qwen3.8Max pantas tetapi mungkin perlu pusingan penghalusan. Kimi K3 boleh tamat masa pada tugasan pelbagai sistem kompleks.

🎮 Demo Langsung — Cuba Sendiri

Berikut ialah output sebenar dari setiap model. Buka dalam pelayar anda dan bandingkan kualiti visual, keinteraktifan, dan prestasi:

☀️ Simulator Sistem Solar

ModelMasa PenjanaanDemo
GPT-5.6 Sol11 minit🚀 Lancar Demo →
Kimi K345 minit🚀 Lancar Demo →

🌃 Pemapar Bandar

ModelMasa PenjanaanDemo
GPT-5.6 Sol11 + 33 minit🚀 Lancar Demo →
Kimi K33+ jam🚀 Lancar Demo →
Qwen3.8Max<10 minit × 2🚀 Lancar Demo →

🎯 Apa Maknanya untuk Pembangun

💡 Panduan Pemilihan Model
  • Perlu kualiti visual terbaik? → GPT-5.6 Sol (Codex). Shader terbaik, output paling berkilau.
  • Perlu kelajuan? → Qwen3.8Max. Sangat pantas, kualiti cukup baik untuk pembuatan prototaip.
  • 3D pelbagai sistem kompleks? → Elak Kimi K3 buat masa ini. Ia cemerlang pada tugasan lebih mudah tetapi bergelut dengan sistem saling berkaitan.
  • Sensitif kos? → Qwen3.8Max memberikan nisbah masa-ke-kualiti terbaik.

Jurang antara model bukan sekadar kelajuan — ia tentang siling kompleksiti. GPT-5.6 Sol boleh uruskan prompt dengan 15+ sistem shader saling bergantung. Qwen3.8Max pantas tetapi mungkin perlu laluan penghalusan. Kimi K3 mempunyai siling lebih rendah pada tugasan 3D kompleks.

Untuk penjanaan fail HTML tunggal — penanda aras "vibe coding" yang baharu — GPT-5.6 Sol buat masa ini mendahului dari segi kualiti, manakala Qwen3.8Max mendahului dari segi throughput. Pilih berdasarkan keutamaan anda.

📎 Sumber

Semua kod, prompt, dan keputusan ujian ialah sumber terbuka: github.com/OBdangshang07/AI_project

Ujian dijalankan oleh pengguna GitHub OBdangshang07. Demo dihasilkan semula dengan fail output HTML asal.