⚡ ภาพรวม
เราทดสอบโมเดล AI แนวหน้าสามตัวบนโจทย์เขียนโค้ดสุดโหด: ให้สร้างเครื่องจำลองระบบสุริยะด้วย Three.jsระดับภาพยนตร์ในไฟล์ HTML ไฟล์เดียว — พื้นผิว procedural ทั้งหมด, custom shader, bloom post-processing, ควบคุมแบบโต้ตอบได้ ไม่มีแอสเซตภายนอกเลย
prompt เดียวกัน, สามโมเดล, สู้กันแบบเผาขา prompt กำหนดความต้องการ shader ที่แม่นยำสำหรับวัตถุท้องฟ้า 15+ รายการ (FBM noise หลายชั้น, vortex noise, cellular noise), ดวงอาทิตย์มีรัศมีเรืองแสง 3 ชั้น, จุดแดงใหญ่ของดาวพฤหัสมีขอบเกลียว, ช่องว่างคาสินีของดาวเสาร์, แสงเมืองด้านกลางคืนของโลก และอื่นๆ ห้ามตัดช่องทาง
🤖 โมเดลที่ทดสอบ
| โมเดล | เครื่องมือ | งาน 1: ระบบสุริยะ | งาน 2: เรนเดอร์เมือง |
|---|---|---|---|
| GPT-5.6 Sol | Codex | 11 นาที | 11 + 33 นาที (สองรอบ) |
| Kimi K3 | Kimi Code | 45 นาที | 3 ชั่วโมง+, ยกเลิกรอบสอง |
| Qwen3.8Max | เรียกตรง | — | ภายใน 10 นาที (สองรอบ) |
นี่ไม่ใช่ benchmark ทางการ — เป็นการทดสอบความกดดันจริงจังโดย GitHub user OBdangshang07 prompt เดียวกัน ความคาดหวังเดียวกัน วัดเวลา wall-clock ตั้งแต่เรียกเครื่องมือจนถึง output สมบูรณ์ คุณภาพตัดสินจากความเที่ยงตรงทางภาพและความสมบูรณ์ของโค้ด
🌌 งานที่หนึ่ง: เครื่องจำลองระบบสุริยะ
prompt เรียกระบบสุริยะระดับภาพยนตร์ที่มีวัตถุท้องฟ้า 15+ รายการ แต่ละรายการต้องใช้ ShaderMaterial ที่กำหนดเองกับ multi-layer noise ข้อกำหนดหลัก:
- ดวงอาทิตย์: texture พลาสมาแบบไดนามิก + รัศมีเรืองแสง 3 ชั้น + จุดดับบนดวงอาทิตย์ + อนุภาคลมสุริยะ
- ดาวพฤหัส: แถบ noise ยืดหลายชั้น, จุดแดงใหญ่มีขอบเกลียว, วงหมุนเล็ก 3+ วง
- ดาวเสาร์: วงแหวนกึ่งโปร่งแสงหลายชั้น + ช่องว่างคาสินี + กระจายอนุภาคผ่าน shader
discard - โลก: แสงสะท้อนบนมหาสมุทร, แสงเมืองด้านกลางคืน, ผิวบรรยากาศแบบเฟรสเนล
- ดาวบริวาร: ดวงจันทร์กาลิเลียน 4 ดวง + ดาวบริวารดาวเสาร์ 4 ดวง แต่ละดวงมี texture procedural เฉพาะตัว
ผลลัพธ์
| มิติ | GPT-5.6 Sol (11 นาที) | Kimi K3 (45 นาที) |
|---|---|---|
| คุณภาพภาพ | ⭐⭐⭐⭐⭐ shader ดีเยี่ยม, แถบดาวพฤหัสดูเป็นธรรมชาติ | ⭐⭐⭐⭐ ดี แต่บางวัตถุใช้ noise ง่ายไป |
| ความสมบูรณ์ของโค้ด | ครบทั้ง 15+ วัตถุ, ดาวบริวารครบ | ครบทุกวัตถุ, ดาวบริวารบางดวงกระชับขึ้น |
| การโต้ตอบ | ควบคุมวงโคจรลื่นไหล, แผงข้อมูล, เร่งเวลา | ควบคุมคล้ายกัน, UI ขัดเกลาน้อยกว่าเล็กน้อย |
| post-processing | UnrealBloomPass ปรับจูนดีเยี่ยม | มี bloom แต่ไม่ละเอียดพอ |
| ความเสถียร | เสถียรที่ 60fps | กระตุกเป็นครั้งคราวบน GPU ต่ำกว่า |
🏙️ งานที่สอง: เรนเดอร์เมือง
ยากกว่าเดิม: สร้างเครื่องเรนเดอร์มหานครแบบเรียลไทม์ที่มีพารามิเตอร์ปรับได้ 50+ รายการ รวมเมือง procedural ไม่รู้จบ, รอบวันกลางคืนแบบไดนามิก, การกระเจิงของบรรยากาศ, และกลุ่มอาคาร 3D หนาแน่นที่ texture แตกต่างกันทุกหลัง
ผลลัพธ์
| โมเดล | รอบที่ 1 | รอบที่ 2 (ขัดเกลา) | ความหนาแน่นอาคาร | คุณภาพ texture |
|---|---|---|---|---|
| Qwen3.8Max | ภายใน 10 นาที | ภายใน 10 นาที | ⭐⭐⭐⭐⭐ หนาแน่นและหลากหลาย | ⭐⭐⭐⭐ procedural texture ดี |
| GPT-5.6 Sol | 11 นาที | 33 นาที | ⭐⭐⭐⭐ หนาแน่น | ⭐⭐⭐⭐⭐ รายละเอียดยอดเยี่ยม |
| Kimi K3 | 3 ชั่วโมง+ | ❌ ยกเลิก | ⭐⭐⭐ ปานกลาง | ⭐⭐⭐ พอใช้ |
Kimi K3 ใช้เวลากว่า 3 ชั่วโมงในรอบแรก และทำรอบสองไม่สำเร็จ งานเรนเดอร์เมืองเผยจุดอ่อนของ K3 ในการสร้างโค้ด 3D ที่ซับซ้อนและไวต่อประสิทธิภาพ ซึ่งมีระบบอันโยงใยกันหลายระบบ (ถนน, จราจร, แสงสว่าง, การสร้างอาคาร)
📊 ข้อค้นพบสำคัญ
🏎️ ความเร็ว
Qwen3.8Max คือราชาความเร็ว — รวมสองรอบใช้เวลาไม่เกิน 10 นาที GPT-5.6 Sol คงที่ที่ ~11 นาทีต่องาน Kimi K3 ช้ากว่า 3–4 เท่าบนงานซับซ้อน
🎨 คุณภาพ
GPT-5.6 Sol ให้คุณภาพภาพดีที่สุด — shader ขัดเกลากว่า, ชั้น noise เป็นธรรมชาติกว่า, post-processing ปรับจูนดีกว่า Qwen3.8Max แลกความขัดเกลาทางภาพบางส่วนกับความเร็วตั้งต้น output ของ Kimi K3 ใช้งานได้แต่ไม่ถึงระดับภาพยนตร์
🔧 ความน่าเชื่อถือ
GPT-5.6 Sol น่าเชื่อถือที่สุด — ทั้งสองงานทำสำเร็จครบ Qwen3.8Max เร็วแต่อาจต้องมีรอบขัดเกลา Kimi K3 อาจ timeout บนงาน multi-system ซับซ้อน
🎮 สาธิตสด — ลองเอง
ด้านล่างคือ output จริงจากแต่ละโมเดล เปิดในเบราว์เซอร์แล้วเปรียบเทียบคุณภาพภาพ การโต้ตอบ และประสิทธิภาพ:
☀️ เครื่องจำลองระบบสุริยะ
| โมเดล | เวลาที่ใช้ | สาธิต |
|---|---|---|
| GPT-5.6 Sol | 11 นาที | 🚀 เปิดสาธิต → |
| Kimi K3 | 45 นาที | 🚀 เปิดสาธิต → |
🌃 เรนเดอร์เมือง
| โมเดล | เวลาที่ใช้ | สาธิต |
|---|---|---|
| GPT-5.6 Sol | 11 + 33 นาที | 🚀 เปิดสาธิต → |
| Kimi K3 | 3 ชั่วโมง+ | 🚀 เปิดสาธิต → |
| Qwen3.8Max | ภายใน 10 นาที × 2 | 🚀 เปิดสาธิต → |
🎯 ความหมายสำหรับนักพัฒนา
- ต้องการคุณภาพภาพดีที่สุด? → GPT-5.6 Sol (Codex) shader ดีที่สุด, output ขัดเกลาที่สุด
- ต้องการความเร็ว? → Qwen3.8Max เร็วราวฟ้าผ่า, คุณภาพเพียงพอสำหรับ prototyping
- 3D หลายระบบซับซ้อน? → เลี่ยง Kimi K3 ไปก่อน เก่งเรื่องงานง่ายก็จริง แต่ติดขัดกับระบบที่อันโยงใยกัน
- ไวต่อต้นทุน? → Qwen3.8Max ให้อัตราส่วนเวลาต่อคุณภาพที่ดีสุด
ช่องว่างระหว่างโมเดลไม่ใช่แค่ความเร็ว — แต่เป็นเรื่องเพดานความซับซ้อน GPT-5.6 Sol รับมือ prompt ที่มีระบบ shader อันโยงใยกัน 15+ ระบบได้ Qwen3.8Max เร็วแต่อาจต้องมีรอบขัดเกลา Kimi K3 มีเพดานต่ำกว่าในงาน 3D ซับซ้อน
สำหรับการสร้าง HTML ไฟล์เดียว — benchmark "vibe coding" ที่กำลังมา — GPT-5.6 Sol นำเรื่องคุณภาพในขณะนี้, ส่วน Qwen3.8Max นำเรื่อง throughput เลือกตามสิ่งที่คุณให้ความสำคัญ
📎 ซอร์สโค้ด
โค้ด, prompt และผลการทดสอบทั้งหมดเป็น open source: github.com/OBdangshang07/AI_project
ทดสอบโดย GitHub user OBdangshang07 ตัวสาธิตทำซ้ำจากไฟล์ output HTML ต้นฉบับ