⚡ ภาพรวม

เราทดสอบโมเดล AI แนวหน้าสามตัวบนโจทย์เขียนโค้ดสุดโหด: ให้สร้างเครื่องจำลองระบบสุริยะด้วย Three.jsระดับภาพยนตร์ในไฟล์ HTML ไฟล์เดียว — พื้นผิว procedural ทั้งหมด, custom shader, bloom post-processing, ควบคุมแบบโต้ตอบได้ ไม่มีแอสเซตภายนอกเลย

🎯 โจทย์ท้าทาย
prompt เดียวกัน, สามโมเดล, สู้กันแบบเผาขา prompt กำหนดความต้องการ shader ที่แม่นยำสำหรับวัตถุท้องฟ้า 15+ รายการ (FBM noise หลายชั้น, vortex noise, cellular noise), ดวงอาทิตย์มีรัศมีเรืองแสง 3 ชั้น, จุดแดงใหญ่ของดาวพฤหัสมีขอบเกลียว, ช่องว่างคาสินีของดาวเสาร์, แสงเมืองด้านกลางคืนของโลก และอื่นๆ ห้ามตัดช่องทาง

🤖 โมเดลที่ทดสอบ

โมเดลเครื่องมืองาน 1: ระบบสุริยะงาน 2: เรนเดอร์เมือง
GPT-5.6 SolCodex11 นาที11 + 33 นาที (สองรอบ)
Kimi K3Kimi Code45 นาที3 ชั่วโมง+, ยกเลิกรอบสอง
Qwen3.8Maxเรียกตรงภายใน 10 นาที (สองรอบ)
⚠️ หมายเหตุระเบียบวิธี
นี่ไม่ใช่ benchmark ทางการ — เป็นการทดสอบความกดดันจริงจังโดย GitHub user OBdangshang07 prompt เดียวกัน ความคาดหวังเดียวกัน วัดเวลา wall-clock ตั้งแต่เรียกเครื่องมือจนถึง output สมบูรณ์ คุณภาพตัดสินจากความเที่ยงตรงทางภาพและความสมบูรณ์ของโค้ด

🌌 งานที่หนึ่ง: เครื่องจำลองระบบสุริยะ

prompt เรียกระบบสุริยะระดับภาพยนตร์ที่มีวัตถุท้องฟ้า 15+ รายการ แต่ละรายการต้องใช้ ShaderMaterial ที่กำหนดเองกับ multi-layer noise ข้อกำหนดหลัก:

  • ดวงอาทิตย์: texture พลาสมาแบบไดนามิก + รัศมีเรืองแสง 3 ชั้น + จุดดับบนดวงอาทิตย์ + อนุภาคลมสุริยะ
  • ดาวพฤหัส: แถบ noise ยืดหลายชั้น, จุดแดงใหญ่มีขอบเกลียว, วงหมุนเล็ก 3+ วง
  • ดาวเสาร์: วงแหวนกึ่งโปร่งแสงหลายชั้น + ช่องว่างคาสินี + กระจายอนุภาคผ่าน shader discard
  • โลก: แสงสะท้อนบนมหาสมุทร, แสงเมืองด้านกลางคืน, ผิวบรรยากาศแบบเฟรสเนล
  • ดาวบริวาร: ดวงจันทร์กาลิเลียน 4 ดวง + ดาวบริวารดาวเสาร์ 4 ดวง แต่ละดวงมี texture procedural เฉพาะตัว

ผลลัพธ์

มิติGPT-5.6 Sol (11 นาที)Kimi K3 (45 นาที)
คุณภาพภาพ⭐⭐⭐⭐⭐ shader ดีเยี่ยม, แถบดาวพฤหัสดูเป็นธรรมชาติ⭐⭐⭐⭐ ดี แต่บางวัตถุใช้ noise ง่ายไป
ความสมบูรณ์ของโค้ดครบทั้ง 15+ วัตถุ, ดาวบริวารครบครบทุกวัตถุ, ดาวบริวารบางดวงกระชับขึ้น
การโต้ตอบควบคุมวงโคจรลื่นไหล, แผงข้อมูล, เร่งเวลาควบคุมคล้ายกัน, UI ขัดเกลาน้อยกว่าเล็กน้อย
post-processingUnrealBloomPass ปรับจูนดีเยี่ยมมี bloom แต่ไม่ละเอียดพอ
ความเสถียรเสถียรที่ 60fpsกระตุกเป็นครั้งคราวบน GPU ต่ำกว่า

🏙️ งานที่สอง: เรนเดอร์เมือง

ยากกว่าเดิม: สร้างเครื่องเรนเดอร์มหานครแบบเรียลไทม์ที่มีพารามิเตอร์ปรับได้ 50+ รายการ รวมเมือง procedural ไม่รู้จบ, รอบวันกลางคืนแบบไดนามิก, การกระเจิงของบรรยากาศ, และกลุ่มอาคาร 3D หนาแน่นที่ texture แตกต่างกันทุกหลัง

ผลลัพธ์

โมเดลรอบที่ 1รอบที่ 2 (ขัดเกลา)ความหนาแน่นอาคารคุณภาพ texture
Qwen3.8Maxภายใน 10 นาทีภายใน 10 นาที⭐⭐⭐⭐⭐ หนาแน่นและหลากหลาย⭐⭐⭐⭐ procedural texture ดี
GPT-5.6 Sol11 นาที33 นาที⭐⭐⭐⭐ หนาแน่น⭐⭐⭐⭐⭐ รายละเอียดยอดเยี่ยม
Kimi K33 ชั่วโมง+❌ ยกเลิก⭐⭐⭐ ปานกลาง⭐⭐⭐ พอใช้
🚨 Kimi K3 ล้มเหลว
Kimi K3 ใช้เวลากว่า 3 ชั่วโมงในรอบแรก และทำรอบสองไม่สำเร็จ งานเรนเดอร์เมืองเผยจุดอ่อนของ K3 ในการสร้างโค้ด 3D ที่ซับซ้อนและไวต่อประสิทธิภาพ ซึ่งมีระบบอันโยงใยกันหลายระบบ (ถนน, จราจร, แสงสว่าง, การสร้างอาคาร)

📊 ข้อค้นพบสำคัญ

🏎️ ความเร็ว

Qwen3.8Max คือราชาความเร็ว — รวมสองรอบใช้เวลาไม่เกิน 10 นาที GPT-5.6 Sol คงที่ที่ ~11 นาทีต่องาน Kimi K3 ช้ากว่า 3–4 เท่าบนงานซับซ้อน

🎨 คุณภาพ

GPT-5.6 Sol ให้คุณภาพภาพดีที่สุด — shader ขัดเกลากว่า, ชั้น noise เป็นธรรมชาติกว่า, post-processing ปรับจูนดีกว่า Qwen3.8Max แลกความขัดเกลาทางภาพบางส่วนกับความเร็วตั้งต้น output ของ Kimi K3 ใช้งานได้แต่ไม่ถึงระดับภาพยนตร์

🔧 ความน่าเชื่อถือ

GPT-5.6 Sol น่าเชื่อถือที่สุด — ทั้งสองงานทำสำเร็จครบ Qwen3.8Max เร็วแต่อาจต้องมีรอบขัดเกลา Kimi K3 อาจ timeout บนงาน multi-system ซับซ้อน

🎮 สาธิตสด — ลองเอง

ด้านล่างคือ output จริงจากแต่ละโมเดล เปิดในเบราว์เซอร์แล้วเปรียบเทียบคุณภาพภาพ การโต้ตอบ และประสิทธิภาพ:

☀️ เครื่องจำลองระบบสุริยะ

โมเดลเวลาที่ใช้สาธิต
GPT-5.6 Sol11 นาที🚀 เปิดสาธิต →
Kimi K345 นาที🚀 เปิดสาธิต →

🌃 เรนเดอร์เมือง

โมเดลเวลาที่ใช้สาธิต
GPT-5.6 Sol11 + 33 นาที🚀 เปิดสาธิต →
Kimi K33 ชั่วโมง+🚀 เปิดสาธิต →
Qwen3.8Maxภายใน 10 นาที × 2🚀 เปิดสาธิต →

🎯 ความหมายสำหรับนักพัฒนา

💡 คู่มือเลือกโมเดล
  • ต้องการคุณภาพภาพดีที่สุด? → GPT-5.6 Sol (Codex) shader ดีที่สุด, output ขัดเกลาที่สุด
  • ต้องการความเร็ว? → Qwen3.8Max เร็วราวฟ้าผ่า, คุณภาพเพียงพอสำหรับ prototyping
  • 3D หลายระบบซับซ้อน? → เลี่ยง Kimi K3 ไปก่อน เก่งเรื่องงานง่ายก็จริง แต่ติดขัดกับระบบที่อันโยงใยกัน
  • ไวต่อต้นทุน? → Qwen3.8Max ให้อัตราส่วนเวลาต่อคุณภาพที่ดีสุด

ช่องว่างระหว่างโมเดลไม่ใช่แค่ความเร็ว — แต่เป็นเรื่องเพดานความซับซ้อน GPT-5.6 Sol รับมือ prompt ที่มีระบบ shader อันโยงใยกัน 15+ ระบบได้ Qwen3.8Max เร็วแต่อาจต้องมีรอบขัดเกลา Kimi K3 มีเพดานต่ำกว่าในงาน 3D ซับซ้อน

สำหรับการสร้าง HTML ไฟล์เดียว — benchmark "vibe coding" ที่กำลังมา — GPT-5.6 Sol นำเรื่องคุณภาพในขณะนี้, ส่วน Qwen3.8Max นำเรื่อง throughput เลือกตามสิ่งที่คุณให้ความสำคัญ

📎 ซอร์สโค้ด

โค้ด, prompt และผลการทดสอบทั้งหมดเป็น open source: github.com/OBdangshang07/AI_project

ทดสอบโดย GitHub user OBdangshang07 ตัวสาธิตทำซ้ำจากไฟล์ output HTML ต้นฉบับ