สรุปสั้น
DeepSeek ยังไม่ได้ออกมายืนยันว่าของพวกนี้คือ V4 สิ่งที่เรามีคือคลื่นผลลัพธ์จาก gray-test ที่สงสัยจำนวนมากและผิดปกติเพราะดูสอดคล้องกันเกินไป: วิดีโอ Bilibili จำนวน 121 คลิปจากครีเอเตอร์ 53 รายในช่วงวันที่ 7–19 กรกฎาคม 2026 บวกกับเซสชันแชร์ของ OpenCode อีก 40 เซสชันและโปรเจกต์ที่ดาวน์โหลดได้อีกไม่กี่ชุด ปริมาณขนาดนี้เพียงพอที่จะมองเห็นรูปแบบ แต่ไม่พอที่จะยืนยัน model ID หรือรัน benchmark แบบควบคุม
ถ้าอ่านหลักฐานด้วยสมมติฐานนี้ ภาพจะชัดเจน: ในแต่ละจุดที่ Kimi K3, GPT-5.6 และ Fable 5.0 แข็งที่สุด V4 ยังนั่งตามติดอยู่นิดหน่อย แต่ระยะห่างเล็กจน — สำหรับงานเขียนโค้ดประจำวันส่วนใหญ่ — นักพัฒนาที่ระมัดระวังเรื่องค่าใช้จ่ายสามารถถือ V4 เป็นค่าเริ่มต้น แล้วเก็บแพ็กเกจพรีเมียมน้ำหนักเบาไว้หนึ่งแพ็กเกจสำหรับการรีวิวโค้ด bug ที่เอาไม่ง่าย และ 10% สุดท้ายของงานหลายรอบระยะยาว
ดูแกลเลอรีภาพหน้าจอและลิงก์แชทจากคลื่นแรกได้ที่ รวมหลักฐาน gray-release ของ DeepSeek V4 ของเรา
แคตตาล็อกแหล่งข้อมูลทั้งหมด หลักฐานสำคัญ
หลักฐานดิบเบื้องหลังข้อสรุปทุกข้อในบทความนี้ — เก็บสำเนาจากรีโพซิตอรีโอเพนซอร์ส YunhaoFu/dsv4ga-news-gather กดขยายเพื่อเรียกดูตามครีเอเตอร์ วัน หรือคีย์เวิร์ด ชื่อเรื่องลิงก์ตรงไป Bilibili
คลิกเพื่อขยายทั้ง 136 รายการ
คำใบ้: ชื่อเรื่องคือลิงก์ไป Bilibili เลย เขียว = เซสชันแชร์, ส้ม = ดาวน์โหลดโปรเจกต์ เอาเมาส์ไปวางบนครีเอเตอร์เพื่อดูชื่อเต็ม
121 การทดสอบบอกอะไรเราบ้าง
ข้อมูลมาจากรีโพซิตอรีโอเพนซอร์ส dsv4ga-news-gather ซึ่งทำดัชนีวิดีโอสาธารณะบน Bilibili และเก็บชื่อเรื่อง ชื่อครีเอเตอร์ ไทม์สแตมป์ คำอธิบาย คอมเมนต์ เซสชันแชร์ และลิงก์ดาวน์โหลดไว้ สแนปชอตของวันที่ 19 กรกฎาคมมีหน้าตาประมาณนี้:
โพสต์ต่อวัน
ไหลมาเรื่อยๆ ก่อน 15 กรกฎาคม จากนั้นทะลักทีเดียว และพีคที่ 18 กรกฎาคม
ครีเอเตอร์ Top 10
ในสิบอันดับแรกมีแค่ kdzzzds กับ Delight-linger ที่แชร์ log เซสชันไว้เป็นจำนวน เขียว = แชร์ 5+ เซสชัน, ส้ม = 1–4, น้ำเงิน = ไม่แชร์
คนจริงๆ แล้วทดสอบอะไรกันบ้าง
จัดกลุ่มจากชื่อเรื่องทั้งหมด 136 รายการ เกมครองอย่างเด็ดขาด — ส่วนแบ็กเอนด์ระดับโปรดักชัน ความปลอดภัย และงานระยะยาวแทบไม่ปรากฏเลย
ความเอนเอียงสองแบบสำคัญกว่าตัวเลขใดๆ ความเอนเอียงจากการคัดเลือก: ส่วนใหญ่เป็นงาน "เขียนโค้ดสดรองคำขอ" — เกมบนเบราว์เซอร์ ฉาก 3D แอนิเมชัน SVG ของเล่นฟิสิกส์ เครื่องมือทำเพลง ชุดข้อมูลนี้เลยเป็นหลักฐานที่แข็งแกร่งสำหรับการทำต้นแบบเร็วและการเจนเนอเรตฟรอนต์เอนด์ แต่เป็นหลักฐานที่อ่อนสำหรับแบ็กเอนด์ระดับโปรดักชัน ความปลอดภัย การดูแลรีโพขนาดใหญ่ หรืออะไรก็ตามที่ใช้เวลาเป็นเดือน ความเอนเอียงด้านความโปร่งใส: ในสิบครีเอเตอร์อันดับแรกมีแค่ 3 รายเท่านั้นที่แชร์พร้อมต์หรือ log แชท ถือว่าชื่อวิดีโอที่เขียนว่า "เวอร์ชันทางการ" เป็นแค่การดักยอดวิว — ครีเอเตอร์เองก็มักจะแค่สงสัยว่าติดเราต์เกรย์ เราใช้คำว่า build เกรย์ของ V4 ที่สงสัย ตลอดทั้งบทความ
V4 ดูจะเก่งเรื่องอะไรบ้าง
แอปจากหนึ่งพร้อมต์ตอนนี้รันได้จริง ไม่ใช่แค่สวยตอนดู
รูปแบบที่เด่นที่สุดคือการเจนเนอเรต implementation แบบครบสูบจากสเปคบางๆ ในชุดมีโลก voxel, เกมยิง, เกมจังหว์, เกมเอาตัวรอด, ฉาก three.js, เครื่องมือทำเพลง และการแสดงผลทางวิศวกรรม เดโม SVG สไตล์ GTA ตัวอย่างหนึ่งถูกอธิบายว่าทำมาจากการเจนเนอเรตหลักรอบเดียวบวกรอบแก้บั๊กหนึ่งรอบ และมีเซสชันแชร์แนบมาด้วย นี่ไม่ใช่ "ประโยคเดียว ส่งมอบเกมหนึ่งชุด" แต่เป็น "โมเดลเลือกสถาปัตยกรรมเอง เอาซับซิสเต็มที่ใช้การได้มาต่อกันพอให้เดโมไอเดียออกมา แล้วไม่ยอมคืน mockup เปล่าให้อีกต่อไป"
โค้ด 3D, SVG และการจำลองน้ำหนักเบาเด่นขึ้น
ฉาก three.js, อีเซต SVG ที่กำหนดเอง, ฟิสิกส์เกม และซิมูเลชันอินเทอแอคทีฟปรากฏซ้ำๆ ทั่วชุด หน้าเว็บสไตล์ CFD ของเหลว-ก๊าซ หนึ่งรายการรายงานว่าใช้ PBF สำหรับของเหลวและ LBM สำหรับก๊าซ จาก 2 รอบสนทนา ครีเอเตอร์เองก็ทักไว้ว่าอากาศพลศาสตร์ยังไม่สมจริงและต้องแก้ต่อ — นี่แหละคือเส้นแบ่งระหว่าง "ต้นแบบที่น่าทึ่ง" กับ "เครื่องมือทางวิศวกรรมที่น่าเชื่อถือ"
ราคาอาจเป็นข่าวหัวจริงๆ
การเปรียบเทียบในชุมชนมักบรรยาย V4 กับ Kimi K3 ว่าใกล้กันมากในงานจริง ถ้า API ตัวสุดท้ายยังคงได้เปรียบเรื่องราคาตามสไตล์ DeepSeek "ความสามารถใกล้แนวหน้าในราคาระดับโครงสร้างพื้นฐาน" จะสำคัญกว่าการชนะเดโมหัวชนกันแบบไหนๆ ดู การเปรียบเทียบราคา AI API ของเราประกอบ
จุดที่ V4 ยังฝืดอยู่
- รสนิยมและการขัดเกลา. ในงานประกอบฟรอนต์เอนด์และคำเขียนยาวๆ ชุมชนมักชอบ Kimi K3 มากกว่า งานภาพของ V4 อาจน่าทึ่ง แต่คุณภาพแกว่งตามการออกแบบพร้อมต์อย่างมาก
- ขอบเขตคำสั่ง. มีเดโมนึงให้โมเดลลบคอมเมนต์ ปรากฏว่ามันแอบไปแก้บั๊กของเกมด้วย ความคึกคักแบบนี้ในของเล่นดูเหมือนเวทมนตร์ แต่ในรีโพจริงคือความเสี่ยงตอนรีวิว ต้องดู diff ทุกอัน — อย่าถือว่า "รันได้" เท่ากับ "ผ่าน"
- ความน่าเชื่อถือในงานหลายรอบระยะยาว. เซสชันยังคงแครช ออกนอกลู่ หรือสะสมหนี้ทางสถาปัตยกรรมข้ามหลายรอบ รอบแรกที่แข็งไม่รับประกันว่ารอบที่ยี่สิบจะยังแข็ง
- ความถูกต้องทางฟิสิกส์. ซิมูเลชันของไหลหรือแรงโน้มถ่วงที่ดูเชื่อถือได้ไม่เท่ากับ CFD หรือกลศาสตร์ที่ใช้การได้ ภาพถูก ≠ ตัวเลขถูก
- การทำซ้ำได้. เราต์ติ้งเกรย์ดูไม่เสถียร ผู้ใช้คนละคนอาจเจอโมเดล ระดับ หรือพฤติกรรมการแซมเปิลคนละแบบ
- คุณภาพของหลักฐาน. วิดีโอหลายคลิปไม่บอกพร้อมต์เต็ม ตัวระบุโมเดล จำนวนครั้งที่ล้มเหลว การใช้ token และการแก้ไขด้วยมือ
คำบรรยายที่ซื่อตรงคือ "ตัวเจนเนอเรตต้นแบบเพดานสูงที่มีความสามารถเขียนโค้ดจริง" — ไม่ใช่ "วิศวกรอาวุโสที่ไม่ต้องมีคนรีวิวอีกต่อไป"
V4 vs Kimi K3 vs GPT-5.6 vs Fable 5.0
ที่นี่ไม่มี benchmark สี่โมเดลแบบควบคุม ตารางข้างล่างเป็นการสังเคราะห์เชิงเวิร์กโฟลว์จากหลักฐาน gray-test และรายงานจากผู้ใช้รอบด้าน — ไม่ใช่กระดานจัดอันดับ
| โมเดล | จุดแข็งที่น่าจะเป็น | ที่ตั้งของ V4 | บทบาทที่เหมาะที่สุด |
|---|---|---|---|
| DeepSeek V4 | ต้นทุน, implementation กว้าง, ต้นแบบเร็ว | เส้นฐาน | งานเขียนโค้ดเริ่มต้นประจำวันและ implementation รอบแรก |
| Kimi K3 | การขัดเกลาฟรอนต์เอนด์, การนำเสนอ, งานเขียน | V4 ขัดเกลาน้อยกว่านิดหน่อยแต่ฟังก์ชันมักใกล้เคียง | ปัจจัย UI, ข้อความผลิตภัณฑ์, การปรับรายละเอียดภาพ |
| GPT-5.6 | ความสม่ำเสมอในการรีวิว, ระบบนิเวศเครื่องมือ, การให้เหตุผลข้ามไฟล์ | ในงานประจำ V4 คือทางเลือกที่ถูกกว่า; หลักฐานยังไม่พอจะสรุปว่าชนะรวม | รีวิวโค้ด, การตรวจสอบ, bug ดื้อ |
| Fable 5.0 | implementation ระยะยาว, การกู้คืนในงานหลายรอบ | ในเดโมที่คัดมา V4 ดูใกล้กัน แต่ที่ขอบน่าเชื่อถือน้อยกว่า | โมเดลสำหรับเลื่อนระดับตอนทำส่วนที่ยากที่สุด |
V4 vs Kimi K3: วัตถุดิบโดยตรงที่น่าเชื่อถือที่สุดชี้ไปที่การแข่งขันที่สูสี K3 ดูดีกว่าในงานฟรอนต์เอนด์และงานเขียน; V4 คุ้มค่ากว่าและแข่งได้ในเชิง implementation มีวิดีโอเปรียบเทียบหนึ่งที่ทะลุยอดวิวหลักหมื่น แต่พร้อมต์และการให้คะแนนไม่ได้ถูกมาตรฐานไว้
V4 vs GPT-5.6: มีคอมเมนต์กระจัดกระจายอ้างว่าแพ้-ชนะบ้างในโปรเจกต์เว็บบางชิ้น พวกนี้เป็นไอเดียสำหรับทดสอบ ไม่ใช่ผล benchmark คำถามที่เป็นประโยชน์จริงๆ คือ: V4 ผ่านสวยทดสอบของรีโพคุณได้ในต้นทุนที่ต่ำกว่าไหม
V4 vs Fable 5.0: เดโมเกมที่น่าทึ่งทำให้อยากเปรียบเทียบ แต่ชุดข้อมูลนี้ไม่พอจะพิสูจน์ว่า V4 เสมอภาคในโค้ดเบสขนาดใหญ่ การรีวิวความปลอดภัย หรือการรันอัตโนมัติระยะยาว ถือ Fable 5.0 เป็นทางเลือกสำหรับเลื่อนระดับไปก่อน จนกว่าการทดสอบที่ทำซ้ำได้จะบอกเป็นอย่างอื่น
ข้อเสนอแนะเชิงปฏิบัติ
การตั้งค่าที่ถูกที่สุดและไม่กัดตัวเองทีหลัง:
- ให้ V4 ทำ 80–90% แรก. การวางแผน, โครงสร้างเริ่มต้น, implementation, การทดสอบ, เอกสาร, การแก้ bug ทั่วไป
- ตรวจสอบในเครื่อง. Lint, เช็กประเภท, ยูนิตและอินทิเกรชันเทสต์ บวกการรีวิว diff โดยคน ข้อนี้เจรจาไม่ได้
- เลื่อนระดับพร้อมหลักฐาน. พอติด ส่ง diff, เทสต์ที่ล้ม และคำถามที่เฉพาะเจาะจงไปให้ Kimi K3, GPT-5.6 หรือ Fable 5.0 — ไม่ใช่ส่งพร้อมต์กำกว่าเดิมไปอีกรอบ
- เก็บแพ็กเกจพรีเมียมน้ำหนักเบาไว้หนึ่งแพ็กเกจ ไม่ใช่สมัครเต็มจำนวนหลายแพ็กเกจ. ใช้มันเป็นผู้รีวิวและโมเดลกู้คืน ไม่ใช่ที่ปั่น token เป็นค่าเริ่มต้น
การตั้งค่านี้ใช้การได้ต่อเมื่อโมเดลตัวที่สองได้รับหลักฐาน — diff, log, เทสต์ที่ล้ม การถามคำถามกำกว่าเดิมกับโมเดลสองตัวมักแค่ทำให้ต้นทุนเป็นสองเท่าโดยความน่าเชื่อถือไม่ดีขึ้น
ตอนเปิดตัวทางการแล้วต้องตรวจอะไรบ้าง
ตัดสินเวอร์ชันทางการด้วยการทำซ้ำได้ ไม่ใช่ด้วยเดโมวันเปิดตัว ตรวจดู:
- API model ID ที่แน่นอน แล้วก็ว่าเว็บ, แอป และ API ใช้ระดับเดียวกันไหม;
- หน้าต่างบริบท, ขีดจำกัดเอาต์พุต, การเรียกเครื่องมือ แล้วก็การรองรับเอาต์พุตแบบมีโครงสร้าง;
- ราคาต่อ token ของ input, cached input และ output;
- ลิมิตอัตรา, เราต์ติ้งชั่วโมงเร่งด่วน แล้วก็ว่าระดับ "Pro/Flash/Max" ทำตัวต่างกันไหม;
- การแก้ไขระดับรีโพ, การเติมเทสต์ แล้วก็การเชื่อฟังคำสั่ง;
- โอกาสที่พร้อมต์เดียวกันจะทำซ้ำได้คุณภาพระดับ gray-test;
- ลิขสิทธิ์, การเก็บรักษาข้อมูล แล้วก็ทางเลือกการติดตั้ง
เราจะอัปเดตหน้านี้เมื่อ DeepSeek เผยแพร่การ์ดโมเดลทางการ, เอกสาร API และราคา ก่อนถึงตอนนั้น คำกล่าวอ้างใดๆ เกี่ยวกับโมเดลตัวสุดท้ายยังเป็นเพียงชั่วคราว
คำถามที่พบบ่อย
เวอร์ชันทางการใช้ได้แล้วตอนนี้หรือยัง?
ชุดข้อมูลนี้บันทึกเราต์ติ้งเกรย์ที่สงสัย ไม่ใช่การเปิดตัวที่ยืนยันแล้ว วิดีโอที่ชื่อบอก "เวอร์ชันทางการ" ไม่ใช่การยืนยันทางการจาก DeepSeek
ความสามารถเขียนโค้ดของ V4 เป็นยังไงกันแน่?
หลักฐานแข็งที่สุดในการทำต้นแบบเว็บเร็ว, เกม, SVG, three.js และการแก้ bug แบบวนซ้ำ และบางที่สุดในรีโพโปรดักชันขนาดใหญ่, โค้ดที่ไวต่อความปลอดภัย และงานอัตโนมัติระยะยาว
V4 เก่งกว่า Kimi K3 ไหม?
ไม่ได้เก่งกว่าในทุกงาน V4 ดูใกล้เคียงและอาจคุ้มค่ากว่า; Kimi K3 มักได้เปรียบในการขัดเกลาฟรอนต์เอนด์และงานเขียน ลองรันด้วยพร้อมต์, runtime และเทสต์ยอมรับเดียวกันแล้วค่อยตัดสินใจ
ผมควรยกเลิกแพ็กเกจเขียนโค้ดพรีเมียมไหม?
สำหรับคนส่วนใหญ่ การลดลงเหลือแพ็กเกจพรีเมียมน้ำหนักเบาหนึ่งแพ็กเกจสมเหตุสมผลกว่ายกเลิกทั้งหมด ให้ V4 รับปริมาณงาน แล้วเก็บโมเดลอิสระหนึ่งตัวไว้สำหรับรีวิวและเลื่อนระดับ
ดูการทดสอบเกรย์ดั้งเดิมได้ที่ไหน?
เริ่มจาก ดัชนี GitHub ของวิดีโอทั้ง 121 คลิป เคสเด่นๆ: เทสต์วงกว้าง V4 + Kimi K3, เปรียบเทียบฟิสิกส์ 3D, เทสต์ MC 8192 บล็อก, ตัวอย่างการแก้ bug โดยที่ไม่ได้สั่ง