สรุปสั้น

DeepSeek ยังไม่ได้ออกมายืนยันว่าของพวกนี้คือ V4 สิ่งที่เรามีคือคลื่นผลลัพธ์จาก gray-test ที่สงสัยจำนวนมากและผิดปกติเพราะดูสอดคล้องกันเกินไป: วิดีโอ Bilibili จำนวน 121 คลิปจากครีเอเตอร์ 53 รายในช่วงวันที่ 7–19 กรกฎาคม 2026 บวกกับเซสชันแชร์ของ OpenCode อีก 40 เซสชันและโปรเจกต์ที่ดาวน์โหลดได้อีกไม่กี่ชุด ปริมาณขนาดนี้เพียงพอที่จะมองเห็นรูปแบบ แต่ไม่พอที่จะยืนยัน model ID หรือรัน benchmark แบบควบคุม

ถ้าอ่านหลักฐานด้วยสมมติฐานนี้ ภาพจะชัดเจน: ในแต่ละจุดที่ Kimi K3, GPT-5.6 และ Fable 5.0 แข็งที่สุด V4 ยังนั่งตามติดอยู่นิดหน่อย แต่ระยะห่างเล็กจน — สำหรับงานเขียนโค้ดประจำวันส่วนใหญ่ — นักพัฒนาที่ระมัดระวังเรื่องค่าใช้จ่ายสามารถถือ V4 เป็นค่าเริ่มต้น แล้วเก็บแพ็กเกจพรีเมียมน้ำหนักเบาไว้หนึ่งแพ็กเกจสำหรับการรีวิวโค้ด bug ที่เอาไม่ง่าย และ 10% สุดท้ายของงานหลายรอบระยะยาว

ข้อสรุปเชิงปฏิบัติ: build ที่สงสัยตัวนี้ยังเขียนโค้ดที่ไร้บั๊กไม่ได้ — สิ่งที่เปลี่ยนไปจริงๆ คือมันเปลี่ยนเจตนาของผลิตภัณฑ์ที่ยังกำกวมด้วยประโยคเดียวให้กลายเป็นเว็บแอปที่รันได้ แล้วยังแก้บั๊กของตัวเองได้พอสมควร นี่แหละคือเส้นแบ่งระหว่าง "autocomplete" กับ "implementation agent"

ดูแกลเลอรีภาพหน้าจอและลิงก์แชทจากคลื่นแรกได้ที่ รวมหลักฐาน gray-release ของ DeepSeek V4 ของเรา

แคตตาล็อกแหล่งข้อมูลทั้งหมด หลักฐานสำคัญ

หลักฐานดิบเบื้องหลังข้อสรุปทุกข้อในบทความนี้ — เก็บสำเนาจากรีโพซิตอรีโอเพนซอร์ส YunhaoFu/dsv4ga-news-gather กดขยายเพื่อเรียกดูตามครีเอเตอร์ วัน หรือคีย์เวิร์ด ชื่อเรื่องลิงก์ตรงไป Bilibili

คลิกเพื่อขยายทั้ง 136 รายการ 121 วิดีโอทดสอบ + 15 โพสต์ที่เกี่ยวข้อง

คำใบ้: ชื่อเรื่องคือลิงก์ไป Bilibili เลย = เซสชันแชร์, ส้ม = ดาวน์โหลดโปรเจกต์ เอาเมาส์ไปวางบนครีเอเตอร์เพื่อดูชื่อเต็ม

#วันที่ครีเอเตอร์ชื่อเรื่อง / หลักฐาน
1 07-19 不爱亲 疑似deepseekV4灰度正式版,一句话生成的mc光影包
2 07-19 一只AI风向标 DeepSeek V4正式版泄露、Opus 5下周发布或由Karpathy训练、京东发布JoyAI-Talker与Video-Edit | 7月19日 AI日报
3 07-19 猫伊cat 【Deepseek】D老师劝用户不要人机恋之后心态崩了然后搓了个这个
4 07-19 Ai产品小丁 DeepSeek V4 正式版要来了?
5 07-19 进化中的阿陈 Kimi K3.1、DeepSeek V4、Grok 4.6接连放出新爆料,Fable 5 却还在限制 50% 用量 !
6 07-19 kdzzzds ds灰度-(不搜素材 +SVG一轮出) 高质量gta5 2.0
7 07-19 帅气的丝庐海椮潔 DeepseekV4一句话生成的类cs游戏
8 07-19 月隐隐约 Deepseek v4正式版文字生成游戏视频合集
9 07-19 星光与雪 DeepSeek v4正式版一句话设计生成减速器
10 07-19 小鲤玩游戏_ DeepSeek V4 正式版即将发布,有哪些值得关注的亮点?
11 07-19 Augenstern_-__- dsv4灰度正式版-再次进化
12 07-19 咖喱鱼 V4一拳崩死FABLE,中国模型无限追杀A÷和GPT
13 07-19 小小小名不是小明 DeepSeek V4 疑似正式版 两句话生成气液CFD网页(较为不真实)
14 07-19 小小小名不是小明 DeepSeek V4 正式版,帮我生成一首电子音乐【基于strudel.cc代码生成的音乐三首】
15 07-19 冬眠の松鼠_ DeepSeek V4正式版 炉石传说
16 07-19 北宸Polariss 【deepseek v4正式版】土豆兄弟
17 07-19 夜之叶归一 deepseek v4 pro 正式版建模测试
18 07-19 Delight-linger 工程实战?【dsv4对战k3】3D物理骨骼动画,对比让人核爆
19 07-19 北宸Polariss 【deepseek v4正式版】水果忍者
20 07-19 UPLUZ 【疑似DeepSeek正式版】灾害模拟,比前几天看到的又进化了
21 07-19 戏场上的老将军 deepseekv4正式版一段提示词生成黑洞
22 07-19 bili_3493108501187431 deepseekv4正式版战雷最终测试版
23 07-18 -_一-_一- 用deepseek正式版的竞争对手gpt5.6Sol花费很多句话实现的大战略地图
24 07-18 PotnQ DSV4灰测一款游戏迭代了几百次有多恐怖?
25 07-18 戏场上的老将军 deepseekv4正式版 超视距8192格MC
26 07-18 UPLUZ 【疑似DeepSeek正式版】谁才是模型之王啊?(战术后仰)
27 07-18 一只AI风向标 DeepSeek V4正式版灰度测试、马斯克Grok 4.6下周开测、上海AI实验室Intern-S2击败Opus4.8 | 7月18日 AI日报
28 07-18 UPLUZ 【疑似DeepSeek正式版】我和D指导重新设计了像素鸟
29 07-18 cacl2_lhg DeepSeek V4 正式版灰度测试制作的我的世界版马车(含多种不同赛道)
30 07-18 宇智波华人 用deepseek做的小游戏,三国斗飞机!!!
31 07-18 梦回0 dsv4正式版还原《星空Starfield》1000颗星球可无缝起降,陶德你的梦想deepseek帮你实现了!
32 07-18 爱摸鱼的月萌 【中配】Anthropic 发展遇冷|Kimi K3.1、Grok 4.6、DeepSeek v4 正式版、美国政府 Gold Eagle 模型,还有机器人综合
33 07-18 赤麟方阵2号 deepseek灰度测试,地球防卫军试玩
34 07-18 bili_3493108501187431 deepseekv4正式版生成的战争雷霆优化版
35 07-18 硅谷神奇 Anthropic的变故……Kimi K3.1、Grok 4.6、DeepSeek v4正式版、美国政府“金鹰”计划,以及机器人综合格斗!
36 07-18 山头小妖 用deepseek,一天开发游戏的进度(新游戏开发中:末日堡垒对抗)
37 07-18 Aki_2519 [疑似Deepseek v4正式版]类Teardown游戏生成
38 07-18 UPLUZ 【疑似DeepSeek正式版】这才是真正的音乐.jpg②
39 07-18 紫巅 (灰测)DeepSeek正式版一次生成重生细胞
40 07-18 小小小名不是小明 双叉臂悬挂测试后续 没有人可以诋毁V4正式版
41 07-18 烟神殿殿主 AI大洗牌!Anthropic跌下神坛,Kimi K3.1、Grok 4.6、DeepSeek v4大混战,还有美政府金鹰计划与机器人MMA
42 07-18 TwoShenMengxi deepseek正式版无人深空X我的世界(目前已坠机)
43 07-18 Delight-linger 【dsv4正式版】用Godot与C#一句话复刻[网吧模拟器]游戏
44 07-18 UPLUZ 【疑似DeepSeek正式版】震惊瘫坐!节奏光剑都被他搞出来了!
45 07-18 杠精MrS deepseekv4pro max疑似灰度正式版,一句话生成合金弹头,引擎也是自己写的无敌了
46 07-18 炽热的钢铁 疑似灰度到了deepseek-v4-pro正式版!只用一句话让大肥鱼手搓了5首电音!
47 07-18 夜之叶归一 deepseek V4 正式版 测试
48 07-18 kdzzzds ds灰度 超视距8192格MC 1轮出+2轮修bug优化
49 07-18 雨下冰梧桐 请让我真诚的说DEEPSEEK V4 灰度测试正式版,很出色,很厉害,很优秀,但不完美,还是会有BUG的,这是最真诚的话,且不接受反驳。
50 07-18 伊甸的亚托莉 【疑似deepseekv4正式版】ai里的贝多芬 多种音乐生成测试
51 07-18 -温醨- 疑似deepseekv4灰度测试,仅提供部分素材,另外部分素材由ai自己生成,逻辑一遍过,第二遍改了下画风
52 07-18 小小小名不是小明 V8声浪模拟,比地平线好听 DS V4 灰测生成
53 07-18 康康不说骚话 霓虹浪人-deepseek一锅出版本
54 07-18 鱼村长233 Deepseekv4正式版灰测,音乐创建和nes模拟器
55 07-18 雨下冰梧桐 单网页小游戏《方块世界》,这次我不蹭DEEPSEEK V4灰度测试正式版,抛弃流量密码,看一看真实数据。
56 07-18 kdzzzds dsv4灰度版 (ds自己建模) csgo 死斗模式+爆破
57 07-18 果汁盒Summer 用DeepSeek(疑似正式版)复刻战双帕弥什
58 07-18 stupid_scout DeepseekV4正式版 类战地游戏彻底翻新 加了许多内容(下载链接在评论区)
59 07-18 LikrFG 疑似 deepseek v4 正式版模型测试
60 07-18 小小小名不是小明 有V8!DS v4正式版游戏两则【马里奥 和 赛车】快速更新第四期,纯玩嗨了分享成果
61 07-18 添星_tianxing deepseek正式版,4块钱做的小游戏
62 07-18 离梦aajjkk DeepSeekv4pro正式版一句话生成4000小球测试,完美无bug(max模式),附带性能测试。
63 07-17 冬眠の松鼠_ DeepSeek V4正式版 三角洲行动和森林
64 07-17 小小小名不是小明 DS v4正式版一句话生成【截图翻译工具、精品独立游戏】快速更新第三期,纯玩嗨了分享成果
65 07-17 Qilin1132 当你让deepseek v4灰度正式版和预览版做同样的游戏时
66 07-17 梦回0 deepseek v4正式版,制作飞车类型游戏
67 07-17 风味光猫 [东方project]DeepSeek疑似灰测与预览版一句话生成弹幕游戏对比
68 07-17 kdzzzds dsv4灰度--(不搜素材纯自己建模)1轮出+1轮修bug的超高质量gta
69 07-17 Augenstern_-__- v4灰度正式版-两个前端版本的对比
70 07-17 没有设置一 deepseek把claude fable5开源了☝️
71 07-17 星光与雪 DeepSeek v4正式版多轮对话复刻《王国·两位君主》
72 07-17 黑韬 DeepseekV4正式版手搓的歌剧《卡门》动画
73 07-17 s就是这样s 疑似DS V4正式版灰度,被这效果吓哭,这是我看过《我的世界》+《无人深空》融合的最好的一个版本
74 07-17 kdzzzds 来看看v4灰测前端 隐藏的巨大潜力(AI生成的提示词)
75 07-17 DaVinci-2nd 没灰度到dsV4正式版或者灰度到坠机了的进来
76 07-17 kdzzzds 核弹之作-疑似dsv4正式版灰度-我的世界/星际拓荒 曲率方块
77 07-17 e4glet DeepSeek 3D Walkman播放器
78 07-17 猫伊cat 【Vibecoding】Claude和Deepseek合力做的可以弹奏的小太阳
79 07-17 一爽电台 马斯克锐评Kimi k3!我只想说 deepseek NO1
80 07-17 浪迹天涯人free deepseek正式版灰度做雷霆战机
81 07-17 kdzzzds 谁敢质疑d老师的审美-疑似dsv4灰度之只用SVG图作我的世界
82 07-17 -温醨- deepseek v4正式版灰度,我的世界+孢子,二次修改
83 07-17 星光与雪 DeepSeek v4正式版多轮对话生成光遇
84 07-17 kdzzzds 疑似dsv4灰度- 我的深空,在原提示词基础上加强美术提示词看看效果(没用联网)
85 07-17 爱尔奎德的死徒 DeepSeek v4灰度正式版+Z-image生成游戏,学院昆特牌
86 07-17 小小小名不是小明 测试第二期!DeepSeek V4正式版全方面深度测试 附带kimiK3
87 07-17 夜之叶归一 deepseek v4正式版 测试
88 07-17 夜之叶归一 deepseek v4正式版测试,一句生成游戏
89 07-17 -温醨- 疑似dsv4正式版灰测,我的世界+孢子
90 07-17 冬眠の松鼠_ DeepSeek V4 魔兽世界 高清重制版
91 07-17 Delight-linger 双日凌空! 对比测试K3与Deepseekv4(灰度正式版)实力
92 07-16 kdzzzds 不严谨测试
93 07-16 PotnQ DSV4正式版灰度无人深空超级伪无缝登陆
94 07-16 探归者夕迁 Deepseekv4正式版-我的太空计划 试玩 软着陆登月
95 07-16 冬眠の松鼠_ DeepSeek V4正式版 多轮对话生成魔兽世界
96 07-16 UPLUZ 【疑似DeepSeek正式版】像素鸟flappybird-预览版与正式版效果对比
97 07-16 stupid_scout DeepseekV4正式版 测试传送门(功能实现很不错!还有一些传送门问题测试)
98 07-16 黑韬 DeepseekV4正式版生成的逆转裁判!
99 07-16 洛必达实验室 Kimi K3 性能简直炸裂!又一个 DeepSeek 时刻要来了?人工智能AI
100 07-16 cacl2_lhg 疑似Deepseek V4正式版生成的仿马力欧赛车小游戏
101 07-16 Augenstern_-__- v4灰度正式版,svg拉弓动画测试
102 07-16 stupid_scout DeepseekV4正式版 我只是让他删注释 竟然顺手修了游戏bug
103 07-16 s就是这样s 疑似高维空间碎片,Deepseek正式版灰度,一句话生成《地平线6》
104 07-16 梦回0 deepseek v4 正式版生成只狼版网页游戏
105 07-16 stupid_scout DeepseekV4正式版生成的战地游戏(效果吊炸天了!!)
106 07-16 吧必须徐112 【7月最新】免费白嫖!DeepSeek V4 自由版免费用,不限次数!
107 07-16 三十丁尼 dsv4生成可自定义音乐的下落式音游
108 07-16 Delight-linger 核弹爆炸,dsv4正式版一次性生成多款安卓游戏,涵盖跑酷,AR,2D打击等等
109 07-16 UPLUZ 【疑似DeepSeek正式版】Besiege围攻,物理模拟很不错
110 07-16 飞越麦当劳 deepseek v4正式版灰测,生成恐怖游戏
111 07-16 飯綱九龍 【东方】Deepseek-v4正式版(疑似)灰度一次生成 - 东 方 智 械 录
112 07-16 Augenstern_-__- dsv4灰度正式版-修正前两期以及展示骑马与砍杀
113 07-16 Augenstern_-__- 疑似dsv4正式版灰度-后室
114 07-16 Augenstern_-__- 疑似dsv4正式版灰度-最有氛围的日系恐怖游戏,预览与正式版对比
115 07-15 UPLUZ 【疑似DeepSeek正式版】塞尔达世界
116 07-15 Delight-linger Deepseekv4正式版-坎巴拉太空计划+我的世界---实操登录月球(硬着陆)3轮对话
117 07-15 作手阿九 deepseekV4pro一句话生成的幸存者游戏
118 07-15 飯綱九龍 疑似dsv4正式版灰度-我的世界X无人深空
119 07-15 Delight-linger Deepseek正式版灰度 木筏求生+我的世界(我的木筏)
120 07-15 齐天大圣wy Deepseek 你这个死肥鱼到底干了什么
121 07-15 桶水test-2 被deepseek震惊了
122 07-15 kdzzzds 疑似deepseekv4正式版灰度 我的世界+无人深空(调小声音)
123 07-14 kdzzzds (以坠机)疑似dsv4正式版灰测 暮色森林(做一半坠机了)
124 07-14 kdzzzds 疑似deepseekv4正式版灰度测试-拳皇
125 07-14 kdzzzds 疑似deepseek v4正式版灰度-我的世界地狱末地地形测试(地形为一次出)
126 07-14 kdzzzds 疑似deepseekv4正式版灰测-无人深空
127 07-13 2258ppq dsv4 正式版 测试2
128 07-11 不可以包含特殊字符 DeepSeek4.0正式版灰度测试小游戏开发
129 07-10 飞越麦当劳 不知道是不是被deepseek v4正式版灰度到了,用一句话生成的,但效果确实好
130 07-09 冬眠の松鼠_ DeepSeek V4正式版一句话生成《后室》和恐怖游戏
131 07-09 小小小名不是小明 国产之光再进化!DeepSeek V4正式版简测,附带横评Gemini3.5 Pro / Grok4.5等
132 07-09 Delight-linger 灰度测试dsv4正式版?泰拉瑞亚-以撒结合-RTS-浏览器操作系统-割绳子-星露谷全测试
133 07-08 冬眠の松鼠_ 灰度测试:DeepSeek V4正式版一句话生成GTA5
134 07-07 冬眠の松鼠_ DeepSeek V4正式版一句话生成CSGO(生成记录透明)
135 07-07 冬眠の松鼠_ DeepSeek V4正式版生成的《我的世界》
136 07-06 System-Win-FUN Deepseek出现恶性漏洞,在回答问题的时候有几率会一直回答那个收到。

121 การทดสอบบอกอะไรเราบ้าง

ข้อมูลมาจากรีโพซิตอรีโอเพนซอร์ส dsv4ga-news-gather ซึ่งทำดัชนีวิดีโอสาธารณะบน Bilibili และเก็บชื่อเรื่อง ชื่อครีเอเตอร์ ไทม์สแตมป์ คำอธิบาย คอมเมนต์ เซสชันแชร์ และลิงก์ดาวน์โหลดไว้ สแนปชอตของวันที่ 19 กรกฎาคมมีหน้าตาประมาณนี้:

121วิดีโอ gray-test
53ครีเอเตอร์อิสระ
40เซสชันแชร์
12ช่วงวัน (7/7–7/19)

โพสต์ต่อวัน

ไหลมาเรื่อยๆ ก่อน 15 กรกฎาคม จากนั้นทะลักทีเดียว และพีคที่ 18 กรกฎาคม

7/6
1
7/7
2
7/8
1
7/9
3
7/10
1
7/11
1
7/13
1
7/14
4
7/15
8
7/16
23
7/17
29
7/18
40
7/19
22

ครีเอเตอร์ Top 10

ในสิบอันดับแรกมีแค่ kdzzzds กับ Delight-linger ที่แชร์ log เซสชันไว้เป็นจำนวน เขียว = แชร์ 5+ เซสชัน, ส้ม = 1–4, น้ำเงิน = ไม่แชร์

kdzzzds
14· 12 แชร์
小小小名不是小明
8· ไม่แชร์
冬眠の松鼠_
8· ไม่แชร์
UPLUZ
8· ไม่แชร์
Delight-linger
7· 11 แชร์
Augenstern_-__-
6· 1 แชร์
夜之叶归一
4· ไม่แชร์
stupid_scout
4· ไม่แชร์
星光与雪
3· ไม่แชร์
梦回0
3· ไม่แชร์

คนจริงๆ แล้วทดสอบอะไรกันบ้าง

จัดกลุ่มจากชื่อเรื่องทั้งหมด 136 รายการ เกมครองอย่างเด็ดขาด — ส่วนแบ็กเอนด์ระดับโปรดักชัน ความปลอดภัย และงานระยะยาวแทบไม่ปรากฏเลย

เกมอื่นๆ / ต้นแบบ
4332%
Voxel / Minecraft
1712%
การ์ด / RPG / อาร์เคด
1712%
ฟิสิกส์ / จำลองอวกาศ
129%
ยิง / ทหาร
118%
เพลง / เสียง
107%
แข่งรถ / โอเพนเวิลด์
86%
ข่าว / สรุป
75%
สยองขวัญ
54%
แชต / โชว์
32%
เครื่องมือ / ทดสอบเอนจิน
32%

ความเอนเอียงสองแบบสำคัญกว่าตัวเลขใดๆ ความเอนเอียงจากการคัดเลือก: ส่วนใหญ่เป็นงาน "เขียนโค้ดสดรองคำขอ" — เกมบนเบราว์เซอร์ ฉาก 3D แอนิเมชัน SVG ของเล่นฟิสิกส์ เครื่องมือทำเพลง ชุดข้อมูลนี้เลยเป็นหลักฐานที่แข็งแกร่งสำหรับการทำต้นแบบเร็วและการเจนเนอเรตฟรอนต์เอนด์ แต่เป็นหลักฐานที่อ่อนสำหรับแบ็กเอนด์ระดับโปรดักชัน ความปลอดภัย การดูแลรีโพขนาดใหญ่ หรืออะไรก็ตามที่ใช้เวลาเป็นเดือน ความเอนเอียงด้านความโปร่งใส: ในสิบครีเอเตอร์อันดับแรกมีแค่ 3 รายเท่านั้นที่แชร์พร้อมต์หรือ log แชท ถือว่าชื่อวิดีโอที่เขียนว่า "เวอร์ชันทางการ" เป็นแค่การดักยอดวิว — ครีเอเตอร์เองก็มักจะแค่สงสัยว่าติดเราต์เกรย์ เราใช้คำว่า build เกรย์ของ V4 ที่สงสัย ตลอดทั้งบทความ

V4 ดูจะเก่งเรื่องอะไรบ้าง

แอปจากหนึ่งพร้อมต์ตอนนี้รันได้จริง ไม่ใช่แค่สวยตอนดู

รูปแบบที่เด่นที่สุดคือการเจนเนอเรต implementation แบบครบสูบจากสเปคบางๆ ในชุดมีโลก voxel, เกมยิง, เกมจังหว์, เกมเอาตัวรอด, ฉาก three.js, เครื่องมือทำเพลง และการแสดงผลทางวิศวกรรม เดโม SVG สไตล์ GTA ตัวอย่างหนึ่งถูกอธิบายว่าทำมาจากการเจนเนอเรตหลักรอบเดียวบวกรอบแก้บั๊กหนึ่งรอบ และมีเซสชันแชร์แนบมาด้วย นี่ไม่ใช่ "ประโยคเดียว ส่งมอบเกมหนึ่งชุด" แต่เป็น "โมเดลเลือกสถาปัตยกรรมเอง เอาซับซิสเต็มที่ใช้การได้มาต่อกันพอให้เดโมไอเดียออกมา แล้วไม่ยอมคืน mockup เปล่าให้อีกต่อไป"

โค้ด 3D, SVG และการจำลองน้ำหนักเบาเด่นขึ้น

ฉาก three.js, อีเซต SVG ที่กำหนดเอง, ฟิสิกส์เกม และซิมูเลชันอินเทอแอคทีฟปรากฏซ้ำๆ ทั่วชุด หน้าเว็บสไตล์ CFD ของเหลว-ก๊าซ หนึ่งรายการรายงานว่าใช้ PBF สำหรับของเหลวและ LBM สำหรับก๊าซ จาก 2 รอบสนทนา ครีเอเตอร์เองก็ทักไว้ว่าอากาศพลศาสตร์ยังไม่สมจริงและต้องแก้ต่อ — นี่แหละคือเส้นแบ่งระหว่าง "ต้นแบบที่น่าทึ่ง" กับ "เครื่องมือทางวิศวกรรมที่น่าเชื่อถือ"

ราคาอาจเป็นข่าวหัวจริงๆ

การเปรียบเทียบในชุมชนมักบรรยาย V4 กับ Kimi K3 ว่าใกล้กันมากในงานจริง ถ้า API ตัวสุดท้ายยังคงได้เปรียบเรื่องราคาตามสไตล์ DeepSeek "ความสามารถใกล้แนวหน้าในราคาระดับโครงสร้างพื้นฐาน" จะสำคัญกว่าการชนะเดโมหัวชนกันแบบไหนๆ ดู การเปรียบเทียบราคา AI API ของเราประกอบ

จุดที่ V4 ยังฝืดอยู่

  • รสนิยมและการขัดเกลา. ในงานประกอบฟรอนต์เอนด์และคำเขียนยาวๆ ชุมชนมักชอบ Kimi K3 มากกว่า งานภาพของ V4 อาจน่าทึ่ง แต่คุณภาพแกว่งตามการออกแบบพร้อมต์อย่างมาก
  • ขอบเขตคำสั่ง. มีเดโมนึงให้โมเดลลบคอมเมนต์ ปรากฏว่ามันแอบไปแก้บั๊กของเกมด้วย ความคึกคักแบบนี้ในของเล่นดูเหมือนเวทมนตร์ แต่ในรีโพจริงคือความเสี่ยงตอนรีวิว ต้องดู diff ทุกอัน — อย่าถือว่า "รันได้" เท่ากับ "ผ่าน"
  • ความน่าเชื่อถือในงานหลายรอบระยะยาว. เซสชันยังคงแครช ออกนอกลู่ หรือสะสมหนี้ทางสถาปัตยกรรมข้ามหลายรอบ รอบแรกที่แข็งไม่รับประกันว่ารอบที่ยี่สิบจะยังแข็ง
  • ความถูกต้องทางฟิสิกส์. ซิมูเลชันของไหลหรือแรงโน้มถ่วงที่ดูเชื่อถือได้ไม่เท่ากับ CFD หรือกลศาสตร์ที่ใช้การได้ ภาพถูก ≠ ตัวเลขถูก
  • การทำซ้ำได้. เราต์ติ้งเกรย์ดูไม่เสถียร ผู้ใช้คนละคนอาจเจอโมเดล ระดับ หรือพฤติกรรมการแซมเปิลคนละแบบ
  • คุณภาพของหลักฐาน. วิดีโอหลายคลิปไม่บอกพร้อมต์เต็ม ตัวระบุโมเดล จำนวนครั้งที่ล้มเหลว การใช้ token และการแก้ไขด้วยมือ

คำบรรยายที่ซื่อตรงคือ "ตัวเจนเนอเรตต้นแบบเพดานสูงที่มีความสามารถเขียนโค้ดจริง" — ไม่ใช่ "วิศวกรอาวุโสที่ไม่ต้องมีคนรีวิวอีกต่อไป"

V4 vs Kimi K3 vs GPT-5.6 vs Fable 5.0

ที่นี่ไม่มี benchmark สี่โมเดลแบบควบคุม ตารางข้างล่างเป็นการสังเคราะห์เชิงเวิร์กโฟลว์จากหลักฐาน gray-test และรายงานจากผู้ใช้รอบด้าน — ไม่ใช่กระดานจัดอันดับ

โมเดลจุดแข็งที่น่าจะเป็นที่ตั้งของ V4บทบาทที่เหมาะที่สุด
DeepSeek V4ต้นทุน, implementation กว้าง, ต้นแบบเร็วเส้นฐานงานเขียนโค้ดเริ่มต้นประจำวันและ implementation รอบแรก
Kimi K3การขัดเกลาฟรอนต์เอนด์, การนำเสนอ, งานเขียนV4 ขัดเกลาน้อยกว่านิดหน่อยแต่ฟังก์ชันมักใกล้เคียงปัจจัย UI, ข้อความผลิตภัณฑ์, การปรับรายละเอียดภาพ
GPT-5.6ความสม่ำเสมอในการรีวิว, ระบบนิเวศเครื่องมือ, การให้เหตุผลข้ามไฟล์ในงานประจำ V4 คือทางเลือกที่ถูกกว่า; หลักฐานยังไม่พอจะสรุปว่าชนะรวมรีวิวโค้ด, การตรวจสอบ, bug ดื้อ
Fable 5.0implementation ระยะยาว, การกู้คืนในงานหลายรอบในเดโมที่คัดมา V4 ดูใกล้กัน แต่ที่ขอบน่าเชื่อถือน้อยกว่าโมเดลสำหรับเลื่อนระดับตอนทำส่วนที่ยากที่สุด

V4 vs Kimi K3: วัตถุดิบโดยตรงที่น่าเชื่อถือที่สุดชี้ไปที่การแข่งขันที่สูสี K3 ดูดีกว่าในงานฟรอนต์เอนด์และงานเขียน; V4 คุ้มค่ากว่าและแข่งได้ในเชิง implementation มีวิดีโอเปรียบเทียบหนึ่งที่ทะลุยอดวิวหลักหมื่น แต่พร้อมต์และการให้คะแนนไม่ได้ถูกมาตรฐานไว้

V4 vs GPT-5.6: มีคอมเมนต์กระจัดกระจายอ้างว่าแพ้-ชนะบ้างในโปรเจกต์เว็บบางชิ้น พวกนี้เป็นไอเดียสำหรับทดสอบ ไม่ใช่ผล benchmark คำถามที่เป็นประโยชน์จริงๆ คือ: V4 ผ่านสวยทดสอบของรีโพคุณได้ในต้นทุนที่ต่ำกว่าไหม

V4 vs Fable 5.0: เดโมเกมที่น่าทึ่งทำให้อยากเปรียบเทียบ แต่ชุดข้อมูลนี้ไม่พอจะพิสูจน์ว่า V4 เสมอภาคในโค้ดเบสขนาดใหญ่ การรีวิวความปลอดภัย หรือการรันอัตโนมัติระยะยาว ถือ Fable 5.0 เป็นทางเลือกสำหรับเลื่อนระดับไปก่อน จนกว่าการทดสอบที่ทำซ้ำได้จะบอกเป็นอย่างอื่น

ข้อเสนอแนะเชิงปฏิบัติ

การตั้งค่าที่ถูกที่สุดและไม่กัดตัวเองทีหลัง:

  1. ให้ V4 ทำ 80–90% แรก. การวางแผน, โครงสร้างเริ่มต้น, implementation, การทดสอบ, เอกสาร, การแก้ bug ทั่วไป
  2. ตรวจสอบในเครื่อง. Lint, เช็กประเภท, ยูนิตและอินทิเกรชันเทสต์ บวกการรีวิว diff โดยคน ข้อนี้เจรจาไม่ได้
  3. เลื่อนระดับพร้อมหลักฐาน. พอติด ส่ง diff, เทสต์ที่ล้ม และคำถามที่เฉพาะเจาะจงไปให้ Kimi K3, GPT-5.6 หรือ Fable 5.0 — ไม่ใช่ส่งพร้อมต์กำกว่าเดิมไปอีกรอบ
  4. เก็บแพ็กเกจพรีเมียมน้ำหนักเบาไว้หนึ่งแพ็กเกจ ไม่ใช่สมัครเต็มจำนวนหลายแพ็กเกจ. ใช้มันเป็นผู้รีวิวและโมเดลกู้คืน ไม่ใช่ที่ปั่น token เป็นค่าเริ่มต้น
แนะนำ: V4 เป็นโมเดล implementation ปริมาณงานสูง บวกแพ็กเกจพรีเมียมน้ำหนักเบาหนึ่งแพ็กเกจสำหรับรีวิวโค้ดอิสระและปัญหาที่เอาตัวรอดจากหลายรอบไม่ได้

การตั้งค่านี้ใช้การได้ต่อเมื่อโมเดลตัวที่สองได้รับหลักฐาน — diff, log, เทสต์ที่ล้ม การถามคำถามกำกว่าเดิมกับโมเดลสองตัวมักแค่ทำให้ต้นทุนเป็นสองเท่าโดยความน่าเชื่อถือไม่ดีขึ้น

ตอนเปิดตัวทางการแล้วต้องตรวจอะไรบ้าง

ตัดสินเวอร์ชันทางการด้วยการทำซ้ำได้ ไม่ใช่ด้วยเดโมวันเปิดตัว ตรวจดู:

  • API model ID ที่แน่นอน แล้วก็ว่าเว็บ, แอป และ API ใช้ระดับเดียวกันไหม;
  • หน้าต่างบริบท, ขีดจำกัดเอาต์พุต, การเรียกเครื่องมือ แล้วก็การรองรับเอาต์พุตแบบมีโครงสร้าง;
  • ราคาต่อ token ของ input, cached input และ output;
  • ลิมิตอัตรา, เราต์ติ้งชั่วโมงเร่งด่วน แล้วก็ว่าระดับ "Pro/Flash/Max" ทำตัวต่างกันไหม;
  • การแก้ไขระดับรีโพ, การเติมเทสต์ แล้วก็การเชื่อฟังคำสั่ง;
  • โอกาสที่พร้อมต์เดียวกันจะทำซ้ำได้คุณภาพระดับ gray-test;
  • ลิขสิทธิ์, การเก็บรักษาข้อมูล แล้วก็ทางเลือกการติดตั้ง

เราจะอัปเดตหน้านี้เมื่อ DeepSeek เผยแพร่การ์ดโมเดลทางการ, เอกสาร API และราคา ก่อนถึงตอนนั้น คำกล่าวอ้างใดๆ เกี่ยวกับโมเดลตัวสุดท้ายยังเป็นเพียงชั่วคราว

คำถามที่พบบ่อย

เวอร์ชันทางการใช้ได้แล้วตอนนี้หรือยัง?

ชุดข้อมูลนี้บันทึกเราต์ติ้งเกรย์ที่สงสัย ไม่ใช่การเปิดตัวที่ยืนยันแล้ว วิดีโอที่ชื่อบอก "เวอร์ชันทางการ" ไม่ใช่การยืนยันทางการจาก DeepSeek

ความสามารถเขียนโค้ดของ V4 เป็นยังไงกันแน่?

หลักฐานแข็งที่สุดในการทำต้นแบบเว็บเร็ว, เกม, SVG, three.js และการแก้ bug แบบวนซ้ำ และบางที่สุดในรีโพโปรดักชันขนาดใหญ่, โค้ดที่ไวต่อความปลอดภัย และงานอัตโนมัติระยะยาว

V4 เก่งกว่า Kimi K3 ไหม?

ไม่ได้เก่งกว่าในทุกงาน V4 ดูใกล้เคียงและอาจคุ้มค่ากว่า; Kimi K3 มักได้เปรียบในการขัดเกลาฟรอนต์เอนด์และงานเขียน ลองรันด้วยพร้อมต์, runtime และเทสต์ยอมรับเดียวกันแล้วค่อยตัดสินใจ

ผมควรยกเลิกแพ็กเกจเขียนโค้ดพรีเมียมไหม?

สำหรับคนส่วนใหญ่ การลดลงเหลือแพ็กเกจพรีเมียมน้ำหนักเบาหนึ่งแพ็กเกจสมเหตุสมผลกว่ายกเลิกทั้งหมด ให้ V4 รับปริมาณงาน แล้วเก็บโมเดลอิสระหนึ่งตัวไว้สำหรับรีวิวและเลื่อนระดับ

ดูการทดสอบเกรย์ดั้งเดิมได้ที่ไหน?

เริ่มจาก ดัชนี GitHub ของวิดีโอทั้ง 121 คลิป เคสเด่นๆ: เทสต์วงกว้าง V4 + Kimi K3, เปรียบเทียบฟิสิกส์ 3D, เทสต์ MC 8192 บล็อก, ตัวอย่างการแก้ bug โดยที่ไม่ได้สั่ง