结论速览
DeepSeek 没有公开确认这些就是 V4。我们能拿到的是一批量大、且一致性可疑的疑似灰度测试输出:2026 年 7 月 7–19 日间 53 位创作者发布的 121 个 Bilibili 视频,加上 40 个 OpenCode 共享会话和少量可下载项目。这个量足够看出模式,但不足以确认模型 ID 或跑一个受控基准。
按这个前提读,结论很清楚:在 Kimi K3、GPT-5.6、Fable 5.0 各自最强的领域,V4 略逊一筹,但差距已经小到——对于大多数日常编程,省钱的开发者完全可以把 V4 当默认,再留一份轻量高端订阅用于代码审查、棘手 bug 和多轮长任务的最后 10%。
想看更早一波的截图和聊天链接,见我们的 DeepSeek V4 灰度测试证据汇总。
完整来源目录 关键证据
本文所有结论的原始证据——镜像自开源仓库 YunhaoFu/dsv4ga-news-gather。展开后可按 UP 主、日期或关键词检索。标题直达 Bilibili。
点击展开全部 136 条记录
提示:标题即 Bilibili 链接。绿色 = 共享会话,橙色 = 项目下载。鼠标悬停 UP 主可见完整名。
121 个测试说明了什么
数据来自开源项目 dsv4ga-news-gather,它索引 Bilibili 公开视频,保留标题、创作者、时间戳、简介、评论、共享会话和下载链接。7 月 19 日的快照大致是这样的:
每日发布量
7 月 15 日前零星流出,之后集中爆发,7 月 18 日达到峰值。
创作者 Top 10
前十名里只有 kdzzzds 和 Delight-linger 公开了大量会话。绿色 = 5+ 个共享会话,橙色 = 1–4 个,蓝色 = 无。
大家实际在测什么
按标题归类共 136 条。游戏占绝对主导——生产级后端、安全、长周期项目几乎没出现。
两个偏差比任何单一数字都重要。选择偏差:大多数是"许愿式编程"——浏览器游戏、3D 场景、SVG 动画、物理小玩具、音乐工具。所以这批数据是快速原型和前端生成的强力证据,但对生产级后端、安全、大型仓库维护、需要数月周期的项目几乎没有说服力。透明度偏差:前十名创作者里只有 3 位分享了提示词或会话日志。视频标题里写"正式版"基本是蹭流量——UP 主通常也只是疑似灰度到了。全文用疑似 V4 灰度版本表述。
V4 看起来擅长什么
一句话应用现在真的能跑,而不是只能看
最显著的模式是从简短规格生成完整实现。集合里有 voxel 世界、射击、音游、生存、three.js 场景、音乐生成器和工程可视化。一个有代表性的 GTA 风 SVG demo 据描述是一次主生成 + 一次修 bug,并附了共享会话。这不是"一句话就能交付一个游戏",而是"模型自己挑架构、把够用的子系统接起来演示想法,不再回退到一个空壳 mockup"。
3D、SVG、轻量模拟代码变强
three.js 场景、自定义 SVG 资源、游戏物理和交互模拟反复出现。一个 气液 CFD 风格网页 据说用 PBF 做液体、LBM 做气体,跑了两次对话。创作者自己也指出空气动力学不真实、需要继续修——这正是"惊艳原型"和"可信工程工具"之间的界线。
价格可能才是真正的头条
社区对比反复把 V4 和 Kimi K3 描述为实际项目上接近。如果最终 API 保留 DeepSeek 一贯的价格优势,"以基础设施价格提供接近前沿的能力"比赢任何一场头对头 demo 都重要。参考我们的 AI API 价格对比。
V4 仍然挣扎的地方
- 品味与打磨。前端组合和长文字上,社区常更偏好 Kimi K3。V4 的视觉可以很惊艳,但质量随提示词设计大幅波动。
- 指令边界。一个 demo 让模型删注释,它顺手把游戏 bug 也修了。这种主动性在玩具里很神奇,在真实仓库里就是审查风险。每个 diff 都要看——别把"能跑"当成"通过"。
- 长多轮可靠性。会话仍然会崩、跑偏,或在多轮后累积架构债。第一次强不保证第二十次还强。
- 物理正确性。看着像样的流体或重力模拟不等于有效的 CFD 或力学。视觉对 ≠ 数值对。
- 可复现性。灰度路由看起来不稳定。不同用户可能命中了不同的模型、档位或采样行为。
- 证据质量。很多视频没给完整提示词、模型标识、失败次数、token 用量和人工编辑。
诚实的描述是"高上限的原型生成器,且具备真实的编程能力"——不是"不再需要审查的资深工程师"。
V4 vs Kimi K3 vs GPT-5.6 vs Fable 5.0
这里没有受控的四模型基准。下表是基于灰度证据和用户反馈整理的工作流导向综合——不是排行榜。
| 模型 | 可能的优势 | V4 的位置 | 最佳角色 |
|---|---|---|---|
| DeepSeek V4 | 成本、广泛实现、快速原型 | 基线 | 日常默认编程和首次实现 |
| Kimi K3 | 前端打磨、呈现、文字 | V4 略逊打磨但功能上常常相当 | UI 优化、产品文案、视觉细化 |
| GPT-5.6 | 审查一致性、工具生态、跨文件推理 | 常规工作 V4 是更便宜的替代;整体胜出证据不足 | 代码审查、校验、顽固 bug |
| Fable 5.0 | 长周期实现、多轮恢复 | 选定 demo 里 V4 看着接近,但边缘稳定性更弱 | 最难部分的升级模型 |
V4 vs Kimi K3:最可信的直接素材指向一场势均力敌的较量。前端和文字上 K3 看着更好;V4 性价比更高、实现上有竞争力。一个对比视频跑到几万播放,但提示词和评分没标准化。
V4 vs GPT-5.6:零星评论声称在某些网页项目上互有胜负。这些是测试灵感,不是基准结果。真正有用的问题是:V4 能不能以更低成本跑过你仓库的测试套件。
V4 vs Fable 5.0:惊艳的游戏 demo 让对比很诱人,但这批数据不足以证明 V4 在大型代码库、安全审查或长时间自动运行上能持平。在可复现测试给出不同结论之前,把 Fable 5.0 当作升级选项。
实操建议
最便宜且不会反噬的配置:
- 让 V4 做前 80–90%。规划、脚手架、实现、测试、文档、常规修 bug。
- 本地验证。Lint、类型检查、单元和集成测试,加上人工 diff 审查。不可妥协。
- 带着证据升级。卡住时,把 diff、失败的测试和具体问题发给 Kimi K3、GPT-5.6 或 Fable 5.0——别再把同样的模糊提示词再发一遍。
- 留一份轻量高端订阅,而不是几份全量订阅。把它当作审查员和救援模型,不是默认的 token 消耗者。
这个配置只在第二个模型拿到证据(diff、日志、失败测试)时才有效。把同一个模糊问题问两个模型通常只是翻倍成本,不会提升可靠性。
正式发布时要验证什么
正式版本要用可复现性来评判,而不是发布会 demo。检查:
- 确切的 API 模型 ID,以及 web、app、API 是否用同一档;
- 上下文窗口、输出上限、工具调用和结构化输出支持;
- 输入、缓存输入和输出的每 token 价格;
- 限速、高峰路由,以及 "Pro/Flash/Max" 档位是否表现不同;
- 仓库级编辑、测试补全和指令遵循;
- 相同提示词复现灰度质量的概率;
- 许可、数据留存和部署选项。
DeepSeek 发布正式模型卡、API 文档和定价后我们会更新本文。在那之前,关于最终模型的任何说法都是暂定的。
常见问题
正式版现在能用了吗?
这批数据记录的是疑似灰度路由,不是已确认的发布。视频标题写"正式版"不等于 DeepSeek 官方确认。
V4 编程能力到底如何?
证据在快速网页原型、游戏、SVG、three.js 和迭代修 bug 上最强;在大型生产仓库、安全敏感代码和长时间自动任务上最弱。
V4 比 Kimi K3 强吗?
不是在所有任务上都强。V4 看着接近,且可能更具性价比;Kimi K3 在前端打磨和文字上常常占优。用同样的提示词、运行时和验收测试再决定。
我应该退订高端编程订阅吗?
对很多人来说,降到一份轻量高端订阅比全部退订更合理。让 V4 扛量,留一个独立模型用于审查和升级。
哪里能看到原始灰度测试?
从 121 个视频的 GitHub 索引 开始。代表性案例:V4 与 Kimi K3 广度测试、3D 物理对比、8192 格 MC 测试、主动修 bug 案例。