Tóm tắt nhanh
DeepSeek chưa xác nhận công khai đây chính là V4. Những gì chúng ta có trong tay là một lượng lớn kết quả kiểm thử gray bị nghi ngờ, với độ nhất quán đáng ngờ: 121 video Bilibili từ 53 creator trong khoảng từ 7 đến 19 tháng 7, 2026, cùng 40 phiên trò chuyện OpenCode chia sẻ và một vài dự án có thể tải về. Lượng này đủ để nhận ra mô hình, nhưng chưa đủ để xác nhận mã định danh mô hình hay chạy một benchmark có kiểm soát.
Đọc theo tiền đề đó thì kết luận khá rõ: ở những lĩnh vực mạnh nhất của từng bên — Kimi K3, GPT-5.6, Fable 5.0 — V4 hơi kém hơn một chút, nhưng khoảng cách đã thu hẹp đến mức đối với phần lớn công việc lập trình hằng ngày, một lập trình viên muốn tiết kiệm hoàn toàn có thể dùng V4 làm mặc định, rồi giữ riêng một gói cao cấp nhẹ cho review code, những bug khó nhằn và 10% cuối cùng của các tác vụ đa lượt dài.
Nếu muốn xem ảnh chụp và liên kết trò chuyện từ đợt trước, xem bài Tổng hợp bằng chứng gray-release DeepSeek V4 của chúng tôi.
Danh mục nguồn đầy đủ Bằng chứng then chốt
Toàn bộ bằng chứng thô đứng sau mọi kết luận trong bài này — được mirror từ kho mã nguồn mở YunhaoFu/dsv4ga-news-gather. Mở rộng ra để duyệt theo creator, ngày hoặc từ khoá. Tiêu đề liên kết thẳng tới Bilibili.
Nhấp để mở rộng tất cả 136 bản ghi
Mẹo: tiêu đề chính là liên kết tới Bilibili.xanh lá = phiên chia sẻ, cam = tải dự án. Di chuột qua creator để xem tên đầy đủ.
121 bài kiểm thử nói lên điều gì
Dữ liệu đến từ dự án mã nguồn mở dsv4ga-news-gather, vốn lập chỉ mục các video Bilibili công khai và lưu giữ tiêu đề, tên creator, dấu thời gian, phần mô tả, bình luận, phiên trò chuyện chia sẻ và liên kết tải về. Bản chụp ngày 19 tháng 7 phân bổ đại khái như sau:
Số bài đăng mỗi ngày
Trước ngày 15 tháng 7 chỉ rỉ rả, sau đó trào ra đồng loạt và đạt đỉnh vào ngày 18 tháng 7.
Top 10 creator
Trong top 10 chỉ có kdzzzds và Delight-linger chia sẻ nhiều phiên trò chuyện. Xanh lá = 5+ phiên chia sẻ, cam = 1–4, xanh dương = không có.
Mọi người thực sự đang kiểm thử gì
Phân loại từ 136 tiêu đề. Game chiếm ưu thế tuyệt đối — backend production, bảo mật và các dự án chu kỳ dài gần như không xuất hiện.
Hai thiên lệch quan trọng hơn bất kỳ con số đơn lẻ nào. Thiên lệch lựa chọn: phần lớn là các bài toán "lập trình theo điều ước" — game trình duyệt, cảnh 3D, ảnh động SVG, đồ chơi vật lý, công cụ âm nhạc. Vì vậy tập dữ liệu này là bằng chứng mạnh cho rapid prototyping và sinh front-end; nhưng lại hầu như không có sức thuyết phục đối với backend production, bảo mật, bảo trì kho mã lớn, hoặc bất kỳ dự án nào cần nhiều tháng. Thiên lệch minh bạch: trong top 10 creator chỉ có 3 người chia sẻ prompt hoặc log trò chuyện. Tiêu đề video ghi "phiên bản chính thức" về cơ bản là câu view — bản thân creator thường cũng chỉ nghi ngờ mình được route gray. Trong toàn bài chúng tôi dùng cách diễn đạt build gray V4 bị nghi ngờ.
V4 có vẻ mạnh ở điểm nào
Ứng dụng một câu giờ thực sự chạy được, thay vì chỉ để ngắm
Mẫu hình nổi bật nhất là hiện thực hoá toàn diện từ một đặcả mỏng. Tập hợp này có thế giới voxel, game bắn súng, game nhạc tiết tấu, game sinh tồn, cảnh three.js, trình sinh nhạc và hình ảnh hoá kỹ thuật. Một demo SVG phong cách GTA mang tính đại diện được mô tả là một lượt sinh chính cộng một lượt sửa bug, kèm theo một phiên trò chuyện chia sẻ. Đó không phải "một câu, ship luôn một game". Mà là "mô hình tự chọn kiến trúc, đấu nối vừa đủ các subsystem để demo ý tưởng, và không còn trả về một mockup rỗng".
Mã 3D, SVG và mô phỏng nhẹ trở nên mạnh hơn
Cảnh three.js, asset SVG tuỳ chỉnh, vật lý game và mô phỏng tương tác xuất hiện lặp đi lặp lại trong tập hợp. Một trang web phong cách CFD khí-lỏng được cho là dùng PBF cho chất lỏng và LBM cho khí, chạy trong hai lượt trò chuyện. Bản thân creator cũng thẳng thắn chỉ ra khí động học không thực tế và cần sửa thêm — đúng là ranh giới giữa một prototype ấn tượng và một công cụ kỹ thuật đáng tin cậy.
Giá có lẽ mới là tiêu đề thật sự quan trọng
Các so sánh trong cộng đồng lặp đi lặp lại mô tả V4 và Kimi K3 là gần nhau ở dự án thực tế. Nếu API cuối cùng giữ được lợi thế giá vốn có của DeepSeek, thì "năng lực gần tầm tiên tiến ở mức giá hạ tầng" lại quan trọng hơn việc thắng bất kỳ demo đối đầu đơn lẻ nào. Tham khảo so sánh giá API AI của chúng tôi.
Những chỗ V4 vẫn còn chật vật
- Gu và sự tinh chỉnh. Ở phối hợp front-end và văn bản dài, cộng đồng thường thích Kimi K3 hơn. Hình ảnh của V4 có thể rất ấn tượng, nhưng chất lượng dao động mạnh theo thiết kế prompt.
- Giới hạn chỉ thị. Một demo yêu cầu mô hình xoá comment; nó tiện tay sửa luôn một bug trong game. Sự chủ động đó trong một món đồ chơi thì thấy hay, nhưng trong một repo thật thì đó là rủi ro khi review. Phải xem từng diff — đừng lấy "chạy được" làm tiêu chuẩn "đạt".
- Độ tin cậy đa lượt dài. Phiên trò chuyện vẫn có thể sập, đi chệch hướng, hoặc tích luỹ nợ kiến trúc qua nhiều lượt. Một lượt đầu mạnh không đảm bảo lượt thứ hai mươi vẫn mạnh.
- Tính đúng đắn vật lý. Một mô phỏng chất lỏng hay trọng lực trông thuyết phục không có nghĩa là CFD hay cơ học hợp lệ. Đúng thị giác ≠ đúng số học.
- Khả năng tái lập. Việc route gray có vẻ không ổn định. Những user khác nhau có thể đã trúng các mô hình, tầng hoặc hành vi sampling khác nhau.
- Chất lượng bằng chứng. Rất nhiều video bỏ qua prompt đầy đủ, mã định danh mô hình, số lần thất bại, mức sử dụng token và các chỉnh sửa thủ công.
Mô tả trung thực là "trình sinh prototype có trần cao, kèm năng lực lập trình thực sự" — chứ không phải "một kỹ sư cấp cao không cần review nữa".
V4 vs Kimi K3 vs GPT-5.6 vs Fable 5.0
Ở đây không có benchmark bốn mô hình có kiểm soát. Bảng dưới đây là một tổng hợp hướng workflow, dựng từ bằng chứng gray-test và các báo cáo người dùng xung quanh — không phải bảng xếp hạng.
| Mô hình | Lợi thế có thể có | Vị trí của V4 | Vai trò tốt nhất |
|---|---|---|---|
| DeepSeek V4 | Chi phí, hiện thực hoá rộng, prototype nhanh | Baseline | Lập trình mặc định hằng ngày và hiện thực hoá đầu tiên |
| Kimi K3 | Tinh chỉnh front-end, trình bày, văn bản | V4 tinh chỉnh kém hơn một chút nhưng về chức năng thường tương đương | Tinh chỉnh UI, copy sản phẩm, chau chuốt thị giác |
| GPT-5.6 | Độ nhất quán khi review, hệ sinh thái công cụ, suy luận xuyên file | V4 có thể là lựa chọn thay rẻ hơn cho công việc thường quy; chưa đủ bằng chứng để khẳng định thắng toàn diện | Code review, kiểm chứng, bug cứng đầu |
| Fable 5.0 | Hiện thực hoá chu kỳ dài, phục hồi đa lượt | Trong các demo chọn lọc V4 có vẻ ngang ngửa, nhưng kém ổn định hơn ở vùng biên | Mô hình escalate cho phần khó nhất còn lại |
V4 vs Kimi K3: tư liệu trực tiếp đáng tin nhất chỉ ra một cuộc so kè ngang sức. Ở front-end và văn bản K3 có vẻ tốt hơn; V4 có tính cạnh tranh về giá cao hơn và cạnh tranh được về hiện thực hoá. Một video so sánh đạt tới vài chục nghìn lượt xem, nhưng prompt và cách chấm điểm không được tiêu chuẩn hoá.
V4 vs GPT-5.6: những bình luận rải rác khẳng định bên thắng bên thua ở các dự án web cụ thể. Đây là ý tưởng để test, không phải kết quả benchmark. Câu hỏi thực sự hữu ích là: V4 có vượt qua bộ test suite trong repo của bạn với chi phí thấp hơn không.
V4 vs Fable 5.0: các demo game ấn tượng khiến việc so sánh rất cám dỗ, nhưng tập dữ liệu này không chứng minh được sự ngang ngửa ở codebase lớn, review bảo mật, hay các chạy tự động dài. Cứ coi Fable 5.0 là một lựa chọn escalate cho tới khi các kiểm thử có thể tái lập nói khác.
Khuyến nghị thực tế
Cấu hình rẻ nhất mà không bị phản đòn về sau:
- Để V4 làm 80–90% đầu tiên. Lập kế hoạch, scaffolding, hiện thực hoá, test, tài liệu, sửa bug thông thường.
- Xác minh cục bộ. Lint, kiểm tra kiểu, unit và integration test, cộng thêm review diff bằng người. Không thể thương lượng.
- Escalate kèm bằng chứng. Khi bí, gửi diff, test thất bại và một câu hỏi hẹp cho Kimi K3, GPT-5.6 hoặc Fable 5.0 — chứ không gửi lại cùng một prompt mơ hồ.
- Giữ một gói cao cấp nhẹ, thay vì vài gói đăng ký đầy đủ. Dùng nó như một người review và mô hình cứu nguy, chứ không phải cái máy đốt token mặc định.
Cấu hình này chỉ có tác dụng khi mô hình thứ hai nhận được bằng chứng — diff, log, test thất bại. Hỏi hai mô hình cùng một câu mơ hồ thường chỉ gấp đôi chi phí mà không cải thiện độ tin cậy.
Cần xác minh gì khi phát hành chính thức
Phiên bản chính thức phải được đánh giá qua khả năng tái lập, chứ không phải qua demo ngày ra mắt. Cần kiểm tra:
- mã định danh mô hình API chính xác, và liệu web, app, API có dùng cùng một tầng hay không;
- cửa sổ ngữ cảnh, giới hạn output, tool calling và hỗ trợ structured output;
- giá mỗi token cho input, cached input và output;
- giới hạn rate, routing giờ cao điểm, và việc các tầng "Pro/Flash/Max" có hành xử khác nhau hay không;
- chỉnh sửa cấp repo, hoàn thiện test và mức độ tuân thủ chỉ thị;
- tần suất một prompt giống nhau tái lập được chất lượng của bản gray;
- giấy phép, lưu giữ dữ liệu và các tuỳ chọn triển khai.
Chúng tôi sẽ cập nhật bài này khi DeepSeek công bố model card chính thức, tài liệu API và bảng giá. Trước thời điểm đó, mọi khẳng định về mô hình cuối cùng đều chỉ mang tính tạm thời.
Câu hỏi thường gặp
Phiên bản chính thức đã dùng được chưa?
Tập dữ liệu này ghi lại việc route gray bị nghi ngờ, chứ không phải một đợt phát hành được xác nhận. Một video gắn nhãn "phiên bản chính thức" không đồng nghĩa với xác nhận chính thức từ DeepSeek.
Năng lực lập trình của V4 rốt cuộc ra sao?
Bằng chứng mạnh nhất nằm ở prototype web nhanh, game, SVG, three.js và sửa bug lặp đi lặp lại; yếu nhất ở các kho production lớn, mã nhạy cảm an ninh và các tác vụ tự động dài.
V4 có mạnh hơn Kimi K3 không?
Không mạnh hơn ở mọi tác vụ. V4 có vẻ ngang ngửa và có thể có tính cạnh tranh về giá tốt hơn; Kimi K3 thường hơn ở tinh chỉnh front-end và văn bản. Hãy chạy cùng prompt, runtime và bài test acceptance trước khi quyết định.
Tôi có nên huỷ gói lập trình cao cấp không?
Với nhiều người, hạ xuống còn một gói cao cấp nhẹ sẽ hợp lý hơn là huỷ tất cả. Để V4 gánh lưu lượng, và giữ lại một mô hình độc lập để review và escalate.
Tôi có thể xem các bản kiểm thử gray gốc ở đâu?
Hãy bắt đầu từ chỉ mục GitHub của 121 video. Các case đại diện: test rộng V4 và Kimi K3, so sánh vật lý 3D, test Minecraft 8192 khối, ví dụ chủ động sửa bug.