Krótka odpowiedź

DeepSeek nie potwierdził, że to V4. Mamy za to dużą i nietypowo spójną falę domniemanych wyników z gray-testu: 121 filmów na Bilibili od 53 twórców między 7 a 19 lipca 2026 roku, do tego 40 udostępnionych sesji OpenCode i garść projektów do pobrania. To wystarczająco dużo, by dostrzec wzorce — ale za mało, by certyfikować identyfikator modelu albo przeprowadzić kontrolowany benchmark.

Czytaj dowody w ten sposób, a obraz staje się jasny: V4 wypada nieznacznie poniżej Kimi K3, GPT-5.6 i Fable 5.0 w ich najsilniejszych obszarach, ale różnica jest na tyle mała, że w większości codziennego kodowania osoba wrażliwa na koszty może przyjąć V4 jako domyślny model i utrzymać jedną lekką subskrypcję premium do code review, opornych bugów i ostatnich 10% długich, wieloetapowych zadań.

Wniosek praktyczny: domniemany build nie pisze bezbłędnego kodu — zmiana polega na tym, że potrafi z jednej linijki intencji wygenerować działającą aplikację, a potem naprawić sensowną część własnych bugów. To właśnie próg między „autouzupełnianiem" a „agentem wdrażającym".

Galerię zrzutów ekranu i linki do czatów z wcześniejszej fali znajdziesz w naszym podsumowaniu dowodów z gray-release DeepSeek V4.

Pełny katalog źródeł Kluczowe dowody

Surowe dowody za każdą tezą w tym artykule — mirror otwartego repozytorium YunhaoFu/dsv4ga-news-gather. Rozwiń, by przeglądać po twórcy, dacie lub słowie kluczowym. Tytuły prowadzą prosto na Bilibili.

Kliknij, aby rozwinąć wszystkie 136 wpisów 121 filmów testowych + 15 powiązanych publikacji

Wskazówka: tytuł to link do Bilibili. = udostępniona sesja czatu, pomarańczowy = pliki projektu do pobrania. Najedź na twórcę, aby zobaczyć pełną nazwę.

#DataTwórcaTytuł / dowód
1 07-19 不爱亲 疑似deepseekV4灰度正式版,一句话生成的mc光影包
2 07-19 一只AI风向标 DeepSeek V4正式版泄露、Opus 5下周发布或由Karpathy训练、京东发布JoyAI-Talker与Video-Edit | 7月19日 AI日报
3 07-19 猫伊cat 【Deepseek】D老师劝用户不要人机恋之后心态崩了然后搓了个这个
4 07-19 Ai产品小丁 DeepSeek V4 正式版要来了?
5 07-19 进化中的阿陈 Kimi K3.1、DeepSeek V4、Grok 4.6接连放出新爆料,Fable 5 却还在限制 50% 用量 !
6 07-19 kdzzzds ds灰度-(不搜素材 +SVG一轮出) 高质量gta5 2.0
7 07-19 帅气的丝庐海椮潔 DeepseekV4一句话生成的类cs游戏
8 07-19 月隐隐约 Deepseek v4正式版文字生成游戏视频合集
9 07-19 星光与雪 DeepSeek v4正式版一句话设计生成减速器
10 07-19 小鲤玩游戏_ DeepSeek V4 正式版即将发布,有哪些值得关注的亮点?
11 07-19 Augenstern_-__- dsv4灰度正式版-再次进化
12 07-19 咖喱鱼 V4一拳崩死FABLE,中国模型无限追杀A÷和GPT
13 07-19 小小小名不是小明 DeepSeek V4 疑似正式版 两句话生成气液CFD网页(较为不真实)
14 07-19 小小小名不是小明 DeepSeek V4 正式版,帮我生成一首电子音乐【基于strudel.cc代码生成的音乐三首】
15 07-19 冬眠の松鼠_ DeepSeek V4正式版 炉石传说
16 07-19 北宸Polariss 【deepseek v4正式版】土豆兄弟
17 07-19 夜之叶归一 deepseek v4 pro 正式版建模测试
18 07-19 Delight-linger 工程实战?【dsv4对战k3】3D物理骨骼动画,对比让人核爆
19 07-19 北宸Polariss 【deepseek v4正式版】水果忍者
20 07-19 UPLUZ 【疑似DeepSeek正式版】灾害模拟,比前几天看到的又进化了
21 07-19 戏场上的老将军 deepseekv4正式版一段提示词生成黑洞
22 07-19 bili_3493108501187431 deepseekv4正式版战雷最终测试版
23 07-18 -_一-_一- 用deepseek正式版的竞争对手gpt5.6Sol花费很多句话实现的大战略地图
24 07-18 PotnQ DSV4灰测一款游戏迭代了几百次有多恐怖?
25 07-18 戏场上的老将军 deepseekv4正式版 超视距8192格MC
26 07-18 UPLUZ 【疑似DeepSeek正式版】谁才是模型之王啊?(战术后仰)
27 07-18 一只AI风向标 DeepSeek V4正式版灰度测试、马斯克Grok 4.6下周开测、上海AI实验室Intern-S2击败Opus4.8 | 7月18日 AI日报
28 07-18 UPLUZ 【疑似DeepSeek正式版】我和D指导重新设计了像素鸟
29 07-18 cacl2_lhg DeepSeek V4 正式版灰度测试制作的我的世界版马车(含多种不同赛道)
30 07-18 宇智波华人 用deepseek做的小游戏,三国斗飞机!!!
31 07-18 梦回0 dsv4正式版还原《星空Starfield》1000颗星球可无缝起降,陶德你的梦想deepseek帮你实现了!
32 07-18 爱摸鱼的月萌 【中配】Anthropic 发展遇冷|Kimi K3.1、Grok 4.6、DeepSeek v4 正式版、美国政府 Gold Eagle 模型,还有机器人综合
33 07-18 赤麟方阵2号 deepseek灰度测试,地球防卫军试玩
34 07-18 bili_3493108501187431 deepseekv4正式版生成的战争雷霆优化版
35 07-18 硅谷神奇 Anthropic的变故……Kimi K3.1、Grok 4.6、DeepSeek v4正式版、美国政府“金鹰”计划,以及机器人综合格斗!
36 07-18 山头小妖 用deepseek,一天开发游戏的进度(新游戏开发中:末日堡垒对抗)
37 07-18 Aki_2519 [疑似Deepseek v4正式版]类Teardown游戏生成
38 07-18 UPLUZ 【疑似DeepSeek正式版】这才是真正的音乐.jpg②
39 07-18 紫巅 (灰测)DeepSeek正式版一次生成重生细胞
40 07-18 小小小名不是小明 双叉臂悬挂测试后续 没有人可以诋毁V4正式版
41 07-18 烟神殿殿主 AI大洗牌!Anthropic跌下神坛,Kimi K3.1、Grok 4.6、DeepSeek v4大混战,还有美政府金鹰计划与机器人MMA
42 07-18 TwoShenMengxi deepseek正式版无人深空X我的世界(目前已坠机)
43 07-18 Delight-linger 【dsv4正式版】用Godot与C#一句话复刻[网吧模拟器]游戏
44 07-18 UPLUZ 【疑似DeepSeek正式版】震惊瘫坐!节奏光剑都被他搞出来了!
45 07-18 杠精MrS deepseekv4pro max疑似灰度正式版,一句话生成合金弹头,引擎也是自己写的无敌了
46 07-18 炽热的钢铁 疑似灰度到了deepseek-v4-pro正式版!只用一句话让大肥鱼手搓了5首电音!
47 07-18 夜之叶归一 deepseek V4 正式版 测试
48 07-18 kdzzzds ds灰度 超视距8192格MC 1轮出+2轮修bug优化
49 07-18 雨下冰梧桐 请让我真诚的说DEEPSEEK V4 灰度测试正式版,很出色,很厉害,很优秀,但不完美,还是会有BUG的,这是最真诚的话,且不接受反驳。
50 07-18 伊甸的亚托莉 【疑似deepseekv4正式版】ai里的贝多芬 多种音乐生成测试
51 07-18 -温醨- 疑似deepseekv4灰度测试,仅提供部分素材,另外部分素材由ai自己生成,逻辑一遍过,第二遍改了下画风
52 07-18 小小小名不是小明 V8声浪模拟,比地平线好听 DS V4 灰测生成
53 07-18 康康不说骚话 霓虹浪人-deepseek一锅出版本
54 07-18 鱼村长233 Deepseekv4正式版灰测,音乐创建和nes模拟器
55 07-18 雨下冰梧桐 单网页小游戏《方块世界》,这次我不蹭DEEPSEEK V4灰度测试正式版,抛弃流量密码,看一看真实数据。
56 07-18 kdzzzds dsv4灰度版 (ds自己建模) csgo 死斗模式+爆破
57 07-18 果汁盒Summer 用DeepSeek(疑似正式版)复刻战双帕弥什
58 07-18 stupid_scout DeepseekV4正式版 类战地游戏彻底翻新 加了许多内容(下载链接在评论区)
59 07-18 LikrFG 疑似 deepseek v4 正式版模型测试
60 07-18 小小小名不是小明 有V8!DS v4正式版游戏两则【马里奥 和 赛车】快速更新第四期,纯玩嗨了分享成果
61 07-18 添星_tianxing deepseek正式版,4块钱做的小游戏
62 07-18 离梦aajjkk DeepSeekv4pro正式版一句话生成4000小球测试,完美无bug(max模式),附带性能测试。
63 07-17 冬眠の松鼠_ DeepSeek V4正式版 三角洲行动和森林
64 07-17 小小小名不是小明 DS v4正式版一句话生成【截图翻译工具、精品独立游戏】快速更新第三期,纯玩嗨了分享成果
65 07-17 Qilin1132 当你让deepseek v4灰度正式版和预览版做同样的游戏时
66 07-17 梦回0 deepseek v4正式版,制作飞车类型游戏
67 07-17 风味光猫 [东方project]DeepSeek疑似灰测与预览版一句话生成弹幕游戏对比
68 07-17 kdzzzds dsv4灰度--(不搜素材纯自己建模)1轮出+1轮修bug的超高质量gta
69 07-17 Augenstern_-__- v4灰度正式版-两个前端版本的对比
70 07-17 没有设置一 deepseek把claude fable5开源了☝️
71 07-17 星光与雪 DeepSeek v4正式版多轮对话复刻《王国·两位君主》
72 07-17 黑韬 DeepseekV4正式版手搓的歌剧《卡门》动画
73 07-17 s就是这样s 疑似DS V4正式版灰度,被这效果吓哭,这是我看过《我的世界》+《无人深空》融合的最好的一个版本
74 07-17 kdzzzds 来看看v4灰测前端 隐藏的巨大潜力(AI生成的提示词)
75 07-17 DaVinci-2nd 没灰度到dsV4正式版或者灰度到坠机了的进来
76 07-17 kdzzzds 核弹之作-疑似dsv4正式版灰度-我的世界/星际拓荒 曲率方块
77 07-17 e4glet DeepSeek 3D Walkman播放器
78 07-17 猫伊cat 【Vibecoding】Claude和Deepseek合力做的可以弹奏的小太阳
79 07-17 一爽电台 马斯克锐评Kimi k3!我只想说 deepseek NO1
80 07-17 浪迹天涯人free deepseek正式版灰度做雷霆战机
81 07-17 kdzzzds 谁敢质疑d老师的审美-疑似dsv4灰度之只用SVG图作我的世界
82 07-17 -温醨- deepseek v4正式版灰度,我的世界+孢子,二次修改
83 07-17 星光与雪 DeepSeek v4正式版多轮对话生成光遇
84 07-17 kdzzzds 疑似dsv4灰度- 我的深空,在原提示词基础上加强美术提示词看看效果(没用联网)
85 07-17 爱尔奎德的死徒 DeepSeek v4灰度正式版+Z-image生成游戏,学院昆特牌
86 07-17 小小小名不是小明 测试第二期!DeepSeek V4正式版全方面深度测试 附带kimiK3
87 07-17 夜之叶归一 deepseek v4正式版 测试
88 07-17 夜之叶归一 deepseek v4正式版测试,一句生成游戏
89 07-17 -温醨- 疑似dsv4正式版灰测,我的世界+孢子
90 07-17 冬眠の松鼠_ DeepSeek V4 魔兽世界 高清重制版
91 07-17 Delight-linger 双日凌空! 对比测试K3与Deepseekv4(灰度正式版)实力
92 07-16 kdzzzds 不严谨测试
93 07-16 PotnQ DSV4正式版灰度无人深空超级伪无缝登陆
94 07-16 探归者夕迁 Deepseekv4正式版-我的太空计划 试玩 软着陆登月
95 07-16 冬眠の松鼠_ DeepSeek V4正式版 多轮对话生成魔兽世界
96 07-16 UPLUZ 【疑似DeepSeek正式版】像素鸟flappybird-预览版与正式版效果对比
97 07-16 stupid_scout DeepseekV4正式版 测试传送门(功能实现很不错!还有一些传送门问题测试)
98 07-16 黑韬 DeepseekV4正式版生成的逆转裁判!
99 07-16 洛必达实验室 Kimi K3 性能简直炸裂!又一个 DeepSeek 时刻要来了?人工智能AI
100 07-16 cacl2_lhg 疑似Deepseek V4正式版生成的仿马力欧赛车小游戏
101 07-16 Augenstern_-__- v4灰度正式版,svg拉弓动画测试
102 07-16 stupid_scout DeepseekV4正式版 我只是让他删注释 竟然顺手修了游戏bug
103 07-16 s就是这样s 疑似高维空间碎片,Deepseek正式版灰度,一句话生成《地平线6》
104 07-16 梦回0 deepseek v4 正式版生成只狼版网页游戏
105 07-16 stupid_scout DeepseekV4正式版生成的战地游戏(效果吊炸天了!!)
106 07-16 吧必须徐112 【7月最新】免费白嫖!DeepSeek V4 自由版免费用,不限次数!
107 07-16 三十丁尼 dsv4生成可自定义音乐的下落式音游
108 07-16 Delight-linger 核弹爆炸,dsv4正式版一次性生成多款安卓游戏,涵盖跑酷,AR,2D打击等等
109 07-16 UPLUZ 【疑似DeepSeek正式版】Besiege围攻,物理模拟很不错
110 07-16 飞越麦当劳 deepseek v4正式版灰测,生成恐怖游戏
111 07-16 飯綱九龍 【东方】Deepseek-v4正式版(疑似)灰度一次生成 - 东 方 智 械 录
112 07-16 Augenstern_-__- dsv4灰度正式版-修正前两期以及展示骑马与砍杀
113 07-16 Augenstern_-__- 疑似dsv4正式版灰度-后室
114 07-16 Augenstern_-__- 疑似dsv4正式版灰度-最有氛围的日系恐怖游戏,预览与正式版对比
115 07-15 UPLUZ 【疑似DeepSeek正式版】塞尔达世界
116 07-15 Delight-linger Deepseekv4正式版-坎巴拉太空计划+我的世界---实操登录月球(硬着陆)3轮对话
117 07-15 作手阿九 deepseekV4pro一句话生成的幸存者游戏
118 07-15 飯綱九龍 疑似dsv4正式版灰度-我的世界X无人深空
119 07-15 Delight-linger Deepseek正式版灰度 木筏求生+我的世界(我的木筏)
120 07-15 齐天大圣wy Deepseek 你这个死肥鱼到底干了什么
121 07-15 桶水test-2 被deepseek震惊了
122 07-15 kdzzzds 疑似deepseekv4正式版灰度 我的世界+无人深空(调小声音)
123 07-14 kdzzzds (以坠机)疑似dsv4正式版灰测 暮色森林(做一半坠机了)
124 07-14 kdzzzds 疑似deepseekv4正式版灰度测试-拳皇
125 07-14 kdzzzds 疑似deepseek v4正式版灰度-我的世界地狱末地地形测试(地形为一次出)
126 07-14 kdzzzds 疑似deepseekv4正式版灰测-无人深空
127 07-13 2258ppq dsv4 正式版 测试2
128 07-11 不可以包含特殊字符 DeepSeek4.0正式版灰度测试小游戏开发
129 07-10 飞越麦当劳 不知道是不是被deepseek v4正式版灰度到了,用一句话生成的,但效果确实好
130 07-09 冬眠の松鼠_ DeepSeek V4正式版一句话生成《后室》和恐怖游戏
131 07-09 小小小名不是小明 国产之光再进化!DeepSeek V4正式版简测,附带横评Gemini3.5 Pro / Grok4.5等
132 07-09 Delight-linger 灰度测试dsv4正式版?泰拉瑞亚-以撒结合-RTS-浏览器操作系统-割绳子-星露谷全测试
133 07-08 冬眠の松鼠_ 灰度测试:DeepSeek V4正式版一句话生成GTA5
134 07-07 冬眠の松鼠_ DeepSeek V4正式版一句话生成CSGO(生成记录透明)
135 07-07 冬眠の松鼠_ DeepSeek V4正式版生成的《我的世界》
136 07-06 System-Win-FUN Deepseek出现恶性漏洞,在回答问题的时候有几率会一直回答那个收到。

Co naprawdę pokazuje 121 testów

Dane pochodzą z otwartego repozytorium dsv4ga-news-gather, które indeksuje publiczne wpisy na Bilibili i zachowuje tytuły, nazwiska twórców, znaczniki czasu, opisy, komentarze, udostępnione konwersacje i linki do pobrania. Snapshot z 19 lipca rozkłada się tak:

121filmów z gray-testu
53niezależnych twórców
40udostępnionych sesji czatu
12okno w dniach (7/7–7/19)

Liczba publikacji dziennie

Powolny kaplic do 15 lipca, potem ściana wydań ze szczytem 18 lipca.

6.07
1
7.07
2
8.07
1
9.07
3
10.07
1
11.07
1
13.07
1
14.07
4
15.07
8
16.07
23
17.07
29
18.07
40
19.07
22

Top 10 twórców

Tylko kdzzzds i Delight-linger udostępnili istotne logi sesji. Zielony = 5+ udostępnionych sesji, pomarańczowy = 1–4, niebieski = brak.

kdzzzds
14· 12 udost.
小小小名不是小明
8· bez udost.
冬眠の松鼠_
8· bez udost.
UPLUZ
8· bez udost.
Delight-linger
7· 11 udost.
Augenstern_-__-
6· 1 udost.
夜之叶归一
4· bez udost.
stupid_scout
4· bez udost.
星光与雪
3· bez udost.
梦回0
3· bez udost.

Co właściwie testowano

Kategoryzacja ze 136 tytułów. Gry zdecydowanie dominują — produkcjne backendy, bezpieczeństwo i prace długoterminowe ledwie się pojawiają.

Inne gry / prototypy
4332%
Voxel / Minecraft
1712%
Karciane / RPG / zręcznościowe
1712%
Fizyka / symulatory kosmiczne
129%
Strzelanki / wojsko
118%
Muzyka / audio
107%
Wyścigi / open world
86%
Aktualności / podsumowania
75%
Horror
54%
Czat / demo vibe
32%
Narzędzia / test silnika
32%

Dwa obciążenia ważą bardziej niż jakakolwiek pojedyncza liczba. Obciążenie selekcji: większość to zadania typu „kodowanie życzeniowe" — gry przeglądarkowe, sceny 3D, animacje SVG, fizyczne zabawki, narzędzia muzyczne. Ten zbiór mocno dowodzi szybkiego prototypowania i generowania front-endu; jest słabym dowodem na produkcjne backendy, bezpieczeństwo, utrzymanie dużych repozytoriów czy cokolwiek, co trwa miesiącami. Obciążenie przejrzystości: tylko 3 z pierwszej dziesiątki twórców udostępniło swoje prompty albo logi czatu. Traktuj tytuły z dopiskiem „oficjalna wersja" jako chwyt marketingowy — twórca zazwyczaj tylko przypuszcza, że trafił na szary routing. W całym tekście używamy sformułowania domniemany gray-build V4.

W czym V4 wygląda na mocny

Aplikacje z jednego promptu realnie działają, zamiast tylko dobrze wyglądać

Najmocniejszy wzorzec to szeroka implementacja z cienkiej specyfikacji. W zbiorze są światy voxelowe, strzelanki, gry rytmiczne, survivale, sceny three.js, generatory muzyki i wizualizacje inżynierskie. Reprezentatywne demo SVG w stylu GTA było podobno jedną generacją główną plus jedną rundą naprawy bugów, z dołączoną udostępnioną konwersacją. To nie jest „jedno zdanie, jedna wydana gra". To „model wybiera architekturę, łączy wystarczająco wiele podsystemów, by pokazać pomysł, i nie oddaje już pustego mockupu".

Silne 3D, SVG i lekkie symulacje

Sceny three.js, własne assety SVG, fizyka gier i interaktywne symulacje powtarzają się w całym zbiorze. Strona w stylu CFD ciecz-gaz podobno używała PBF dla cieczy i LBM dla gazu w dwóch konwersacjach. Twórca sam zaznaczył nierealistyczną aerodynamikę i konieczność dalszych poprawek — to dokładnie granica między imponującym prototypem a godnym zaufania narzędziem inżynierskim.

Cena może być prawdziwym nagłówkiem

Porównania w społeczności wielokrotnie opisują V4 i Kimi K3 jako zbliżone w realnych projektach. Jeśli ostateczne API utrzyma typową dla DeepSeek przewagę cenową, „zdolność bliska frontier po cenach infrastruktury" znaczy więcej niż wygranie jakiegokolwiek pojedynczego demo head-to-head. Zobacz nasze porównanie cen AI API.

Gdzie V4 wciąż ma problemy

  • Wykończenie i gust. Kimi K3 jest częściej preferowany do kompozycji front-endowych i długich form tekstowych. Wizualia V4 potrafią robić wrażenie, ale jakość mocno skacze w zależności od projektu promptu.
  • Granice instrukcji. W jednym demo poproszono model o usunięcie komentarzy; przy okazji sam naprawił buga w grze. W zabawce ta inicjatywa wydaje się magiczna, w prawdziwym repozytorium jest ryzykiem dla code review. Przeglądaj każdy diff — nie traktuj „działa" jako wystarczającego warunku.
  • Niezawodność w długich wieloetapowych sesjach. Sesje nadal się wywalają, gubią wątek albo kumulują dług architektoniczny po wielu rundach. Silne pierwsze podejście nie gwarantuje silnego dwudziestego.
  • Poprawność fizyki. Przekonująca symulacja cieczy czy grawitacji to nie to samo co poprawne CFD czy mechanika. Wizualnie dobrze ≠ liczbowo dobrze.
  • Powtarzalność. Szary routing wygląda na niespójny. Różni użytkownicy mogli trafić na różne modele, poziomy albo zachowanie próbkowania.
  • Jakość dowodów. Wiele filmów pomija pełny prompt, identyfikator modelu, liczbę niepowodzeń, zużycie tokenów i ręczne edycje.

Szczere podsumowanie: „generator prototypów o wysokim suficie z prawdziwą zdolnością kodowania" — a nie „senior, który już nie potrzebuje rewizji".

V4 vs Kimi K3 vs GPT-5.6 vs Fable 5.0

Nie ma tu kontrolowanego benchmarku czterech modeli. Poniższa tabela to zorientowana na workflow synteza dowodów z gray-testu i relacji użytkowników — a nie ranking.

ModelPrawdopodobna przewagaGdzie stoi V4Najlepsza rola
DeepSeek V4Koszt, szeroka implementacja, szybkie prototypyPunkt odniesieniaDomyślne kodowanie codzienne i pierwsza implementacja
Kimi K3Wykończenie front-endu, prezentacja, pisanieV4 jest nieco mniej dopracowany, ale często funkcjonalnie porównywalnyPrzejście UI, copy produktowe, dopracowanie wizualne
GPT-5.6Spójność w rewizji, ekosystem narzędzi, wnioskowanie między plikamiV4 może być tańszym zamiennikiem do rutynowych prac; brak dowodów na ogólną wygranąCode review, walidacja, oporne bugi
Fable 5.0Implementacja długoterminowa, regeneracja w wielu turachV4 wygląda na zbliżonego w wybranych demo, ale jest mniej niezawodny na krawędziachModel eskalacyjny dla najtrudniejszej reszty pracy

V4 vs Kimi K3: najbardziej wiarygodny materiał bezpośredni wskazuje na wyrównany pojedynek. K3 wygląda lepiej na front-endzie i w pisaniu; V4 może oferować lepszy stosunek wartości do ceny i bywa konkurencyjny w implementacji. Jeden film porównawczy zdobył dziesiątki tysięcy wyświetleń, ale prompty i punktacja nie były ustandaryzowane.

V4 vs GPT-5.6: pojedyncze komentarze mówią o wygranych i przegranych w konkretnych projektach webowych. To pomysły na testy, a nie wyniki benchmarku. Przydatne pytanie brzmi: czy V4 przejdzie zestaw testów Twojego repozytorium taniej.

V4 vs Fable 5.0: imponujące demo gier czynią porównanie kuszącym, ale zbiór nie dowodzi równości na dużych kodowych bazach, w code review bezpieczeństwa ani przy długich autonomicznych przebiegach. Traktuj Fable 5.0 jako opcję eskalacji, dopóki powtarzalne testy nie wykażą inaczej.

Praktyczna konfiguracja

Najtańsza konfiguracja, która nie odbije się później:

  1. Niech V4 zrobi pierwsze 80–90%. Planowanie, scaffold, implementacja, testy, dokumentacja, zwykłe naprawianie bugów.
  2. Weryfikuj lokalnie. Lint, sprawdzanie typów, testy jednostkowe i integracyjne oraz ludzki przegląd diffa. Bez kompromisów.
  3. Eskaluj z dowodami. Gdy utkniesz, wyślij diff, nietrafiające testy i wąskie pytanie do Kimi K3, GPT-5.6 albo Fable 5.0 — a nie ten sam mętny prompt drugi raz.
  4. Utrzymuj jedną lekką subskrypcję premium, nie kilka pełnych. Używaj jej jako recenzenta i modelu ratunkowego, a nie domyślnego palnika tokenów.
Zalecenie: V4 jako model implementacyjny o dużej przepustowości, plus jedna lekka subskrypcja premium do niezależnego code review i problemów, które przetrwają kilka tur.

To działa tylko wtedy, gdy drugi model dostaje dowody — diffy, logi, nietrafiające testy. Pytanie dwóch modeli o to samo mętne zagadnienie zazwyczaj tylko podwaja koszt bez poprawy niezawodności.

Co zweryfikować przy oficjalnej premierze V4

Oceniaj oficjalną premierę przez powtarzalność, a nie demo z dnia debiutu. Sprawdź:

  • dokładny identyfikator modelu w API oraz to, czy web, aplikacja i API korzystają z tego samego poziomu;
  • okno kontekstowe, limit wyjścia, wywoływanie narzędzi i wsparcie dla wyjścia ustrukturyzowanego;
  • cena za token wejściowy, wejście z cache i token wyjściowy;
  • limity zapytań, routing w godzinach szczytu oraz to, czy poziomy „Pro/Flash/Max" zachowują się inaczej;
  • edycje w skali repozytorium, uzupełnianie testów i trzymanie się instrukcji;
  • jak często identyczne prompty odtwarzają jakość z gray-testu;
  • licencja, retencja danych i opcje wdrożenia.

Zaktualizujemy tę stronę, gdy DeepSeek opublikuje oficjalne model cards, dokumentację API i cennik. Do tego czasu wszelkie twierdzenia o ostatecznym modelu pozostają prowizoryczne.

Najczęstsze pytania

Czy oficjalna wersja jest już dostępna?

Zbiór dokumentuje domniemany szary routing, a nie potwierdzone wydanie. Film z tytułem „oficjalna wersja" to nie jest oficjalne potwierdzenie ze strony DeepSeek.

Jak dobry jest V4 do kodowania?

Dowody są najsilniejsze dla szybkich prototypów webowych, gier, SVG, three.js i iteracyjnego naprawiania bugów. Najcieńsze są dla dużych repozytoriów produkcyjnych, kodu wrażliwego pod kątem bezpieczeństwa i długiej pracy autonomicznej.

Czy V4 jest lepszy od Kimi K3?

Nie w każdym zadaniu. V4 wydaje się zbliżony i może dawać lepszą wartość; Kimi K3 często ma przewagę w wykończeniu front-endu i piśmie. Przed wyborem przetestuj ten sam prompt, środowisko uruchomieniowe i testy akceptacji.

Czy powinienem anulować subskrypcję premium do kodowania?

Dla wielu użytkowników więcej sensu ma przejście na jedną lekką subskrypcję premium niż anulowanie wszystkiego. Niech V4 obsłuży wolumen, a niezależny model zostaw do rewizji i eskalacji.

Gdzie można obejrzeć oryginalne gray-testy?

Zacznij od indeksu na GitHubie wszystkich 121 filmów. Reprezentatywne przypadki: szeroki test V4 i Kimi K3, porównanie fizyki 3D, test Minecrafta z 8192 blokami, przykład proaktywnego naprawiania bugów.