In het kort
DeepSeek heeft niet bevestigd dat dit V4 is. Wat we hebben is een grote, opvallend consistente golf vermoedelijke gray-test-output: 121 Bilibili-video’s van 53 makers tussen 7 en 19 juli 2026, plus 40 gedeelde OpenCode-sessies en een handvol downloadbare projecten. Dat is genoeg om patronen te herkennen — niet genoeg om een model-ID te certificeren of een gecontroleerde benchmark te draaien.
Lees je het bewijs zo, dan is het beeld duidelijk: V4 lijkt in hun sterkste domeinen iets achter op Kimi K3, GPT-5.6 en Fable 5.0, maar het verschil is klein genoeg dat een kostenbewuste ontwikkelaar V4 voor het meeste dagelijkse programmeerwerk als default kan nemen, met één licht premium-abonnement ernaast voor review, lastige bugs en de laatste 10% van langdurig multi-turn-werk.
Voor de schermafbeeldingen en chatlinks uit de eerdere golf, zie onze round-up van DeepSeek V4 gray-release-bewijs.
Volledige brondencatalogus Belangrijkste bewijs
De rauwe evidentie achter elke bewering in dit artikel — gespiegeld vanuit de open YunhaoFu/dsv4ga-news-gather-repository. Klap uit om te bladeren op maker, datum of trefwoord. Titels linken direct naar Bilibili.
Klik om alle 136 records uit te klappen
Tip: de titel is de link naar Bilibili. groen = gedeelde chatsessie, oranje = projectdownload. Houd de muis op een maker voor de volledige naam.
Wat 121 tests écht laten zien
De data komt uit de open dsv4ga-news-gather-repository, die publieke Bilibili-berichten indexeert en titels, makers, tijdstempels, beschrijvingen, reacties, gedeelde sessies en downloadlinks bewaart. De momentopname van 19 juli ziet er zo uit:
Berichten per dag
Traag gesijpel tot 15 juli, dan een muur van releases met een piek op 18 juli.
Top 10 makers
Alleen kdzzzds en Delight-linger deelden substantiële sessielogs. Groen = 5+ gedeelde sessies, oranje = 1–4, blauw = geen.
Wat mensen écht hebben getest
Gecategoriseerd uit 136 titels. Games domineren — productie-backends, security en langlopend werk komen nauwelijks voor.
Twee vormen van bias wegen zwaarder dan welk enkel getal dan ook. Selectiebias: het gros is “wens-programmeren” — browserspelletjes, 3D-scènes, SVG-animatie, physics-speelgoed, muziektools. De set is sterk bewijs voor snelle prototyping en front-end-generatie; het is zwak bewijs voor productie-backends, security, groot-repo-onderhoud of alles wat maanden duurt. Transparantiebias: slechts 3 van de top 10 makers deelden hun prompts of chatlogs. Behandel videotitels met “official version” als marketing — de maker vermoedt zelf meestal alleen een gray-route. We gebruiken doorlopend vermoedelijke V4 gray-build.
Waar V4 blijkbaar goed in is
Apps uit één prompt draaien nu echt, in plaats van alleen mooi te lijken
Het sterkste patroon is brede implementatie vanuit een dunne specificatie. De set bevat voxel-werelden, shooters, rhythm-games, survival-games, three.js-scènes, muziekgeneratoren en engineering-visualisaties. Een representatieve GTA-achtige SVG-demo werd beschreven als één hoofdgeneratie plus één bugfix-ronde, met een gedeelde sessie erbij. Dat is niet “één zin, één afgeleverd spel”. Het is “het model kiest een architectuur, koppelt genoeg subsystemen aan elkaar om het idee te demo-en, en loopt niet meer terug met een lege mockup”.
Sterk in 3D, SVG en lichtgewicht simulatie
Three.js-scènes, custom SVG-assets, game-physics en interactieve simulaties komen terug in de hele collectie. Een air-liquid CFD-achtige pagina zou in twee gesprekken PBF voor vloeistof en LBM voor gas gebruiken. De maker gaf zelf ook aan dat de aerodynamica niet realistisch is en meer herstel nodig heeft — precies de grens tussen een indrukwekkend prototype en een betrouwbaar engineering-tool.
Prijs is misschien wel de echte kop
Community-vergelijkingen beschrijven V4 en Kimi K3 herhaaldelijk als dichtbij op praktische projecten. Als de uiteindelijke API DeepSeeks gebruikelijke prijsvoordeel houdt, dan is “near-frontier-capaciteit tegen infrastructuurprijzen” belangrijker dan welke enkele head-to-head-demo winnen. Zie onze AI API-prijsvergelijking voor de huidige context.
Waar V4 nog steeds moeite mee heeft
- Afwerking en smaak. Kimi K3 wordt vaak geprefereerd voor front-end-compositie en langere tekst. V4’s visuals kunnen indrukwekkend zijn, maar de kwaliteit zwaait sterk heen en weer met het promptontwerp.
- Instructiegrenzen. Eén demo vroeg het model commentaar te verwijderen; het maakte ook zelf een game-bug op. Dat initiatief voelt magisch in een speeltje, en is een review-risico in een echte repo. Review elke diff — accepteer “hij draait” niet als voldoende.
- Lange multi-turn-betrouwbaarheid. Sessies crashen nog, verliezen richting, of stapelen over veel ronden architecturale schuld op. Een sterke eerste poging garandeert geen sterke twintigste poging.
- Physics-correctheid. Een overtuigende vloeistof- of zwaartekrachtsimulatie is geen geldige CFD of mechanica. Visueel juist ≠ numeriek juist.
- Reproduceerbaarheid. Gray-routing lijkt inconsistent. Verschillende gebruikers kunnen verschillende modellen, tiers of sampling-gedrag hebben geraakt.
- Kwaliteit van het bewijs. Veel video’s laten de volledige prompt, model-ID, faalaantal, token-gebruik en handmatige bewerkingen weg.
De eerlijke beschrijving is “een prototype-generator met een hoog plafond én écht programmeervermogen” — niet “een senior engineer die geen review meer nodig heeft”.
V4 vs Kimi K3 vs GPT-5.6 vs Fable 5.0
Er is hier geen gecontroleerde benchmark van vier modellen. De tabel hieronder is een workflow-gerichte synthese van het gray-test-bewijs en de gebruikersverhalen eromheen — geen ranglijst.
| Model | Waarschijnlijk voordeel | Waar V4 staat | Beste rol |
|---|---|---|---|
| DeepSeek V4 | Kosten, brede implementatie, snelle prototypes | Baseline | Standaard dagelijks programmeerwerk en eerste implementatie |
| Kimi K3 | Front-end-afwerking, presentatie, schrijven | V4 is iets minder gepolijst maar vaak functioneel vergelijkbaar | UI-pass, productcopy, visuele verfijning |
| GPT-5.6 | Review-consistentie, tool-ecosysteem, cross-file-redeneren | V4 is mogelijk het goedkopere alternatief voor routinewerk; onvoldoende bewijs voor een algemene winst | Code-review, validatie, koppige bugs |
| Fable 5.0 | Langlopende implementatie, multi-turn-herstel | V4 lijkt dichtbij in geselecteerde demo’s maar minder betrouwbaar aan de rand | Escalatiemodel voor het moeilijkste resterende werk |
V4 vs Kimi K3: het meest geloofwaardige directe materiaal wijst op een nek-aan-nek-race. K3 lijkt beter in front-end en schrijven; V4 is mogelijk sterker in waarde en concurrerend in implementatie. Eén vergelijkingsvideo haalde tienduizenden weergaven, maar prompts en scoren waren niet gestandaardiseerd.
V4 vs GPT-5.6: geïsoleerde reacties claimen winst en verlies op specifieke webprojecten. Dit zijn testideeën, geen benchmark-resultaten. De nuttige vraag is of V4 voor minder geld de test-suite van jouw repo kan doorstaan.
V4 vs Fable 5.0: indrukwekkende game-demo’s maken de vergelijking verleidelijk, maar de collectie bewijst geen gelijkwaardigheid op grote codebases, security-review of lange autonome runs. Beschouw Fable 5.0 als een escalatie-optie totdat reproduceerbare tests anders uitwijzen.
Een praktische setup
De goedkoopste setup die je later niet opbrekt:
- Laat V4 de eerste 80–90% doen. Planning, scaffolding, implementatie, tests, documentatie, gewone bugfixes.
- Verifieer lokaal. Lint, type-check, unit- en integration-tests, plus een menselijke diff-review. Onderhandelbaar: nee.
- Escaleer met bewijs. Stuur, als je vastzit, de diff, falende tests en een specifieke vraag naar Kimi K3, GPT-5.6 of Fable 5.0 — niet nóg eens dezelfde vage prompt.
- Houd één licht premium-abonnement aan, niet meerdere volledige abonnementen. Gebruik het als reviewer en herstelmodel, niet als de standaard tokenverbrander.
Dit werkt alleen als het tweede model bewijs krijgt — diffs, logs, falende tests. Twee modellen dezelfde vage vraag stellen verdubbelt meestal de kosten zonder de betrouwbaarheid te verbeteren.
Wat te verifiëren als V4 officieel launcht
Beoordeel de officiële release op reproduceerbaarheid, niet op launch-dag-demo’s. Controleer:
- de exacte API-model-ID, en of web, app en API dezelfde tier gebruiken;
- contextvenster, output-limiet, tool-calling en ondersteuning voor structured output;
- prijs per input-, cached-input- en output-token;
- rate-limits, routing op piekmomenten, en of “Pro/Flash/Max”-tiers zich anders gedragen;
- bewerken op repo-schaal, test-aanvulling en instructie-opvolging;
- hoe vaak identieke prompts de gray-test-kwaliteit reproduceren;
- licentie, data-retentie en deployment-opties.
We updaten deze pagina zodra DeepSeek officiële modelkaarten, API-documentatie en prijzen publiceert. Tot die tijd blijven beweringen over het uiteindelijke model voorlopig.
FAQ
Is de officiële versie al beschikbaar?
De collectie documenteert vermoedelijke gray-routing, geen bevestigde release. Een video met de titel “official version” is geen officiële bevestiging van DeepSeek.
Hoe goed is V4 voor programmeren?
Het bewijs is het sterkst voor snelle web-prototypes, games, SVG, three.js en iteratief bugfixen. Het is het dunst voor grote productie-repo’s, security-gevoelige code en lang autonoom werk.
Is V4 beter dan Kimi K3?
Niet over alle taken. V4 lijkt dichtbij en biedt misschien meer waarde; Kimi K3 heeft vaak de rand in front-end-afwerking en schrijven. Draai dezelfde prompt, runtime en acceptatietests voordat je kiest.
Moet ik mijn premium programmeer-abonnement opzeggen?
Voor veel gebruikers is downgraden naar één licht premium-abonnement logischer dan alles opzeggen. Laat V4 het volume dragen en houd een onafhankelijk model aan voor review en escalatie.
Waar kan ik de oorspronkelijke gray-tests inzien?
Begin met de GitHub-index van alle 121 video’s. Representatieve cases: brede V4 + Kimi K3-test, 3D-physics-vergelijking, 8192-blocks Minecraft-test, proactief bugfix-voorbeeld.