Det korta svaret
DeepSeek har inte bekräftat att det här är V4. Vad vi har är en stor och ovanligt samstämmig våg av misstänkt gråtest-output: 121 Bilibili-videor från 53 skapare mellan 7 och 19 juli 2026, plus 40 delade OpenCode-konversationer och en handfull nedladdningsbara projekt. Det räcker för att urskilja mönster — inte för att certifiera ett modell-ID eller köra ett kontrollerat benchmark.
Läser du bevisen på det sättet blir bilden tydlig: V4 ligger något efter Kimi K3, GPT-5.6 och Fable 5.0 i deras starkaste nischer, men tillräckligt tätt för att en kostnadsmedveten utvecklare för det mesta skulle kunna ha V4 som standard och behålla en lätt premiumprenumeration för granskning, svåra buggar och de sista 10 % av långa fleromgångsuppgifter.
För skärmdumpsgalleriet och chattlänkarna från den tidigare vågen, se vår sammanställning av DeepSeek V4-gråsläppbevis.
Fullständig källkatalog Nyckelbevis
Råbevisen bakom varje påstående i den här artikeln — speglad från öppna YunhaoFu/dsv4ga-news-gather-arkivet. Expandera för att bläddra per skapare, datum eller nyckelord. Titlar länkar direkt till Bilibili.
Klicka för att expandera alla 136 poster
Tips: titeln är länken till Bilibili. grön = delad chattsession, orange = projekt nedladdning. Hovra över en skapare för att se hela namnet.
Vad 121 tester faktiskt visar
Datan kommer från öppna dsv4ga-news-gather-arkivet, som indexerar offentliga Bilibili-inlägg och bevarar titlar, skaparnamn, tidsstämplar, beskrivningar, kommentarer, delade konversationer och nedladdningslänkar. Den 19 juli-snapshotten ser ut så här:
Inlägg per dag
Långsamt dryp fram till 15 juli, sedan en vägg av släpp som toppar 18 juli.
Topp 10 skapare
Bara kdzzzds och Delight-linger delade omfattande sessionsloggar. Grön = 5+ delade sessioner, orange = 1–4, blå = inga.
Vad folk faktiskt testade
Kategoriserat från 136 titlar. Spel dominerar — produktionsbackends, säkerhet och långsiktigt arbete dyker knappt upp.
Två snedvridningar spelar större roll än något enskilt tal. Urvalssnedvridning: de flesta av dessa är "önskekodning" — webbläsarspel, 3D-scener, SVG-animering, fysikleksaker, musikverktyg. Sviten är starkt bevis för snabb prototypning och front-end-generering; det är svagt bevis för produktionsbackends, säkerhet, underhåll av stora kodarkiv eller något som tar månader. Transparenssnedvridning: bara 3 av de topp 10 skaparna delade sina prompts eller chattloggar. Se videotitlar som säger "officiell version" som marknadsföring — skaparen misstänker oftast bara en grå rutt. Vi använder misstänkt V4-gråbyggnation genomgående.
Vad V4 faktiskt verkar vara bra på
Appar från en prompt kör nu, istället för att bara se snygga ut
Det starkaste mönstret är bred implementering från en tunn spec. Sviten inkluderar voxelvärldar, shooters, rytmspel, överlevnadsspel, three.js-scener, musikgeneratorer och ingenjörsvaniseringar. En representativ GTA-stil SVG-demo beskrevs som en huvudgenerering plus en bugghanteringsrunda, med en delad konversation bifogad. Det är inte "en mening, ett levererat spel". Det är "modellen väljer en arkitektur, kopplar ihop tillräckligt mycket av den för att demo idén, och lämnar inte längre tillbaka en tom mockup".
Stark 3D, SVG och lättviktssimulering
Three.js-scener, anpassade SVG-tillgångar, spelfysik och interaktiva simuleringar upprepas i samlingen. En vätska-gas CFD-stil sida använde enligt uppgift PBF för vätska och LBM för gas under två konversationer. Skaparen flaggade också orealistisk aerodynamik och behov av mer reparation — exakt gränsen mellan en imponerande prototyp och ett pålitligt ingenjörsverktyg.
Priset kan vara den verkliga rubriken
Community-jämförelser beskriver upprepade gånger V4 och Kimi K3 som nära på praktiska projekt. Om det slutgiltiga API:et behåller DeepSeeks vanliga prisfördel är "nära-frontline-förmåga till infrastrukturpris" viktigare än att vinna en enskild head-to-head-demo. Se vår Jämförelse av AI API-priser för aktuell kontext.
Där V4 fortfarande kämpar
- Puts och smak. Kimi K3 föredras ofta för front-end-sammansättning och långa texter. V4:s visuella intryck kan vara slående, men kvaliteten svänger kraftigt med promptdesign.
- Instruktionsgränser. En demo bad modellen ta bort kommentarer; den fixade också en spelbugg på eget initiativ. Det initiativet känns magiskt i en leksak, och är en granskningsrisk i ett riktigt kodarkiv. Granska varje diff — acceptera inte "den kör" som tillräckligt.
- Lång fleromgångs pålitlighet. Sessioner kraschar fortfarande, tappar riktning eller ackumulerar arkitekturskuld över många omgångar. Ett starkt första försök garanterar inte ett starkt tjugonde.
- Fysikalisk korrekthet. En övertygande vätske- eller gravitationssimulering är inte giltig CFD eller mekanik. Visuellt rätt ≠ numeriskt rätt.
- Reproducerbarhet. Grå routing ser inkonsekvent ut. Olika användare kan ha träffat olika modeller, nivåer eller samplingsbeteende.
- Beviskvalitet. Många videor utelämnar fullständig prompt, modellidentifierare, antal misslyckanden, tokenanvändning och manuella redigeringar.
Den ärliga beskrivningen är "prototypgenerator med högt tak och verklig kodförmåga" — inte "en senior ingenjör som inte längre behöver granskning".
V4 mot Kimi K3 mot GPT-5.6 mot Fable 5.0
Det finns inget kontrollerat fyrmodells-benchmark här. Tabellen nedan är en arbetsflödesorienterad syntes av gråtest-bevisen och användarrapporterna runt dem — inte en rankinglista.
| Modell | Tänkbar fördel | Var V4 står | Bästa roll |
|---|---|---|---|
| DeepSeek V4 | Kostnad, bred implementering, snabba prototyper | Baslinje | Daglig standardkodning och första implementering |
| Kimi K3 | Front-end-puts, presentation, skrivande | V4 är något mindre putsad men ofta funktionellt jämförbar | UI-pass, produkttext, visuell förfining |
| GPT-5.6 | Granskningskonsekvens, verktygsekosystem, filövergripande resonemang | V4 kan vara det billigare substitutet för rutinarbete; inte tillräckligt med bevis för en generell vinst | Kodgranskning, validering, envisa buggar |
| Fable 5.0 | Långsiktiga implementeringar, fleromgångsåterhämtning | V4 ser nära ut i utvalda demos men mindre pålitlig i kanten | Eskaleringsmodell för det svåraste återstående arbetet |
V4 mot Kimi K3: det mest trovärdiga direkta materialet pekar på en jämn kamp. K3 ser bättre ut på front-end och skrivande; V4 kan ha bättre värde och vara konkurrenskraftig på implementering. En jämförelsevideo nådde tiotusentals visningar, men prompts och poängsättning var inte standardiserade.
V4 mot GPT-5.6: isolerade kommentarer hävdar vinster och förluster på specifika webbprojekt. Detta är testidéer, inte benchmark-resultat. Den användbara frågan är huruvida V4 kan passera ditt kodarkivs testsvit till lägre kostnad.
V4 mot Fable 5.0: imponerande spel-demos gör jämförelsen frestande, men samlingen fastställer inte paritet på stora kodarkiv, säkerhetsgranskning eller långa autonoma körningar. Behandla Fable 5.0 som ett eskaleringsalternativ tills reproducerbara tester säger annat.
En praktisk uppsättning
Den billigaste uppsättningen som inte bitr dig senare:
- Låt V4 göra de första 80–90 %. Planering, ställning, implementering, tester, dokumentation, vanlig buggfix.
- Verifiera lokalt. Lint, typkontroll, enhets- och integrationstester, samt en mänsklig diff-granskning. Förhandlingsbart.
- Eskalera med bevis. När du sitter fast, skicka diffen, misslyckade tester och en snäv fråga till Kimi K3, GPT-5.6 eller Fable 5.0 — inte samma vaga prompt igen.
- Behåll ett lätt prenumerationsupplägg, inte flera fulla prenumerationer. Använd det som granskare och återställningsmodell, inte som standard förbrukare av tokens.
Det här fungerar bara om den andra modellen får bevis — diffar, loggar, misslyckade tester. Att fråga två modeller samma vaga fråga fördubblar oftast kostnaden utan att förbättra pålitligheten.
Vad du ska verifiera när V4 officiellt lanseras
Bedöm officiella släpp på reproducerbarhet, inte lanseringsdemos. Kontrollera:
- det exakta API-modell-ID:t, och huruvida webb, app och API använder samma nivå;
- kontextfönster, output-gräns, verktygsanrop och stöd för strukturerad output;
- pris per indata, cachad indata och output-token;
- hastighetsbegränsningar, rusningstid-routing, och huruvida "Pro/Flash/Max"-nivåerna beter sig olika;
- kodarkivsskalig redigering, testkomplettering och instruktionsföljsamhet;
- hur ofta identiska prompts reproducerar gråtest-kvaliteten;
- licens, datalagring och distributionsalternativ.
Vi uppdaterar den här sidan när DeepSeek publicerar officiella modellkort, API-dokumentation och prissättning. Tills dess förblir påståenden om den slutgiltiga modellen preliminära.
Vanliga frågor
Är den officiella versionen redan tillgänglig?
Samlingen dokumenterar misstänkt grå routing, inte ett bekräftat släpp. En video med titeln "officiell version" är inte officiell bekräftelse från DeepSeek.
Hur bra är V4 för kodning?
Bevisen är starkast för snabba webbprototyper, spel, SVG, three.js och iterativ buggfix. De är tunnast för stora produktionsarkiv, säkerhetskänslig kod och långt autonomt arbete.
Är V4 bättre än Kimi K3?
Inte över alla uppgifter. V4 verkar nära och kan erbjuda bättre värde; Kimi K3 har ofta övertag på front-end-puts och skrivande. Kör samma prompt, runtime och acceptanstester innan du väljer.
Bör jag säga upp min premium kodningsprenumeration?
För många användare är det mer meningsfullt att nedgradera till ett lätt premiumupplägg än att säga upp allt. Låt V4 hantera volymen och behåll en oberoende modell för granskning och eskalering.
Var kan jag inspektera de ursprungliga gråtesterna?
Börja med GitHub-indexet över alla 121 videor. Representativa fall: bred V4 + Kimi K3-test, 3D-fysikjämförelse, 8192-block Minecraft-test, proaktiv buggfix-exempel.