Det korte svar
DeepSeek har ikke bekræftet, at dette er V4. Hvad vi har, er en stor og usædvanlig ensartet bølge af formodede gråtest-outputs: 121 Bilibili-videoer fra 53 skabere mellem 7. og 19. juli 2026, plus 40 delte OpenCode-samtaler og en håndfuld downloadbare projekter. Det er nok til at genkende mønstre — ikke nok til at certificere et model-ID eller køre en kontrolleret benchmark.
Læser man beviserne med det forbehold, er billedet klart: V4 ligger en smule bag Kimi K3, GPT-5.6 og Fable 5.0 i deres respektive styrkeområder, men forskellen er nu så lille, at en omkostningsbevidst udvikler for de fleste dagligdags kodeopgaver godt kan bruge V4 som standard og blot beholde ét let premium-abonnement til kode review, svære bugs og de sidste 10 % af lange multiturn-opgaver.
For skærmbilledgalleriet og chat-links fra den tidligere bølge, se vores round-up af DeepSeek V4 gray-release-beviser.
Fuld kildekatalog Nøglebeviser
De rå beviser bag hver påstand i denne artikel — spejlet fra det åbne YunhaoFu/dsv4ga-news-gather-repository. Udvid for at browse efter skaber, dato eller nøgleord. Titler linker direkte til Bilibili.
Klik for at udvide alle 136 poster
Tip: titlen er linket til Bilibili. grøn = delt chatsession, orange = projekt-download. Hold musen over en skaber for at se det fulde navn.
Hvad 121 tests egentlig viser
Dataen kommer fra det åbne dsv4ga-news-gather-repository, som indekserer offentlige Bilibili-indlæg og bevarer titler, skabernavne, tidsstempler, beskrivelser, kommentarer, delte samtaler og download-links. Øjebliksbilledet fra 19. juli ser cirka sådan her ud:
Indlæg per dag
Langsom dryp indtil 15. juli, derefter en mur af udgivelser med peak på 18. juli.
Top 10 skabere
Blandt de ti øverste er det kun kdzzzds og Delight-linger, der har delt store mængder session-logge. Grøn = 5+ delte sessioner, orange = 1–4, blå = ingen.
Hvad folk faktisk testede
Kategoriseret ud fra 136 titler. Spil dominerer fuldstændigt — produktions-backends, sikkerhed og langtidsopgaver ses stort set ikke.
To skævheder betyder mere end et hvilket som helst enkelt tal. Udvalgsskævhed: de fleste af disse er "ønske-kodning" — browserspil, 3D-scener, SVG-animation, fysik-legetøj, musikværktøjer. Sættet er stærke beviser for hurtig prototyping og front-end-generering; det er svage beviser for produktions-backends, sikkerhed, vedligeholdelse af store repositories eller noget, der tager måneder. Gennemsigtighedsskævhed: kun 3 af de 10 øverste skabere delte deres prompts eller chat-logge. Betragt videotitler, der siger "officiel version", som markedsføring — skaberen mistænker typisk kun en grå rute. Vi bruger formodet V4-grå-build gennem hele teksten.
Hvad V4 faktisk ser ud til at være god til
Apps fra én prompt kører nu, i stedet for bare at se flotte ud
Det stærkeste mønster er bred implementering ud fra en tynd spec. Sættet indeholder voxel-verdener, shootere, rytmespil, overlevelsesspil, three.js-scener, musikgeneratorer og ingeniør-visualiseringer. En repræsentativ GTA-agtig SVG-demo blev beskrevet som én hovedgenerering plus én bugfix-runde, med en delt samtale vedhæftet. Det er ikke "én sætning, ét leveret spil". Det er "modellen vælger en arkitektur, kobler nok af den sammen til at demonstrere ideen, og returnerer ikke længere en tom mockup".
Stærk 3D, SVG og letvægts-simulering
Three.js-scener, tilpassede SVG-assets, spilfysik og interaktive simuleringer går igen på tværs af samlingen. En CFD-agtig luft-væske-side skulle angiveligt bruge PBF til væske og LBM til gas over to samtaler. Skaberen pegede selv på urealistisk aerodynamik og behov for mere reparation — netop grænsen mellem en imponerende prototype og et troværdigt ingeniørværktøj.
Pris kan være den egentlige overskrift
Fællesskabssammenligninger beskriver gentagne gange V4 og Kimi K3 som tætte på praktiske projekter. Hvis det endelige API bevarer DeepSeeks sædvanlige prisanfordel, betyder "næsten-frontier-kapacitet til infrastrukturpriser" mere end at vinde et hvilket som helst enkelt head-to-head-demo. Se vores AI API-prissammenligning for aktuel kontekst.
Hvor V4 stadig kæmper
- Finish og smag. Kimi K3 foretrækkes ofte til front-end-sammensætning og lange formuleringer. V4's visuelt kan være imponerende, men kvaliteten svinger kraftigt med prompt-designet.
- Instruktionsgrænser. Én demo bad modellen om at slette kommentarer; den fixede også en spil-bug på egen hånd. Det initiativ føles magisk i et legetøj og er en review-risiko i et rigtigt repo. Gennemgå hver diff — accepter ikke "det kører" som tilstrækkeligt.
- Lang multiturn-pålidelighed. Sessioner crasher stadig, mister retning eller akkumulerer arkitekturgæld over mange runder. En stærk første gennemkørsel garanterer ikke en stærk tyvende gennemkørsel.
- Fysisk korrekthed. En overbevisende væske- eller tyngdekraft-simulering er ikke gyldig CFD eller mekanik. Visuelt korrekt ≠ numerisk korrekt.
- Reproducerbarhed. Grå routing virker inkonsekvent. Forskellige brugere kan have ramt forskellige modeller, trin eller sampling-adfærd.
- Bevisernes kvalitet. Mange videoer udelader den fulde prompt, model-identifikator, antal fejl, token-forbrug og manuelle redigeringer.
Den ærlige beskrivelse er "prototype-generator med højt loft og reel kode-evne" — ikke "en senioringeniør, der ikke længere har brug for review".
V4 vs Kimi K3 vs GPT-5.6 vs Fable 5.0
Der findes ingen kontrolleret fire-models-benchmark her. Tabellen nedenfor er en arbejdsflow-orienteret syntese af gråtest-beviserne og brugerrapporterne omkring dem — ikke en leaderboard.
| Model | Mulig fordel | Hvor V4 står | Bedste rolle |
|---|---|---|---|
| DeepSeek V4 | Omkostning, bred implementering, hurtige prototyper | Baseline | Standard daglig-kodning og første implementering |
| Kimi K3 | Front-end-finish, præsentation, skrivning | V4 er lidt mindre færdigpoleret men ofte funktionelt sammenlignelig | UI-gennemkørsel, produkttekst, visuel forfining |
| GPT-5.6 | Review-konsistens, værktøjsøkosystem, fil-krydsende ræsonnement | V4 kan være det billigere alternativ til rutinearbejde; ikke tilstrækkeligt bevis for en generel sejr | Kode-review, validering, stædige bugs |
| Fable 5.0 | Langsigtet implementering, multiturn-gendannelse | V4 ser tæt ud i udvalgte demoer men er mindre pålidelig i kanten | Eskaleringsmodel til det sværeste tilbageværende arbejde |
V4 vs Kimi K3: det mest troværdige direkte materiale peger på en tæt kamp. K3 ser bedre ud på front-end og skrivning; V4 er muligvis stærkere på værdi og konkurrencedygtig på implementering. Én sammenligningsvideo nåede titusindvis af visninger, men prompts og scoring var ikke standardiseret.
V4 vs GPT-5.6: isolerede kommentarer hævder sejre og nederlag på bestemte webprojekter. Det er testidéer, ikke benchmark-resultater. Det nyttige spørgsmål er, om V4 kan bestå dit repos test-suite til en lavere pris.
V4 vs Fable 5.0: imponerende spil-demoer gør sammenligningen fristende, men samlingen etablerer ikke lighed på store kodebaser, sikkerheds-review eller lange autonome kørsler. Betragt Fable 5.0 som en eskaleringsmulighed, indtil reproducerbare tests siger andet.
Et praktisk setup
Det billigste setup, der ikke vender tilbage og bider dig senere:
- Lad V4 klare de første 80–90 %. Planlægning, stillads, implementering, tests, docs, almindelig bug-fixing.
- Verificer lokalt. Lint, type-check, unit- og integrationstests samt en menneskelig diff-gennemgang. Ikke til forhandling.
- Eskalér med beviser. Når du sidder fast, send diff'en, fejlede tests og et snævert spørgsmål til Kimi K3, GPT-5.6 eller Fable 5.0 — ikke den samme vage prompt igen.
- Behold ét let premium-abonnement, ikke flere fulde abonnementer. Brug det som reviewer og gendannelsesmodel, ikke som standard token-forbruger.
Dette virker kun, hvis den anden model får beviser — diffs, logge, fejlede tests. At spørge to modeller det samme vage spørgsmål fordobler typisk omkostningerne uden at forbedre pålideligheden.
Hvad du skal verificere, når V4 officielt lanceres
Bedøm den officielle udgivelse på reproducerbarhed, ikke lancerings-demos. Tjek:
- det præcise API-model-ID, og om web, app og API bruger samme trin;
- kontekstvindue, output-grænse, værktøjskald og understøttelse af struktureret output;
- pris pr. input-, cached-input- og output-token;
- rate-limits, routing i spidsbelastning og om "Pro/Flash/Max"-trin opfører sig forskelligt;
- redigering på repo-niveau, test-fuldførelse og instruktions-overholdelse;
- hvor ofte identiske prompts gengiver gråtest-kvaliteten;
- licens, datalagring og implementeringsmuligheder.
Vi opdaterer denne side, når DeepSeek udgiver officielle modelkort, API-dokumentation og priser. Indtil da forbliver påstande om den endelige model foreløbige.
FAQ
Er den officielle version allerede tilgængelig?
Samlingen dokumenterer formodet grå routing, ikke en bekræftet udgivelse. En video med titlen "officiel version" er ikke en officiel bekræftelse fra DeepSeek.
Hvor god er V4 til at kode?
Beviserne er stærkest for hurtige web-prototyper, spil, SVG, three.js og iterativ bug-fixing. De er tyndest for store produktions-repos, sikkerhedsfølsom kode og langt autonomt arbejde.
Er V4 bedre end Kimi K3?
Ikke på alle opgaver. V4 virker tæt på og tilbyder muligvis bedre værdi; Kimi K3 har ofte en fordel inden for front-end-finish og skrivning. Kør samme prompt, runtime og accepttest, før du vælger.
Skal jeg opsige mit premium-kodningsabonnement?
For mange brugere giver det mere mening at nedgradere til ét letvægts premium-abonnement end at opsige alt. Lad V4 håndtere volumenet, og behold en uafhængig model til review og eskalering.
Hvor kan jeg inspicere de originale gråtests?
Start med GitHub-indekset over alle 121 videoer. Repræsentative tilfælde: bred V4- og Kimi K3-test, 3D-fysik-sammenligning, 8192-bloks Minecraft-test, proaktivt bugfix-eksempel.