Kort svar
DeepSeek har ikke bekreftet at dette er V4. Det vi har er en stor, uvanlig ensartet bølge av mistenkte gray-test-utskrifter: 121 Bilibili-videoer fra 53 skapere mellom 7. og 19. juli 2026, pluss 40 delte OpenCode-samtaler og en håndfull nedlastbare prosjekter. Det er nok til å få øye på mønstre — ikke nok til å sertifisere en modell-ID eller kjøre en kontrollert benchmark.
Leser du bevisene med det forbeholdet, er bildet tydelig: V4 virker litt bak Kimi K3, GPT-5.6 og Fable 5.0 i deres sterkeste områder, men nær nok til at en kostnadsbevisst utvikler for det meste av daglig koding kan bruke V4 som standard, og beholde ett lett premium-abonnement til kodegjennomgang, vanskelige bugs og de siste 10 % av lang, fleromgangs arbeid.
For galleriet med skjermbilder og chatte-lenker fra den tidligere bølgen, se vår samling av DeepSeek V4 gray-release-beviser.
Fullstendig kildekatalog Nøkkelbevis
Råbevisene bak hvert påstand i denne artikkelen — speilet fra den åpne YunhaoFu/dsv4ga-news-gather-repoen. Utvid for å bla etter skaper, dato eller nøkkelord. Titler lenker rett til Bilibili.
Klikk for å utvide alle 136 poster
Tips: tittelen er lenken til Bilibili. grønn = delt chatsession, oransje = prosjektnedlasting. Hold musepekeren over en skaper for å se hele navnet.
Hva 121 tester faktisk viser
Dataene kommer fra den åpne dsv4ga-news-gather-repoen, som indekserer offentlige Bilibili-innlegg og bevarer titler, skapernavn, tidsstempler, beskrivelser, kommentarer, delte samtaler og nedlastingslenker. Øyeblikksbildet fra 19. juli ser omtrent slik ut:
Innlegg per dag
Spredt drypp før 15. juli, deretter en flom av utgivelser som topper seg 18. juli.
Topp 10 skapere
Bare kdzzzds og Delight-linger delte omfattende sessionslogger. Grønn = 5+ delte sessions, oransje = 1–4, blå = ingen.
Hva folk faktisk testet
Kategorisert fra 136 titler. Spill dominerer totalt — produksjonsbackender, sikkerhet og langtidsoppgaver forekommer så vidt.
To skjevheter betyr mer enn noe enkelt tall. Utvalgsskjevhet: de fleste av disse er «ønske-koding» — nettleserspill, 3D-scener, SVG-animasjon, fysikk-leketøy, musikkverktøy. Samlingen er sterke bevis for rask prototyping og frontend-generering; den er svake bevis for produksjonsbackender, sikkerhet, vedlikehold av store repoer eller ting som tar måneder. Åpenhetsskjevhet: bare 3 av de ti øverste skaperne delte prompts eller chatterlogger. Behandle videotitler som sier «offisiell versjon» som markedsføring — skaperen mistenker vanligvis bare en gray-rute. Vi bruker mistenkt V4 gray-bygg gjennomgående.
Hva V4 faktisk ser ut til å være god på
Én-prompt-apper kjører nå, i stedet for å bare se fine ut
Det sterkeste mønsteret er bred implementering fra en tynn spec. Samlingen omfatter voxel-verdener, skytespill, rytmespill, overlevelsesspill, three.js-scener, musikkgeneratorer og ingeniørvisualiseringer. En representativ GTA-aktig SVG-demo ble beskrevet som én hovedgenerering pluss én bugfiks-runde, med en delt samtale vedlagt. Det er ikke «én setning, ett utgitt spill». Det er «modellen velger en arkitektur, kobler nok av den sammen for å demonstrere ideen, og leverer ikke lenger tilbake et tomt mockup».
Stere 3D, SVG og lettvekts simulasjon
Three.js-scener, egendefinerte SVG-ressurser, spillfysikk og interaktive simuleringer går igjen i samlingen. En CFD-aktig side for væske og gass skal angivelig ha brukt PBF for væske og LBM for gass over to samtaler. Skaperen påpekte selv urealistisk aerodynamikk og at mer reparasjon trengs — akkurat grensen mellom en imponerende prototype og et pålitelig ingeniørverktøy.
Pris kan være den virkelige overskriften
I fellesskapet beskrives V4 og Kimi K3 gjentatte ganger som jevnbyrdige på praktiske prosjekter. Hvis det endelige API-et beholder DeepSeeks vanlige prisfordel, betyr «near-frontier-evne til infrastrukturpriser» mer enn å vinne en enkelt head-to-head-demo. Se vår AI API-prissammenligning for aktuell kontekst.
Hvor V4 fortsatt sliter
- Finish og smak. Kimi K3 foretrekkes ofte for frontend-sammensetning og lang tekst. V4s visuelle kan være imponerende, men kvaliteten svinger kraftig med prompt-utforming.
- Instruksjonsgrenser. Én demo ba modellen slette kommentarer; den fikset også en spillbug på egenhånd. Det initiativet føles magisk i et leketøy, og er en gjennomgangsrisiko i et ekte repo. Gå gjennom hver diff — ikke aksepter «det kjører» som tilstrekkelig.
- Pålitelighet over lange, fleromgangs-økter. Sessions krasjer fortsatt, mister retning, eller bygger opp arkitekturgjeld over mange runder. En sterk første runde garanterer ikke en sterk tjuende runde.
- Fysikk-riktighet. En overbevisende væske- eller tyngdekraft-simulasjon er ikke gyldig CFD eller mekanikk. Visuelt riktig ≠ numerisk riktig.
- Reproduserbarhet. Gray-ruting virker inkonsekvent. Ulike brukere kan ha truffet ulike modeller, nivåer eller samplingsoppførsel.
- Beviskvalitet. Mange videoer utelater full prompt, modell-ID, antall feil, token-bruk og manuelle redigeringer.
Det ærlige svaret er «prototype-generator med høyt tak og ekte kode-evne» — ikke «en senioringeniør som ikke lenger trenger gjennomgang».
V4 vs Kimi K3 vs GPT-5.6 vs Fable 5.0
Det finnes ingen kontrollert fire-modell-benchmark her. Tabellen under er en arbeidsflyt-orientert syntese av gray-test-bevisene og brukerrapportene rundt dem — ikke en rangering.
| Modell | Sannsynlig fordel | Hvor V4 står | Beste rolle |
|---|---|---|---|
| DeepSeek V4 | Kostnad, bred implementering, raske prototyper | Grunnlinje | Standard daglig-koding og første implementering |
| Kimi K3 | Frontend-finish, presentasjon, tekst | V4 er litt mindre finpuss men ofte funksjonelt jevngod | UI-gjennomgang, produkttekst, visuell forfining |
| GPT-5.6 | Gjennomgangskonsistens, verktøyøkosystem, på-tvers-av-filer-resonnement | V4 kan være det billigere alternativet til rutinearbeid; ikke nok bevis for en generell seier | Kodegjennomgang, validering, sta bugs |
| Fable 5.0 | Langhorisont-implementering, gjenoppretting over flere omganger | V4 ser nær ut i utvalgte demoer men mindre pålitelig i kantene | Eskaleringsmodell for det vanskeligste gjenstående arbeidet |
V4 vs Kimi K3: det mest troverdige direktematerialet peker mot en jevn kamp. K3 ser bedre ut på frontend og tekst; V4 kan være bedre verdi og konkurransedyktig på implementering. Én sammenligningsvideo nådde titusenvis av visninger, men prompts og poengsetting var ikke standardisert.
V4 vs GPT-5.6: spredte kommentarer hevder seiere og tap på bestemte nettprosjekter. Dette er testideer, ikke benchmark-resultater. Det nyttige spørsmålet er om V4 kan passere repoets test-suite til lavere kostnad.
V4 vs Fable 5.0: imponerende spill-demoer gjør sammenligningen fristende, men samlingen etablerer ikke paritet på store kodebaser, sikkerhetsgjennomgang eller lange autonome kjøringer. Behandle Fable 5.0 som et eskaleringsalternativ inntil reproduserbare tester sier noe annet.
Et praktisk oppsett
Det billigste oppsettet som ikke slår tilbake på deg senere:
- La V4 gjøre de første 80–90 %. Planlegging, stillas, implementering, tester, dokumentasjon, vanlig bugfiksing.
- Verifiser lokalt. Lint, typesjekk, enhets- og integrasjonstester, pluss en menneskelig diff-gjennomgang. Ikke forhandlingsbart.
- Skaler opp med bevis. Når du sitter fast, send diff, feilende tester og et snevert spørsmål til Kimi K3, GPT-5.6 eller Fable 5.0 — ikke samme vage prompt på nytt.
- Behold ett lett premium-abonnement, ikke flere fulle abonnementer. Bruk det som en anmelder og gjenopprettingsmodell, ikke standard token-sluk.
Dette fungerer bare hvis den andre modellen får bevis — diff, logger, feilende tester. Å spørre to modeller det samme vage spørsmålet dobler vanligvis kostnaden uten å forbedre påliteligheten.
Hva du bør verifisere når V4 offisielt lanseres
Døm den offisielle utgaven på reproduserbarhet, ikke lanserings-demoer. Sjekk:
- eksakt API-modell-ID, og om web, app og API bruker samme nivå;
- kontekstvindu, utgangsgrense, verktøykall og støtte for strukturert utdata;
- pris per input-, cache-input- og output-token;
- rate-grenser, rushtids-ruting, og om «Pro/Flash/Max»-nivåene oppfører seg ulikt;
- repo-skala redigering, testfullføring og instruksjons-etterlevelse;
- hvor ofte identiske prompts reproduserer gray-test-kvaliteten;
- lisens, datalagring og distribusjonsalternativer.
Vi oppdaterer denne siden når DeepSeek publiserer offisielle modellkort, API-dokumentasjon og prising. Frem til da er alle påstander om den endelige modellen foreløpige.
Vanlige spørsmål
Er den offisielle versjonen tilgjengelig nå?
Samlingen dokumenterer mistenkt gray-ruting, ikke en bekreftet lansering. En videotittel som sier «offisiell versjon» er ikke offisiell bekreftelse fra DeepSeek.
Hvor god er V4 egentlig til koding?
Bevisene er sterkest for raske web-prototyper, spill, SVG, three.js og iterativ bugfiksing. De er tynnest for store produksjons-repoer, sikkerhetssensitiv kode og lang autonom koding.
Er V4 bedre enn Kimi K3?
Ikke på alle oppgaver. V4 virker nær og kan tilby bedre verdi; Kimi K3 har ofte et forsprang på frontend-finish og tekst. Kjør samme prompt, runtime og akseptansetester før du velger.
Bør jeg si opp premium kode-abonnementet mitt?
For mange er det mer fornuftig å gå ned til ett lett premium-abonnement enn å si opp alt. La V4 ta volumet og behold en uavhengig modell til gjennomgang og eskalering.
Hvor kan jeg se de opprinnelige gray-testene?
Start med GitHub-indeksen over alle 121 videoer. Representative tilfeller: bred V4 + Kimi K3-test, 3D-fysikk-sammenligning, 8192-blokk Minecraft-test, proaktiv bugfiks-eksempel.