Lyhyt vastaus
DeepSeek ei ole vahvistanut, että nämä olisivat V4:ää. Käytössämme on suuri, epätavallisen yhtenäinen aalto epäiltyä harmaatestitulostusta: 121 Bilibili-videota 53 tekijältä 7.–19. heinäkuuta 2026 välissä, mukana 40 jaettua OpenCode-keskustelua sekä muutama ladattava projekti. Tämä riittää mallien havaitsemiseen — mutta ei mallitunnuksen sertifioimiseen eikä kontrolloidun vertailun ajamiseen.
Kun todisteet lukee tällä esiymmärryksellä, kuva on selvä: V4 näyttää hieman Kimi K3:ta, GPT-5.6:ta ja Fable 5.0:ta heikommalta näiden vahvimmilla alueilla, mutta ero on jo niin pieni, että kustannustietoinen kehittäjä voi useimmissa arkisissa koodaustilanteissa pitää V4:ää oletuksena ja säästää yhden kevyen premium-tilauksen katselmointiin, hankalille bugeille ja monikierroksisen pitkän työn viimeiselle 10 %:lle.
Aiemman aallon kuvakaappaukset ja keskustelulinkit löytyvät artikkelista DeepSeek V4 -harmaajulkaisun todistekokoelma.
Täydellinen lähdeluettelo Avaintodisteet
Kaikki tämän artikkelin väitteet todistavat alkuperäiset lähteet — peilattu avoimesta tietovarastosta YunhaoFu/dsv4ga-news-gather. Laajenna ja selaa tekijän, päivämäärän tai avainsanan mukaan. Otsikot linkittävät suoraan Bilibiliin.
Laajenna kaikki 136 tietuetta
Vinkki: otsikko on suora linkki Bilibiliin. vihreä = jaettu keskustelu, oranssi = projektin lataus. Vie kursori tekijän nimen päälle nähdäksesi koko nimen.
Mitä 121 testiä oikeasti näyttävät
Data tulee avoimesta dsv4ga-news-gather-tietovarastosta, joka indeksoi julkisia Bilibili-julkaisuja ja säilyttää otsikot, tekijöiden nimet, aikaleimat, kuvaukset, kommentit, jaetut keskustelut ja latauslinkit. 19. heinäkuuta tilanne näyttää suurin piirtein tältä:
Julkaisuja päivässä
Hidas tippuminen 15. heinäkuuta asti, sitten julkaisutulva, joka huipentui 18. heinäkuuta.
Top 10 -tekijät
Kymmenen parhaasta vain kdzzzds ja Delight-linger julkaisivat merkittäviä keskustelulokeja. Vihreä = 5+ jaettua keskustelua, oranssi = 1–4, sininen = ei mitään.
Mitä oikeasti testattiin
Luokiteltu 136 otsikosta. Pelit hallitsevat täysin — tuotantotason backendit, turvallisuus ja pitkän aikavälin projektit puuttuvat lähes kokonaan.
Kaksi harhaa merkitsevät enemmän kuin yksikään yksittäinen luku. Valintaharha: suurin osa näistä on "toivekoodausta" — selainpelejä, 3D-kohtauksia, SVG-animaatiota, fysiikkaleluja, musiikkityökaluja. Joukko on vahvaa todistetta nopealle prototyypöinnille ja frontend-tuotannolle, mutta heikkoa todistetta tuotantotason backendeille, turvallisuudelle, suurten repojen ylläpidolle tai mille tahansa, mikä vaatii kuukausia. Läpinäkyvyysharha: vain 3 kymmenestä suosituimmasta tekijästä julkaisi kehotteensa tai keskustelulokinsa. Käsittele "virallinen versio" -otsikoita markkinointina — tekijä epäilee itsekin yleensä vain harmaareittiä. Käytämme läpi koko tekstin ilmaisua epäilty V4-harmaaversio.
Mistä V4 vaikuttaa olevan hyvä
Yhden kehotteen sovellukset oikeasti toimivat nyt — eivät vain näytä hyvältä
Vahvin piirre on laaja toteutus ohuesta spesifikaatiosta. Joukossa on voxel-maailmoja, ammuntapelejä, rytmipelejä, selviytymispelejä, three.js-kohtauksia, musiikintuottajia ja insinöörivisualisaatioita. Edustava GTA-tyylinen SVG-demo kuvattiin yhden päägeneroinnin ja yhden buginkorjauskierroksen tulokseksi, ja siihen oli liitetty jaettu keskustelu. Kyse ei siis ole "yksi lause, yksi toimitettu peli". Kyse on siitä, että malli valitsee arkkitehtuurin, kytkee riittävän osan sitä toisiinsa demonstroimaan idean eikä enää palauta tyhjää mockupia.
3D, SVG ja kevyt simulaatio vahvoilla
Three.js-kohtaukset, räätälöidyt SVG-resurssit, pelifysiikka ja interaktiiviset simulaatiot toistuvat kokoelmassa. Eräs kaasu-neste-CFD-tyylinen sivu käytti kuvauksen mukaan PBF:ää nesteelle ja LBM:ää kaasulle kahdessa keskustelussa. Tekijä itsekin huomautti aerodynamiikan epärealistisuudesta ja jatkuvasta korjaustarpeesta — juuri tuo on raja vaikuttavan prototyypin ja luotettavan insinöörityökalun välissä.
Hinta saattaa olla varsinainen uutisotsikko
Yhteisön vertailut kuvailevat toistuvasti V4:ää ja Kimi K3:ta lähes samantasoisiksi käytännön projekteissa. Jos lopullinen API säilyttää DeepSeekin tavaramiehisen hintaedun, "lähellä huippua oleva kyvykkyys infrastruktuurihinnoilla" painaa enemmän kuin minkä tahansa yksittäisen kaksinkamppailun voittaminen. Katso AI API -hintavertailumme nykytilanteen taustoittamiseksi.
Missä V4 yhä kamppailee
- Viimeistely ja maku. Kimi K3:a suositaan usein frontend-kokoonpanoissa ja pitkissä teksteissä. V4:n visuaalit voivat olla vaikuttavia, mutta laatu heilahtelee rajusti kehotteen suunnittelun mukaan.
- Käskyjen rajat. Yhdessä demossa mallia pyydettiin poistamaan kommentteja, ja se korjasi samalla itsestään pelibugin. Sellainen oma-aloitteisuus tuntuu taianomaiselta lelussa — ja on katselmointiriski oikeassa repossa. Käy läpi jokainen diff — älä hyväksy "se toimii" riittäväksi.
- Pitkän monikierroksen luotettavuus. Istunnot yhä kaatuvat, menettävät suunnan tai kerryttävät arkkitehtuurivelkaa monen kierroksen aikana. Vahva ensimmäinen kierros ei takaa vahvaa kahdettakymmentettä kierrosta.
- Fysiikan oikeellisuus. Uskottava neste- tai painovoimasimulaatio ei ole kelvollista CFD:tä tai mekaniikkaa. Visuaalisesti oikein ≠ numeerisesti oikein.
- Toistettavuus. Harmaareititys näyttää epäjohdonmukaiselta. Eri käyttäjät ovat ehkä osuneet eri malleihin, tasoihin tai otantakäyttäytymiseen.
- Todisteen laatu. Monet videot jättävät pois koko kehotteen, mallitunnisteen, epäonnistumismäärän, token-käytön ja manuaaliset muokkaukset.
Rehellinen kuvaus on "korkean katon prototyypintuottaja, jolla on todellista koodauskykyä" — ei "senior-kehittäjä, joka ei enää tarvitse katselmointia".
V4 vs Kimi K3 vs GPT-5.6 vs Fable 5.0
Tässä ei ole kontrolloitua neljän mallin vertailua. Alla oleva taulukko on työnkulkuorientoitunut synteesi harmaatestitodisteista ja niitä ympäröivistä käyttäjäraporteista — ei tulosluettelo.
| Malli | Todennäköinen etu | Missä V4 sijoittuu | Paras rooli |
|---|---|---|---|
| DeepSeek V4 | Hinta, laaja toteutus, nopeat prototyypit | Perustaso | Päivittäisen koodauksen oletus ja ensitoteutus |
| Kimi K3 | Frontend-viimeistely, esitys, kirjoittaminen | V4 on hieman vähemmän viimeistelty mutta usein toiminnallisesti verrattavissa | UI-viilaus, tuotetekstit, visuaalinen hienosäätö |
| GPT-5.6 | Katselmoinnin johdonmukaisuus, työkaluekosysteemi, tiedostojen välinen päättely | V4 voi olla halvempi korvike rutiinityöhön; ei tarpeeksi todistetta yleiseen voittoon | Koodikatselmointi, validointi, itsepäiset bugit |
| Fable 5.0 | Pitkän aikavälin toteutus, monikierroksen palautuminen | V4 näyttää läheiseltä valituissa demoissa mutta on epäluotettavampi reunatapauksissa | Eskalaatiomalli vaikeimpaan jäljellä olevaan työhön |
V4 vs Kimi K3: uskottavin suora aineisto viittaa tiukkaan kisapariin. K3 näyttää paremmalta frontendissä ja kirjoittamisessa; V4 tarjoaa ehkä paremman hinta-laatusuhteen ja on kilpailukykyinen toteutuksessa. Yksi vertailuvideo keräsi kymmeniä tuhansia katselukertoja, mutta kehotteet ja pisteytys eivät olleet vakioidut.
V4 vs GPT-5.6: yksittäiset kommentit väittävät voittoja ja tappioita tietyissä web-projekteissa. Nämä ovat testi-ideoita, eivät vertailutuloksia. Hyödyllinen kysymys on, voiko V4 läpäistä reposition testisarjan halvemmalla.
V4 vs Fable 5.0: vaikuttavat pelidemot tekevät vertailusta houkuttelevan, mutta aineisto ei todista tasaväkisyyttä suurissa koodikannoissa, turvallisuuskatselmoinnissa tai pitkissä automaattiajoissa. Käsittele Fable 5.0:aa eskalaatiovaihtoehtona, kunnes toistettavat testit osoittavat muuta.
Käytännönläheinen asetukset
Halvin asetus, joka ei puraise myöhemmin:
- Anna V4:n tehdä ensimmäiset 80–90 %. Suunnittelu, runko, toteutus, testit, dokumentaatio ja tavallinen bugikorjaus.
- Tarkista lokaalisti. Lint, tyypintarkastus, yksikkö- ja integraatiotestit sekä ihmisen suorittama diff-katselmointi. Ei neuvoteltavissa.
- Eskaloi todisteiden kanssa. Kun jämähdät, lähetä diff, epäonnistuneet testit ja kapea kysymys Kimi K3:lle, GPT-5.6:lle tai Fable 5.0:lle — älä lähetä samaa sumeaa kehotetta uudelleen.
- Pidä yksi kevyt premium-tilaus, ei useita täystilauksia. Käytä sitä katselmoijana ja palautusmallina, ei oletusarvoisena tokeninpolttajana.
Tämä toimii vain, jos toinen malli saa todisteita — diffejä, lokeja, epäonnistuneita testejä. Saman sumean kysymyksen esittäminen kahdelle mallille yleensä vain tuplaa kustannukset parantamatta luotettavuutta.
Mitä tarkistaa V4:n virallisessa julkaisussa
Tuomitse virallinen julkaisu toistettavuuden perusteella, ei julkaisupäivän demojen. Tarkista:
- tarkka API-mallitunniste ja se, käyttävätkö web, sovellus ja API samaa tasoa;
- konteksti-ikkuna, tulostusraja, työkalukutsut ja tukea jäsennetylle tulosteelle;
- hinta per syöte-, välimuistissa oleva syöte- ja tulostetoken;
- nopeusrajoitukset, ruuhka-aikojen reititys ja se, käyttäytyvätkö "Pro/Flash/Max"-tasot eri tavalla;
- repo-tason muokkaus, testien täydentäminen ja käskyjen noudattaminen;
- kuinka usein samat kehotteet toistavat harmaatestin laadun;
- lisenssi, tietojen säilytys ja käyttöönottoasetukset.
Päivitämme tämän sivun, kun DeepSeek julkaisee viralliset mallikortit, API-dokumentaation ja hinnoittelun. Siihen asti väitteet lopullisesta mallista pysyvät alustavina.
Usein kysytyt kysymykset
Onko virallinen versio jo saatavilla?
Kokoelma dokumentoi epäiltyä harmaareititystä, ei vahvistettua julkaisua. Video, jonka otsikossa lukee "virallinen versio", ei ole DeepSeekin virallinen vahvistus.
Kuinka hyvä V4 on koodauksessa?
Todisteet ovat vahvimmillaan nopeissa web-prototyypeissä, peleissä, SVG:ssä, three.js:ssä ja iteratiivisessa bugikorjauksessa. Ohuimmillaan ne ovat suurissa tuotantorepoissa, turvallisuusherkässä koodissa ja pitkässä automaattisessa työssä.
Onko V4 parempi kuin Kimi K3?
Ei jokaisessa tehtävässä. V4 näyttää läheiseltä ja saattaa tarjota paremman hinta-laatusuhteen; Kimi K3:lla on usein etu frontend-viimeistelyssä ja kirjoittamisessa. Aja sama kehote, sama suoritusaikaympäristö ja samat hyväksymistestit ennen valintaa.
Pitäisikö minun peruuttaa premium-koodaustilaukseni?
Monille käyttäjille on järkevämpää pudottaa yhteen kevyteen premium-tilaukseen kuin peruuttaa kaikki. Anna V4:n kantaa volyymi ja pidä riippumaton malli katselmointiin ja eskalaatioon.
Mistä voin tutkia alkuperäiset harmaatestit?
Aloita GitHub-indeksistä, johon on koottu kaikki 121 videota. Edustavia tapauksia: laaja V4 + Kimi K3 -testi, 3D-fysiikkavertailu, 8192-palikan Minecraft-testi, oma-aloitteinen bugikorjausesimerkki.