Maikling sagot
Hindi pa opisyal na kinukumpirma ng DeepSeek na ito ay V4. Ang meron tayo ay isang malaki at di-karaniwang consistent na alon ng suspected na gray-test output: 121 Bilibili video mula sa 53 creator sa pagitan ng Hulyo 7 at Hulyo 19, 2026, kasama ang 40 na shared na OpenCode conversation at mga ilang nadadagdag na project. Sapat ito para makita ang mga pattern — pero hindi sapat para ma-certify ang isang model ID o mag-run ng controlled benchmark.
Basahin mo ang ebidensya gamit ang premisang iyon at malinaw ang larawan: medyo nasa likod ang V4 kina Kimi K3, GPT-5.6, at Fable 5.0 sa kanilang mga pinakamalakas na domain, pero sapat na ang paglapit para sa karamihan ng pang-araw-araw na coding — maaaring gawing default ng isang cost-conscious na developer ang V4 at panatilihin ang isang light premium subscription para sa code review, mahihirap na bug, at sa huling 10% ng mahahabang multi-turn na gawain.
Para sa screenshot gallery at chat link mula sa mas maagang alon, tingnan ang aming roundup ng ebidensya ng DeepSeek V4 gray-release.
Buong source catalog Key evidence
Ang raw na ebidensya sa likod ng bawat claim sa artikulong ito — mirror mula sa open na YunhaoFu/dsv4ga-news-gather repository. I-expand para mag-browse ayon sa creator, petsa, o keyword. Direktang nakalinks ang mga title sa Bilibili.
I-click para i-expand lahat ng 136 record
Tip: ang title ang link papunta sa Bilibili. berde = shared na chat session, kahel = download ng project. I-hover ang creator para makita ang buong pangalan.
Ano sinasabi ng 121 test
Galing ang data sa open na dsv4ga-news-gather repository, na nag-i-index ng public na Bilibili post at nagtatabi ng title, pangalan ng creator, timestamp, description, komento, shared na conversation, at link ng download. Ganito magkaanak ang snapshot noong Hulyo 19:
Post kada araw
Hinahalo-halo hanggang Hulyo 15, pagkatapos ay pader ng release na umakyat sa peak noong Hulyo 18.
Top 10 creator
Tanging kdzzzds at Delight-linger lang sa top 10 ang nagbahagi ng malaking session log. Berde = 5+ shared na session, kahel = 1–4, asul = wala.
Ano talaga ang sinusubok ng mga tao
Naka-category mula sa 136 title. Dominado ng laro — halos walang production backend, security, o long-horizon na trabaho.
Dalawang bias ang mas mahalaga kaysa sa anumang solong numero. Selection bias: karamihan sa mga ito ay "wish coding" na gawain — browser game, 3D scene, SVG animation, physics toy, music tool. Matibay na ebidensya ito para sa rapid prototyping at front-end generation; mahinang ebidensya para sa production backend, security, large-repo maintenance, o anumang tatagal ng ilang buwan. Transparency bias: tatlo lang sa top 10 creator ang nagbahagi ng prompt o chat log. Ituring ang mga title ng video na nagsasabing "official version" bilang marketing — karaniwan, hinala lang din ng creator na naka-gray route sila. Ginagamit namin ang suspected V4 gray build sa buong artikulo.
Saan magaling ang V4 (base sa ebidensya)
Tumatakbo na talaga ang one-prompt app, hindi lang maganda tignan
Ang pinakamalakas na pattern ay malawakang implementation mula sa manipis na spec. Kasama sa set ang mga voxel world, shooter, rhythm game, survival game, three.js scene, music generator, at engineering visualization. Isang representative na GTA-style SVG demo ay descrito bilang isang main generation plus isang bug-fix round, na may nakalakip na shared na conversation. Hindi ito "isang pangungusap, isang na-deliver na laro." Ito ay "pipili ang model ng architecture, iwi-wire ang sapat na bahagi nito para ma-demo ang ideya, at hindi na nagbabalik ng empty na mockup."
Malakas ang 3D, SVG, at lightweight na simulation
Mga three.js scene, custom SVG asset, game physics, at interactive simulation ang paulit-ulit na lumalabas sa koleksyon. Isang air-liquid CFD-style page ay umano'y gumamit ng PBF para sa liquid at LBM para sa gas sa loob ng dalawang conversation. Itinuro rin ng creator ang hindi realistic na aerodynamics at pangangailangan ng karagdagang pag-aayos — ito mismo ang linya sa pagitan ng impressive na prototype at trustworthy na engineering tool.
Baka ang presyo ang tunay na headline
Paulit-ulit na inilalarawan ng komunidad na magkalapit ang V4 at Kimi K3 sa praktikal na proyekto. Kung mapapanatili ng final API ang karaniwang price advantage ng DeepSeek, mas mahalaga ang "near-frontier capability sa infrastructure pricing" kaysa sa pagpanalo sa anumang isang head-to-head demo. Tingnan ang aming paghahambing ng presyo ng AI API para sa kasalukuyang konteksto.
Saan nangangapa pa rin ang V4
- Polish at lasa. Mas madalas na prepin ang Kimi K3 para sa front-end composition at mahabang text. Maganda ang visuals ng V4, pero malaki ang nagbabagong kalidad depende sa prompt design.
- Hangganan ng instruction. Sa isang demo, hiningi sa model na magtanggal ng comment; ayusin din nito ang bug ng laro nang kusa. Magical ang ganitong initiative sa toy, pero panganib sa review sa totoong repo. Suriin ang bawat diff — huwag ituring na "tumatakbo" bilang "pumasa."
- Mahabang multi-turn reliability. Nag-cr-crash pa rin, nawawala ang direksyon, o nagtutubo ng architectural debt sa maraming round ang session. Hindi garantadong malakas pa rin sa ikadalawampu kung malakas sa una.
- Tama ang physics. Ang convincing na fluid o gravity simulation ay hindi nangangahulugang valid na CFD o mechanics. Tama visually ≠ tama numerically.
- Reproducibility. Mukhang inconsistent ang gray routing. Maaaring na-hit ng iba't ibang user ang iba't ibang model, tier, o sampling behavior.
- Kalidad ng ebidensya. Maraming video ang walang kumpletong prompt, model identifier, failure count, token use, o manual na edit.
Ang tapat na paglalarawan ay "high-ceiling prototype generator na may tunay na coding ability" — hindi "senior engineer na hindi na kailangan ng review."
V4 vs Kimi K3 vs GPT-5.6 vs Fable 5.0
Walang controlled four-model benchmark dito. Ang talahanayan sa ibaba ay isang workflow-oriented synthesis ng gray-test evidence at ng user report sa paligid nito — hindi leaderboard.
| Model | Malamang na advantage | Posisyon ng V4 | Pinakamagandang role |
|---|---|---|---|
| DeepSeek V4 | Cost, malawak na implementation, mabilis na prototype | Baseline | Default na pang-araw-araw na coding at unang implementation |
| Kimi K3 | Front-end polish, presentation, writing | Medyo mas less polished ang V4 pero kadalasang functionally comparable | UI pass, product copy, visual refinement |
| GPT-5.6 | Review consistency, tool ecosystem, cross-file reasoning | Maaaring mas murang substitute ang V4 para sa routine na gawain; hindi sapat ang ebidensya para sa pangkalahatang panalo | Code review, validation, mahihirap na bug |
| Fable 5.0 | Long-horizon implementation, multi-turn recovery | Magkalapit ang V4 sa piniling demo pero less reliable sa edge | Escalation model para sa pinakamahirap na natitirang gawain |
V4 vs Kimi K3: ang pinaka-credible na direktang material ay tumuturo sa isang malapit na laban. Maganda ang K3 sa front-end at writing; maaaring mas lamang ang value ng V4 at kompetitibo sa implementation. Umabot sa tens of thousands ng views ang isang comparison video, pero hindi standardized ang prompt at scoring.
V4 vs GPT-5.6: mga isolated na komento ang nag-claim ng panalo o talo sa partikular na web project. Test idea ito, hindi benchmark result. Ang kapaki-pakinabang na tanong ay kung kaya ng V4 na pumasa sa test suite ng repo mo sa mas mababang halaga.
V4 vs Fable 5.0: nagagawang temping ng impressive na game demo ang comparison, pero hindi itinatatag ng koleksyon ang parity sa malalaking codebase, security review, o mahahabang autonomous na run. Ituring ang Fable 5.0 bilang escalation option hanggang sabihin ng reproducible na test ng iba.
Praktikal na setup
Ang pinakamurang setup na hindi kakagat sa iyo mamaya:
- Pabayaan mong gawin ng V4 ang unang 80–90%. Planning, scaffolding, implementation, test, doc, ordinaryong pag-ayos ng bug.
- I-verify locally. Lint, type-check, unit at integration test, at human diff review. Hindi negotiable.
- Mag-escalate gamit ang ebidensya. Kapag natigil, ipadala ang diff, failing test, at makitid na tanong sa Kimi K3, GPT-5.6, o Fable 5.0 — huwag na huwag ipadala muli ang parehong vague na prompt.
- Manatili sa isang light premium plan, hindi ilang full subscription. Gamitin bilang reviewer at recovery model, hindi bilang default na token burner.
Gumagana lang ito kung may ebidensyang nakakarating sa pangalawang model — diff, log, failing test. Ang pagtatanong ng parehong vague na tanong sa dalawang model ay karaniwang nagdo-double ng halaga nang hindi pinapabuti ang reliability.
Ano dapat i-verify kapag inilabas na opisyal ang V4
Hatulan ang opisyal na release ayon sa reproducibility, hindi sa launch-day demo. Suriin:
- ang eksaktong API model ID, at kung ang web, app, at API ay gumagamit ng parehong tier;
- context window, output limit, tool calling, at suporta sa structured output;
- presyo kada input, cached input, at output token;
- rate limit, peak-hour routing, at kung iba ang behavior ng "Pro/Flash/Max" na tier;
- repository-scale na pag-edit, test completion, at instruction adherence;
- kung gaano kadalas mare-reproduce ng parehong prompt ang kalidad ng gray-test;
- lisensya, data retention, at deployment option.
I-a-update namin ang page na ito kapag naglathala ang DeepSeek ng opisyal na model card, API doc, at pricing. Hanggang sa panahong iyon, tentative pa rin ang anumang claim tungkol sa final na model.
Mga Madalas Itanong
Available na ba ang official version ngayon?
Kinokumento ng koleksyon ang suspected gray routing, hindi kumpirmadong release. Ang video na may title na "official version" ay hindi opisyal na kumpirmasyon mula sa DeepSeek.
Maganda ba talaga ang V4 sa coding?
Pinakamalakas ang ebidensya para sa rapid web prototype, laro, SVG, three.js, at iterative na pag-ayos ng bug; pinakamahina para sa malalaking production repo, security-sensitive na code, at mahahabang autonomous na gawain.
Mas malakas ba ang V4 kaysa Kimi K3?
Hindi sa lahat ng gawain. Magkalapit ang V4 at maaaring mas maganda ang value; kadalasang mas lamang ang Kimi K3 sa front-end polish at writing. Patakbuhin ang parehong prompt, runtime, at acceptance test bago pumili.
Dapat ba akong mag-cancel ng premium coding subscription ko?
Para sa maraming user, mas makatwiran ang pag-downgrade sa isang lightweight premium plan kaysa pag-cancel ng lahat. Hayaan mong dalhin ng V4 ang volume at panatilihin ang isang malayang model para sa review at escalation.
Saan ko makikita ang mga orihinal na gray test?
Magsimula sa GitHub index ng lahat ng 121 video. Mga representative na kaso: broad V4 + Kimi K3 test, 3D physics comparison, 8192-block Minecraft test, proactive bug-fix example.