संक्षिप्त उत्तर
DeepSeek ने अभी तक पुष्टि नहीं की है कि ये V4 हैं। हमारे पास जो है वह संदिग्ध ग्रे-टेस्ट आउटपुट की एक बड़ी, असामान्य रूप से संगत लहर है: 7 जुलाई से 19 जुलाई 2026 के बीच 53 निर्माताओं के 121 Bilibili वीडियो, साथ ही 40 साझा OpenCode संवाद और मुट्ठी भर डाउनलोडयोग्य प्रोजेक्ट। यह पैटर्न देखने के लिए पर्याप्त है — मॉडल ID प्रमाणित करने या नियंत्रित बेंचमार्क चलाने के लिए नहीं।
साक्ष्य को इस नज़रिए से पढ़ें तो तस्वीर साफ़ है: Kimi K3, GPT-5.6 और Fable 5.0 के सबसे मज़बूत इलाकों में V4 थोड़ा पीछे दिखता है, लेकिन इतना क़रीब है कि ज़्यादातर रोज़मर्रा की कोडिंग के लिए एक लागत-सचेत डेवलपर V4 को डिफ़ॉल्ट बना सकता है, और समीक्षा, ज़िद्दी बग्स और लंबे मल्टी-टर्न काम के आख़िरी 10% के लिए एक हल्की प्रीमियम सब्सक्रिप्शन रख सकता है।
पहले दौर के स्क्रीनशॉट और चैट लिंक के लिए हमारी DeepSeek V4 ग्रे-रिलीज़ साक्ष्य संग्रह देखें।
पूर्ण स्रोत कैटलॉग मुख्य साक्ष्य
इस लेख के हर दावे के पीछे का कच्चा साक्ष्य — ओपन रिपॉजिटरी YunhaoFu/dsv4ga-news-gather से मिरर किया गया। निर्माता, तारीख या कीवर्ड से ब्राउज़ करने के लिए विस्तार करें। शीर्षक सीधे Bilibili पर ले जाते हैं।
सभी 136 रिकॉर्ड विस्तार के लिए क्लिक करें
सुझाव: शीर्षक ही Bilibili लिंक है। हरा = साझा चैट सत्र, नारंगी = प्रोजेक्ट डाउनलोड। निर्माता पर होवर करें तो पूरा नाम दिखता है।
121 टेस्ट वास्तव में क्या दिखाते हैं
डेटा ओपन dsv4ga-news-gather रिपॉजिटरी से आता है, जो सार्वजनिक Bilibili पोस्ट इंडेक्स करता है और शीर्षक, निर्माता नाम, टाइमस्टैम्प, विवरण, टिप्पणियाँ, साझा संवाद और डाउनलोड लिंक सहेजता है। 19 जुलाई का स्नैपशॉट कुछ यूँ टूटता है:
प्रतिदिन पोस्ट
15 जुलाई तक सुस्त रिसाव, फिर रिलीज़ों की दीवार जो 18 जुलाई को चरम पर पहुँची।
टॉप 10 निर्माता
टॉप 10 में सिर्फ़ kdzzzds और Delight-linger ने पर्याप्त सत्र लॉग साझा किए। हरा = 5+ साझा सत्र, नारंगी = 1–4, नीला = कोई नहीं।
लोग वास्तव में क्या टेस्ट कर रहे थे
136 शीर्षकों से श्रेणीबद्ध। गेम्स हावी हैं — प्रोडक्शन बैकएंड, सुरक्षा और लंबी अवधि के काम लगभग नहीं दिखते।
दो पक्षपात किसी भी एक अंक से ज़्यादा मायने रखते हैं। चयन पक्षपात: इनमें से ज़्यादातर "इच्छा-कोडिंग" काम हैं — ब्राउज़र गेम्स, 3D दृश्य, SVG एनिमेशन, भौतिकी खिलौने, संगीत टूल। यह सेट तेज़ी से प्रोटोटाइप और फ्रंट-एंड जनरेशन के लिए मज़बूत सबूत है; प्रोडक्शन बैकएंड, सुरक्षा, बड़े रिपो रखरखाव, या ऐसी किसी भी चीज़ के लिए कमज़ोर सबूत है जिसमें महीने लगते हैं। पारदर्शिता पक्षपात: टॉप 10 में से सिर्फ़ 3 निर्माताओं ने अपने प्रॉम्प्ट या चैट लॉग साझा किए। "आधिकारिक संस्करण" वाले वीडियो शीर्षकों को मार्केटिंग समझें — निर्माता आमतौर पर सिर्फ़ ग्रे रूट का संदेह करता है। हम पूरे लेख में संदिग्ध V4 ग्रे बिल्ड का उपयोग करते हैं।
V4 वास्तव में किसमें अच्छा लगता है
एक-प्रॉम्प्ट ऐप अब वास्तव में चलते हैं, सिर्फ़ सुंदर दिखने के बजाय
सबसे मज़बूत पैटर्न एक पतले स्पेक से व्यापक कार्यान्वयन है। इस सेट में voxel दुनिया, शूटर, रिदम गेम्स, सर्वाइवल गेम्स, three.js दृश्य, संगीत जनरेटर और इंजीनियरिंग विज़ुअलाइज़ेशन शामिल हैं। एक प्रतिनिधि GTA-स्टाइल SVG डेमो को एक मुख्य जनरेशन और एक बग-फिक्स राउंड के रूप में बताया गया, साथ में साझा संवाद जुड़ा था। यह "एक वाक्य, एक शिप किया गेम" नहीं है। यह है — "मॉडल एक आर्किटेक्चर चुनता है, आइडिया डेमो करने के लिए काफ़ी सबसिस्टम जोड़ता है, और अब खाली मॉकअप वापस नहीं थमाता"।
मज़बूत 3D, SVG और हल्के सिमुलेशन
Three.js दृश्य, कस्टम SVG एसेट, गेम भौतिकी और इंटरैक्टिव सिमुलेशन संग्रह में बार-बार दोहराए गए। एक वायु-तरल CFD-स्टाइल पेज कथित तौर पर दो संवादों में तरल के लिए PBF और गैस के लिए LBM इस्तेमाल करता है। निर्माता ने खुद भी अवास्तविक एयरोडायनामिक्स और ज़्यादा मरम्मत की ज़रूरत को चिह्नित किया — ठीक वही रेखा जो एक प्रभावशाली प्रोटोटाइप और भरोसेमंद इंजीनियरिंग टूल के बीच होती है।
कीमत ही असली सुर्खी हो सकती है
सामुदायिक तुलनाएँ बार-बार V4 और Kimi K3 को व्यावहारिक प्रोजेक्ट पर क़रीब बताती हैं। अगर अंतिम API में DeepSeek का आम मूल्य लाभ बना रहता है, तो "बुनियादी ढांचे की कीमत पर फ्रंटियर-क़रीब क्षमता" किसी एक हेड-टू-हेड डेमो को जीतने से ज़्यादा मायने रखती है। मौजूदा संदर्भ के लिए हमारी AI API कीमत तुलना देखें।
V4 आज भी जहाँ संघर्ष करता है
- पॉलिश और स्वाद। फ्रंट-एंड रचना और लंबे लेखन के लिए Kimi K3 को अक्सर पसंद किया जाता है। V4 के विज़ुअल प्रभावशाली हो सकते हैं, लेकिन गुणवत्ता प्रॉम्प्ट डिज़ाइन के साथ तेज़ी से उतार-चढ़ाव करती है।
- निर्देश सीमाएँ। एक डेमो में मॉडल से कमेंट हटाने को कहा गया; उसने साथ ही एक गेम बग भी खुद ठीक कर दिया। यह सक्रियता एक खिलौने में जादुई लगती है, और असली रिपो में समीक्षा जोखिम है। हर diff की समीक्षा करें — "यह चलता है" को पर्याप्त न मानें।
- लंबी मल्टी-टर्न भरोसेमंदता। सत्र अब भी क्रैश होते हैं, दिशा खो देते हैं, या कई राउंड में आर्किटेक्चरल कर्ज़ जमा करते हैं। मज़बूत पहली पास, मज़बूत बीसवीं पास की गारंटी नहीं देती।
- भौतिकी की सटीकता। एक सम्मोहक तरल या गुरुत्व सिमुलेशन मान्य CFD या यांत्रिकी नहीं है। दृश्यमान सही ≠ संख्यात्मक सही।
- प्रजननक्षमता। ग्रे रूटिंग असंगत दिखती है। अलग उपयोगकर्ता शायद अलग मॉडल, टियर या सैंपलिंग व्यवहार में पड़े।
- साक्ष्य की गुणवत्ता। कई वीडियो पूरा प्रॉम्प्ट, मॉडल पहचानकर्ता, फ़ेलियर गिनती, टोकन उपयोग और मैन्युअल संपादन नहीं देते।
ईमानदार वर्णन है "वास्तविक कोडिंग क्षमता के साथ उच्च-सीलिंग वाला प्रोटोटाइप जनरेटर" — न कि "एक सीनियर इंजीनियर जिसे अब समीक्षा की ज़रूरत नहीं"।
V4 vs Kimi K3 vs GPT-5.6 vs Fable 5.0
यहाँ कोई नियंत्रित चार-मॉडल बेंचमार्क नहीं है। नीचे की तालिका ग्रे-टेस्ट साक्ष्य और उसके आसपास की उपयोगकर्ता रिपोर्टों का वर्कफ़्लो-उन्मुख संश्लेषण है — कोई लीडरबोर्ड नहीं।
| मॉडल | संभावित लाभ | V4 की स्थिति | सर्वोत्तम भूमिका |
|---|---|---|---|
| DeepSeek V4 | लागत, व्यापक कार्यान्वयन, तेज़ प्रोटोटाइप | बेसलाइन | रोज़मर्रा का डिफ़ॉल्ट कोडिंग और पहली रियलाइज़ेशन |
| Kimi K3 | फ्रंट-एंड पॉलिश, प्रस्तुति, लेखन | V4 थोड़ा कम पॉलिश वाला है लेकिन अक्सर कार्यात्मक रूप से बराबर | UI पास, उत्पाद कॉपी, दृश्य परिष्कार |
| GPT-5.6 | समीक्षा संगतता, टूल इकोसिस्टम, क्रॉस-फ़ाइल तर्क | नियमित काम के लिए V4 सस्ता विकल्प हो सकता है; समग्र जीत के लिए पर्याप्त सबूत नहीं | कोड समीक्षा, सत्यापन, ज़िद्दी बग्स |
| Fable 5.0 | लंबी अवधि कार्यान्वयन, मल्टी-टर्न रिकवरी | चुनिंदा डेमो में V4 क़रीब दिखता है लेकिन किनारे पर कम भरोसेमंद | सबसे कठिन बचे काम के लिए एस्केलेशन मॉडल |
V4 vs Kimi K3: सबसे विश्वसनीय प्रत्यक्ष सामग्री एक क़रीबी मुकाबले की ओर इशारा करती है। फ्रंट-एंड और लेखन पर K3 बेहतर दिखता है; V4 बेहतर मूल्य वाला हो सकता है और कार्यान्वयन पर प्रतिस्पर्धी। एक तुलना वीडियो के दसियों हज़ार व्यूज़ आए, लेकिन प्रॉम्प्ट और स्कोरिंग मानकीकृत नहीं थे।
V4 vs GPT-5.6: कुछ छिटपुट टिप्पणियाँ कुछ वेब प्रोजेक्ट पर जीत-हार का दावा करती हैं। ये टेस्ट आइडिया हैं, बेंचमार्क परिणाम नहीं। उपयोगी सवाल यह है: क्या V4 कम लागत पर आपके रिपो का टेस्ट सूट पास कर सकता है।
V4 vs Fable 5.0: प्रभावशाली गेम डेमो तुलना को लुभावना बनाते हैं, लेकिन यह संग्रह बड़े कोडबेस, सुरक्षा समीक्षा या लंबे स्वायत्त रन पर समानता साबित नहीं करता। प्रजननक्षम टेस्ट अलग कहने तक Fable 5.0 को एक एस्केलेशन विकल्प मानें।
एक व्यावहारिक सेटअप
सबसे सस्ता सेटअप जो बाद में भारी न पड़े:
- V4 को पहले 80–90% करने दें। योजना, स्कैफ़ोल्डिंग, कार्यान्वयन, टेस्ट, डॉक्स, सामान्य बग ठीक करना।
- स्थानीय रूप से सत्यापित करें। Lint, टाइप-चेक, यूनिट और इंटीग्रेशन टेस्ट, और एक मानव diff समीक्षा। बिना शर्त।
- सबूत के साथ एस्केलेट करें। अटकने पर diff, फेल होते टेस्ट और एक संकरा सवाल Kimi K3, GPT-5.6 या Fable 5.0 को भेजें — वही अस्पष्ट प्रॉम्प्ट फिर से नहीं।
- एक हल्की प्रीमियम योजना रखें, कई पूर्ण सब्सक्रिप्शन नहीं। इसे समीक्षक और रिकवरी मॉडल के रूप में इस्तेमाल करें, डिफ़ॉल्ट टोकन जलाने वाला नहीं।
यह तभी काम करता है जब दूसरे मॉडल को सबूत मिले — diff, लॉग, फेल होते टेस्ट। दो मॉडलों से एक ही अस्पष्ट सवाल पूछना आमतौर पर भरोसेमंदता बढ़ाए बिना लागत दोगुनी कर देता है।
आधिकारिक लॉन्च पर क्या सत्यापित करें
आधिकारिक रिलीज़ को लॉन्च-डे डेमो से नहीं, प्रजननक्षमता से आंकें। जाँचें:
- सटीक API मॉडल ID, और क्या web, app और API एक ही टियर इस्तेमाल करते हैं;
- संदर्भ विंडो, आउटपुट सीमा, टूल कॉलिंग और संरचित-आउटपुट समर्थन;
- इनपुट, कैश किए गए इनपुट और आउटपुट प्रति टोकन कीमत;
- रेट सीमाएँ, पीक-हावर रूटिंग, और क्या "Pro/Flash/Max" टियर अलग व्यवहार करते हैं;
- रिपोज़िटरी-स्केल संपादन, टेस्ट पूर्णता और निर्देश पालन;
- समान प्रॉम्प्ट कितनी बार ग्रे-टेस्ट गुणवत्ता को प्रजनित करते हैं;
- लाइसेंस, डेटा प्रतिधारण और डिप्लॉयमेंट विकल्प।
DeepSeek द्वारा आधिकारिक मॉडल कार्ड, API डॉक्स और मूल्य प्रकाशित करने पर हम इस पेज को अपडेट करेंगे। तब तक, अंतिम मॉडल के बारे में दावे अस्थायी रहेंगे।
अक्सर पूछे जाने वाले प्रश्न
क्या आधिकारिक संस्करण अब उपलब्ध है?
यह संग्रह संदिग्ध ग्रे रूटिंग का दस्तावेज़ है, पुष्टि की गई रिलीज़ का नहीं। "आधिकारिक संस्करण" शीर्षक वाला कोई भी वीडियो DeepSeek की आधिकारिक पुष्टि नहीं है।
V4 कोडिंग के लिए कितना अच्छा है?
सबूत तेज़ी से वेब प्रोटोटाइप, गेम्स, SVG, three.js और पुनरावृत्त बग ठीक करने के लिए सबसे मज़बूत हैं। बड़े प्रोडक्शन रिपो, सुरक्षा-संवेदनशील कोड और लंबे स्वायत्त काम के लिए सबसे पतले हैं।
क्या V4, Kimi K3 से बेहतर है?
हर काम पर नहीं। V4 क़रीब दिखता है और बेहतर मूल्य दे सकता है; Kimi K3 का फ्रंट-एंड पॉलिश और लेखन में अक्सर बढ़त रहती है। चुनने से पहले एक ही प्रॉम्प्ट, रनटाइम और स्वीकृति टेस्ट चलाएँ।
क्या मैं अपनी प्रीमियम कोडिंग सब्सक्रिप्शन रद्द कर दूँ?
कई उपयोगकर्ताओं के लिए सब कुछ रद्द करने से एक हल्की प्रीमियम योजना में डाउनग्रेड करना ज़्यादा समझदारी है। V4 को मात्रा संभालने दें और समीक्षा व एस्केलेशन के लिए एक स्वतंत्र मॉडल रखें।
मैं मूल ग्रे-टेस्ट कहाँ देख सकता हूँ?
सभी 121 वीडियो के GitHub इंडेक्स से शुरू करें। प्रतिनिधि मामले: V4 + Kimi K3 व्यापक टेस्ट, 3D भौतिकी तुलना, 8192-ब्लॉक Minecraft टेस्ट, सक्रिय बग-फिक्स उदाहरण।