Kısa cevap
DeepSeek bunların V4 olduğunu doğrulamadı. Elimizde, hacimli ama tutarlılık açısından şüpheli bir olası gri test çıktısı dalgası var: 7–19 Temmuz 2026 arasında 53 içerik üreticisinden 121 Bilibili videosu, ayrıca 40 paylaşılan OpenCode oturumu ve bir avuç indirilebilir proje. Bu, örüntü yakalamaya yeter — model kimliğini sertifikalandırmaya veya kontrollü bir benchmark yürütmeye yetmez.
Kanıtları bu çerçevede okursanız tablo net: V4, Kimi K3, GPT-5.6 ve Fable 5.0'ın en güçlü oldukları alanlarda onlardan biraz geride görünüyor; ama aradaki fark, çoğu günlük kodlama için maliyet bilinçli bir geliştiricinin V4'ü varsayılan yapıp kod incelemesi, inatçı hatalar ve uzun çok turlu işlerin son %10'u için hafif bir premium abonelik tutmasına yetecek kadar küçük.
Daha eski dalgadan ekran görüntüleri ve sohbet bağlantıları için DeepSeek V4 gri yayın kanıt derlememize bakın.
Tam kaynak kataloğu Temel kanıt
Bu makaledeki her iddianın arkasındaki ham kanıt — açık YunhaoFu/dsv4ga-news-gather deposundan aynalanmıştır. İçerik üretici, tarih veya anahtar kelimeye göre gezinmek için genişletin. Başlıklar doğrudan Bilibili'ye gider.
Tüm 136 kaydı genişletmek için tıklayın
İpucu: başlığın kendisi Bilibili bağlantısıdır. yeşil = paylaşılan sohbet oturumu, turuncu = proje indirmesi. İçerik üreticinin tam adını görmek için üzerine gelin.
121 test aslında ne gösteriyor
Veri, Bilibili gönderilerini dizinleyip başlıkları, içerik üretici adlarını, zaman damgalarını, açıklamaları, yorumları, paylaşılan oturumları ve indirme bağlantılarını koruyan açık dsv4ga-news-gather deposundan geliyor. 19 Temmuz anlık görüntüsü kabaca şöyle:
Günlük gönderim
15 Temmuz'a kadar yavaş bir damla, ardından 18 Temmuz'da zirve yapan bir yayın dalgası.
İlk 10 içerik üretici
Yalnızca kdzzzds ve Delight-linger önemli oturum günlüklerini paylaştı. Yeşil = 5+ paylaşılan oturum, turuncu = 1–4, mavi = yok.
İnsanlar aslında ne test etti
136 başlıktan sınıflandırıldı. Oyunlar baskın — üretim arka uçları, güvenlik ve uzun vadeli işler zar zor görünüyor.
İki önyargı tek bir sayıdan daha önemli. Seçim önyargısı: bunların çoğu "dilek kodlaması" görevleri — tarayıcı oyunları, 3D sahneler, SVG animasyon, fizik oyuncakları, müzik araçları. Bu küme hızlı prototipleme ve ön yüz üretimi için güçlü kanıt; üretim arka uçları, güvenlik, büyük depo bakımı veya aylar alan herhangi bir şey için zayıf kanıt. Şeffaflık önyargısı: ilk 10 içerik üreticiden yalnızca 3'ü komutlarını veya sohbet günlüklerini paylaştı. "Resmi sürüm" yazan video başlıklarını pazarlama olarak ele alın — içerik üretici genellikle yalnızca gri rotadan şüpheleniyor. Metin boyunca şüpheli V4 gri yapı diyoruz.
V4 aslında ne yapabiliyor gibi görünüyor
Tek komutluk uygulamalar artık sadece güzel görünmüyor, çalışıyor
En güçlü örüntü, ince bir spesifikasyondan geniş uygulama. Kümede voxel dünyalar, nişancılar, ritim oyunları, hayatta kalma oyunları, three.js sahneleri, müzik üreteçleri ve mühendislik görselleştirmeleri var. Temsilî bir GTA tarzı SVG demo, bir ana üretim artı bir hata düzeltme turu olarak tanımlandı ve ekli paylaşılan bir oturumu var. Bu, "tek cümle, tek teslim oyun" değil. "Model bir mimari seçiyor, fikri demoya yetecek kadar alt sistemi birbirine bağlıyor ve artık boş bir mockup geri vermiyor".
Güçlü 3D, SVG ve hafif simülasyon
Three.js sahneleri, özel SVG varlıkları, oyun fiziği ve etkileşimli simülasyonlar koleksiyon boyunca tekrar ediyor. Bir hava-sıvı CFD tarzı sayfanın iki oturumda sıvı için PBF, gaz için LBM kullandığı bildirildi. İçerik üretici ayrıca gerçekçi olmayan aerodinamik ve daha fazla onarım gerektiğini işaret etti — tam da etkileyici bir prototip ile güvenilir bir mühendislik aracı arasındaki çizgi.
Fiyat asıl başlık olabilir
Topluluk karşılaştırmaları V4 ve Kimi K3'ü pratik projelerde defalarca yakın olarak tanımlıyor. Son API DeepSeek'in alışılmış fiyat avantajını korursa, "altyapı fiyatıyla sınır-açın yeteneği" tek bir düello demoyu kazanmaktan daha önemli. Güncel bağlam için AI API fiyat karşılaştırmamıza bakın.
V4'ün hâlâ zorlandığı yerler
- Cila ve zevk. Kimi K3 ön yüz kompozisyonu ve uzun metinler için sıklıkla tercih ediliyor. V4'ün görselleri etkileyici olabilir, ama kalite komut tasarımıyla keskin salınımlar yapıyor.
- Komut sınırları. Bir demo modelden yorumları silmesini istedi; o ayrıca kendi başına bir oyun hatasını düzeltti. Bu inisiyatif bir oyuncakta büyülü hissettiriyor, gerçek bir depoda ise inceleme riski. Her diff'i inceleyin — "çalışıyor"u yeterli olarak kabul etmeyin.
- Uzun çok turlu güvenilirlik. Oturumlar hâlâ çöküyor, yönünü kaybediyor veya birçok tur boyunca mimari borç biriktiriyor. Güçlü bir ilk tur, yirmincinin de güçlü olacağını garanti etmiyor.
- Fizik doğruluğu. İnanı veren bir sıvı veya yerçekimi simülasyonu geçerli CFD veya mekanik değildir. Görsel olarak doğru ≠ sayısal olarak doğru.
- Tekrarlanabilirlik. Gri yönlendirme tutarsız görünüyor. Farklı kullanıcılar farklı modellere, katmanlara veya örnekleme davranışına denk gelmiş olabilir.
- Kanıt kalitesi. Birçok video tam komutu, model tanımlayıcısını, başarısızlık sayısını, token kullanımını ve elle yapılan düzenlemeleri atlıyor.
Dürüst tanım, "gerçek kodlama yeteneği olan yüksek tavanlı prototip üreteci" — "inceleme gerektirmeyen kıdemli bir mühendis" değil.
V4 vs Kimi K3 vs GPT-5.6 vs Fable 5.0
Burada kontrollü bir dört model benchmarkı yok. Aşağıdaki tablo, gri test kanıtının ve çevresindeki kullanıcı raporlarının iş akışı odaklı bir sentezidir — bir liderlik tablosu değil.
| Model | Olası avantaj | V4'ün konumu | En iyi rol |
|---|---|---|---|
| DeepSeek V4 | Maliyet, geniş uygulama, hızlı prototipler | Taban çizgisi | Varsayılan günlük kodlama ve ilk uygulama |
| Kimi K3 | Ön yüz cilası, sunum, yazım | V4 biraz daha az cilalı ama çoğu zaman işlevsel olarak karşılaştırılabilir | UI turu, ürün metni, görsel iyileştirme |
| GPT-5.6 | İnceleme tutarlılığı, araç ekosistemi, dosyalar arası akıl yürütme | Rutin işlerde V4 daha ucuz bir alternatif olabilir; genel bir zafer için yeterli kanıt yok | Kod incelemesi, doğrulama, inatçı hatalar |
| Fable 5.0 | Uzun vadeli uygulama, çok turlu kurtarım | Seçili demolarda V4 yakın görünüyor ama kenarda daha az güvenilir | Geriye kalan en zor işler için yükseltme modeli |
V4 vs Kimi K3: En güvenilir doğrudan materyal yakın bir yarışa işaret ediyor. Ön yüz ve yazımda K3 daha iyi görünüyor; V4 daha iyi değer olabilir ve uygulamada rekabetçi. Bir karşılaştırma videosu on binlerce izlemeye ulaştı, ama komutlar ve puanlama standardize edilmedi.
V4 vs GPT-5.6: Bazı web projelerinde kazanç ve kayıplar olduğunu iddia eden izole yorumlar var. Bunlar benchmark sonuçları değil, test fikirleri. Faydalı soru, V4'ün deponuzun test suitini daha düşük maliyetle geçip geçemeyeceğidir.
V4 vs Fable 5.0: Etkileyici oyun demoları karşılaştırmayı cazip kılıyor, ama bu küme büyük kod tabanlarında, güvenlik incelemesinde veya uzun otonom koşularda eşitliği kanıtlamıyor. Tekrarlanabilir testler aksini söyleyene kadar Fable 5.0'ı bir yükseltme seçeneği olarak ele alın.
Pratik bir kurulum
Sizi sonradan ısırmayacak en ucuz kurulum:
- V4 ilk %80–90'ı yapsın. Planlama, iskelet, uygulama, testler, belgeler, sıradan hata düzeltme.
- Yerel olarak doğrulayın. Lint, tip kontrolü, birim ve entegrasyon testleri ve insan diff incelemesi. Pazarlık edilemez.
- Kanıtla yükseltin. Takıldığınızda diff'i, başarısız testleri ve dar bir soruyu Kimi K3, GPT-5.6 veya Fable 5.0'a gönderin — aynı belirsiz komutu tekrar değil.
- Birkaç tam abonelik değil, tek bir hafif premium plan tutun. Onu varsayılan token yakıcı olarak değil, bir inceleyici ve kurtarma modeli olarak kullanın.
Bu yalnızca ikinci model kanıt alırsa işe yarar — diff'ler, günlükler, başarısız testler. İki modele aynı belirsiz soruyu sormak genellikle güvenilirliği artırmadan maliyeti ikiye katlar.
V4 resmi olarak çıkınca neyi doğrulamalı
Resmi sürümü lansman günü demolarına değil, tekrarlanabilirliğe göre yargılayın. Şunları kontrol edin:
- tam API model kimliği ve web, uygulama ile API'nın aynı katmanı kullanıp kullanmadığı;
- bağlam penceresi, çıktı sınırı, araç çağırma ve yapılandırılmış çıktı desteği;
- girdi, önbelleğe alınmış girdi ve çıktı token başına fiyat;
- hız limitleri, yoğun saat yönlendirmesi ve "Pro/Flash/Max" katmanlarının farklı davranıp davranmadığı;
- depo ölçeğinde düzenleme, test tamamlama ve komut bağlılığı;
- aynı komutların gri test kalitesini ne sıklıkla tekrarladığı;
- lisans, veri saklama ve dağıtım seçenekleri.
DeepSeek resmi model kartlarını, API belgelerini ve fiyatlandırmayı yayımladığında bu sayfayı güncelleyeceğiz. O zamana kadar, son model hakkındaki iddialar geçici kalır.
SSS
Resmi sürüm zaten erişilebilir mi?
Koleksiyon teyit edilmiş bir yayını değil, şüpheli gri yönlendirmeyi belgeliyor. "Resmi sürüm" başlıklı bir video DeepSeek'ten resmi teyit değildir.
V4 kodlama için ne kadar iyi?
Kanıt hızlı web prototipleri, oyunlar, SVG, three.js ve yinelemeli hata düzeltme için en güçlü. Büyük üretim depoları, güvenlik açısından kritik kod ve uzun otonom işler için en zayıf.
V4, Kimi K3'ten daha mı iyi?
Her görevde değil. V4 yakın görünüyor ve daha iyi değer sunabilir; Kimi K3 çoğu zaman ön yüz cilası ve yazımda öne çıkıyor. Seçmeden önce aynı komutu, çalışma zamanını ve kabul testlerini çalıştırın.
Premium kodlama aboneliğimi iptal etmeli miyim?
Çoğu kullanıcı için her şeyi iptal etmek yerine tek bir hafif premium plana düşmek daha mantıklı. Hacmi V4 işlesin; inceleme ve yükseltme için bağımsız bir model tutun.
Orijinal gri testleri nerede inceleyebilirim?
Tüm 121 videonun GitHub diziniyle başlayın. Temsilî vakalar: geniş V4 + Kimi K3 testi, 3D fizik karşılaştırması, 8192 bloklu Minecraft testi, proaktif hata düzeltme örneği.