Jawapan ringkas
DeepSeek belum mengesahkan secara terbuka bahawa ini adalah V4. Apa yang kita ada ialah satu gelombang besar dan luar biasa konsisten output ujian kelabu yang disyaki: 121 video Bilibili daripada 53 pencipta antara 7–19 Julai 2026, ditambah 40 perbualan OpenCode yang dikongsi dan segelintir projek boleh dimuat turun. Itu cukup untuk mengenal pasti corak — tetapi tidak cukup untuk mensahkan ID model atau menjalankan benchmark terkawal.
Dibaca berdasarkan premis itu, gambarannya jelas: V4 kelihatan sedikit di belakang Kimi K3, GPT-5.6 dan Fable 5.0 dalam bidang terkuat masing-masing, tetapi cukup dekat sehingga, bagi kebanyakan pengekodan harian, pembangun yang berjimat cemas boleh menjadikan V4 sebagai lalai dan menyimpan satu langganan premium ringan untuk semakan kod, pepijat rumit, dan 10% terakhir kerja pelbagai pusingan yang panjang.
Untuk galeri tangkap layar dan pautan sembang dari gelombang lebih awal, lihat himpunan bukti keluaran kelabu DeepSeek V4 kami.
Katalog sumber penuh Bukti utama
Bukti mentah di sebalik setiap dakwaan dalam artikel ini — dicerminkan daripada repositori terbuka YunhaoFu/dsv4ga-news-gather. Kembangkan untuk melayari mengikut pencipta, tarikh atau kata kunci. Tajuk memaut terus ke Bilibili.
Klik untuk kembangkan semua 136 rekod
Tip: tajuk ialah pautan ke Bilibili. hijau = sesi sembang dikongsi, oren = muat turun projek. Larik tetikus pada pencipta untuk melihat nama penuh.
Apa yang ditunjukkan oleh 121 ujian
Data datang daripada repositori terbuka dsv4ga-news-gather, yang mengindeks siaran Bilibili awam dan mengekalkan tajuk, nama pencipta, cap masa, penerangan, ulasan, perbualan yang dikongsi dan pautan muat turun. Tangkap layar 19 Julai dipecahkan seperti ini:
Siaran setiap hari
Bocoran perlahan sehingga 15 Julai, kemudian letupan siaran yang memuncak pada 18 Julai.
10 pencipta teratas
Hanya kdzzzds dan Delight-linger berkongsi log sesi yang banyak dalam sepuluh teratas. Hijau = 5+ sesi dikongsi, oren = 1–4, biru = tiada.
Apa yang sebenarnya diuji orang
Dikategorikan daripada 136 tajuk. Permainan mendominasi — bahagian belakang gred pengeluaran, keselamatan dan kerja jangka panjang hampir tidak muncul.
Dua bias lebih penting daripada mana-mana nombor tunggal. Bias pemilihan: kebanyakannya ialah tugas "pengekodan cita-cita" — permainan pelayar, adegan 3D, animasi SVG, mainan fizik, alat muzik. Set ini ialah bukti kuat untuk pemprototaipan pantas dan penjanaan bahagian hadapan; ia bukti lemah untuk bahagian belakang pengeluaran, keselamatan, penyelenggaraan repositori besar, atau apa-apa yang mengambil masa berbulan-bulan. Bias ketelusan: hanya 3 daripada 10 pencipta teratas berkongsi promp atau log sembang mereka. Anggap tajuk video yang tertulis "versi rasmi" sebagai pemasaran — pencipta biasanya hanya mengesyaki laluan kelabu. Kami menggunakan binaan kelabu V4 yang disyaki sepanjang artikel.
Apa yang V4 kelihatan mahir
Aplikasi satu-promp kini benar-benar berjalan, bukan sekadar cantik dilihat
Corak paling ketara ialah pelaksanaan luas daripada spesifikasi nipis. Set ini termasuk dunia voxel, penembak, permainan irama, permainan survival, adegan three.js, penjana muzik dan visualisasi kejuruteraan. Satu demo SVG bergaya GTA yang berwakilan digambarkan sebagai satu penjanaan utama ditambah satu pusingan pembaikan pepijat, dengan perbualan yang dikongsi dilampirkan. Itu bukan "satu ayat, satu permainan siap". Ia adalah "model memilih seni bina, menyambung cukup banyak daripadanya untuk mendemo idea, dan tidak lagi memulangkan mockup kosong".
3D, SVG dan simulasi ringan semakin kuat
Adegan three.js, aset SVG tersuai, fizik permainan dan simulasi interaktif berulang dalam koleksi. Satu halaman gaya CFD cecair-udara dilaporkan menggunakan PBF untuk cecair dan LBM untuk gas dalam dua perbualan. Pencipta juga menandakan aerodinamik yang tidak realistik dan keperluan untuk lebih pembaikan — persis garis antara prototaip mengagumkan dan alat kejuruteraan yang boleh dipercayai.
Harga mungkin tajuk utama yang sebenar
Perbandingan komuniti berulang kali menggambarkan V4 dan Kimi K3 sebagai hampir pada projek praktikal. Jika API akhir mengekalkan kelebihan harga lazim DeepSeek, "keupayaan hampir barisan hadapan pada harga infrastruktur" lebih penting daripada memenangi mana-mana demo bersemuka tunggal. Lihat perbandingan harga API AI kami untuk konteks semasa.
Di mana V4 masih bergelut
- Kemasan dan cita rasa. Kimi K3 selalunya lebih digemari untuk komposisi bahagian hadapan dan perkataan panjang. Visual V4 boleh mengagumkan, tetapi kualiti naik turun dengan ketara mengikut reka bentuk promp.
- Sempadan arahan. Satu demo meminta model memadam komen; ia juga membetulkan pepijat permainan sendiri. Inisiatif itu terasa ajaib dalam mainan, tetapi menjadi risiko semakan dalam repositori sebenar. Semak setiap diff — jangan terima "ia berjalan" sebagai memadai.
- Kebolehpercayaan pelbagai pusingan yang panjang. Sesi masih ranap, hilang haluan, atau mengumpul hutang seni bina selepas banyak pusingan. Pusingan pertama yang kuat tidak menjamin pusingan kedua puluh yang kuat.
- Ketepatan fizik. Simulasi cecair atau graviti yang meyakinkan bukan CFD atau mekanik yang sah. Betul visualnya ≠ betul berangkanya.
- Kebolehasilan semula. Penghalaan kelabu kelihatan tidak konsisten. Pengguna berbeza mungkin terkena model, tahap atau tingkah laku persampelan yang berbeza.
- Kualiti bukti. Ramai video tidak menyertakan promp penuh, pengenal model, bilangan kegagalan, penggunaan token dan suntingan manual.
Penerangan jujurnya ialah "penjana prototaip siling tinggi dengan keupayaan pengekodan sebenar" — bukan "jurutera kanan yang tidak lagi memerlukan semakan".
V4 vs Kimi K3 vs GPT-5.6 vs Fable 5.0
Tiada benchmark empat-model terkawal di sini. Jadual di bawah ialah sintesis berorientasikan aliran kerja daripada bukti ujian kelabu dan laporan pengguna sekitarnya — bukan papan kedudukan.
| Model | Kelebihan yang berkemungkinan | Kedudukan V4 | Peranan terbaik |
|---|---|---|---|
| DeepSeek V4 | Kos, pelaksanaan luas, prototaip pantas | Garis asas | Pengekodan harian lalai dan pelaksanaan pertama |
| Kimi K3 | Kemasan bahagian hadapan, pembentangan, penulisan | V4 kurang kemas tetapi selalunya setara dari segi fungsi | Laluan UI, salinan produk, perincian visual |
| GPT-5.6 | Konsistensi semakan, ekosistem alat, penaakan lintas-fail | V4 mungkin pengganti yang lebih murah bagi kerja rutin; bukti tidak mencukupi untuk kemenangan am | Semakan kod, pengesahan, pepijat degil |
| Fable 5.0 | Pelaksanaan jangka panjang, pemulihan pelbagai pusingan | V4 kelihatan hampir dalam demo terpilih tetapi kurang stabil di pinggir | Model peningkatan untuk baki kerja paling sukar |
V4 vs Kimi K3: bahan langsung yang paling boleh dipercayai menunjukkan persaingan yang rapat. K3 kelihatan lebih baik pada bahagian hadapan dan penulisan; V4 mungkin lebih berbaloi dan berdaya saing dari segi pelaksanaan. Satu video perbandingan mencapai puluhan ribu tontonan, tetapi promp dan pemarkahan tidak diseragamkan.
V4 vs GPT-5.6: ulasan terpencil mendakwa kemenangan dan kekalahan pada projek web tertentu. Ini idea ujian, bukan hasil benchmark. Soalan yang berguna ialah sama ada V4 boleh lulus suite ujian repositori anda pada kos lebih rendah.
V4 vs Fable 5.0: demo permainan yang mengagumkan membuat perbandingan menggoda, tetapi koleksi ini tidak menetapkan kesetaraan pada pangkalan kod besar, semakan keselamatan, atau jalanan autonomi yang panjang. Anggap Fable 5.0 sebagai pilihan peningkatan sehingga ujian boleh dhasilkan semula menyatakan sebaliknya.
Cadangan praktikal
Konfigurasi paling murah yang tidak akan menjerut anda kemudian:
- Biar V4 buat 80–90% pertama. Perancangan, perancak, pelaksanaan, ujian, dokumen, pembaikan pepijat biasa.
- Sahkan secara setempat. Lint, semakan jenis, ujian unit dan integrasi, serta semakan diff manusia. Tidak boleh dirunding.
- Peningkat dengan bukti. Bila tersepit, hantar diff, ujian gagal dan soalan sempit kepada Kimi K3, GPT-5.6 atau Fable 5.0 — bukan promp kabur yang sama lagi.
- Simpan satu pelan premium ringan, bukan beberapa langganan penuh. Gunakannya sebagai pengulas dan model pemulihan, bukan pembakar token lalai.
Konfigurasi ini hanya berkesan jika model kedua menerima bukti — diff, log, ujian gagal. Bertanya kepada dua model soalan kabur yang sama biasanya hanya menggandakan kos tanpa meningkatkan kebolehpercayaan.
Apa perlu disahkan ketika pelancaran rasmi
Nilai rilis rasmi berdasarkan kebolehasilan semula, bukan demo hari pelancaran. Semak:
- ID model API yang tepat, dan sama ada web, app serta API menggunakan tahap yang sama;
- tetingkap konteks, had output, panggilan alat dan sokongan output berstruktur;
- harga setiap token untuk input, input cache dan output;
- had kadar, penghalaan waktu puncak, dan sama ada tahap "Pro/Flash/Max" berkelakuan berbeza;
- penyuntingan skala repositori, pelengkapan ujian dan pematuhan arahan;
- seberapa kerap promp yang sama menghasilkan semula kualiti ujian kelabu;
- lesen, pengekalan data dan pilihan deployment.
Kami akan mengemas kini halaman ini apabila DeepSeek menerbitkan kad model rasmi, dokumentasi API dan harga. Buat masa ini, sebarang dakwaan tentang model akhir kekal sementara.
Soalan lazim
Adakah versi rasmi sudah tersedia?
Koleksi ini mendokumenkan penghalaan kelabu yang disyaki, bukan rilis yang disahkan. Video bertajuk "versi rasmi" bukan pengesahan rasmi daripada DeepSeek.
Sehebat mana V4 untuk pengekodan?
Bukti paling kuat untuk prototaip web pantas, permainan, SVG, three.js dan pembaikan pepijat berulang. Ia paling nipis untuk repositori pengeluaran besar, kod sensitif keselamatan dan kerja autonomi yang panjang.
Adakah V4 lebih bagus daripada Kimi K3?
Tidak dalam setiap tugas. V4 kelihatan hampir dan mungkin lebih berbaloi; Kimi K3 selalukan mendahului dalam kemasan bahagian hadapan dan penulisan. Jalankan promp, masa jalan dan ujian penerimaan yang sama sebelum memilih.
Patutkah saya membatalkan langganan pengekodan premium?
Bagi banyak pengguna, menurunkan kepada satu pelan premium ringan lebih masuk akal daripada membatalkan semua. Biar V4 urus volum dan simpan satu model bebas untuk semakan dan peningkatan.
Di mana saya boleh melihat ujian kelabu asal?
Mulakan dengan indeks GitHub bagi semua 121 video. Kes perwakilan: ujian luas V4 + Kimi K3, perbandingan fizik 3D, ujian Minecraft 8192 blok, contoh pembaikan pepijat proaktif.