Ikhtisar singkat
DeepSeek belum mengonfirmasi bahwa ini adalah V4. Yang kita punya adalah gelombang keluaran dugaan uji abu-abu yang jumlahnya besar dan tidak biasanya konsisten: 121 video Bilibili dari 53 kreator antara 7–19 Juli 2026, ditambah 40 sesi OpenCode yang dibagikan dan segelintir proyek yang dapat diunduh. Cukup untuk melihat pola — tapi belum cukup untuk menyertifikasi ID model atau menjalankan benchmark terkontrol.
Dengan premis itu, gambarnya jelas: pada area terkuat masing-masing, V4 sedikit tertinggal dari Kimi K3, GPT-5.6, dan Fable 5.0, tetapi celahnya sudah cukup kecil sehingga — untuk sebagian besar pekerjaan coding harian — developer yang mengutamakan biaya bisa menjadikan V4 sebagai default dan menyimpan satu langganan premium ringan untuk code review, bug bandel, dan 10% terakhir dari pekerjaan multi-putaran yang panjang.
Untuk galeri tangkapan layar dan tautan chat dari gelombang sebelumnya, lihat kumpulan bukti gray-release DeepSeek V4 kami.
Katalog sumber lengkap Bukti kunci
Bukti mentah di balik setiap klaim di artikel ini — dimirror dari repositori terbuka YunhaoFu/dsv4ga-news-gather. Buka untuk menelusuri berdasarkan kreator, tanggal, atau kata kunci. Judul langsung menuju Bilibili.
Klik untuk membuka semua 136 catatan
Tips: judul adalah tautan ke Bilibili. hijau = sesi chat yang dibagikan, oranye = unduhan proyek. Arahkan kursor ke kreator untuk melihat nama lengkap.
Apa yang sebenarnya ditunjukkan oleh 121 uji
Data berasal dari repositori terbuka dsv4ga-news-gather, yang mengindeks kiriman Bilibili publik dan mempertahankan judul, nama kreator, stempel waktu, deskripsi, komentar, percakapan yang dibagikan, dan tautan unduhan. Snapshot 19 Juli terbagi seperti ini:
Kiriman per hari
Bola-bola kecil sampai 15 Juli, lalu dinding rilis yang memuncak pada 18 Juli.
10 kreator teratas
Hanya kdzzzds dan Delight-linger yang membagikan log sesi dalam jumlah besar. Hijau = 5+ sesi dibagikan, oranye = 1–4, biru = tidak ada.
Apa yang sebenarnya diuji orang
Dikategorikan dari 136 judul. Game mendominasi — backend produksi, keamanan, dan pekerjaan jangka panjang nyaris tidak muncul.
Dua bias lebih penting daripada angka tunggal apa pun. Bias seleksi: sebagian besar adalah tugas "coding angan-angan" — game browser, adegan 3D, animasi SVG, mainan fisika, alat musik. Kumpulan ini adalah bukti kuat untuk pembuatan prototipe cepat dan generasi front-end; tetapi bukti lemah untuk backend produksi, keamanan, pemeliharaan repositori besar, atau apa pun yang membutuhkan waktu berbulan-bulan. Bias transparansi: hanya 3 dari 10 kreator teratas yang membagikan prompt atau log chat mereka. Anggap judul video yang mengatakan "versi resmi" sebagai pemasaran — biasanya kreatornya sendiri hanya menduga mendapat rute abu-abu. Kami menggunakan dugaan build abu-abu V4 di seluruh artikel.
Apa yang tampaknya dikuasai V4
Aplikasi satu prompt sekarang benar-benar berjalan, bukan sekadar cantik
Pola terkuat adalah implementasi luas dari spesifikasi tipis. Kumpulannya mencakup dunia voxel, game tembak, game ritme, game survival, adegan three.js, generator musik, dan visualisasi teknik. Sebuah demo SVG bergaya GTA yang representatif digambarkan sebagai satu generasi utama plus satu putaran perbaikan bug, dengan percakapan yang dibagikan disertakan. Itu bukan "satu kalimat, satu game yang dirilis". Melainkan "model memilih arsitektur, menghubungkan cukup banyak bagiannya untuk mendemokan ide, dan tidak lagi menyerahkan mockup kosong".
3D, SVG, dan simulasi ringan yang kuat
Adegan three.js, aset SVG kustom, fisika game, dan simulasi interaktif berulang di seluruh koleksi. Sebuah halaman bergaya CFD cairan-udara dilaporkan menggunakan PBF untuk cairan dan LBM untuk gas dalam dua percakapan. Kreatornya juga menandai aerodinamika yang tidak realistis dan kebutuhan akan perbaikan lebih lanjut — persis garis pemisah antara prototipe mengesankan dan alat teknik yang tepercaya.
Harga mungkin menjadi berita utama yang sebenarnya
Perbandingan komunitas berulang kali menggambarkan V4 dan Kimi K3 sebagai berdekatan pada proyek praktis. Jika API final mempertahankan keunggulan harga biasa DeepSeek, "kemampuan hampir frontier dengan harga infrastruktur" lebih penting daripada memenangkan demo head-to-head tunggal mana pun. Lihat perbandingan harga API AI kami untuk konteks terkini.
Di mana V4 masih kesulitan
- Kehalusan dan selera. Kimi K3 sering lebih disukai untuk komposisi front-end dan kata-kata panjang. Visual V4 bisa mengesankan, tetapi kualitasnya naik turun drastis tergantung desain prompt.
- Batas instruksi. Satu demo meminta model menghapus komentar; ia juga memperbaiki bug game sendiri. Inisiatif itu terasa magis di mainan, dan menjadi risiko review di repositori nyata. Tinjau setiap diff — jangan terima "ini berjalan" sebagai cukup.
- Keandalan multi-putaran panjang. Sesi masih crash, kehilangan arah, atau mengakumulasi utang arsitektural selama banyak putaran. Putaran pertama yang kuat tidak menjamin putaran keduapuluh yang kuat.
- Keabsahan fisika. Simulasi cairan atau gravitasi yang meyakinkan bukan CFD atau mekanika yang valid. Benar secara visual ≠ benar secara numerik.
- Reproduktibilitas. Perutean abu-abu tampaknya tidak konsisten. Pengguna berbeda mungkin mendapatkan model, tier, atau perilaku pengambilan sampel yang berbeda.
- Kualitas bukti. Banyak video menghilangkan prompt lengkap, identifier model, jumlah kegagalan, penggunaan token, dan suntingan manual.
Deskripsi yang jujur adalah "generator prototipe berplafon tinggi dengan kemampuan coding nyata" — bukan "insinyur senior yang tidak lagi butuh review".
V4 vs Kimi K3 vs GPT-5.6 vs Fable 5.0
Tidak ada benchmark empat model yang terkontrol di sini. Tabel di bawah adalah sintesis berorientasi alur kerja dari bukti uji abu-abu dan laporan pengguna di sekitarnya — bukan papan peringkat.
| Model | Keunggulan yang mungkin | Posisi V4 | Peran terbaik |
|---|---|---|---|
| DeepSeek V4 | Biaya, implementasi luas, prototipe cepat | Baseline | Coding harian default dan implementasi pertama |
| Kimi K3 | Kehalusan front-end, presentasi, tulisan | V4 sedikit kurang halus tetapi sering setara secara fungsional | Pass UI, salinan produk, penyempurnaan visual |
| GPT-5.6 | Konsistensi review, ekosistem alat, penalaran lintas file | V4 mungkin pengganti yang lebih murah untuk pekerjaan rutin; belum cukup bukti untuk kemenangan menyeluruh | Code review, validasi, bug bandel |
| Fable 5.0 | Implementasi jangka panjang, pemulihan multi-putaran | V4 terlihat berdekatan dalam demo terpilih tetapi kurang andal di tepi | Model eskalasi untuk pekerjaan tersulit yang tersisa |
V4 vs Kimi K3: materi langsung paling krusial menunjuk pada kontes yang berimbang. K3 terlihat lebih baik di front-end dan tulisan; V4 mungkin lebih kuat dari sisi nilai dan kompetitif dalam implementasi. Satu video perbandingan mencapai puluhan ribu tayangan, tetapi prompt dan penilaian tidak distandarkan.
V4 vs GPT-5.6: komentar terpisah mengklaim menang dan kalah pada proyek web tertentu. Ini adalah ide uji, bukan hasil benchmark. Pertanyaan yang berguna adalah apakah V4 dapat lolos suite pengujian repo Anda dengan biaya lebih rendah.
V4 vs Fable 5.0: demo game yang mengesankan membuat perbandingan menggoda, tetapi koleksi ini tidak menetapkan kesetaraan pada basis kode besar, review keamanan, atau eksekusi otonom yang panjang. Anggap Fable 5.0 sebagai opsi eskalasi sampai pengujian yang reproduktibel mengatakan sebaliknya.
Pengaturan praktis
Pengaturan termurah yang tidak akan menggigit Anda nanti:
- Biarkan V4 mengerjakan 80–90% pertama. Perencanaan, scaffolding, implementasi, pengujian, dokumentasi, perbaikan bug biasa.
- Verifikasi secara lokal. Lint, type-check, pengujian unit dan integrasi, serta review diff oleh manusia. Tidak bisa ditawar.
- Eskalasi dengan bukti. Saat macet, kirim diff, pengujian yang gagal, dan pertanyaan sempit ke Kimi K3, GPT-5.6, atau Fable 5.0 — bukan prompt vague yang sama lagi.
- Simpan satu paket premium ringan, bukan beberapa langganan penuh. Gunakan sebagai reviewer dan model pemulihan, bukan pembakar token default.
Ini hanya berhasil jika model kedua mendapat bukti — diff, log, pengujian yang gagal. Menanyakan pertanyaan vague yang sama ke dua model biasanya hanya menggandakan biaya tanpa meningkatkan keandalan.
Apa yang harus diverifikasi saat V4 resmi diluncurkan
Nilai rilis resmi berdasarkan reproduktibilitas, bukan demo hari peluncuran. Periksa:
- ID model API yang tepat, dan apakah web, app, serta API menggunakan tier yang sama;
- context window, batas output, tool calling, dan dukungan structured output;
- harga per token input, input ter-cache, dan output;
- rate limit, perutean jam sibuk, dan apakah tier "Pro/Flash/Max" berperilaku berbeda;
- pengeditan skala repositori, penyelesaian pengujian, dan kepatuhan instruksi;
- seberapa sering prompt identik mereproduksi kualitas uji abu-abu;
- lisensi, retensi data, dan opsi deployment.
Kami akan memperbarui halaman ini ketika DeepSeek menerbitkan kartu model resmi, dokumentasi API, dan harga. Sampai saat itu, klaim tentang model final tetap sementara.
FAQ
Apakah versi resmi sudah tersedia?
Koleksi ini mendokumentasikan dugaan perutean abu-abu, bukan rilis yang dikonfirmasi. Video berjudul "versi resmi" bukan konfirmasi resmi dari DeepSeek.
Seberapa bagus V4 untuk coding?
Bukti paling kuat untuk prototipe web cepat, game, SVG, three.js, dan perbaikan bug iteratif. Paling tipis untuk repo produksi besar, kode sensitif keamanan, dan pekerjaan otonom yang panjang.
Apakah V4 lebih baik dari Kimi K3?
Tidak di setiap tugas. V4 tampak berdekatan dan mungkin menawarkan nilai lebih baik; Kimi K3 sering unggul dalam kehalusan front-end dan tulisan. Jalankan prompt, runtime, dan pengujian penerimaan yang sama sebelum memilih.
Haruskah saya membatalkan langganan coding premium saya?
Untuk banyak pengguna, menurunkan ke satu paket premium ringan lebih masuk akal daripada membatalkan semuanya. Biarkan V4 menangani volume dan simpan satu model independen untuk review dan eskalasi.
Di mana saya bisa memeriksa uji abu-abu asli?
Mulai dari indeks GitHub dari semua 121 video. Kasus representatif: uji V4 + Kimi K3 yang luas, perbandingan fisika 3D, uji Minecraft 8192 blok, contoh perbaikan bug proaktif.