결론 요약
DeepSeek가 이것이 V4라고 공식 확인한 적은 없다. 우리가 손에 넣을 수 있는 건 양은 많지만 일관성은 검증되지 않은 의심되는 그레이 테스트 산출물이다. 2026년 7월 7~19일 사이 53명의 크리에이터가 올린 Bilibili 영상 121개, OpenCode 공유 세션 40개, 그리고 소수의 다운로드 가능한 프로젝트. 패턴을 읽기엔 충분하지만, 모델 ID를 확정하거나 통제된 벤치마크를 돌리기엔 부족하다.
이 전제로 읽으면 그림은 명확하다. Kimi K3, GPT-5.6, Fable 5.0이 각자 가장 강한 영역에서는 V4가 한 수 아래지만, 그 격차는 이미 —— 대부분의 일상적 코딩에서는 —— 비용에 민감한 개발자가 V4를 기본값으로 두고, 코드 리뷰와 까다로운 버그, 다중 턴 긴 작업의 마지막 10%를 위해 가벼운 프리미엄 구독 하나만 남겨두어도 될 만큼 좁아졌다.
더 일찍 흘러나온 스크린샷과 대화 링크가 궁금하다면 우리의 DeepSeek V4 그레이 출시 증거 모음을 보라.
전체 출처 목록 핵심 증거
본문 모든 결론의 원본 증거 —— 오픈 레포지토리 YunhaoFu/dsv4ga-news-gather에서 미러링. 펼치면 크리에이터·날짜·키워드로 검색할 수 있다. 제목을 클릭하면 Bilibili로 바로 이동한다.
클릭하여 전체 136건 펼치기
팁: 제목이 곧 Bilibili 링크다. 녹색 = 공유 세션, 주황 = 프로젝트 다운로드. 크리에이터 위에 마우스를 올리면 전체 이름이 보인다.
121개 테스트가 말해주는 것
데이터는 오픈소스 프로젝트 dsv4ga-news-gather에서 왔다. 이 프로젝트는 Bilibili 공개 영상을 인덱싱해 제목, 크리에이터, 타임스탬프, 소개, 댓글, 공유 세션, 다운로드 링크를 보존한다. 7월 19일 기준 스냅샷은 대략 이렇다.
일일 게시량
7월 15일 이전엔 드문드문 흘러나오다가 이후 폭발했고, 7월 18일에 정점을 찍었다.
크리에이터 Top 10
상위 10명 중 대량으로 세션을 공개한 건 kdzzzds와 Delight-linger뿐이다. 녹색 = 공유 세션 5개 이상, 주황 = 1~4개, 파랑 = 없음.
실제로 무엇을 테스트하고 있나
제목 기준으로 분류한 136건. 게임이 압도적 —— 프로덕션급 백엔드, 보안, 장기 프로젝트는 거의 등장하지 않는다.
어떤 단일 숫자보다 중요한 편향이 두 개 있다. 선택 편향: 대부분이 "위시리스트식 프로그래밍" —— 브라우저 게임, 3D 씬, SVG 애니메이션, 물리 장난감, 음악 툴. 그래서 이 데이터는 빠른 프로토타이핑과 프론트엔드 생성에 관해서는 강력한 증거지만, 프로덕션급 백엔드, 보안, 대형 레포 유지보수, 몇 달이 걸리는 프로젝트에 관해서는 거의 설득력이 없다. 투명성 편향: 상위 10명 크리에이터 중 프롬프트나 세션 로그를 공개한 건 3명뿐. 영상 제목에 "정식 버전"이라 적은 건 대부분 조회수용 —— UP 주 역시 보통 그레이 테스트가 걸린 것으로 추정될 뿐이다. 본문 전체에서 의심되는 V4 그레이 버전으로 표기한다.
V4가 잘하는 것으로 보이는 부분
한 줄 앱이 이제 보여주기만 하는 게 아니라 진짜 돌아간다
가장 두드러진 패턴은 짧은 스펙에서 완전한 구현이 나온다는 것이다. 묶음 안엔 voxel 세계, 슈팅, 리듬게임, 생존, three.js 씬, 음악 생성기, 엔지니어링 시각화가 있다. 대표적인 GTA풍 SVG 데모는 설명에 따르면 메인 생성 1회 + 버그 수정 1회로 만들어졌고 공유 세션이 첨부돼 있다. 이건 "한 문장에 게임 하나가 인계된다"가 아니라, "모델이 스스로 아키텍처를 고르고 아이디어를 데모할 만큼의 서브시스템을 엮어내며, 더는 빈 껍데기 목업으로 후퇴하지 않는다"는 뜻이다.
3D·SVG·가벼운 시뮬레이션 코드가 강해졌다
three.js 씬, 커스텀 SVG 에셋, 게임 물리, 인터랙티브 시뮬레이션이 반복해 등장한다. 하나는 PBF로 액체를, LBM으로 기체를 처리한다는 기액 CFD풍 웹페이지로, 두 번의 대화로 만들어졌다. 크리에이터 본인도 공기역학이 사실적이지 않고 계속 다듬어야 한다고 지적한다 —— 이게 "놀라운 프로토타입"과 "신뢰할 수 있는 엔지니어링 툴"의 경계다.
가격이 어쩌면 진짜 헤드라인이다
커뮤니티 비교는 반복해서 V4와 Kimi K3를 실제 프로젝트에서 거의 비슷하다고 묘사한다. 최종 API가 DeepSeek 특유의 가격 우위를 유지한다면, "인프라 가격에 프론티어에 가까운 능력을 제공"하는 게 어떤 일대일 데모에서 이기는 것보다 중요하다. 우리의 AI API 가격 비교를 참고하라.
V4가 여전히 허덕이는 부분
- 취향과 다듬기. 프론트엔드 조합과 긴 텍스트에서는 커뮤니티가 종종 Kimi K3를 더 선호한다. V4의 시각은 멋질 수 있지만 품질은 프롬프트 설계에 따라 크게 흔들린다.
- 명령의 경계. 한 데모에선 모델에게 주석을 지우라고 했더니 게임 버그까지 슬쩍 고쳤다. 이런 자율성은 장난감에선 마법이지만 실제 레포에선 리뷰 리스크다. 모든 diff를 봐라 —— "돌아간다"를 "통과했다"로 착각하지 말 것.
- 긴 다중 턴의 신뢰성. 세션은 여전히 크래시되고, 빗나가고, 턴이 거듭될수록 아키텍처 부채가 쌓인다. 첫 번째가 강하다고 스무 번째도 강하다는 보장은 없다.
- 물리 정확도. 그럴듯해 보이는 유체나 중력 시뮬레이션이 유효한 CFD나 역학을 의미하진 않는다. 시각적 정답 ≠ 수치적 정답.
- 재현성. 그레이 라우팅은 불안정해 보인다. 사용자마다 다른 모델, 다른 등급, 다른 샘플링 동작에 걸렸을 수 있다.
- 증거 품질. 많은 영상이 전체 프롬프트, 모델 식별자, 실패 횟수, 토큰 사용량, 수동 편집 내역을 제공하지 않는다.
정직한 묘사는 "상한이 높은 프로토타입 생성기이자 실제 프로그래밍 능력을 갖췄다" —— "리뷰가 더는 필요 없는 시니어 엔지니어"가 아니다.
V4 vs Kimi K3 vs GPT-5.6 vs Fable 5.0
여기엔 통제된 4모델 벤치마크가 없다. 아래 표는 그레이 증거와 사용자 피드백을 바탕으로 정리한 워크플로우 중심 종합 —— 순위표가 아니다.
| 모델 | 잠재적 강점 | V4의 위치 | 최적 역할 |
|---|---|---|---|
| DeepSeek V4 | 비용, 폭넓은 구현, 빠른 프로토타입 | 기준선 | 일상적 기본 코딩과 첫 구현 |
| Kimi K3 | 프론트엔드 다듬기, 표현, 글 | V4가 다듬기에선 약간 뒤지만 기능적으론 종종 동급 | UI 최적화, 제품 카피, 시각 세분화 |
| GPT-5.6 | 리뷰 일관성, 툴 생태계, 크로스 파일 추론 | 루틴 작업에선 V4가 더 저렴한 대안; 전반적 우위 증거는 부족 | 코드 리뷰, 검증, 고질적 버그 |
| Fable 5.0 | 장기 구현, 다중 턴 복구 | 고른 데모에선 V4가 가까워 보이지만 엣지 케이스 안정성은 더 약 | 가장 어려운 부분의 업그레이드 모델 |
V4 vs Kimi K3: 가장 신뢰할 만한 직접 자료는 막상막하의 대결을 가리킨다. 프론트엔드와 글에서는 K3가 더 나아 보이고; V4는 가성비가 더 좋고 구현에서 경쟁력 있다. 한 비교 영상은 수만 재생을 기록했지만 프롬프트와 평가 기준은 표준화되지 않았다.
V4 vs GPT-5.6: 드문드문 어떤 웹 프로젝트에서는 서로 우위가 엇갈린다는 댓글이 있다. 이건 테스트 영감이지 벤치마크 결과가 아니다. 진짜 유용한 질문은: V4가 더 낮은 비용으로 당신 레포의 테스트 스위트를 통과시킬 수 있느냐다.
V4 vs Fable 5.0: 놀라운 게임 데모가 비교를 유혹하지만, 이 데이터는 V4가 대형 코드베이스, 보안 리뷰, 장시간 자동 실행에서 동급이라는 걸 증명하기엔 부족하다. 재현 가능한 테스트가 다른 결론을 내놓기 전까지는 Fable 5.0을 업그레이드 옵션으로 두어라.
실전 권장 구성
가장 저렴하고 역효과가 나지 않는 구성:
- V4에게 앞의 80~90%를 맡겨라. 계획, 스캐폴드, 구현, 테스트, 문서, 루틴 버그 수정.
- 로컬 검증. 린트, 타입 검사, 단위/통합 테스트, 그리고 수동 diff 리뷰. 타협 불가.
- 증거를 챙겨 업그레이드하라. 막혔을 때 diff, 실패한 테스트, 구체적 질문을 Kimi K3, GPT-5.6, Fable 5.0에 보내라 —— 같은 모호한 프롬프트를 또 보내지 말 것.
- 풀구독 여러 개가 아니라 가벼운 프리미엄 구독 하나. 이걸 리뷰어와 구조 모델로 써라, 기본 토큰 소비자가 아니라.
이 구성은 두 번째 모델이 증거(diff, 로그, 실패한 테스트)를 받을 때만 작동한다. 같은 모호한 질문을 두 모델에 던지는 건 보통 비용만 두 배로 만들 뿐 신뢰성은 올리지 않는다.
정식 출시 때 검증할 것
정식 버전은 발표회 데모가 아니라 재현 가능성으로 평가해야 한다. 확인할 것:
- 정확한 API 모델 ID, 그리고 웹·앱·API가 같은 등급을 쓰는지;
- 컨텍스트 윈도우, 출력 상한, 툴 호출 및 구조화 출력 지원;
- 입력·캐시 입력·출력별 토큰당 가격;
- 레이트 리밋, 피크 라우팅, "Pro/Flash/Max" 등급이 다르게 동작하는지;
- 레포 수준 편집, 테스트 보충, 명령 준수;
- 같은 프롬프트로 그레이 품질을 재현할 확률;
- 라이선스, 데이터 보존, 배포 옵션.
DeepSeek가 정식 모델 카드, API 문서, 가격을 공개한 뒤에 이 글을 업데이트한다. 그 전까지 최종 모델에 대한 어떤 주장도 잠정적이다.
자주 묻는 질문
정식 버전을 지금 당장 쓸 수 있나?
이 데이터가 기록한 건 의심되는 그레이 라우팅이지 확인된 출시가 아니다. 영상 제목에 "정식 버전"이라 적혀 있다고 DeepSeek 공식 확인을 의미하진 않는다.
V4의 코딩 능력은 실제로 어느 정도인가?
증거는 빠른 웹 프로토타입, 게임, SVG, three.js, 반복적 버그 수정에서 가장 강하다; 대형 프로덕션 레포, 보안 민감 코드, 장시간 자동 작업에서 가장 약하다.
V4가 Kimi K3보다 강한가?
모든 작업에서 강한 건 아니다. V4가 가까워 보이고 더 가성비가 좋을 수 있다; Kimi K3는 프론트엔드 다듬기와 글에서 자주 우위다. 같은 프롬프트, 같은 런타임, 같은 인수 테스트로 직접 결정하라.
고급 코딩 구독을 해지해야 할까?
많은 사람에게 풀구독 전체 해지보다 가벼운 프리미엄 구독 하나로 줄이는 게 더 합리적이다. V4가 물량을 담당하고, 리뷰와 업그레이드용으로 독립 모델 하나를 남겨둬라.
원본 그레이 테스트는 어디서 볼 수 있나?
121개 영상의 GitHub 인덱스에서 시작하라. 대표 사례: V4와 Kimi K3 광범위 테스트·3D 물리 비교·8192칸 MC 테스트·자율 버그 수정 사례.