⚡ 개요
극한의 코딩 챌린지로 세 최첨단 AI 모델을 테스트했다. 단일 HTML 파일 하나로 영화급 Three.js 태양계 시뮬레이터를 만드는 것——텍스처는 전부 절차적, 커스텀 셰이더, 블룸 포스트프로세싱, 인터랙티브 컨트롤까지, 외부 리소스는 제로.
동일한 프롬프트, 세 모델, 정면 대결. 프롬프트는 15개 이상 천체의 정밀 셰이더 요구사항(다층 FBM 노이즈, 와류 노이즈, 셀 노이즈)을 상세히 규정했고, 태양의 3겹 코로나, 목성 대적점의 나선형 가장자리, 토성의 카시니 간극, 지구 밤면의 도시 불빛까지 빠짐없이 담았다. 대충 때우는 건 허용하지 않는다.
🤖 테스트 모델
| 모델 | 도구 | 태스크 1: 태양계 | 태스크 2: 도시 렌더링 |
|---|---|---|---|
| GPT-5.6 Sol | Codex | 11분 | 11 + 33분(2라운드) |
| Kimi K3 | Kimi Code | 45분 | 3시간+, 2라운드 포기 |
| Qwen3.8Max | 직접 호출 | — | 10분 이내(2라운드) |
공식 벤치마크가 아니다——GitHub 사용자 OBdangshang07가 직접 진행한 실전 스트레스 테스트다. 동일 프롬프트, 동일 기대치 아래에서 도구 호출 순간부터 완전한 출력이 나오기까지의 경과 시간을 쟀다. 품질은 시각적 충실도와 코드 완성도로 판정했다.
🌌 태스크 1: 태양계 시뮬레이터
프롬프트는 15개 이상의 천체에 각각 커스텀 ShaderMaterial과 다층 노이즈를 요구하는 영화급 태양계를 담고 있다. 핵심 요구사항은 이렇다.
- 태양: 다이내믹 플라즈마 텍스처 + 3겹 코로나 + 흑점 + 태양풍 입자
- 목성: 다층 늘어진 노이즈 밴드, 대적점의 나선형 가장자리, 3개 이상의 소형 와류
- 토성: 다층 반투명 링 + 카시니 간극 + 셰이더
discard기반 입자 산란 - 지구: 해양 정반사 하이라이트, 밤면 도시 불빛, 프레넬 대기권
- 위성: 갈릴레이 위성 4개 + 토성 위성 4개, 각각 독립된 절차적 텍스처
결과
| 항목 | GPT-5.6 Sol(11분) | Kimi K3(45분) |
|---|---|---|
| 시각 품질 | ⭐⭐⭐⭐⭐ 셰이더가 훌륭, 목성 밴드가 유기적 | ⭐⭐⭐⭐ 준수하지만 일부 천체 노이즈가 단순 |
| 코드 완성도 | 15개 이상 천체 전부, 위성까지 빠짐없이 | 천체는 전부 등장, 일부 위성은 단순화 |
| 인터랙션 | 매끄러운 궤도 컨트롤, 정보 패널, 시간 가속 | 비슷한 컨트롤, UI 정교함은 약간 아래 |
| 포스트프로세싱 | UnrealBloomPass 튜닝이 잘 잡혀 있음 | 블룸은 있으나 정교하지 않음 |
| 안정성 | 60fps로 안정적 | 저사양 GPU에서 가끔 드롭 |
🏙️ 태스크 2: 도시 렌더러
난이도를 한 단계 올렸다. 50개 이상의 조정 가능한 파라미터를 가진 실시간 도시 렌더러를 생성하는 것. 절차적 무한 도시, 다이내믹 주야 사이클, 대기 산란, 그리고 건물마다 텍스처가 다른 밀집 3D 건물군까지 포함해야 한다.
결과
| 모델 | 1라운드 | 2라운드(정제) | 건물 밀도 | 텍스처 품질 |
|---|---|---|---|---|
| Qwen3.8Max | 10분 이내 | 10분 이내 | ⭐⭐⭐⭐⭐ 조밀하고 다양 | ⭐⭐⭐⭐ 절차적 텍스처 양호 |
| GPT-5.6 Sol | 11분 | 33분 | ⭐⭐⭐⭐ 조밀 | ⭐⭐⭐⭐⭐ 디테일이 뛰어남 |
| Kimi K3 | 3시간+ | ❌ 포기 | ⭐⭐⭐ 보통 | ⭐⭐⭐ 무난 |
Kimi K3는 1라운드에서 3시간을 넘겼고, 2라운드는 아예 포기했다. 도시 렌더링 태스크는 K3의 약점을 정확히 노려 buzz——도로·교통·조명·건물 생성이 서로 얽히는 복잡하고 성능에 민감한 다중 시스템 3D 코드를 짤 때 한계가 드러났다.
📊 핵심 발견
🏎️ 속도
Qwen3.8Max가 속도의 왕이다——2라운드를 합쳐도 10분 안이다. GPT-5.6 Sol은 태스크당 약 11분으로 안정적. Kimi K3는 복잡한 태스크에서 3~4배 느리다.
🎨 품질
GPT-5.6 Sol이 시각 품질 최상위——셰이더가 더 정교하고, 노이즈 층이 더 유기적이며, 포스트프로세싱 튜닝도 한 수 위다. Qwen3.8Max는 속도를 위해 시각적 마감 일부를 희생했다. Kimi K3 출력은 쓸 만하지만 영화급에는 못 미친다.
🔧 안정성
GPT-5.6 Sol이 가장 믿을 만하다——두 태스크를 모두 끝까지 완성했다. Qwen3.8Max는 빠르지만 정제 라운드가 필요할 수 있다. Kimi K3는 복잡한 다중 시스템 태스크에서 타임아웃될 위험이 있다.
🎮 라이브 데모——직접 체험하기
아래는 각 모델의 실제 출력이다. 브라우저에서 열어보고 시각 품질, 인터랙션, 성능을 직접 비교해 보자.
☀️ 태양계 시뮬레이터
🌃 도시 렌더러
🎯 개발자를 위한 시사점
- 최고의 시각 품질이 필요하다면? → GPT-5.6 Sol(Codex). 셰이더가 가장 좋고 출력이 가장 정교하다.
- 속도가 최우선이라면? → Qwen3.8Max. 압도적으로 빠르고 프로토타입 품질로 충분하다.
- 복잡한 다중 시스템 3D? → 당분간 Kimi K3는 피하자. 단순 태스크엔 강하지만, 시스템이 얽히는 곳에서는 고전한다.
- 비용이 민감하다면? → Qwen3.8Max가 시간 대비 품질 효율이 가장 좋다.
모델 사이의 격차는 단순히 속도만이 아니다——복잡도 천장의 차이다. GPT-5.6 Sol은 15개 이상의 상호 의존적인 셰이더 시스템을 품은 프롬프트를 소화한다. Qwen3.8Max는 빠르지만 정제가 필요할 수 있다. Kimi K3는 복잡한 3D 태스크에서 천장이 확실히 낮다.
단일 HTML 파일 생성——이 떠오르는 "바이브 코딩" 벤치마크——에서 GPT-5.6 Sol이 현재 품질 리드, Qwen3.8Max가 처리량 리드를 잡고 있다. 필요에 맞게 고르면 된다.
📎 소스 코드
모든 코드, 프롬프트, 테스트 결과는 오픈소스로 공개: github.com/OBdangshang07/AI_project
테스트는 GitHub 사용자 OBdangshang07가 진행했다. 데모는 원본 HTML 출력 파일을 그대로 재현한 것이다.