⚡ 개요

극한의 코딩 챌린지로 세 최첨단 AI 모델을 테스트했다. 단일 HTML 파일 하나로 영화급 Three.js 태양계 시뮬레이터를 만드는 것——텍스처는 전부 절차적, 커스텀 셰이더, 블룸 포스트프로세싱, 인터랙티브 컨트롤까지, 외부 리소스는 제로.

🎯 도전 과제
동일한 프롬프트, 세 모델, 정면 대결. 프롬프트는 15개 이상 천체의 정밀 셰이더 요구사항(다층 FBM 노이즈, 와류 노이즈, 셀 노이즈)을 상세히 규정했고, 태양의 3겹 코로나, 목성 대적점의 나선형 가장자리, 토성의 카시니 간극, 지구 밤면의 도시 불빛까지 빠짐없이 담았다. 대충 때우는 건 허용하지 않는다.

🤖 테스트 모델

모델도구태스크 1: 태양계태스크 2: 도시 렌더링
GPT-5.6 SolCodex11분11 + 33분(2라운드)
Kimi K3Kimi Code45분3시간+, 2라운드 포기
Qwen3.8Max직접 호출10분 이내(2라운드)
⚠️ 테스트 방법에 대하여
공식 벤치마크가 아니다——GitHub 사용자 OBdangshang07가 직접 진행한 실전 스트레스 테스트다. 동일 프롬프트, 동일 기대치 아래에서 도구 호출 순간부터 완전한 출력이 나오기까지의 경과 시간을 쟀다. 품질은 시각적 충실도와 코드 완성도로 판정했다.

🌌 태스크 1: 태양계 시뮬레이터

프롬프트는 15개 이상의 천체에 각각 커스텀 ShaderMaterial과 다층 노이즈를 요구하는 영화급 태양계를 담고 있다. 핵심 요구사항은 이렇다.

  • 태양: 다이내믹 플라즈마 텍스처 + 3겹 코로나 + 흑점 + 태양풍 입자
  • 목성: 다층 늘어진 노이즈 밴드, 대적점의 나선형 가장자리, 3개 이상의 소형 와류
  • 토성: 다층 반투명 링 + 카시니 간극 + 셰이더 discard 기반 입자 산란
  • 지구: 해양 정반사 하이라이트, 밤면 도시 불빛, 프레넬 대기권
  • 위성: 갈릴레이 위성 4개 + 토성 위성 4개, 각각 독립된 절차적 텍스처

결과

항목GPT-5.6 Sol(11분)Kimi K3(45분)
시각 품질⭐⭐⭐⭐⭐ 셰이더가 훌륭, 목성 밴드가 유기적⭐⭐⭐⭐ 준수하지만 일부 천체 노이즈가 단순
코드 완성도15개 이상 천체 전부, 위성까지 빠짐없이천체는 전부 등장, 일부 위성은 단순화
인터랙션매끄러운 궤도 컨트롤, 정보 패널, 시간 가속비슷한 컨트롤, UI 정교함은 약간 아래
포스트프로세싱UnrealBloomPass 튜닝이 잘 잡혀 있음블룸은 있으나 정교하지 않음
안정성60fps로 안정적저사양 GPU에서 가끔 드롭

🏙️ 태스크 2: 도시 렌더러

난이도를 한 단계 올렸다. 50개 이상의 조정 가능한 파라미터를 가진 실시간 도시 렌더러를 생성하는 것. 절차적 무한 도시, 다이내믹 주야 사이클, 대기 산란, 그리고 건물마다 텍스처가 다른 밀집 3D 건물군까지 포함해야 한다.

결과

모델1라운드2라운드(정제)건물 밀도텍스처 품질
Qwen3.8Max10분 이내10분 이내⭐⭐⭐⭐⭐ 조밀하고 다양⭐⭐⭐⭐ 절차적 텍스처 양호
GPT-5.6 Sol11분33분⭐⭐⭐⭐ 조밀⭐⭐⭐⭐⭐ 디테일이 뛰어남
Kimi K33시간+❌ 포기⭐⭐⭐ 보통⭐⭐⭐ 무난
🚨 Kimi K3가 무너졌다
Kimi K3는 1라운드에서 3시간을 넘겼고, 2라운드는 아예 포기했다. 도시 렌더링 태스크는 K3의 약점을 정확히 노려 buzz——도로·교통·조명·건물 생성이 서로 얽히는 복잡하고 성능에 민감한 다중 시스템 3D 코드를 짤 때 한계가 드러났다.

📊 핵심 발견

🏎️ 속도

Qwen3.8Max가 속도의 왕이다——2라운드를 합쳐도 10분 안이다. GPT-5.6 Sol은 태스크당 약 11분으로 안정적. Kimi K3는 복잡한 태스크에서 3~4배 느리다.

🎨 품질

GPT-5.6 Sol이 시각 품질 최상위——셰이더가 더 정교하고, 노이즈 층이 더 유기적이며, 포스트프로세싱 튜닝도 한 수 위다. Qwen3.8Max는 속도를 위해 시각적 마감 일부를 희생했다. Kimi K3 출력은 쓸 만하지만 영화급에는 못 미친다.

🔧 안정성

GPT-5.6 Sol이 가장 믿을 만하다——두 태스크를 모두 끝까지 완성했다. Qwen3.8Max는 빠르지만 정제 라운드가 필요할 수 있다. Kimi K3는 복잡한 다중 시스템 태스크에서 타임아웃될 위험이 있다.

🎮 라이브 데모——직접 체험하기

아래는 각 모델의 실제 출력이다. 브라우저에서 열어보고 시각 품질, 인터랙션, 성능을 직접 비교해 보자.

☀️ 태양계 시뮬레이터

모델생성 시간데모
GPT-5.6 Sol11분🚀 데모 열기 →
Kimi K345분🚀 데모 열기 →

🌃 도시 렌더러

모델생성 시간데모
GPT-5.6 Sol11 + 33분🚀 데모 열기 →
Kimi K33시간+🚀 데모 열기 →
Qwen3.8Max10분 이내 × 2🚀 데모 열기 →

🎯 개발자를 위한 시사점

💡 모델 선택 가이드
  • 최고의 시각 품질이 필요하다면? → GPT-5.6 Sol(Codex). 셰이더가 가장 좋고 출력이 가장 정교하다.
  • 속도가 최우선이라면? → Qwen3.8Max. 압도적으로 빠르고 프로토타입 품질로 충분하다.
  • 복잡한 다중 시스템 3D? → 당분간 Kimi K3는 피하자. 단순 태스크엔 강하지만, 시스템이 얽히는 곳에서는 고전한다.
  • 비용이 민감하다면? → Qwen3.8Max가 시간 대비 품질 효율이 가장 좋다.

모델 사이의 격차는 단순히 속도만이 아니다——복잡도 천장의 차이다. GPT-5.6 Sol은 15개 이상의 상호 의존적인 셰이더 시스템을 품은 프롬프트를 소화한다. Qwen3.8Max는 빠르지만 정제가 필요할 수 있다. Kimi K3는 복잡한 3D 태스크에서 천장이 확실히 낮다.

단일 HTML 파일 생성——이 떠오르는 "바이브 코딩" 벤치마크——에서 GPT-5.6 Sol이 현재 품질 리드, Qwen3.8Max가 처리량 리드를 잡고 있다. 필요에 맞게 고르면 된다.

📎 소스 코드

모든 코드, 프롬프트, 테스트 결과는 오픈소스로 공개: github.com/OBdangshang07/AI_project

테스트는 GitHub 사용자 OBdangshang07가 진행했다. 데모는 원본 HTML 출력 파일을 그대로 재현한 것이다.