⚡ Visión general

Sometimos a tres modelos de IA frontera a un reto de programación extremo: generar un simulador del sistema solar con Three.js de calidad cinematográfica dentro de un único archivo HTML: texturas procedimentales, shaders a medida, posprocesado con bloom y controles interactivos, todo sin un solo recurso externo.

🎯 El reto
Mismo prompt, tres modelos, comparativa directa. El prompt detallaba 15+ cuerpos celestes con requisitos precisos de shader (ruido FBM multicapa, ruido de vórtice, ruido celular), tres capas de halo en el Sol, la Gran Mancha Roja de Júpiter con bordes en espiral, la división de Cassini en los anillos de Saturno, las luces de las ciudades en la cara oscura de la Tierra y mucho más. Atajos prohibidos.

🤖 Modelos probados

ModeloHerramientaTarea 1: Sistema solarTarea 2: Renderizador de ciudad
GPT-5.6 SolCodex11 min11 + 33 min (2 rondas)
Kimi K3Kimi Code45 min3+ horas, 2.ª ronda abandonada
Qwen3.8MaxDirecto<10 min (2 rondas)
⚠️ Nota metodológica
Esto no es un benchmark formal: es una prueba de estrés real del usuario de GitHub OBdangshang07. Mismo prompt, mismas expectativas, midiendo el tiempo transcurrido desde la llamada a la herramienta hasta la salida completa. La calidad se juzga por la fidelidad visual y la completitud del código.

🌌 Tarea 1: Simulador del sistema solar

El prompt exigía un sistema solar de nivel cinematográfico con 15+ cuerpos celestes, cada uno con su propio ShaderMaterial y ruido multicapa. Requisitos clave:

  • Sol: textura de plasma dinámica con 3 capas de halo, manchas solares y partículas de viento solar
  • Júpiter: bandas de ruido estirado multicapa, Gran Mancha Roja con bordes en espiral, 3+ vórtices menores
  • Saturno: anillos translúcidos multicapa con división de Cassini, dispersión de partículas vía discard en el shader
  • Tierra: reflejos especulares en los océanos, luces de ciudades en la cara oscura, envoltura atmosférica Fresnel
  • Lunas: 4 lunas galileanas + 4 lunas de Saturno, cada una con su textura procedimental única

Resultados

AspectoGPT-5.6 Sol (11 min)Kimi K3 (45 min)
Calidad visual⭐⭐⭐⭐⭐ Shaders excelentes, las bandas de Júpiter se ven orgánicas⭐⭐⭐⭐ Correcto, pero algunos cuerpos usan ruido más simple
Completitud del códigoLos 15+ cuerpos, todas las lunasTodos los cuerpos presentes, algunas lunas simplificadas
InteractividadControles de órbita fluidos, paneles informativos, aceleración temporalControles similares, UI algo menos pulida
PosprocesadoUnrealBloomPass bien ajustadoHay bloom, pero menos fino
Estabilidad60 fps establesCaídas puntuales de fps en GPUs modestas

🏙️ Tarea 2: Renderizador de ciudad

Aún más difícil: generar un renderizador metropolitano en tiempo real con 50+ parámetros ajustables, ciudad infinita procedimental, ciclo día/noche dinámico, dispersión atmosférica y densos bloques 3D de edificios con texturas distintas en cada uno.

Resultados

ModeloRonda 1Ronda 2 (refinamiento)Densidad de edificiosCalidad de textura
Qwen3.8Max<10 min<10 min⭐⭐⭐⭐⭐ Denso y variado⭐⭐⭐⭐ Buen procedimental
GPT-5.6 Sol11 min33 min⭐⭐⭐⭐ Denso⭐⭐⭐⭐⭐ Detalle excelente
Kimi K33+ horas❌ Abandonada⭐⭐⭐ Moderada⭐⭐⭐ Aceptable
🚨 Kimi K3 se atragantó
Kimi K3 invirtió más de 3 horas en la primera ronda y no logró terminar la segunda. La tarea del renderizador de ciudad dejó al descubierto la debilidad de K3 al generar código 3D complejo y sensible al rendimiento con muchos sistemas interdependientes (calles, tráfico, iluminación, generación de edificios).

📊 Conclusiones clave

🏎️ Velocidad

Qwen3.8Max es el rey de la velocidad: ambas rondas por debajo de 10 minutos en total. GPT-5.6 Sol es constante (~11 min por tarea). Kimi K3 es de 3 a 4 veces más lento en tareas complejas.

🎨 Calidad

GPT-5.6 Sol ofrece la mejor calidad visual: sus shaders son más finos, las capas de ruido más orgánicas y el posprocesado mejor ajustado. Qwen3.8Max sacrifica algo de pulido visual a cambio de velocidad bruta. La salida de Kimi K3 funciona, pero resulta menos cinematográfica.

🔧 Fiabilidad

GPT-5.6 Sol es el más fiable: completó ambas tareas al completo. Qwen3.8Max es rápido, pero puede necesitar una ronda de refinamiento. Kimi K3 puede quedarse sin tiempo en tareas multi-sistema complejas.

🎮 Demos en directo — pruébalas tú mismo

Aquí tienes las salidas reales de cada modelo. Ábrelas en tu navegador y compara la calidad visual, la interactividad y el rendimiento:

☀️ Simulador del sistema solar

ModeloTiempo de generaciónDemo
GPT-5.6 Sol11 min🚀 Abrir demo →
Kimi K345 min🚀 Abrir demo →

🌃 Renderizador de ciudad

ModeloTiempo de generaciónDemo
GPT-5.6 Sol11 + 33 min🚀 Abrir demo →
Kimi K33+ horas🚀 Abrir demo →
Qwen3.8Max<10 min × 2🚀 Abrir demo →

🎯 Qué significa esto para los desarrolladores

💡 Guía de elección de modelo
  • ¿Buscas la mejor calidad visual? → GPT-5.6 Sol (Codex). Los mejores shaders y la salida más pulida.
  • ¿Buscas velocidad? → Qwen3.8Max. Rapidísimo, con calidad suficiente para prototipar.
  • ¿3D multi-sistema complejo? → De momento, evita Kimi K3. Brilla en tareas sencillas, pero se atasca con sistemas interconectados.
  • ¿Sensible al coste? → Qwen3.8Max ofrece la mejor relación tiempo/calidad.

La diferencia entre modelos no es solo velocidad: es el techo de complejidad. GPT-5.6 Sol aguanta prompts con 15+ sistemas de shader interdependientes. Qwen3.8Max es rápido, pero puede necesitar rondas de refinamiento. Kimi K3 tiene un techo más bajo en tareas 3D complejas.

Para la generación de HTML en un único archivo —el emergente benchmark del «vibe coding»— GPT-5.6 Sol lidera actualmente en calidad, mientras que Qwen3.8Max lidera en rendimiento. Elige según tu prioridad.

📎 Código fuente

Todo el código, los prompts y los resultados de las pruebas son de código abierto: github.com/OBdangshang07/AI_project

Prueba realizada por el usuario de GitHub OBdangshang07. Las demos se reproducen con los archivos de salida HTML originales.