⚡ Visión general
Sometimos a tres modelos de IA frontera a un reto de programación extremo: generar un simulador del sistema solar con Three.js de calidad cinematográfica dentro de un único archivo HTML: texturas procedimentales, shaders a medida, posprocesado con bloom y controles interactivos, todo sin un solo recurso externo.
Mismo prompt, tres modelos, comparativa directa. El prompt detallaba 15+ cuerpos celestes con requisitos precisos de shader (ruido FBM multicapa, ruido de vórtice, ruido celular), tres capas de halo en el Sol, la Gran Mancha Roja de Júpiter con bordes en espiral, la división de Cassini en los anillos de Saturno, las luces de las ciudades en la cara oscura de la Tierra y mucho más. Atajos prohibidos.
🤖 Modelos probados
| Modelo | Herramienta | Tarea 1: Sistema solar | Tarea 2: Renderizador de ciudad |
|---|---|---|---|
| GPT-5.6 Sol | Codex | 11 min | 11 + 33 min (2 rondas) |
| Kimi K3 | Kimi Code | 45 min | 3+ horas, 2.ª ronda abandonada |
| Qwen3.8Max | Directo | — | <10 min (2 rondas) |
Esto no es un benchmark formal: es una prueba de estrés real del usuario de GitHub OBdangshang07. Mismo prompt, mismas expectativas, midiendo el tiempo transcurrido desde la llamada a la herramienta hasta la salida completa. La calidad se juzga por la fidelidad visual y la completitud del código.
🌌 Tarea 1: Simulador del sistema solar
El prompt exigía un sistema solar de nivel cinematográfico con 15+ cuerpos celestes, cada uno con su propio ShaderMaterial y ruido multicapa. Requisitos clave:
- Sol: textura de plasma dinámica con 3 capas de halo, manchas solares y partículas de viento solar
- Júpiter: bandas de ruido estirado multicapa, Gran Mancha Roja con bordes en espiral, 3+ vórtices menores
- Saturno: anillos translúcidos multicapa con división de Cassini, dispersión de partículas vía
discarden el shader - Tierra: reflejos especulares en los océanos, luces de ciudades en la cara oscura, envoltura atmosférica Fresnel
- Lunas: 4 lunas galileanas + 4 lunas de Saturno, cada una con su textura procedimental única
Resultados
| Aspecto | GPT-5.6 Sol (11 min) | Kimi K3 (45 min) |
|---|---|---|
| Calidad visual | ⭐⭐⭐⭐⭐ Shaders excelentes, las bandas de Júpiter se ven orgánicas | ⭐⭐⭐⭐ Correcto, pero algunos cuerpos usan ruido más simple |
| Completitud del código | Los 15+ cuerpos, todas las lunas | Todos los cuerpos presentes, algunas lunas simplificadas |
| Interactividad | Controles de órbita fluidos, paneles informativos, aceleración temporal | Controles similares, UI algo menos pulida |
| Posprocesado | UnrealBloomPass bien ajustado | Hay bloom, pero menos fino |
| Estabilidad | 60 fps estables | Caídas puntuales de fps en GPUs modestas |
🏙️ Tarea 2: Renderizador de ciudad
Aún más difícil: generar un renderizador metropolitano en tiempo real con 50+ parámetros ajustables, ciudad infinita procedimental, ciclo día/noche dinámico, dispersión atmosférica y densos bloques 3D de edificios con texturas distintas en cada uno.
Resultados
| Modelo | Ronda 1 | Ronda 2 (refinamiento) | Densidad de edificios | Calidad de textura |
|---|---|---|---|---|
| Qwen3.8Max | <10 min | <10 min | ⭐⭐⭐⭐⭐ Denso y variado | ⭐⭐⭐⭐ Buen procedimental |
| GPT-5.6 Sol | 11 min | 33 min | ⭐⭐⭐⭐ Denso | ⭐⭐⭐⭐⭐ Detalle excelente |
| Kimi K3 | 3+ horas | ❌ Abandonada | ⭐⭐⭐ Moderada | ⭐⭐⭐ Aceptable |
Kimi K3 invirtió más de 3 horas en la primera ronda y no logró terminar la segunda. La tarea del renderizador de ciudad dejó al descubierto la debilidad de K3 al generar código 3D complejo y sensible al rendimiento con muchos sistemas interdependientes (calles, tráfico, iluminación, generación de edificios).
📊 Conclusiones clave
🏎️ Velocidad
Qwen3.8Max es el rey de la velocidad: ambas rondas por debajo de 10 minutos en total. GPT-5.6 Sol es constante (~11 min por tarea). Kimi K3 es de 3 a 4 veces más lento en tareas complejas.
🎨 Calidad
GPT-5.6 Sol ofrece la mejor calidad visual: sus shaders son más finos, las capas de ruido más orgánicas y el posprocesado mejor ajustado. Qwen3.8Max sacrifica algo de pulido visual a cambio de velocidad bruta. La salida de Kimi K3 funciona, pero resulta menos cinematográfica.
🔧 Fiabilidad
GPT-5.6 Sol es el más fiable: completó ambas tareas al completo. Qwen3.8Max es rápido, pero puede necesitar una ronda de refinamiento. Kimi K3 puede quedarse sin tiempo en tareas multi-sistema complejas.
🎮 Demos en directo — pruébalas tú mismo
Aquí tienes las salidas reales de cada modelo. Ábrelas en tu navegador y compara la calidad visual, la interactividad y el rendimiento:
☀️ Simulador del sistema solar
| Modelo | Tiempo de generación | Demo |
|---|---|---|
| GPT-5.6 Sol | 11 min | 🚀 Abrir demo → |
| Kimi K3 | 45 min | 🚀 Abrir demo → |
🌃 Renderizador de ciudad
| Modelo | Tiempo de generación | Demo |
|---|---|---|
| GPT-5.6 Sol | 11 + 33 min | 🚀 Abrir demo → |
| Kimi K3 | 3+ horas | 🚀 Abrir demo → |
| Qwen3.8Max | <10 min × 2 | 🚀 Abrir demo → |
🎯 Qué significa esto para los desarrolladores
- ¿Buscas la mejor calidad visual? → GPT-5.6 Sol (Codex). Los mejores shaders y la salida más pulida.
- ¿Buscas velocidad? → Qwen3.8Max. Rapidísimo, con calidad suficiente para prototipar.
- ¿3D multi-sistema complejo? → De momento, evita Kimi K3. Brilla en tareas sencillas, pero se atasca con sistemas interconectados.
- ¿Sensible al coste? → Qwen3.8Max ofrece la mejor relación tiempo/calidad.
La diferencia entre modelos no es solo velocidad: es el techo de complejidad. GPT-5.6 Sol aguanta prompts con 15+ sistemas de shader interdependientes. Qwen3.8Max es rápido, pero puede necesitar rondas de refinamiento. Kimi K3 tiene un techo más bajo en tareas 3D complejas.
Para la generación de HTML en un único archivo —el emergente benchmark del «vibe coding»— GPT-5.6 Sol lidera actualmente en calidad, mientras que Qwen3.8Max lidera en rendimiento. Elige según tu prioridad.
📎 Código fuente
Todo el código, los prompts y los resultados de las pruebas son de código abierto: github.com/OBdangshang07/AI_project
Prueba realizada por el usuario de GitHub OBdangshang07. Las demos se reproducen con los archivos de salida HTML originales.