⚡ Visão geral
Submetemos três modelos de IA de fronteira a um desafio de codificação brutal: gerar um simulador de Sistema Solar em Three.js com qualidade cinematográfica dentro de um único arquivo HTML — todas as texturas procedurais, shaders customizados, pós-processamento de bloom e controles interativos, sem nenhum asset externo.
Mesmo prompt, três modelos, cabo a cabo. O prompt especificava 15+ corpos celestes com requisitos exatos de shader (ruído FBM em múltiplas camadas, ruído vórtex, ruído celular), 3 camadas de glow no Sol, a Grande Mancha Vermelha de Júpiter com bordas em espiral, a divisão de Cassini em Saturno, luzes de cidades no lado escuro da Terra e mais. Nenhum atalho permitido.
🤖 Modelos testados
| Modelo | Ferramenta | Tarefa 1: Sistema Solar | Tarefa 2: Renderizador de cidade |
|---|---|---|---|
| GPT-5.6 Sol | Codex | 11 min | 11 + 33 min (2 rodadas) |
| Kimi K3 | Kimi Code | 45 min | 3+ horas, 2ª rodada abandonada |
| Qwen3.8Max | Direto | — | <10 min (2 rodadas) |
Isso não é um benchmark formal — é um stress test real do usuário do GitHub OBdangshang07. Mesmo prompt, mesmas expectativas, medindo o tempo total (wall-clock) da invocação da ferramenta até a saída completa. Qualidade julgada por fidelidade visual e integridade do código.
🌌 Tarefa 1: Simulador do Sistema Solar
O prompt exigia um Sistema Solar de nível cinematográfico com 15+ corpos celestes, cada um exigindo um ShaderMaterial customizado com ruído em múltiplas camadas. Requisitos principais:
- Sol: textura de plasma dinâmica com 3 camadas de glow, manchas solares e partículas de vento solar
- Júpiter: faixas de ruído esticado em múltiplas camadas, Grande Mancha Vermelha com bordas em espiral, 3+ vórtices menores
- Saturno: anéis translúcidos em múltiplas camadas com a divisão de Cassini, espalhamento de partículas via
discardno shader - Terra: realces especulares nos oceanos, luzes de cidades no lado escuro, shell atmosférico com efeito Fresnel
- Luas: 4 luas galileanas + 4 luas de Saturno, cada uma com texturas procedurais únicas
Resultados
| Aspecto | GPT-5.6 Sol (11 min) | Kimi K3 (45 min) |
|---|---|---|
| Fidelidade visual | ⭐⭐⭐⭐⭐ Shaders excelentes, faixas de Júpiter parecem orgânicas | ⭐⭐⭐⭐ Bom, mas alguns corpos usam ruído mais simples |
| Integridade do código | Todos os 15+ corpos, todas as luas inclusas | Todos os corpos presentes, algumas luas simplificadas |
| Interatividade | Controles de órbita suaves, painéis de info, aceleração de tempo | Controles parecidos, UI um pouco menos polida |
| Pós-processamento | UnrealBloomPass bem ajustado | Bloom presente, mas menos refinado |
| Estabilidade | Estável a 60fps | Quedas ocasionais de frame em GPUs mais fracas |
🏙️ Tarefa 2: Renderizador de cidade
Um desafio ainda mais duro: gerar um renderizador metropolitano em tempo real com 50+ parâmetros ajustáveis, cidade procedural infinita, ciclo dinâmico de dia/noite, espalhamento atmosférico e aglomerados densos de prédios 3D com texturas únicas.
Resultados
| Modelo | Rodada 1 | Rodada 2 (refino) | Densidade de prédios | Qualidade de textura |
|---|---|---|---|---|
| Qwen3.8Max | <10 min | <10 min | ⭐⭐⭐⭐⭐ Denso e variado | ⭐⭐⭐⭐ Bom procedural |
| GPT-5.6 Sol | 11 min | 33 min | ⭐⭐⭐⭐ Denso | ⭐⭐⭐⭐⭐ Detalhe excelente |
| Kimi K3 | 3+ horas | ❌ Abandonado | ⭐⭐⭐ Moderado | ⭐⭐⭐ Razoável |
O Kimi K3 levou mais de 3 horas na primeira rodada e não conseguiu terminar a segunda. A tarefa do renderizador de cidade expôs o ponto fraco do K3 na geração de código 3D complexo e sensível a performance, com vários sistemas interdependentes (ruas, tráfego, iluminação, geração de prédios).
📊 Principais conclusões
🏎️ Velocidade
Qwen3.8Max é o rei da velocidade — as duas rodadas somadas ficam abaixo de 10 minutos. O GPT-5.6 Sol é consistente (~11 min por tarefa). O Kimi K3 é de 3 a 4 vezes mais lento em tarefas complexas.
🎨 Qualidade
GPT-5.6 Sol entrega a melhor qualidade visual — seus shaders são mais refinados, as camadas de ruído mais orgânicas e o pós-processamento melhor ajustado. O Qwen3.8Max troca um pouco do polimento visual por velocidade pura. A saída do Kimi K3 é funcional, mas menos cinematográfica.
🔧 Confiabilidade
GPT-5.6 Sol é o mais confiável — completou as duas tarefas por inteiro. O Qwen3.8Max é rápido, mas pode precisar de uma rodada de refino. O Kimi K3 pode estourar o tempo limite em tarefas multi-sistema complexas.
🎮 Demos ao vivo — teste você mesmo
Abaixo estão as saídas reais de cada modelo. Abra no navegador e compare a qualidade visual, a interatividade e a performance:
☀️ Simulador do Sistema Solar
| Modelo | Tempo de geração | Demo |
|---|---|---|
| GPT-5.6 Sol | 11 min | 🚀 Abrir demo → |
| Kimi K3 | 45 min | 🚀 Abrir demo → |
🌃 Renderizador de cidade
| Modelo | Tempo de geração | Demo |
|---|---|---|
| GPT-5.6 Sol | 11 + 33 min | 🚀 Abrir demo → |
| Kimi K3 | 3+ horas | 🚀 Abrir demo → |
| Qwen3.8Max | <10 min × 2 | 🚀 Abrir demo → |
🎯 O que isso significa para desenvolvedores
- Precisa da melhor qualidade visual? → GPT-5.6 Sol (Codex). Shaders melhores, saída mais polida.
- Precisa de velocidade? → Qwen3.8Max. Estupidamente rápido, com qualidade suficiente para prototipação.
- 3D multi-sistema complexo? → Evite o Kimi K3 por enquanto. Ele brilha em tarefas mais simples, mas tropeça em sistemas interconectados.
- Sensível a custo? → Qwen3.8Max entrega a melhor relação tempo-qualidade.
O hiato entre os modelos não é só velocidade — é sobre o teto de complexidade. O GPT-5.6 Sol dá conta de prompts com 15+ sistemas de shader interdependentes. O Qwen3.8Max é rápido, mas pode precisar de passadas de refino. O Kimi K3 tem um teto mais baixo em tarefas 3D complexas.
Para geração de HTML em arquivo único — o emergente benchmark de "vibe coding" — hoje o GPT-5.6 Sol lidera em qualidade, enquanto o Qwen3.8Max lidera em throughput. Escolha conforme a sua prioridade.
📎 Código-fonte
Todo o código, prompts e resultados de teste são open source: github.com/OBdangshang07/AI_project
Teste conduzido pelo usuário do GitHub OBdangshang07. Demos reproduzidas com os arquivos originais de saída HTML.