⚡ Übersicht
Wir haben drei frontier KI-Modelle mit einer extremen Coding-Herausforderung getestet: in einer einzigen HTML-Datei einen filmreifen Three.js Sonnensystem-Simulator generieren — komplett prozedurale Texturen, Custom-Shader, Bloom-Post-Processing, interaktive Steuerung, null externe Assets.
Derselbe Prompt, drei Modelle, ein direkter Vergleich. Der Prompt legte exakte Shader-Anforderungen für 15+ Himmelskörper fest (mehrlagiges FBM-Rauschen, Turbulenz-Rauschen, Zell-Rauschen), 3-schichtige Sonnen-Korona, Spiralränder des Großen Roten Flecks auf Jupiter, Cassini-Teilung des Saturn, nächtliche Stadtlichter der Erde usw. Abkürzungen waren nicht erlaubt.
🤖 Getestete Modelle
| Modell | Tool | Aufgabe 1: Sonnensystem | Aufgabe 2: Stadt-Renderer |
|---|---|---|---|
| GPT-5.6 Sol | Codex | 11 Minuten | 11 + 33 Minuten (zwei Runden) |
| Kimi K3 | Kimi Code | 45 Minuten | 3 Stunden+, zweite Runde abgebrochen |
| Qwen3.8Max | Direkter Aufruf | — | unter 10 Minuten (zwei Runden) |
Das ist kein formeller Benchmark — es ist ein echter Stresstest von GitHub-Nutzer OBdangshang07. Identischer Prompt, identische Erwartungen, gemessen wurde die Wall-Clock-Zeit vom Tool-Aufruf bis zum fertigen Output. Die Qualität wurde an visueller Detailtreue und Code-Vollständigkeit bewertet.
🌌 Aufgabe 1: Sonnensystem-Simulator
Der Prompt verlangte ein filmreifes Sonnensystem mit 15+ Himmelskörpern, jeder mit eigenem ShaderMaterial und mehrlagigem Rauschen. Kernanforderungen:
- Sonne: dynamische Plasma-Textur + 3-schichtige Korona + Sonnenflecken + Sonnenwind-Partikel
- Jupiter: mehrlagige gestreckte Rauschbänder, Spiralränder des Großen Roten Flecks, 3+ kleine Wirbel
- Saturn: mehrlagige halbtransparente Ringe + Cassini-Teilung + Shader-
discardPartikelstreuung - Erde: spiegelnde Glanzpunkte auf den Ozeanen, nächtliche Stadtlichter, Fresnel-Atmosphärenschale
- Monde: 4 galiläische Monde + 4 Saturn-Monde, jeder mit eigener prozeduraler Textur
Ergebnisse
| Dimension | GPT-5.6 Sol (11 Minuten) | Kimi K3 (45 Minuten) |
|---|---|---|
| Visuelle Qualität | ⭐⭐⭐⭐⭐ hervorragende Shader, Jupiters Bänder wirken organisch | ⭐⭐⭐⭐ solide, aber bei einigen Körpern zu einfaches Rauschen |
| Code-Vollständigkeit | alle 15+ Himmelskörper, alle Monde vorhanden | alle Körper vorhanden, einige Monde vereinfacht |
| Interaktivität | flüssige Orbit-Steuerung, Info-Panel, Zeitbeschleunigung | ähnliche Steuerung, UI weniger fein |
| Post-Processing | UnrealBloomPass sauber abgestimmt | Bloom vorhanden, aber weniger raffiniert |
| Stabilität | stabile 60 fps | auf schwächeren GPUs gelegentliche Einbrüche |
🏙️ Aufgabe 2: Stadt-Renderer
Höherer Schwierigkeitsgrad: ein Echtzeit-Stadt-Renderer mit 50+ justierbaren Parametern — prozedurale unendliche Stadt, dynamischer Tag-Nacht-Zyklus, atmosphärische Streuung, dichte 3D-Bebauung (jedes Gebäude eigene Textur).
Ergebnisse
| Modell | Runde 1 | Runde 2 (Feinschliff) | Gebäudedichte | Texturqualität |
|---|---|---|---|---|
| Qwen3.8Max | unter 10 Minuten | unter 10 Minuten | ⭐⭐⭐⭐⭐ dicht und vielfältig | ⭐⭐⭐⭐ gute prozedurale Texturen |
| GPT-5.6 Sol | 11 Minuten | 33 Minuten | ⭐⭐⭐⭐ dicht | ⭐⭐⭐⭐⭐ exzellente Details |
| Kimi K3 | 3 Stunden+ | ❌ abgebrochen | ⭐⭐⭐ mittelmäßig | ⭐⭐⭐ brauchbar |
Kimi K3 brauchte in der ersten Runde über 3 Stunden und hat in der zweiten direkt aufgegeben. Die Stadt-Renderer-Aufgabe offenbart die Schwäche von K3 bei komplexem, performance-kritischem 3D-Code mit vielen gekoppelten Systemen (Straßen, Verkehr, Beleuchtung, Gebäudegenerierung).
📊 Kernergebnisse
🏎️ Geschwindigkeit
Qwen3.8Max ist der Geschwindigkeitskönig — beide Runden zusammen unter 10 Minuten. GPT-5.6 Sol bleibt stabil bei ~11 Minuten pro Aufgabe. Kimi K3 ist bei komplexen Aufgaben 3–4-mal langsamer.
🎨 Qualität
GPT-5.6 Sol liefert die höchste visuelle Qualität — raffinierte Shader, organischeres Rauschen, besser abgestimmtes Post-Processing. Qwen3.8Max tauscht etwas visuellen Feinschliff gegen Geschwindigkeit ein. Kimi K3s Output ist brauchbar, aber nicht filmreif.
🔧 Zuverlässigkeit
GPT-5.6 Sol ist am zuverlässigsten — beide Aufgaben vollständig abgeschlossen. Qwen3.8Max ist schnell, braucht aber eventuell eine Nachbesserungsrunde. Kimi K3 droht bei komplexen Multi-System-Aufgaben abzubrechen.
🎮 Live-Demos — selbst ausprobieren
Dies sind die echten Outputs der einzelnen Modelle. Im Browser öffnen und visuelle Qualität, Interaktivität und Performance vergleichen:
☀️ Sonnensystem-Simulator
| Modell | Generierungszeit | Demo |
|---|---|---|
| GPT-5.6 Sol | 11 Minuten | 🚀 Demo starten → |
| Kimi K3 | 45 Minuten | 🚀 Demo starten → |
🌃 Stadt-Renderer
| Modell | Generierungszeit | Demo |
|---|---|---|
| GPT-5.6 Sol | 11 + 33 Minuten | 🚀 Demo starten → |
| Kimi K3 | 3 Stunden+ | 🚀 Demo starten → |
| Qwen3.8Max | unter 10 Minuten × 2 | 🚀 Demo starten → |
🎯 Erkenntnisse für Entwickler
- Maximale visuelle Qualität? → GPT-5.6 Sol (Codex). Beste Shader, edelster Output.
- Maximale Geschwindigkeit? → Qwen3.8Max. Rasend schnell, für Prototyping reicht die Qualität.
- Komplexe Multi-System-3D? → Kimi K3 vorerst meiden. Stark bei einfachen Aufgaben, überfordert bei gekoppelten Systemen.
- Kostenkritisch? → Qwen3.8Max bietet das beste Zeit-Qualitäts-Verhältnis.
Der Abstand zwischen den Modellen ist nicht nur Geschwindigkeit — es ist die Komplexitätsdecke. GPT-5.6 Sol schafft Prompts mit 15+ voneinander abhängigen Shader-Systemen. Qwen3.8Max ist schnell, braucht aber eventuell Nachbesserung. Kimi K3 hat bei komplexen 3D-Aufgaben eine niedrigere Decke.
Für Single-File-HTML-Generierung — dieser neue „Vibe-Coding"-Benchmark — führt GPT-5.6 Sol bei der Qualität, Qwen3.8Max beim Durchsatz. Nach Bedarf wählen.
📎 Quellcode
Der gesamte Code, alle Prompts und Testergebnisse sind Open Source: github.com/OBdangshang07/AI_project
Getestet hat der GitHub-Nutzer OBdangshang07. Die Demos nutzen die originalen HTML-Output-Dateien.