⚡ Übersicht

Wir haben drei frontier KI-Modelle mit einer extremen Coding-Herausforderung getestet: in einer einzigen HTML-Datei einen filmreifen Three.js Sonnensystem-Simulator generieren — komplett prozedurale Texturen, Custom-Shader, Bloom-Post-Processing, interaktive Steuerung, null externe Assets.

🎯 Die Herausforderung
Derselbe Prompt, drei Modelle, ein direkter Vergleich. Der Prompt legte exakte Shader-Anforderungen für 15+ Himmelskörper fest (mehrlagiges FBM-Rauschen, Turbulenz-Rauschen, Zell-Rauschen), 3-schichtige Sonnen-Korona, Spiralränder des Großen Roten Flecks auf Jupiter, Cassini-Teilung des Saturn, nächtliche Stadtlichter der Erde usw. Abkürzungen waren nicht erlaubt.

🤖 Getestete Modelle

ModellToolAufgabe 1: SonnensystemAufgabe 2: Stadt-Renderer
GPT-5.6 SolCodex11 Minuten11 + 33 Minuten (zwei Runden)
Kimi K3Kimi Code45 Minuten3 Stunden+, zweite Runde abgebrochen
Qwen3.8MaxDirekter Aufrufunter 10 Minuten (zwei Runden)
⚠️ Hinweis zur Methodik
Das ist kein formeller Benchmark — es ist ein echter Stresstest von GitHub-Nutzer OBdangshang07. Identischer Prompt, identische Erwartungen, gemessen wurde die Wall-Clock-Zeit vom Tool-Aufruf bis zum fertigen Output. Die Qualität wurde an visueller Detailtreue und Code-Vollständigkeit bewertet.

🌌 Aufgabe 1: Sonnensystem-Simulator

Der Prompt verlangte ein filmreifes Sonnensystem mit 15+ Himmelskörpern, jeder mit eigenem ShaderMaterial und mehrlagigem Rauschen. Kernanforderungen:

  • Sonne: dynamische Plasma-Textur + 3-schichtige Korona + Sonnenflecken + Sonnenwind-Partikel
  • Jupiter: mehrlagige gestreckte Rauschbänder, Spiralränder des Großen Roten Flecks, 3+ kleine Wirbel
  • Saturn: mehrlagige halbtransparente Ringe + Cassini-Teilung + Shader-discard Partikelstreuung
  • Erde: spiegelnde Glanzpunkte auf den Ozeanen, nächtliche Stadtlichter, Fresnel-Atmosphärenschale
  • Monde: 4 galiläische Monde + 4 Saturn-Monde, jeder mit eigener prozeduraler Textur

Ergebnisse

DimensionGPT-5.6 Sol (11 Minuten)Kimi K3 (45 Minuten)
Visuelle Qualität⭐⭐⭐⭐⭐ hervorragende Shader, Jupiters Bänder wirken organisch⭐⭐⭐⭐ solide, aber bei einigen Körpern zu einfaches Rauschen
Code-Vollständigkeitalle 15+ Himmelskörper, alle Monde vorhandenalle Körper vorhanden, einige Monde vereinfacht
Interaktivitätflüssige Orbit-Steuerung, Info-Panel, Zeitbeschleunigungähnliche Steuerung, UI weniger fein
Post-ProcessingUnrealBloomPass sauber abgestimmtBloom vorhanden, aber weniger raffiniert
Stabilitätstabile 60 fpsauf schwächeren GPUs gelegentliche Einbrüche

🏙️ Aufgabe 2: Stadt-Renderer

Höherer Schwierigkeitsgrad: ein Echtzeit-Stadt-Renderer mit 50+ justierbaren Parametern — prozedurale unendliche Stadt, dynamischer Tag-Nacht-Zyklus, atmosphärische Streuung, dichte 3D-Bebauung (jedes Gebäude eigene Textur).

Ergebnisse

ModellRunde 1Runde 2 (Feinschliff)GebäudedichteTexturqualität
Qwen3.8Maxunter 10 Minutenunter 10 Minuten⭐⭐⭐⭐⭐ dicht und vielfältig⭐⭐⭐⭐ gute prozedurale Texturen
GPT-5.6 Sol11 Minuten33 Minuten⭐⭐⭐⭐ dicht⭐⭐⭐⭐⭐ exzellente Details
Kimi K33 Stunden+❌ abgebrochen⭐⭐⭐ mittelmäßig⭐⭐⭐ brauchbar
🚨 Kimi K3 ist gescheitert
Kimi K3 brauchte in der ersten Runde über 3 Stunden und hat in der zweiten direkt aufgegeben. Die Stadt-Renderer-Aufgabe offenbart die Schwäche von K3 bei komplexem, performance-kritischem 3D-Code mit vielen gekoppelten Systemen (Straßen, Verkehr, Beleuchtung, Gebäudegenerierung).

📊 Kernergebnisse

🏎️ Geschwindigkeit

Qwen3.8Max ist der Geschwindigkeitskönig — beide Runden zusammen unter 10 Minuten. GPT-5.6 Sol bleibt stabil bei ~11 Minuten pro Aufgabe. Kimi K3 ist bei komplexen Aufgaben 3–4-mal langsamer.

🎨 Qualität

GPT-5.6 Sol liefert die höchste visuelle Qualität — raffinierte Shader, organischeres Rauschen, besser abgestimmtes Post-Processing. Qwen3.8Max tauscht etwas visuellen Feinschliff gegen Geschwindigkeit ein. Kimi K3s Output ist brauchbar, aber nicht filmreif.

🔧 Zuverlässigkeit

GPT-5.6 Sol ist am zuverlässigsten — beide Aufgaben vollständig abgeschlossen. Qwen3.8Max ist schnell, braucht aber eventuell eine Nachbesserungsrunde. Kimi K3 droht bei komplexen Multi-System-Aufgaben abzubrechen.

🎮 Live-Demos — selbst ausprobieren

Dies sind die echten Outputs der einzelnen Modelle. Im Browser öffnen und visuelle Qualität, Interaktivität und Performance vergleichen:

☀️ Sonnensystem-Simulator

ModellGenerierungszeitDemo
GPT-5.6 Sol11 Minuten🚀 Demo starten →
Kimi K345 Minuten🚀 Demo starten →

🌃 Stadt-Renderer

ModellGenerierungszeitDemo
GPT-5.6 Sol11 + 33 Minuten🚀 Demo starten →
Kimi K33 Stunden+🚀 Demo starten →
Qwen3.8Maxunter 10 Minuten × 2🚀 Demo starten →

🎯 Erkenntnisse für Entwickler

💡 Modell-Auswahlleitfaden
  • Maximale visuelle Qualität? → GPT-5.6 Sol (Codex). Beste Shader, edelster Output.
  • Maximale Geschwindigkeit? → Qwen3.8Max. Rasend schnell, für Prototyping reicht die Qualität.
  • Komplexe Multi-System-3D? → Kimi K3 vorerst meiden. Stark bei einfachen Aufgaben, überfordert bei gekoppelten Systemen.
  • Kostenkritisch? → Qwen3.8Max bietet das beste Zeit-Qualitäts-Verhältnis.

Der Abstand zwischen den Modellen ist nicht nur Geschwindigkeit — es ist die Komplexitätsdecke. GPT-5.6 Sol schafft Prompts mit 15+ voneinander abhängigen Shader-Systemen. Qwen3.8Max ist schnell, braucht aber eventuell Nachbesserung. Kimi K3 hat bei komplexen 3D-Aufgaben eine niedrigere Decke.

Für Single-File-HTML-Generierung — dieser neue „Vibe-Coding"-Benchmark — führt GPT-5.6 Sol bei der Qualität, Qwen3.8Max beim Durchsatz. Nach Bedarf wählen.

📎 Quellcode

Der gesamte Code, alle Prompts und Testergebnisse sind Open Source: github.com/OBdangshang07/AI_project

Getestet hat der GitHub-Nutzer OBdangshang07. Die Demos nutzen die originalen HTML-Output-Dateien.