Ich habe alle 12 Ergebnisse gelesen und bewertet: Kreativität, Design, Interaktion, Codequalität und Ambition (Freie Wahl) bzw. Pflichtfeatures, UX-Extras und Polish (Kanban). Max. 50 Punkte pro Track, 100 insgesamt.
Summe aus Freier Wahl + Gleiches Thema. Opus 5 gewinnt beide Tracks klar.
| # | Modell | Freie Wahl | Kanban | Gesamt |
|---|---|---|---|---|
| 1 | Claude Opus 5 | 47 | 49 | 96 / 100 |
| 2 | Cursor Auto | 40 | 37 | 77 / 100 |
| 3 | Cursor Grok 4.5 | 41 | 35 | 76 / 100 |
| 4 | Claude Fable 5 | 38 | 38 | 76 / 100 |
| 5 | GPT-5.6 | 31 | 39 | 70 / 100 |
| 6 | Composer 2.5 | 34 | 29 | 63 / 100 |
Grok und Fable liegen bei 76 gleichauf — Grok vorne wegen stärkerer Freier Wahl (AETHER), Fable ausgeglichener und beim Kanban-DnD solider.
Pro Track die Einzelkriterien und Kurzfazit.
Kreativität · Visuelles Design · Interaktivität · Codequalität · Technische Ambition
Pflichtfeatures · Visuelles Design · UX-Extras · Codequalität · Produktions-Polish
Code-Review der Dateien, nicht nur Optik. DnD-Reorder, LocalStorage-Edge-Cases und echte Feature-Tiefe zählen extra.
Claude Opus 5 ist der klare Sieger: KOSMOS als echte Physik-Sandbox und FlowBoard als einziges Kanban mit Pointer-DnD, Touch, Reorder und robuster Persistenz. Cursor Auto und Grok 4.5 punkten mit starker Design-Identität in der Freien Wahl. GPT-5.6 liefert solide Utility-Apps und das zweitbeste Kanban, bleibt aber bei freier Kreativität hinter dem Feld. Composer 2.5 schließt ab — funktioniert, aber mit dem schwächsten Kanban (u. a. LocalStorage-Bug bei leerem Board).