Blog bewertet zwölf KI-Modelle in vier Apps
TryAI hat alle zwölf Einträge selbst erstellt und bewertet, ohne unabhängige Prüfung.
- Claude Fable 5 löste als einziges Modell den Zauberwürfel in allen fünf Versuchen.
- GPT-5.6 Luna antwortete am schnellsten (1,0 Sekunden) und am günstigsten (0,001 Dollar pro Lauf).
- Grok 4.5 erreichte bei schwierigen Aufgaben das Niveau von Claude Opus 4.8 bei niedrigeren Kosten.
Warum das wichtig ist: Die Seite, die den Benchmark entwarf, hat ihn auch bewertet und als unabhängigen Beweis veröffentlicht.
TryAI blog (official benchmark post) ↗ · 10. Juli 202610.7.26