Un blog évalue douze modèles d'IA sur quatre applications
TryAI a construit et jugé les douze entrées lui-même, notant cinq tentatives par tâche sans arbitre ni audit externe.
- Claude Fable 5 est le seul à avoir résolu le Rubik's cube proprement lors des cinq essais.
- GPT-5.6 Luna a répondu le plus rapidement, en 1,0 seconde, et le moins cher, à 0,001 dollar par exécution.
- Grok 4.5 a égalé Claude Opus 4.8 sur les tâches difficiles tout en coûtant nettement moins cher.
Pourquoi c'est important: Le site qui a conçu le benchmark l'a aussi jugé, puis a publié le classement comme preuve indépendante.
TryAI blog (official benchmark post) ↗ · 10 juil. 202610/07/26