Un singolo blog valuta dodici modelli di IA su quattro app
TryAI ha costruito e giudicato tutte e dodici le voci da solo, segnando cinque tentativi per compito senza arbitro o audit esterno.
- Claude Fable 5 da solo ha risolto il cubo di Rubik in modo pulito in tutti e cinque i tentativi.
- GPT-5.6 Luna ha risposto più velocemente, a 1,0 secondi, ed è stato il più economico, a 0,001 dollari per esecuzione.
- Grok 4.5 ha eguagliato Claude Opus 4.8 su compiti difficili pur costando notevolmente meno.
Perché conta: Il sito che ha progettato il benchmark lo ha anche giudicato, poi ha pubblicato la classifica come prova indipendente.
TryAI blog (official benchmark post) ↗ · 10 lug 202610/07/26