News, Fast

Atom Brief

10 lug 2026 · Archivio
Tech

Un singolo blog valuta dodici modelli di IA su quattro app

TryAI ha costruito e giudicato tutte e dodici le voci da solo, segnando cinque tentativi per compito senza arbitro o audit esterno.

  • Claude Fable 5 da solo ha risolto il cubo di Rubik in modo pulito in tutti e cinque i tentativi.
  • GPT-5.6 Luna ha risposto più velocemente, a 1,0 secondi, ed è stato il più economico, a 0,001 dollari per esecuzione.
  • Grok 4.5 ha eguagliato Claude Opus 4.8 su compiti difficili pur costando notevolmente meno.

Perché conta: Il sito che ha progettato il benchmark lo ha anche giudicato, poi ha pubblicato la classifica come prova indipendente.

TryAI blog (official benchmark post) ↗ · 10 lug 202610/07/26