Sourced News

Atom Brief

mar 21 lug 2026 · 0 notizie · Verificato · Iscriviti
Tech

Studio di Berkeley: agenti AI al lavoro, successo al 25%

Il test Agents' Last Exam ha analizzato oltre 1.500 compiti in 55 professioni: nessun modello ha superato il livello di difficoltà più alto.

  • Il miglior agente ha completato solo il 25,2% dei test ALE-CLI, a fronte dell'82,0% su Terminal-Bench e del 59,1% su SWE-bench-Pro.
  • Tutti gli agenti di frontiera testati, incluso Fable 5, hanno ottenuto zero nel livello di difficoltà massimo.
  • Il costo per compito è stato di 15,70 dollari per Fable 5 e di 1,33 dollari per Composer 2.5.

Perché conta: Nessun datore di lavoro paga un dipendente con un tasso di successo del 25% e nessun algoritmo cambia questa realtà.

UC Berkeley RDI (Center for Responsible, Decentralized Intelligence) — 'Agents' Last Exam' study ↗ · 20 lug 202620/07/26 · ✓ Verificato