Studio di Berkeley: agenti AI al lavoro, successo al 25%
Il test Agents' Last Exam ha analizzato oltre 1.500 compiti in 55 professioni: nessun modello ha superato il livello di difficoltà più alto.
- Il miglior agente ha completato solo il 25,2% dei test ALE-CLI, a fronte dell'82,0% su Terminal-Bench e del 59,1% su SWE-bench-Pro.
- Tutti gli agenti di frontiera testati, incluso Fable 5, hanno ottenuto zero nel livello di difficoltà massimo.
- Il costo per compito è stato di 15,70 dollari per Fable 5 e di 1,33 dollari per Composer 2.5.
Perché conta: Nessun datore di lavoro paga un dipendente con un tasso di successo del 25% e nessun algoritmo cambia questa realtà.
UC Berkeley RDI (Center for Responsible, Decentralized Intelligence) — 'Agents' Last Exam' study ↗ · 20 lug 202620/07/26 · ✓ Verificato✓