Estudio de Berkeley evalúa agentes IA: éxito del 25% en trabajos reales
El estudio Agents' Last Exam ejecutó más de 1,500 tareas en 55 ocupaciones. Ningún modelo superó el nivel de dificultad más alto.
- El mejor agente aprobó solo el 25.2% de ALE-CLI, frente al 82.0% en Terminal-Bench y 59.1% en SWE-bench-Pro.
- Todos los modelos de vanguardia evaluados, incluido Fable 5, obtuvieron un 0% en el nivel más difícil.
- Fable 5 costó 15.70 dólares por tarea, mientras que Composer 2.5 costó solo 1.33 dólares.
Por qué importa: Ningún empleador paga a un trabajador por una tasa de éxito de uno de cada cuatro, y ningún algoritmo cambia esa realidad aritmética.
UC Berkeley RDI (Center for Responsible, Decentralized Intelligence) — 'Agents' Last Exam' study ↗ · 20 jul 202620/7/26 · ✓ Verificado✓