IA passa em só 25% de testes reais de trabalho, diz Berkeley
O estudo Agents' Last Exam testou mais de 1.500 tarefas em 55 profissões, e nenhum modelo passou dos testes mais difíceis.
- O melhor agente acertou 25,2% no ALE-CLI, contra 82,0% no Terminal-Bench e 59,1% no SWE-bench-Pro.
- Todo agente testado, incluindo o Fable 5, zerou nos testes do nível mais difícil.
- Rodar o Fable 5 custou US$ 15,70 por tarefa; o Composer 2.5 custou US$ 1,33.
Por que importa: Nenhum patrão paga salário por um em cada quatro acertos, e nenhum algoritmo muda essa conta.
UC Berkeley RDI (Center for Responsible, Decentralized Intelligence) — 'Agents' Last Exam' study ↗ · 20 de jul. de 202620/07/26 · ✓ Checado✓