Sourced News

Atom Brief

ter., 21 de jul. de 2026 · 0 notícias · Confirmado · Inscreva-se
Tech

IA passa em só 25% de testes reais de trabalho, diz Berkeley

O estudo Agents' Last Exam testou mais de 1.500 tarefas em 55 profissões, e nenhum modelo passou dos testes mais difíceis.

  • O melhor agente acertou 25,2% no ALE-CLI, contra 82,0% no Terminal-Bench e 59,1% no SWE-bench-Pro.
  • Todo agente testado, incluindo o Fable 5, zerou nos testes do nível mais difícil.
  • Rodar o Fable 5 custou US$ 15,70 por tarefa; o Composer 2.5 custou US$ 1,33.

Por que importa: Nenhum patrão paga salário por um em cada quatro acertos, e nenhum algoritmo muda essa conta.

UC Berkeley RDI (Center for Responsible, Decentralized Intelligence) — 'Agents' Last Exam' study ↗ · 20 de jul. de 202620/07/26 · ✓ Checado