Sourced News

Atom Brief

wt., 21 lip 2026 · 0 wiadomości · Potwierdzone · Subskrybuj
Tech

Badanie z Berkeley: agenci AI wykonują tylko 25% zadań

Test The Agents' Last Exam objął ponad 1500 zadań w 55 zawodach. Żaden model nie poradził sobie z najtrudniejszym poziomem.

  • Najlepszy agent zaliczył 25,2% zadań w ALE-CLI, przy 82,0% w Terminal-Bench i 59,1% w SWE-bench-Pro.
  • Wszystkie testowane modele, w tym Fable 5, uzyskały zero procent skuteczności na najtrudniejszym poziomie.
  • Koszt wykonania zadania przez Fable 5 wyniósł 15,70 USD, a przez Composer 2.5 zaledwie 1,33 USD.

Dlaczego to ważne: Żaden pracodawca nie płaci za 25-procentową skuteczność, a obecne algorytmy tego nie zmieniają.

UC Berkeley RDI (Center for Responsible, Decentralized Intelligence) — 'Agents' Last Exam' study ↗ · 20 lip 202620.07.26 · ✓ Sprawdzone