Badanie z Berkeley: agenci AI wykonują tylko 25% zadań
Test The Agents' Last Exam objął ponad 1500 zadań w 55 zawodach. Żaden model nie poradził sobie z najtrudniejszym poziomem.
- Najlepszy agent zaliczył 25,2% zadań w ALE-CLI, przy 82,0% w Terminal-Bench i 59,1% w SWE-bench-Pro.
- Wszystkie testowane modele, w tym Fable 5, uzyskały zero procent skuteczności na najtrudniejszym poziomie.
- Koszt wykonania zadania przez Fable 5 wyniósł 15,70 USD, a przez Composer 2.5 zaledwie 1,33 USD.
Dlaczego to ważne: Żaden pracodawca nie płaci za 25-procentową skuteczność, a obecne algorytmy tego nie zmieniają.
UC Berkeley RDI (Center for Responsible, Decentralized Intelligence) — 'Agents' Last Exam' study ↗ · 20 lip 202620.07.26 · ✓ Sprawdzone✓