Berkeley-studie toetst AI-agenten: slechts 25 procent slaagt
Het Agents' Last Exam testte ruim 1.500 taken in 55 beroepen. Geen enkel model haalde de moeilijkste categorie.
- De beste agent haalde 25,2% op ALE-CLI, tegenover 82,0% op Terminal-Bench en 59,1% op SWE-bench-Pro.
- Elk getest topmodel, waaronder Fable 5, scoorde nul procent in de zwaarste categorie.
- Fable 5 kostte 15,70 dollar per taak, tegenover 1,33 dollar voor Composer 2.5.
Waarom dit ertoe doet: Geen werkgever betaalt voor een slagingskans van één op vier. Vooralsnog verandert geen enkel algoritme die rekensom.
UC Berkeley RDI (Center for Responsible, Decentralized Intelligence) — 'Agents' Last Exam' study ↗ · 20 jul 202620-7-26 · ✓ Gecheckt✓