Sourced News

Atom Brief

di 21 jul 2026 · 0 berichten · Bevestigd · Abonneren
Tech

Berkeley-studie toetst AI-agenten: slechts 25 procent slaagt

Het Agents' Last Exam testte ruim 1.500 taken in 55 beroepen. Geen enkel model haalde de moeilijkste categorie.

  • De beste agent haalde 25,2% op ALE-CLI, tegenover 82,0% op Terminal-Bench en 59,1% op SWE-bench-Pro.
  • Elk getest topmodel, waaronder Fable 5, scoorde nul procent in de zwaarste categorie.
  • Fable 5 kostte 15,70 dollar per taak, tegenover 1,33 dollar voor Composer 2.5.

Waarom dit ertoe doet: Geen werkgever betaalt voor een slagingskans van één op vier. Vooralsnog verandert geen enkel algoritme die rekensom.

UC Berkeley RDI (Center for Responsible, Decentralized Intelligence) — 'Agents' Last Exam' study ↗ · 20 jul 202620-7-26 · ✓ Gecheckt