Berkeley-Studie: KI-Agenten scheitern an echten Jobs
Der Test Agents' Last Exam prüfte über 1.500 Aufgaben in 55 Berufen. In der schwierigsten Kategorie versagten alle Modelle.
- Der beste Agent löste nur 25,2 Prozent der ALE-CLI-Aufgaben, verglichen mit 82,0 Prozent bei Terminal-Bench und 59,1 Prozent bei SWE-bench-Pro.
- Keines der getesteten Spitzenmodelle, darunter Fable 5, erreichte in der schwierigsten Stufe einen Erfolg.
- Die Kosten pro Aufgabe lagen bei 15,70 US-Dollar für Fable 5 und bei 1,33 US-Dollar für Composer 2.5.
Warum das wichtig ist: Kein Arbeitgeber zahlt für eine Erfolgsquote von 25 Prozent. Daran ändern auch Algorithmen nichts.
UC Berkeley RDI (Center for Responsible, Decentralized Intelligence) — 'Agents' Last Exam' study ↗ · 20. Juli 202620.7.26 · ✓ Geprüft✓