Sourced News

Atom Brief

Di., 21. Juli 2026 · 0 Meldungen · Bestätigt · Abonnieren
Tech

Berkeley-Studie: KI-Agenten scheitern an echten Jobs

Der Test Agents' Last Exam prüfte über 1.500 Aufgaben in 55 Berufen. In der schwierigsten Kategorie versagten alle Modelle.

  • Der beste Agent löste nur 25,2 Prozent der ALE-CLI-Aufgaben, verglichen mit 82,0 Prozent bei Terminal-Bench und 59,1 Prozent bei SWE-bench-Pro.
  • Keines der getesteten Spitzenmodelle, darunter Fable 5, erreichte in der schwierigsten Stufe einen Erfolg.
  • Die Kosten pro Aufgabe lagen bei 15,70 US-Dollar für Fable 5 und bei 1,33 US-Dollar für Composer 2.5.

Warum das wichtig ist: Kein Arbeitgeber zahlt für eine Erfolgsquote von 25 Prozent. Daran ändern auch Algorithmen nichts.

UC Berkeley RDI (Center for Responsible, Decentralized Intelligence) — 'Agents' Last Exam' study ↗ · 20. Juli 202620.7.26 · ✓ Geprüft