柏克萊研究實測 AI 代理人:實際工作成功率僅 25%
「代理人期末考」(Agents' Last Exam)針對 55 種職業進行超過 1,500 項任務測試,所有模型在最高難度等級全數掛零。
- 表現最佳的 AI 代理人在 ALE-CLI 測試中僅通過 25.2%,遠低於 Terminal-Bench 的 82.0% 與 SWE-bench-Pro 的 59.1%。
- 包括 Fable 5 在內的所有頂尖模型,在最高難度測試中得分均為 0%。
- Fable 5 每項任務成本為 15.70 美元,而 Composer 2.5 僅需 1.33 美元。
為什麼重要: 沒有雇主會為僅有四分之一成功率的員工買單,演算法也無法改變這項經濟現實。
UC Berkeley RDI (Center for Responsible, Decentralized Intelligence) — 'Agents' Last Exam' study ↗ · 2026年7月20日26/7/20 · ✓ 已查證✓