Sourced News

Atom Brief

2026年7月21日週二 · 0 篇報導 · 已查證 · 訂閱
Tech

柏克萊研究實測 AI 代理人:實際工作成功率僅 25%

「代理人期末考」(Agents' Last Exam)針對 55 種職業進行超過 1,500 項任務測試,所有模型在最高難度等級全數掛零。

  • 表現最佳的 AI 代理人在 ALE-CLI 測試中僅通過 25.2%,遠低於 Terminal-Bench 的 82.0% 與 SWE-bench-Pro 的 59.1%
  • 包括 Fable 5 在內的所有頂尖模型,在最高難度測試中得分均為 0%
  • Fable 5 每項任務成本為 15.70 美元,而 Composer 2.5 僅需 1.33 美元。

為什麼重要: 沒有雇主會為僅有四分之一成功率的員工買單,演算法也無法改變這項經濟現實。

UC Berkeley RDI (Center for Responsible, Decentralized Intelligence) — 'Agents' Last Exam' study ↗ · 2026年7月20日26/7/20 · ✓ 已查證