Sourced News

Atom Brief

2026年7月21日(火) · 0 · 確認済み · 登録する
Tech

AIエージェントの実務能力は最大25%、UCバークレーが調査

UCバークレーの研究チームが55職種・1500以上のタスクでAIを評価。最難関レベルでは全モデルが失敗した。

  • 最高性能のAIでもALE-CLIの達成率は25.2%。Terminal-Benchの82.0%、SWE-bench-Proの59.1%と比較して低調。
  • Fable 5を含む主要なAIモデルは、最難関レベルのタスクで正答率0%だった。
  • 1タスクあたりのコストはFable 515.70ドル、Composer 2.51.33ドル。

なぜ重要か: 成功率25%の労働者を雇う企業はない。AIが実務で通用するには、まだ大きな壁がある。

UC Berkeley RDI (Center for Responsible, Decentralized Intelligence) — 'Agents' Last Exam' study ↗ · 2026年7月20日26/7/20 · ✓ 確認済