AIエージェントの実務能力は最大25%、UCバークレーが調査
UCバークレーの研究チームが55職種・1500以上のタスクでAIを評価。最難関レベルでは全モデルが失敗した。
- 最高性能のAIでもALE-CLIの達成率は25.2%。Terminal-Benchの82.0%、SWE-bench-Proの59.1%と比較して低調。
- Fable 5を含む主要なAIモデルは、最難関レベルのタスクで正答率0%だった。
- 1タスクあたりのコストはFable 5が15.70ドル、Composer 2.5が1.33ドル。
なぜ重要か: 成功率25%の労働者を雇う企業はない。AIが実務で通用するには、まだ大きな壁がある。
UC Berkeley RDI (Center for Responsible, Decentralized Intelligence) — 'Agents' Last Exam' study ↗ · 2026年7月20日26/7/20 · ✓ 確認済✓