Исследование Беркли: ИИ-агенты справляются лишь с 25% задач
В рамках теста The Agents' Last Exam модели выполнили более 1500 заданий в 55 профессиях, но провалились на самом сложном уровне.
- Лучший агент выполнил 25,2% задач ALE-CLI против 82,0% в Terminal-Bench и 59,1% в SWE-bench-Pro.
- Все протестированные передовые модели, включая Fable 5, показали нулевой результат на самом сложном уровне.
- Стоимость выполнения одной задачи для Fable 5 составила 15,70 доллара, для Composer 2.5 — 1,33 доллара.
Почему это важно: Работодатели не платят сотрудникам за эффективность в 25%, и алгоритмы пока не меняют эту экономическую реальность.
UC Berkeley RDI (Center for Responsible, Decentralized Intelligence) — 'Agents' Last Exam' study ↗ · 20 июл. 2026 г.20.07.26 · ✓ Проверено✓