Sourced News

Atom Brief

вт, 21 июл. 2026 г. · 0 историй · Подтверждено · Подписаться
Tech

Исследование Беркли: ИИ-агенты справляются лишь с 25% задач

В рамках теста The Agents' Last Exam модели выполнили более 1500 заданий в 55 профессиях, но провалились на самом сложном уровне.

  • Лучший агент выполнил 25,2% задач ALE-CLI против 82,0% в Terminal-Bench и 59,1% в SWE-bench-Pro.
  • Все протестированные передовые модели, включая Fable 5, показали нулевой результат на самом сложном уровне.
  • Стоимость выполнения одной задачи для Fable 5 составила 15,70 доллара, для Composer 2.51,33 доллара.

Почему это важно: Работодатели не платят сотрудникам за эффективность в 25%, и алгоритмы пока не меняют эту экономическую реальность.

UC Berkeley RDI (Center for Responsible, Decentralized Intelligence) — 'Agents' Last Exam' study ↗ · 20 июл. 2026 г.20.07.26 · ✓ Проверено