News, Fast

Atom Brief

15 сент. 2026 г. · Архив
Tech

IBM Research сократила почти вдвое число сбоев ИИ-агентов при повторяющихся задачах

IBM Research сократила почти вдвое число сбоев ИИ-агентов при повторяющихся задачах

Модель GPT-4.1 успешно решала задачи AppWorld в 77% случаев, но выдавала тот же результат в пяти попытках подряд лишь в 53% случаев.

  • Инструмент Consistency Analyzer проверяет каждую точку принятия решений агента пять раз, чтобы отсечь случайные шаги.
  • Показатель согласованности Pass^5 вырос с 53,0% до 69,0%, прибавив 16 пунктов на тестах AppWorld.
  • Результаты в задачах средней сложности выросли на 22,9 пункта, а в смежных задачах улучшились на 13,0 пунктов при тех же правилах.

Почему это важно: Успех с первой попытки и провал при повторении означают, что навыка на самом деле не было, а была лишь удача.

Hugging Face ↗ · 15 сент. 2026 г.15.09.26