IBM Research сократила почти вдвое число сбоев ИИ-агентов при повторяющихся задачах

Модель GPT-4.1 успешно решала задачи AppWorld в 77% случаев, но выдавала тот же результат в пяти попытках подряд лишь в 53% случаев.
- Инструмент Consistency Analyzer проверяет каждую точку принятия решений агента пять раз, чтобы отсечь случайные шаги.
- Показатель согласованности Pass^5 вырос с 53,0% до 69,0%, прибавив 16 пунктов на тестах AppWorld.
- Результаты в задачах средней сложности выросли на 22,9 пункта, а в смежных задачах улучшились на 13,0 пунктов при тех же правилах.
Почему это важно: Успех с первой попытки и провал при повторении означают, что навыка на самом деле не было, а была лишь удача.