IBM 연구소, 인공지능 에이전트 반복 작업 실패율 절반으로 낮춰

GPT-4.1은 앱월드 과제를 77% 성공했으나 동일한 성공을 5번 연속으로 유지한 비율은 53%에 그쳤다.
- 일관성 분석기는 동전 던지기 같은 단계를 잡아내기 위해 각 에이전트의 결정 지점을 다섯 번 재표본 추출한다.
- 앱월드에서 패스 파이브 일관성 수치는 53.0%에서 69.0%로 16포인트 상승했다.
- 중간 난이도 과제는 22.9포인트 상승했으며 동일한 지침에서 유도된 유사 과제들은 13.0포인트 개선되었다.
왜 중요한가: 한 번 성공하고 재시도에서 실패한다는 것은 기술이 애초에 존재하지 않았고 오직 행운뿐이었음을 뜻한다.