IBM 研究將 AI 代理重複任務失敗率減半

GPT-4.1 在 77% 的情況下解決了 AppWorld 任務,但在連續五次嘗試中重複相同成功的機率僅有 53%。
- 一致性分析器對每個代理決策點進行五次重新採樣,以捕捉靠運氣的步驟。
- Pass^5 一致性從 53.0% 跳升至 69.0%,在 AppWorld 上提升了 16 個百分點。
- 中等難度任務上升 22.9 個百分點;根據相同的準則,相關任務提升了 13.0 個百分點。
為什麼重要: 成功一次但在重試時失敗,意味著這項技能從未真正具備,純粹只是運氣。