IBM Research réduit presque de moitié les échecs répétés des agents IA

GPT-4.1 a résolu les tâches d'AppWorld dans 77 % des cas, mais n'a reproduit ce succès lors de cinq essais d'affilée que dans 53 % des cas.
- L'analyseur de cohérence réévalue chaque décision d'agent cinq fois pour repérer les étapes aléatoires.
- La cohérence Pass^5 est passée de 53,0 % à 69,0 %, soit un gain de 16 points sur AppWorld.
- Les tâches de difficulté moyenne ont progressé de 22,9 points et les tâches connexes de 13,0 points avec les mêmes consignes.
Pourquoi c'est important: Réussir une fois et échouer au test suivant prouve que la compétence n'était pas acquise, c'était juste de la chance.