IBM Reduz Quase à Metade a Instabilidade dos Agentes de IA

O GPT-4.1 resolveu tarefas do AppWorld em 77% das vezes, mas repetiu o mesmo acerto cinco vezes seguidas em apenas 53% delas.
- O Consistency Analyzer refaz cada decisão do agente cinco vezes para achar os pontos instáveis.
- A taxa de acerto repetido saltou de 53,0% para 69,0% no AppWorld, ganho de 16 pontos.
- Tarefas de dificuldade média subiram 22,9 pontos; tarefas relacionadas ganharam 13,0 pontos com as mesmas diretrizes.
Por que importa: Acertar uma vez não é competência, é sorte que ainda não foi testada duas vezes.