IBM Research dimezza il tasso di fallimento dei compiti ripetitivi delle IA

GPT-4.1 ha risolto i compiti di AppWorld nel 77% dei casi, ma ha ripetuto lo stesso successo in cinque tentativi consecutivi solo nel 53% dei casi.
- Il Consistency Analyzer ricampiona ogni punto decisionale dell'agente cinque volte per catturare i passaggi casuali.
- La consistenza Pass^5 è balzata dal 53,0% al 69,0%, con un guadagno di 16 punti su AppWorld.
- I compiti di media difficoltà sono aumentati di 22,9 punti; i compiti correlati sono migliorati di 13,0 punti con le stesse linee guida.
Perché conta: Riuscire una volta e fallire al nuovo tentativo significa che l'abilità non c'era mai, c'era solo fortuna.