IBM Research verkleint foutenmarge bij herhaalde taken voor AI-agenten

GPT-4.1 loste AppWorld-taken 77% van de tijd op, maar herhaalde datzelfde succes in vijf opeenvolgende pogingen slechts 53% van de tijd.
- De Consistency Analyzer hertest elk beslispunt van de agent vijf keer om op goed geluk genomen stappen op te sporen.
- De Pass^5-consistentie steeg van 53,0% naar 69,0%, een winst van 16 punten op AppWorld.
- Moeilijke taken van gemiddeld niveau stegen met 22,9 punten; gerelateerde taken verbeterden met 13,0 punten op basis van dezelfde richtlijnen.
Waarom dit ertoe doet: Eenmalig slagen en bij een herhaling falen betekent dat de vaardigheid er nooit was, enkel geluk.