News, Fast

Atom Brief

15 sep 2026 · Archief
Tech

IBM Research verkleint foutenmarge bij herhaalde taken voor AI-agenten

IBM Research verkleint foutenmarge bij herhaalde taken voor AI-agenten

GPT-4.1 loste AppWorld-taken 77% van de tijd op, maar herhaalde datzelfde succes in vijf opeenvolgende pogingen slechts 53% van de tijd.

  • De Consistency Analyzer hertest elk beslispunt van de agent vijf keer om op goed geluk genomen stappen op te sporen.
  • De Pass^5-consistentie steeg van 53,0% naar 69,0%, een winst van 16 punten op AppWorld.
  • Moeilijke taken van gemiddeld niveau stegen met 22,9 punten; gerelateerde taken verbeterden met 13,0 punten op basis van dezelfde richtlijnen.

Waarom dit ertoe doet: Eenmalig slagen en bij een herhaling falen betekent dat de vaardigheid er nooit was, enkel geluk.

Hugging Face ↗ · 15 sep 202615-9-26