IBM Research halbiert Fehlerrate von KI-Agenten bei Aufgaben

GPT-4.1 löste AppWorld-Aufgaben zwar in 77 Prozent der Fälle, schaffte diesen Erfolg bei fünf Versuchen in Folge jedoch nur zu 53 Prozent.
- Der Consistency Analyzer lässt jeden Agenten bei Entscheidungspunkten fünfmal ansetzen, um Zufallstreffer auszusortieren.
- Die Pass^5-Konsistenz stieg von 53,0 auf 69,0 Prozent, was einem Zuwachs von 16 Punkten bei AppWorld entspricht.
- Mittelschwere Aufgaben legten um 22,9 Punkte zu; ähnliche Aufgaben verbesserten sich durch dieselben Leitlinien um 13,0 Punkte.
Warum das wichtig ist: Wer einmal gewinnt und beim zweiten Versuch scheitert, hatte nie echtes Können, sondern nur Glück.