News, Fast

Atom Brief

15. Sept. 2026 · Archiv
Tech

IBM Research halbiert Fehlerrate von KI-Agenten bei Aufgaben

IBM Research halbiert Fehlerrate von KI-Agenten bei Aufgaben

GPT-4.1 löste AppWorld-Aufgaben zwar in 77 Prozent der Fälle, schaffte diesen Erfolg bei fünf Versuchen in Folge jedoch nur zu 53 Prozent.

  • Der Consistency Analyzer lässt jeden Agenten bei Entscheidungspunkten fünfmal ansetzen, um Zufallstreffer auszusortieren.
  • Die Pass^5-Konsistenz stieg von 53,0 auf 69,0 Prozent, was einem Zuwachs von 16 Punkten bei AppWorld entspricht.
  • Mittelschwere Aufgaben legten um 22,9 Punkte zu; ähnliche Aufgaben verbesserten sich durch dieselben Leitlinien um 13,0 Punkte.

Warum das wichtig ist: Wer einmal gewinnt und beim zweiten Versuch scheitert, hatte nie echtes Können, sondern nur Glück.

Hugging Face ↗ · 15. Sept. 202615.9.26