News, Fast

Atom Brief

15 wrz 2026 · Archiwum
Tech

IBM Research prawie o połowę zmniejsza odsetek błędów agentów AI

IBM Research prawie o połowę zmniejsza odsetek błędów agentów AI

Model GPT-4.1 rozwiązywał zadania z bazy AppWorld w 77% przypadków, ale powtórzył sukces w pięciu kolejnych próbach już tylko w 53% sytuacji.

  • Analizator Spójności testuje każdą decyzję agenta pięć razy, aby wychwycić przypadkowe trafienia.
  • Wskaźnik spójności Pass^5 wzrósł z 53,0% do 69,0%, co oznacza skok o 16 punktów procentowych w zadaniach AppWorld.
  • Zadania o średnim stopniu trudności poprawiły się o 22,9 punktu, a zadania powiązane o 13,0 punktów przy tych samych wytycznych.

Dlaczego to ważne: Odniesienie sukcesu raz i porażka przy próbie powtórzenia oznacza, że umiejętności tak naprawdę nie było, a decydował przypadek.

Hugging Face ↗ · 15 wrz 202615.09.26