IBM Research prawie o połowę zmniejsza odsetek błędów agentów AI

Model GPT-4.1 rozwiązywał zadania z bazy AppWorld w 77% przypadków, ale powtórzył sukces w pięciu kolejnych próbach już tylko w 53% sytuacji.
- Analizator Spójności testuje każdą decyzję agenta pięć razy, aby wychwycić przypadkowe trafienia.
- Wskaźnik spójności Pass^5 wzrósł z 53,0% do 69,0%, co oznacza skok o 16 punktów procentowych w zadaniach AppWorld.
- Zadania o średnim stopniu trudności poprawiły się o 22,9 punktu, a zadania powiązane o 13,0 punktów przy tych samych wytycznych.
Dlaczego to ważne: Odniesienie sukcesu raz i porażka przy próbie powtórzenia oznacza, że umiejętności tak naprawdę nie było, a decydował przypadek.