IBM Research, YZ Ajanlarının Tekrar Eden Görev Başarısızlığını Neredeyse Yarıya İndirdi

GPT-4.1 AppWorld görevlerini yüzde 77 oranında çözerken, arka arkaya beş denemede aynı başarıyı sadece yüzde 53 oranında tekrarladı.
- Tutarlılık Analizcisi, tura-yazı adımlarını yakalamak için her ajan karar noktasını beş kez yeniden örnekliyor.
- Pass^5 tutarlılığı AppWorld'de yüzde 53,0'ten yüzde 69,0'a yükselerek 16 puanlık bir artış gösterdi.
- Orta zorluktaki görevler 22,9 puan arttı; benzer görevler aynı yönergelerden yüzde 13,0 oranında iyileşti.
Neden önemli: Bir kez başarılı olup tekrar denendiğinde başarısız olmak, becerinin hiç var olmadığını, sadece şans olduğunu gösterir.