News, Fast

Atom Brief

15 Eyl 2026 · Arşiv
Tech

IBM Research, YZ Ajanlarının Tekrar Eden Görev Başarısızlığını Neredeyse Yarıya İndirdi

IBM Research, YZ Ajanlarının Tekrar Eden Görev Başarısızlığını Neredeyse Yarıya İndirdi

GPT-4.1 AppWorld görevlerini yüzde 77 oranında çözerken, arka arkaya beş denemede aynı başarıyı sadece yüzde 53 oranında tekrarladı.

  • Tutarlılık Analizcisi, tura-yazı adımlarını yakalamak için her ajan karar noktasını beş kez yeniden örnekliyor.
  • Pass^5 tutarlılığı AppWorld'de yüzde 53,0'ten yüzde 69,0'a yükselerek 16 puanlık bir artış gösterdi.
  • Orta zorluktaki görevler 22,9 puan arttı; benzer görevler aynı yönergelerden yüzde 13,0 oranında iyileşti.

Neden önemli: Bir kez başarılı olup tekrar denendiğinde başarısız olmak, becerinin hiç var olmadığını, sadece şans olduğunu gösterir.

Hugging Face ↗ · 15 Eyl 202615.09.26