Sourced News

Atom Brief

21 Tem 2026 Sal · 0 haber · Doğrulandı · Abone ol
Tech

Berkeley Araştırması: Yapay Zeka Ajanları İş Başında %25 Başarıda

Agents' Last Exam testi 55 meslek dalında 1.500'den fazla görevi inceledi; tüm modeller en zor seviyede sınıfta kaldı.

  • En başarılı ajan ALE-CLI testinde %25,2 başarı gösterdi. Terminal-Bench skoru %82,0, SWE-bench-Pro skoru ise %59,1 oldu.
  • Fable 5 dahil test edilen tüm güncel yapay zeka ajanları, en zor seviyede sıfır puan aldı.
  • Fable 5 görev başına 15,70 dolar maliyet çıkarırken, Composer 2.5'in maliyeti 1,33 dolarda kaldı.

Neden önemli: Hiçbir işveren dörtte bir başarı oranına sahip bir çalışana maaş ödemez. Algoritmalar henüz bu gerçeği değiştiremiyor.

UC Berkeley RDI (Center for Responsible, Decentralized Intelligence) — 'Agents' Last Exam' study ↗ · 20 Tem 202620.07.26 · ✓ Teyitli