Berkeley Araştırması: Yapay Zeka Ajanları İş Başında %25 Başarıda
Agents' Last Exam testi 55 meslek dalında 1.500'den fazla görevi inceledi; tüm modeller en zor seviyede sınıfta kaldı.
- En başarılı ajan ALE-CLI testinde %25,2 başarı gösterdi. Terminal-Bench skoru %82,0, SWE-bench-Pro skoru ise %59,1 oldu.
- Fable 5 dahil test edilen tüm güncel yapay zeka ajanları, en zor seviyede sıfır puan aldı.
- Fable 5 görev başına 15,70 dolar maliyet çıkarırken, Composer 2.5'in maliyeti 1,33 dolarda kaldı.
Neden önemli: Hiçbir işveren dörtte bir başarı oranına sahip bir çalışana maaş ödemez. Algoritmalar henüz bu gerçeği değiştiremiyor.
UC Berkeley RDI (Center for Responsible, Decentralized Intelligence) — 'Agents' Last Exam' study ↗ · 20 Tem 202620.07.26 · ✓ Teyitli✓