Studi Berkeley Uji Agen AI di Pekerjaan Nyata: Skor Tertinggi 25%
Ujian The Agents' Last Exam menguji lebih dari 1.500 tugas di 55 profesi, dan semua model gagal total di tingkat tersulit.
- Agen terbaik hanya lulus 25,2% pada ALE-CLI, dibandingkan 82,0% pada Terminal-Bench dan 59,1% pada SWE-bench-Pro.
- Semua agen canggih yang diuji, termasuk Fable 5, mencetak nol persen pada tingkat tersulit.
- Biaya operasional Fable 5 mencapai 15,70 dolar AS per tugas, sementara Composer 2.5 hanya 1,33 dolar AS.
Mengapa ini penting: Tidak ada pemberi kerja yang mau membayar pekerja dengan tingkat keberhasilan satu dari empat, dan algoritma belum mengubah hitungan tersebut.
UC Berkeley RDI (Center for Responsible, Decentralized Intelligence) — 'Agents' Last Exam' study ↗ · 20 Jul 202620/7/26 · ✓ Terverifikasi✓