Sourced News

Atom Brief

Sel, 21 Jul 2026 · 0 berita · Terverifikasi · Berlangganan
Tech

Studi Berkeley Uji Agen AI di Pekerjaan Nyata: Skor Tertinggi 25%

Ujian The Agents' Last Exam menguji lebih dari 1.500 tugas di 55 profesi, dan semua model gagal total di tingkat tersulit.

  • Agen terbaik hanya lulus 25,2% pada ALE-CLI, dibandingkan 82,0% pada Terminal-Bench dan 59,1% pada SWE-bench-Pro.
  • Semua agen canggih yang diuji, termasuk Fable 5, mencetak nol persen pada tingkat tersulit.
  • Biaya operasional Fable 5 mencapai 15,70 dolar AS per tugas, sementara Composer 2.5 hanya 1,33 dolar AS.

Mengapa ini penting: Tidak ada pemberi kerja yang mau membayar pekerja dengan tingkat keberhasilan satu dari empat, dan algoritma belum mengubah hitungan tersebut.

UC Berkeley RDI (Center for Responsible, Decentralized Intelligence) — 'Agents' Last Exam' study ↗ · 20 Jul 202620/7/26 · ✓ Terverifikasi