Sourced News

Atom Brief

Thứ 3, 21 thg 7, 2026 · 0 tin · Đã kiểm chứng · Đăng ký
Tech

Nghiên cứu Berkeley: AI chỉ đạt 25% hiệu suất công việc thực tế

Bài kiểm tra The Agents' Last Exam thực hiện hơn 1.500 tác vụ trên 55 ngành nghề, kết quả cho thấy mọi mô hình đều thất bại ở cấp độ khó nhất.

  • Mô hình tốt nhất chỉ đạt 25,2% ở bài kiểm tra ALE-CLI, so với 82,0% ở Terminal-Bench và 59,1% ở SWE-bench-Pro.
  • Tất cả các tác nhân AI hàng đầu, bao gồm Fable 5, đều đạt 0% ở cấp độ khó nhất.
  • Chi phí vận hành Fable 515,70 USD mỗi tác vụ, trong khi Composer 2.5 chỉ tốn 1,33 USD.

Vì sao quan trọng: Không nhà tuyển dụng nào trả lương cho nhân viên có tỷ lệ thành công 25%, và thuật toán hiện nay chưa thay đổi được thực tế đó.

UC Berkeley RDI (Center for Responsible, Decentralized Intelligence) — 'Agents' Last Exam' study ↗ · 20 thg 7, 202620/7/26 · ✓ Xác minh