Sourced News

Atom Brief

2026년 7월 21일 (화) · 0 · 확인됨 · 구독하기
Tech

버클리대 AI 에이전트 실무 평가, 성공률 25%에 그쳐

55개 직종에서 1,500개 이상의 과제를 수행한 '에이전트 라스트 이그잼(ALE)' 테스트 결과, 모든 모델이 최고 난이도 단계에서 전원 실패했다.

  • 최고 성능 모델의 ALE-CLI 성공률은 25.2%에 불과했다. 터미널 벤치(82.0%)나 SWE-벤치 프로(59.1%) 결과보다 현저히 낮다.
  • 페이블 5(Fable 5)를 포함한 모든 최신 AI 에이전트가 최고 난이도 과제에서 성공률 0%를 기록했다.
  • 과제당 비용은 페이블 515.70달러, 컴포저 2.5(Composer 2.5)가 1.33달러였다.

왜 중요한가: 기업은 25%의 성공률을 보이는 노동자에게 급여를 지급하지 않으며, AI 알고리즘도 이 경제적 현실을 바꾸지 못했다.

UC Berkeley RDI (Center for Responsible, Decentralized Intelligence) — 'Agents' Last Exam' study ↗ · 2026년 7월 20일26. 7. 20. · ✓ 확인