Sourced News

Atom Brief

الثلاثاء، 21 يوليو 2026 · 0 أخبار · مؤكَّد · اشترك
Tech

دراسة من بيركلي: وكلاء الذكاء الاصطناعي ينجحون في 25% من المهام فقط

أخضع اختبار "اختبار الوكلاء الأخير" (ALE) النماذج لأكثر من 1500 مهمة في 55 وظيفة، وفشلت جميعها في المستوى الأكثر تعقيداً.

  • سجل أفضل وكيل ذكاء اصطناعي 25.2% في اختبار ALE-CLI، مقابل 82.0% في Terminal-Bench و59.1% في SWE-bench-Pro.
  • فشلت جميع النماذج المتقدمة، بما فيها Fable 5، في تحقيق أي نتيجة في المستوى الأصعب.
  • بلغت تكلفة تشغيل Fable 5 نحو 15.70 دولاراً للمهمة، مقابل 1.33 دولار فقط لنموذج Composer 2.5.

لماذا هذا مهم: لا يوظف أصحاب العمل أحداً بنسبة نجاح 25%، والخوارزميات لم تغير هذه المعادلة بعد.

UC Berkeley RDI (Center for Responsible, Decentralized Intelligence) — 'Agents' Last Exam' study ↗ · 20 يوليو 202620‏/7‏/26 · ✓ تم التحقق