دراسة من بيركلي: وكلاء الذكاء الاصطناعي ينجحون في 25% من المهام فقط
أخضع اختبار "اختبار الوكلاء الأخير" (ALE) النماذج لأكثر من 1500 مهمة في 55 وظيفة، وفشلت جميعها في المستوى الأكثر تعقيداً.
- سجل أفضل وكيل ذكاء اصطناعي 25.2% في اختبار ALE-CLI، مقابل 82.0% في Terminal-Bench و59.1% في SWE-bench-Pro.
- فشلت جميع النماذج المتقدمة، بما فيها Fable 5، في تحقيق أي نتيجة في المستوى الأصعب.
- بلغت تكلفة تشغيل Fable 5 نحو 15.70 دولاراً للمهمة، مقابل 1.33 دولار فقط لنموذج Composer 2.5.
لماذا هذا مهم: لا يوظف أصحاب العمل أحداً بنسبة نجاح 25%، والخوارزميات لم تغير هذه المعادلة بعد.
UC Berkeley RDI (Center for Responsible, Decentralized Intelligence) — 'Agents' Last Exam' study ↗ · 20 يوليو 202620/7/26 · ✓ تم التحقق✓