IA : une étude de Berkeley pointe 25 % de réussite
L'examen "Agents' Last Exam" a soumis des IA à plus de 1 500 tâches réparties sur 55 métiers. Aucun modèle n'a passé le niveau le plus difficile.
- Le meilleur agent atteint 25,2 % de réussite sur ALE-CLI, contre 82,0 % sur Terminal-Bench et 59,1 % sur SWE-bench-Pro.
- Tous les modèles de pointe testés, dont Fable 5, ont échoué totalement au niveau de difficulté maximal.
- Le coût par tâche est de 15,70 $ pour Fable 5, contre 1,33 $ pour Composer 2,5.
Pourquoi c'est important: Aucun employeur ne peut se contenter d'un taux de réussite d'un quart. Pour l'heure, l'IA ne change pas cette équation.
UC Berkeley RDI (Center for Responsible, Decentralized Intelligence) — 'Agents' Last Exam' study ↗ · 20 juil. 202620/07/26 · ✓ Vérifié✓