Sourced News

Atom Brief

mar. 21 juil. 2026 · 0 brèves · Vérifié · S'abonner
Tech

IA : une étude de Berkeley pointe 25 % de réussite

L'examen "Agents' Last Exam" a soumis des IA à plus de 1 500 tâches réparties sur 55 métiers. Aucun modèle n'a passé le niveau le plus difficile.

  • Le meilleur agent atteint 25,2 % de réussite sur ALE-CLI, contre 82,0 % sur Terminal-Bench et 59,1 % sur SWE-bench-Pro.
  • Tous les modèles de pointe testés, dont Fable 5, ont échoué totalement au niveau de difficulté maximal.
  • Le coût par tâche est de 15,70 $ pour Fable 5, contre 1,33 $ pour Composer 2,5.

Pourquoi c'est important: Aucun employeur ne peut se contenter d'un taux de réussite d'un quart. Pour l'heure, l'IA ne change pas cette équation.

UC Berkeley RDI (Center for Responsible, Decentralized Intelligence) — 'Agents' Last Exam' study ↗ · 20 juil. 202620/07/26 · ✓ Vérifié