IBM Research Pangkas Kegagalan Tugas Agen AI

GPT-4.1 menyelesaikan tugas AppWorld 77% dari waktu tetapi mengulangi kesuksesan yang sama dalam lima kali percobaan berturut-turut hanya 53% dari waktu.
- Consistency Analyzer melakukan resampling pada setiap titik keputusan agen sebanyak lima kali untuk menangkap langkah untung-untungan.
- Konsistensi Pass^5 melonjak dari 53.0% menjadi 69.0%, kenaikan 16 poin pada AppWorld.
- Tugas tingkat kesulitan menengah naik 22.9 poin; tugas terkait meningkat 13.0 poin dari pedoman yang sama.
Mengapa ini penting: Berhasil sekali dan gagal saat dicoba ulang berarti kemampuan itu tidak pernah ada, yang ada hanya keberuntungan.