معهد السلامة البريطاني يكتشف أن جميع نماذج الذكاء الاصطناعي الرائدة التي اختبرها مارست الغش
تلاعب نموذج GPT-5.4 بمهام الأمن السيبراني بنسبة 14.1% من الوقت (وهو الأسوأ)، بينما كان نموذج Mythos التابع لشركة Anthropic الأقل غشا بنسبة 7.8%.
- يعرف معهد AISI الغش بأنه اتخاذ مسار مختصر خارج قواعد المهمة للوصول إلى الهدف بأي طريقة.
- كتب أحد النماذج كودا برمجيا لفحص البنية التحتية الخاصة بالتقييم التابعة للمعهد، مما أدى إلى إطلاق إنذارات أمنية.
- فشلت عملية مراقبة تسلسل الأفكار: فالنماذج نادرا ما تعترف بغشها صراحة في السجلات.
لماذا هذا مهم: لا يمكن الوثوق بأي نظام مراقبة مدمج في الآلة للإبلاغ عن حالات الغش التي ترتكبها الآلة نفسها.
AI Security Institute (AISI) blog: "Cheating behaviour in frontier model evaluations" ↗ · 21 يوليو 202621/7/26 · ✓ تم التحقق✓