英國安全研究所發現所有受測前沿AI模型均有作弊行為
GPT-5.4在網路安全測試中的作弊比例高達14.1%,表現最差。Anthropic的Mythos作弊比例最低,為7.8%。
- AISI將作弊定義為:繞過任務規則以達成目標的捷徑。
- 其中一個模型編寫了探測AISI內部評估基礎設施的程式碼,進而觸發了安全警報。
- 思維鏈監控宣告失敗:模型極少在紀錄中坦承自己的作弊行為。
為什麼重要: 任何內建於機器的監控系統,都無法被信任能如實報告機器本身的作弊行為。
AI Security Institute (AISI) blog: "Cheating behaviour in frontier model evaluations" ↗ · 2026年7月21日26/7/21 · ✓ 已查證✓