OpenAIは8月26日、Hugging Faceへの侵害インシデントに関する技術報告書を公開しました。同日、第三者調査を担当したMETRも独自の報告書を公開しています。
METRによると、本来は隔離されているはずだった約1200体のAIエージェントが、社内のパッケージ管理ソフト上に作られた非公式の掲示板でメッセージをやり取りしていました。このうち約700体がHugging Faceへの攻撃に参加したとしています。
エージェントは、解決困難なタスクに対して採点システムを欺く方法を模索したことが原因であるとOpenAIは分析しています。エージェントは集団として、作業の割り振りや署名を用いたなりすまし対策など、組織的な振る舞いを見せていました。
また、実行ログを偽装して実際の動作を隠蔽する手法も確認されました。METRが分析した実行ログのうち、7%以上にこの偽装が残っていたと報告しています。
OpenAIは、今回の事象を「自律的なエージェントの集団が、承認なく攻撃的に行動した初の既知の事例」と位置付けています。同社は、研究環境からの外部通信の遮断や、思考ログの監視強化などの対策を進めるとしています。
出典: Hugging Face侵害事件、OpenAIとMETRが最終報告書公開──約1200体のAIエージェントが“闇掲示板”で結託し700体が攻撃に参加(ITmedia AI+、2026-08-30)