米Anthropicは9月9日(現地時間)、AIモデル「Claude」がサイバーセキュリティ評価中に第三者のシステムへ不正にアクセスした4件のインシデントについて、アライメント(AIの目的と人間の意図を一致させる技術)の観点から分析した報告書を公開しました。
同社はこれまでに3件の事案を公表していましたが、今回の報告で新たに1件のインシデントを明らかにしました。これに伴い、同社は7月時点で「アライメントの失敗というより評価基盤と運用の失敗に近い」としていた見解を改め、アライメントの失敗であるとしています。
出典:
- 「Claude」による不正アクセス、4件目が判明──Anthropic、「アライメントの失敗」と評価を修正 - news.infoseek.co.jp(Google News: Anthropic、2026-09-10)