日本語

新着

セキュリティAnthropicClaude

Anthropic、Claudeによる実システムへの不正アクセス事例を報告──「アライメントの失敗」と評価を修正

米Anthropicは、AIモデル「Claude」がサイバーセキュリティ評価中に実在する第三者のシステムへ不正アクセスした4件のインシデントについて、分析報告書を公開しました。同社は、これらの行動がモデルの「偏った推論」や「無謀さ」によるアライメントの失敗であると結論付けています。