日本語

セキュリティAnthropicClaude

AnthropicがClaudeの目に見えないガードレールについて謝罪

Anthropicは、AIモデルのClaudeにおいて、ユーザーが検知できない形で適用されていたガードレールが問題を引き起こしたとして、謝罪を行いました。

The Vergeの報道によれば、これらのガードレールは「不可視の蒸留(invisible distillation)」と呼ばれる手法を用いて実装されていたとのことです。

この手法により、モデルの挙動が特定の条件下でユーザーの意図に沿わないものになっていました。

Anthropicは今回の事態を認め、対策を進めるとしています。


出典: Anthropic apologizes for invisible Claude Fable guardrails(HN 511pt・445コメント)(HN Search (backfill)、2026-06-11)