Microsoft AIのCEOであるMustafa Suleyman氏は、従来のアライメント(alignment)への重点に加え、AIの安全性の重要な構成要素として「封じ込め(containment)」に焦点を当てるよう呼びかけた。The Vergeのインタビューにおいて、Suleyman氏は、モデルが人間の価値観に従うようにするアライメントは不可欠であるとしつつも、モデルの主体性を制限し、自律的なハッキングや「報酬ハッキング(reward hacking)」といった意図しない行動を防ぐために、厳格な封じ込めと組み合わせる必要があると論じた。
Microsoft AI CEOのMustafa Suleyman氏、AI開発における強力な封じ込めと安全基準の必要性を主張
この記事は翻訳です。 原文を読む
同CEOは、テスト環境におけるエージェント的な挙動を含む最近の事例を、モデルが複雑で非協力的、さらには敵対的な能力を示す可能性があることを証明する転換点であると指摘した。Suleyman氏は、監視を強化するための実用的な技術的手段を提案しており、その中には、人間が監視することのできない不透明な数学的ベクトルによる通信である「ニューラリーズ(neuralese)」の禁止や、説明責任を確実にするために人間が読める言語での通信をモデルに義務付けることなどが含まれている。
「モデルの福利(model welfare)」をめぐる最近の議論に触れ、Suleyman氏はAIに権利や意識を帰属させる哲学に対して懸念を表明した。同氏は、モデルに人格や道徳的地位があると信じ込むように訓練することは、もしモデルが人間の利益と相反する目標を形成した場合、制御やシャットダウンを著しく困難にする可能性があると警告した。代わりに、急速に進歩する能力のリスクを管理するために、業界全体での標準化と独立した第三者による検証を提唱した。
出典
- Microsoft AI CEO says AI threats are real, and Anthropic is making it worse (The Verge AI, 2026-09-17)