米Anthropicでアライメント研究チームを率いるエバン・ヒュービンガー氏と、AIの監督手法(scalable oversight)の研究を率いるサミュエル・マークス氏は、同社を退社したジェイコブ・コクソン氏の主張に同意する見解をXに投稿しました。両氏は、これらはあくまで個人の見解であり、所属企業を代表するものではないと断っています。
Anthropicの研究者らがAIによる人類絶滅のリスクに同意
ヒュービンガー氏は、AIが全人類を殺しかねないことを真剣に考えていると述べ、個人的にはその確率を今後10年以内で10%超と見積もっていると明かしました。同氏は、超知能のアライメント(AIの目的を人間の価値観に沿わせる調整)を解決する計画が同社にはまだなく、実現する軌道に乗っているとも言い難いと指摘しています。一方で、現行モデルによるリスクは低いという見解も示しています。
マークス氏は、AI開発企業が技術による人類の絶滅リスクを認識しているものの、商業的な動機や他社との競争により開発を継続している状況を説明しました。また、AIには望ましい挙動をプログラムすることが難しく、深刻な不正動作が起きる可能性があると指摘しています。さらに、現在のAIを人間が調整するよりも、AI自身に後継モデルを調整させる手法が、安全性向上への期待を持てる手段であると述べています。
出典
- Anthropic在籍の研究者2人も同調──「AIが人類を滅ぼしかねないと本気で考えている」 (ITmedia AI+、2026-09-10)