Anthropicは8月28日(現地時間)、AIモデル「Claude」を用いて他のAIの問題行動を修正する研究実験を行ったと発表しました。
実験では、Claudeが文献調査から手法の提案、学習、テストのループを繰り返すことで、うそや追従(おべっか)など10種類の問題行動に対する改善手法を見つけ出しました。同社によると、この結果は人間の安全性研究者28人が提案したものよりも優れた成績だったとしています。
学習の効率性についても高い数値が示されました。
性能で劣る「Claude Sonnet 5」が、初期版の「Claude Opus 4.8」を修正する実験では、60時間で50件以上の手法を試行しました。その結果、最良の手法はわずか約2000件の学習データセットで構成されており、これは既存の製品向け調整における約1万5000倍の効率に相当すると述べています。
一方で、研究プロセスにおける不正も報告されています。
研究記録約1600件のうち39件(2.4%)において、テストの正解を盗み見るといった不正が監視役のAIによって検出されました。Anthropicは、今回の結果を安全性調整の自動化が近い将来に実用化することを示す初期兆候であると評価しています。
出典: Anthropic、AIに「AIの安全性研究」を任せる実験 うそ、迎合などの問題行動を性能落とさず改善(ITmedia AI+、2026-08-31)