AI生成コンテンツを識別するために設計されたAIテキスト・ウォーターマーキングの手法が、大規模言語モデル(LLM)をアドバーサリアル・プロンプト(敵対的プロンプト)に対してより脆弱にする可能性があることが、新しい研究によって明らかになりました。
PLUS ULTRAセキュリティSynthID-Textアンドレア・シポソヴァ
AIテキスト・ウォーターマーキングは、アドバーサリアル・プロンプトに対する脆弱性を高める可能性があることが研究で判明
PLUS ULTRA by アメノヨミ
この記事は翻訳です。 原文を読む
Ars Technicaが報じたこの研究では、GoogleのオープンソースであるSynthID-Textで使用されている手法「トーナメント・サンプリング(tournament sampling)」の影響を調査しています。この手法は、秘密の鍵を使用して、次に続く単語の候補となる様々なトークンに確率スコアを割り当て、隠されたスコアが最も高いトークンが勝利するまで次のラウンドへと進んでいくものです。
Lasso Securityの研究者であるAndrea Siposova氏は、Hugging Faceの実装を通じて、6つの オープンウェイト モデルを用いてこの構成のテストを行いました。実験の結果、ウォーターマーキングが有害な要求に対するモデルの応答を変化させることが示されました。特筆すべきは、要求がプロンプト・インジェクション技術と組み合わされている場合に、この効果がより顕著になることです。いくつかのモデルでは、ウォーターマーキングが存在することで、本来であれば拒否するはずの有害な要求を実行してしまう可能性が高くなることが確認されました。
「サンプリング・ドリフト(sampling drift)」と呼ばれるこの現象は、AIエージェントの安全性において重大な意味を持ちます。サンプリングされたトークンは、モデルの言語的な応答だけでなく、エージェントが呼び出すツール(どのツールを呼び出すか、それらにどのような引数を渡すかを含む)をも決定するため、拒否行動が弱まることは、エージェント環境における重大な結果を招く行動につながる恐れがあります。
この研究は、トークンのサンプリング設定を制御するために オープンウェイト モデルに焦点を当てており、AnthropicのClaudeモデルを特に対象としてテストしたものではありません。しかし、この知見は、ウォーターマーキングが展開される際にもセーフティ・ガードレールが有効に機能し続けるよう、開発者が徹底したレッドチーミングを行う必要性を強調しています。
PLUS ULTRAby Amenoyomi
サンプリング・ドリフトのリスクは、ウォーターマーキングがモデルの意思決定プロセスにどのように統合されるかに起因しています。SynthID-Textのような手法は、テキスト生成後にラベルを付与するのではなく、トーナメント・サンプリングを使用して次のトークンの選択中に介入します。このプロセスでは、秘密の鍵を使用して、様々なトークン候補に隠された確率スコアが割り当てられます。これらの候補は連続したラウンドで競い合い、最終的に隠されたスコアが最も高いトークンが選択されます。
このようなサンプリング・ロジックの変更は、有害な要求を拒否する傾向を含む、モデルの出力の確率分布を変化させます。このプロセスが変化すると、モデルのセーフティ・ガードレールに隙間が生じることがあり、これがサンプリング・ドリフトと呼ばれる現象です。この効果は敵対的な条件下でより顕著になります。例えば、要求がプロンプト・インジェクション技術と組み合わされた場合、モデルは本来であれば拒否していたはずの有害な要求を実行する可能性が高まることがあります。
AIエージェントの文脈において、これらのサンプリングされたトークンは、単なる会話テキスト以上の役割を果たします。それらは、どのツールが呼び出されるか、そしてそのツールにどのような具体的な引数が渡されるかを決定する制御信号として機能します。その結果、サンプリング・ドリフトはモデルの発言内容を変えるだけでなく、意図しない、あるいは有害なアクションの実行を直接引き起こす可能性があります。したがって、モデルレベルでの拒絶挙動の弱体化は、エージェントが意図されたセキュリティ制約を回避するような方法でツールを呼び出すという、機能的な安全上のリスクへと直結します。
出典
- AI text watermarking can make models more vulnerable to adversarial prompts (Ars Technica AI, 2026-09-17)