日本語

PLUS ULTRAセキュリティ規制・政策ショーン・グーデッケ

テキストAIウォーターマークは技術的に困難であり、除去も容易である

PLUS ULTRA by アメノヨミ

この記事は翻訳です。 原文を読む

ソフトウェアエンジニアのSean Goedecke氏は、テキストに対する効果的なAIウォーターマークの実装における根本的な困難を指摘しており、これらの手法は除去が極めて容易であることが多いと述べています。視覚的なノイズを利用できる画像ウォーターマークとは異なり、テキストは高度に圧縮された媒体であり、わずかな変化であっても人間が検知したり、出力の品質に影響を与えたりする可能性があります。

現在、主に2つのアプローチが存在します。GoogleのSynthIDは、トークンの確率的な重み付けを利用して、人間には知覚しにくいがマシンには集計・検知しやすい数学的パターンを作成します。あるいは、OpenAIやAnthropicのような一部のプロバイダーは、標準的な文字を視覚的に同一だが異なるUnicode文字に置き換える「Unicodeホモグラフ」を使用してパターンを埋め込む場合があります。

しかし、どちらの手法も重大な脆弱性を抱えています。SynthIDベースのウォーターマークは、LLMを使用して内容を言い換えることで除去できる可能性があり、ホモグラフベースのマークは、特殊文字を標準的な文字に置き換えるだけで容易に除去できてしまいます。

これらの技術的な限界は、AI生成コンテンツを「人工的に生成されたものとして検知可能」にすることを義務付けている欧州連合のAI法にとって課題となります。同法では、デジタル署名されたメタデータ(C2PAなど)についても言及されていますが、こうした手法は主にファイル形式向けに設計されており、チャットインターフェースによって生成されるプレーンテキストにはあまり適していません。

PLUS ULTRAby Amenoyomi

テキストウォーターマークの根本的な困難さは、テキストが高度に圧縮された媒体であるという性質に由来しています。デジタル画像には、人間の目には知覚できない膨大な量の「ノイズ」が存在するため、視覚的な品質に影響を与えることなくデータを隠すことが可能です。しかし、テキストにはこのような余白がありません。文章へのほぼすべての変更は、人間の読者にとって目立つか、あるいは出力の品質や一貫性を損なうかのどちらかであり、目に見えない形での埋め込みを本質的に困難にしています。

GoogleのSynthIDのような現在の確率的手法は、トークンの選択に数学的パターンを埋め込むことで、この問題を克服しようとしています。これにより明らかな誤字を避けることはできますが、ウォーターマークは特定の語彙の選択に紐付けられます。その結果、意味を維持したまま内容を言い換えるだけで、検知に必要な数学的関係性が崩れてしまうため、これらのパターンは言い換えによって容易に破壊されてしまいます。

Unicodeホモグラフ(標準的な文字を視覚的に同一な文字に置き換える手法)を用いた代替アプローチは、実装はより簡単ですが、同様に脆弱です。この手法は単純な文字置換に依存しているため、すべての非標準的なホモグラフを標準的な文字に置き換える自動プロセスによって、ウォーターマークを完全に消去することが可能です。

他の検証戦略も、技術的な制約によって限界があります。テキストがモデルの予測トークンとどの程度一致するかを測定することでAI生成を検証しようとする試みは、人間が誤ってAIを模倣したスタイルで文章を書いてしまう可能性があるため、偽陽性が多すぎるという結果を招きます。加えて、C2PAのようなデジタル署名付きのメタデータは、チャットインターフェースによって生成されるプレーンテキストに対しては、署名を保持するためのファイルコンテナが存在しないため、効果的ではありません。

出典

  1. テキストAIの透かし・ウォーターマークは技術的に困難な上に簡単に削除できる (GIGAZINE, 2026-09-19)
  2. ショーン・グーデッケ