The New York Timesが主導する訴訟で公開された法廷文書により、MicrosoftとOpenAIの幹部が、AIスクレイピングがニュースパブリッシャーに与える深刻な影響を内部的に認識していたことが明らかになりました。
公開文書で判明、MicrosoftとOpenAIの幹部がAIスクレイピングによる「窃盗」とニュースへの存亡の危機を認めていた
PLUS ULTRA by アメノヨミ
この記事は翻訳です。 原文を読む
Microsoftの応用科学ディレクターであるBrent Hecht氏は、2023 1月の内部メモの中で、AIトレーニングのためのニューススクレイピングを「前例のない規模の驚くべき窃盗」であり、「人類史上最大の労働窃盗」であると表現したと報じられています。また、Hecht氏は、広範なスクレイピングによって「フェアユース(公正利用)」という概念が「完全な嘲笑」に成り下がったと示唆しました。
OpenAIでは、ChatGPT責任者のNick Turley氏が内部メッセージの中で、ニュースコンテンツでトレーニングされた商用製品により、パブリッシャーが「存亡の危機」に直面することになると述べ、これらの製品は「大部分が代替的である」と指摘しました。
Microsoft自身のデータも、この代替がもたらす現実的な結果を浮き彫りにしています。一部のニュース原告について、MicrosoftはCopilotの「回答エンジン」により、クリック率が 83% から 93% まで低下したことを記録していました。内部文書では、この現象を、コンテンツサプライチェーンの経済的基盤を損なうことで、モデルの性能とウェブ全体の両方を傷つける恐れがある「ドゥームループ(破滅のループ)」と呼んでいました。
また、提出された文書には、ペイウォールを回避する方法を用いるなど、両社がどのようにコンテンツを取得したとされるかの詳細が記されています。文書によると、OpenAIの研究者がGreg Brockman社長に The New York Times のペイウォールを回避する「ハック」について知らせた際、Brockman氏は「あぁ、いいな(ah nice)」と反応したとのことです。さらに、モデルの出力に表示されるのを防ぐため、トレーニングデータから著作権表示を削除する取り組みが行われたことが文書で示唆されています。
Microsoftは、自社のAI製品はニュースサイトの代替とならない変革的なフェアユースであると主張してきましたが、内部文書では「作成者が自分のコンテンツをこのような形式で使用されることを意図した者はほぼおらず、またその使用に対する報酬も支払われていない」ことが認められていました。
PLUS ULTRAby Amenoyomi
この紛争の焦点は、「フェアユース」の法的解釈、具体的にはAIトレーニングがコンテンツを変革させるものなのか、あるいは市場における代替物として機能するのかという点にあります。Microsoftは公には、自社のAI製品は変革的なフェアユースであると主張していますが、応用科学ディレクターのBrent Hecht氏による内部文書では、この慣行をフェアユースの概念に対する「完全な嘲笑」であり、「人類史上最大の労働窃盗」であると表現しています。
内部データは、この代替による現実的な影響を強調しています。ユーザーが従来のBing検索ではなくCopilotの回答エンジンを利用した際、Microsoftは一部のニュースパブリッシャーで 83% から 93% の、また他のパブリッシャーで 51% から 94% のクリック率低下を記録しました。これは内部的に「ドゥームループ」と表現されており、最終製品が不可欠な「コンテンツサプライチェーン」の経済的基盤を損なうというシステム的なリスクであり、将来のモデルの性能と広範なウェブの両方に害を及ぼす可能性があるとしています。
公開された文書には、トレーニングデータの取得に使用された具体的な手法についても詳しく記されている。OpenAIの従業員はペイウォールを回避するための「ハック」を開発したと報じられており、グレッグ・ブロックマン社長はこの行為に対し「ああ、いいな(ah nice)」という言葉で認めていた。さらに、モデルがユーザーに著作権表示を出力することを防ぐため、トレーニングデータセットから著作権表示を削除していたとされる。収集の規模は膨大であり、トレーニング中期のデータセットには New York Times、Daily News、Center for Investigative Reporting の作品が 91,692 以上含まれており、別のデータセットには nytimes.com だけから 2 万件以上の文書が含まれていた。
これらの事実が明らかになったことを受け、Microsoft の広報担当者は、ブレント・ヘクト氏のコメントは「個人の見解」を反映したものであり、会社の法的な見解を代表するものではないと述べた。サティア・ナデラCEOは、ペイウォール背後のコンテンツはグラウンディングやトレーニングのためにライセンスを受けるべきであると証言し、チャットボットがユーザーを元のソースに誘導するのではなく、AIプラットフォーム上で直接情報を提供することで、代替品として機能してきたことを認めた。
出典
- Microsoft exec called AI scraping the “largest theft of labor in human history” (Ars Technica AI, 2026-09-17)
- Microsoft幹部がAIによるデータスクレイピングを「人類史上最大の労働窃盗」と表現 (GIGAZINE, 2026-09-18)