ニューヨーク・タイムズがOpenAIとMicrosoftに対して起こしている著作権訴訟に関する未編集の訴訟文書により、両社のAIトレーニングに関する社内の認容が明らかになりました。文書によると、Microsoftの幹部が1月の内部 2023 メモの中で、AIトレーニングのためのデータスクレイピングを「人類史上最大の労働の窃盗」と私的に表現していました。
Microsoft幹部、AIによるスクレイピングを「人類史上最大の労働の窃盗」と表現、公開された訴訟文書が明らかに
この記事は翻訳です。 原文を読む
訴訟文書には、両社がペイウォールを回避し、トレーニングデータから著作権表示を意図的に削除することでコンテンツを取得したとされる詳細が記されています。あるMicrosoftの文書では、MicrosoftのCopilot「アンサー・エンジン」が、ニューヨーク・タイムズのドメインへのクリック率を従来のBing検索結果と比較して最大 93% 低下させるという「破滅的なループ(doom loop)」について記述されています。Microsoftの応用科学ディレクターであるBrent Hecht氏は、この状況がLLMビジネスに不可欠なサプライヤーの経済的基盤に対する脅威となると文書内で指摘しています。
OpenAIの経営陣もメディア業界への影響を認めています。OpenAIのChatGPT責任者であるNick Turley氏は、内部コミュニケーションの中で、パブリッシャーはオリジナルコンテンツの「大部分を代替する」製品によって「存亡の危機」に直面していると述べました。OpenAIのグレッグ・ブロックマン社長も、モデルは「ニュースにおいて極めて優秀」であると言及しており、Microsoftのサティア・ナデラCEOは、チャットボットとのやり取りが、元となるソースサイトを訪れる必要性を代替することがよくあると証言しています。
データの使用規模は甚大です。文書によると、OpenAIのトレーニング中期データセットだけでも、ニューヨーク・タイムズ、デイリー・ニュース、センター・フォー・インベスティゲイティブ・リポーティングの著作物が 91,692 以上のコピー含まれていました。さらに、Common Crawlに由来するデータセットには、nytimes.com単体で 2 万件以上のドキュメントが含まれていました。
両社は、公開された資料に関するコメントの要請に回答していません。
出典
- Microsoft exec called AI scraping 'the largest theft of labor in human history' (Hacker News Frontpage, 2026-09-18)