新聞2社がOpenAI・Microsoftを提訴 「学習済みAIモデルの廃棄」要求は実現可能か

米シアトル・タイムズとニューズデイは2026年9月4日、OpenAI関連会社とMicrosoftをニューヨーク南部地区連邦地方裁判所に提訴した。記事を無断でAIの学習などに使われたと主張し、損害賠償に加え、記事を組み込んだ学習データセットや大規模言語モデルの廃棄を求めている。事件番号は1:26-cv-07644。訴状で確認できる。

要求が認められれば、AI企業は多額の費用をかけて開発したモデルを失うことになるのか。モデル全体を削除することは技術的には可能だ。ただし、裁判所がどのモデルまで廃棄を認めるのか、特定の記事だけを取り除いてモデルを存続させられるのかは、それぞれ別の問題になる。

2026年9月6日時点で確認できた資料によると、廃棄はあくまで原告側の請求であり、裁判所が命じた措置ではない。本稿では訴状、米著作権法、過去の裁判・行政措置、機械学習の研究を照合し、どのような条件なら実現し得るのかを検討する。

新聞2社は何を求めているのか

今回の要求は、ネット上の記事を消すだけにとどまらず、被告が保有・管理するモデルや学習データにも及ぶ。訴状37ページの請求事項では、米著作権法503条に基づき、原告の著作物のコピーと、その著作物または派生物を組み込んだLLM・学習データセットについて、差し押さえまたは廃棄を求めている。請求事項の原文は、単純に「ChatGPTを停止せよ」と求める内容ではない。

確認項目内容
原告The Seattle Times Company、Newsday LLC
提訴日・裁判所2026年9月4日、ニューヨーク南部地区連邦地方裁判所
問題視する利用記事の無断取得、AI学習などへの利用、記事を再現・代替する出力など
求める救済損害賠償、侵害行為の差し止め、対象コピー・データセット・モデルの差し押さえや廃棄など
現在の位置付け原告の主張と請求。侵害や廃棄の必要性が認定されたわけではない

訴状に名前が挙がっている製品でも、すべてのバージョンで同じ記事が使われ、同じ法的責任が生じると決まったわけではない。実際にどのモデルが対象になるのかを判断するには、学習履歴や記事が利用された経路を確認する必要がある。

OpenAIはロイターに対し、公開データによる学習とフェアユースを根拠とする従来の立場を示した。Microsoftは提訴に驚きを示す一方、地域報道の重要性を認め、解決に向けて対話する姿勢を示している。ロイターの報道

法律上、AIモデルを廃棄させることはできるのか

米著作権法には、侵害物の廃棄を命じる規定がある。ただし、AIの学習に著作物が使われたという理由だけで、モデル全体の廃棄が自動的に決まるわけではない。

503条(b)では、最終判決などの一部として、権利侵害に当たる方法で作成・使用されたコピーや、それを複製するための一定の物について、廃棄またはその他の合理的な処分を命じられると定めている。今回の争いでは、問題となったモデルがこの規定の対象になるのか、対象になるとしてどこまで処分するのが妥当なのかが問われる。

差し止めについても、侵害の認定と救済内容の判断は分けて考える必要がある。米最高裁のeBay対MercExchange判決(2006年)は、回復困難な損害、金銭賠償では不十分であること、当事者間の負担の比較、公益という4要素を示した。特許事件の判決だが、判決文では著作権についても、侵害が認められたからといって差し止めが自動的に認められるわけではないと説明している。

本件でも、記事の無断利用が認められるかどうかに加え、将来の被害を止めるためにどのような措置が必要なのかが焦点になる。出力や検索機能の制限で足りるのか、それともモデルの存続自体が問題になるのかによって、適切な対応は変わる。なお、503条の廃棄と502条の差し止めを、まったく同じ要件で判断される制度として扱うこともできない。

過去にはモデル削除の措置もある。ただし、新聞訴訟とは条件が違う

学習に使ったデータに加えて、そのデータから作られたモデルまで削除する措置には前例がある。ただし、その前例だけで今回の結論が決まるわけではない。

米連邦取引委員会(FTC)は2021年5月、写真アプリを開発したEveralbumとの和解を確定した。ユーザー写真への顔認識技術の適用やデータ保持をめぐる説明が問題となり、写真・動画に加えて、それらを使って開発したモデルとアルゴリズムの削除も求められた。FTCの発表

事例資料で確認できる判断・要求今回に当てはめる際の限界
EveralbumとFTCの和解
2021年
対象データに加え、それを使って作ったモデル・アルゴリズムの削除消費者への説明などをめぐる行政上の和解。新聞記事の著作権訴訟ではない
Bartz対Anthropicの判断
2025年6月23日
当該事件の学習利用をフェアユースと判断。一方、海賊版の蔵書用コピーを学習目的で一括して正当化する主張は認めず特定の書籍利用についての判断。ニュース記事を代替する出力まで一律に適法としたわけではない
シアトル・タイムズ/ニューズデイの訴状
2026年9月4日
記事を組み込んだモデル・データセットなどの廃棄を請求現段階で確認できるのは請求内容であり、廃棄命令ではない

Anthropicの事件では、2025年6月の裁判所文書が、学習用の複製と、海賊版を集めて中央ライブラリーに保管する行為を分けて評価している。この区別は本件を考えるうえでも参考になる。「学習に使ったのだからすべて適法」「無断取得があったのだからモデル全体を廃棄」と一括りにせず、個々の行為を分けて考える必要がある。

技術面の比較:データ削除、出力制限、モデル廃棄は何が違うか

元記事を学習データから削除しても、すでに学習を終えたモデルの数値が自動的に書き換わるわけではない。一方で、モデルのファイルそのものを削除すれば、そのコピーは使えなくなる。難しいのは、ほかの能力を残しながら特定の記事の影響だけを取り除き、本当に除去できたのかを検証することだ。

モデルの「重み」とは、学習によって調整された多数の数値を指す。記事が一般的な文書フォルダーのように1本ずつ保存されているとは限らないが、学習内容を記憶し、文章を再現する場合はある。こうした問題への対応として、特定データの影響を取り除く「マシン・アンラーニング」が研究されている。TOFU研究論文

以下は、各処置が何を変えるのかを本稿で整理した比較表だ。実装の難易度や、法的な対応として十分かどうかは、対象となるシステムや命令の内容によって変わる。

対応方法直接変更するもの利点残る課題
学習データからの記事削除保存済みの本文、加工した学習用データなど以後の学習への再投入を防ぐ手掛かりになる既存モデルの重みは変わらない。転載・重複データの確認も必要
検索・RAGからの除外検索対象、回答時に参照するデータベースやキャッシュその経路から記事を取得することを抑えられるモデルがすでに記憶している内容には別の対応が必要
出力フィルター利用者に返す文章の判定・制限記事と一致する出力などを抑制できる出さないことと、モデル内部から影響を除いたことは同じではない
アンラーニング既存モデルの重みなどモデルを残しながら対象データの影響を減らすことを目指せる消去の十分性、他の能力への悪影響、繰り返し処理への耐性の検証が必要
対象データを除いた再学習新たに構築するモデル対象データを学習しないモデルを作るための基準となる計算費用、データの選別、性能評価が必要。別経路から同じ文章が入る可能性にも対処する
対象モデルの廃棄配備済みモデル、保存コピーなど命令対象の資産対象コピーの継続利用を止められるバックアップや管理範囲の特定が必要。別モデルへの切り替え・再開発の負担が生じる

RAGとは、回答時に外部の資料を検索し、その内容をモデルに渡す仕組みだ。同じ記事の文章が出力されたとしても、モデルが学習時に覚えていたのか、その場で検索して参照したのかによって、対処すべき場所は異なる。

こうして整理すると、廃棄要求が実現可能かどうかを「削除ボタンがあるか」だけで判断できないことが分かる。対象となる資産を特定したうえで、どの利用経路を止め、何をもって対応完了とするのかまで決めなければ、実際に履行できる命令にはなりにくい。

研究データが示す「記事だけ忘れさせる」ことの難しさ

アンラーニングには研究成果があるものの、特定の質問に答えなくなったというだけでは、完全に忘れたとは判断できない。

2024年のTOFUは、200人の架空の著者プロフィールを使い、忘却能力を調べるベンチマークを提示した。同年のMUSEはニュース記事や書籍を対象とし、70億パラメーターの言語モデルで8種類の手法を評価している。TOFUMUSE

比較項目TOFU(2024年)MUSE(2024年)
主な対象架空の著者プロフィールについての質問と回答ニュース記事と書籍
規模・評価条件の例200人分、各20問の質問と回答70億パラメーターのモデル、8種類の忘却手法
本件を考えるうえでの意味対象データを最初から学習しなかった場合との比較が重要文章の再現抑制に加え、情報漏えいや他の能力への影響も評価する必要がある

MUSEでは、文章の再現などを抑えられる手法でも、一般的な性能の低下や、繰り返し・大規模な削除要求への対応が課題となった。ただし、これは2024年の特定条件で行われた評価である。2026年の商用モデルの忘却性能を直接測定した結果ではなく、あらゆる手法が今後も失敗し続けることを証明した研究でもない。

研究で「知識を忘れる」と呼ばれる目標と、著作権上どこまで除去する必要があるのかも一致するとは限らない。ニュースが伝える事実と、その新聞社が作った文章表現を分け、裁判所が対象とする権利や利用行為に沿って評価する必要がある。

独自計算:「100回試して再現ゼロ」でも完全削除を証明できない

100回テストして記事の再現が一度も起きなかったとしても、条件をそろえた試行における再現確率の片側95%信頼上限は約2.95%となる。「観測されなかった」と「絶対に起きない」は同じではない。その差は数字で確認できる。

ここでは、あらかじめ定めた質問の分布から独立に試行し、各試行で記事が再現される確率を一定のpとする。n回すべてで再現しない確率は(1−p)n。再現が0回だった場合の片側95%信頼上限は、これが0.05になる値、つまり次の式で求められる。

再現確率の上限 = 1 − 0.051/n

独立したテスト回数観測された再現回数再現確率の片側95%信頼上限
30回0回約9.50%
100回0回約2.95%
300回0回約0.994%
1,000回0回約0.299%

たとえば、真の再現確率を仮に0.1%とすると、100回のテストで1回以上検出できる確率は約9.52%にとどまる。1,000回では約63.23%で、約95%の検出確率を得るには2,995回の試行が必要になる。これは1−(1−0.001)nによる本稿の計算であり、ChatGPTやCopilotの実測値ではない。

もちろん、この試算には限界がある。同じ質問を少し言い換えただけの試行には相関があり、どのような質問を選ぶかによって再現率も変わる。表が示しているのはモデルに記事が残っている確率ではなく、設定したテスト条件で文章が出力される確率についての数字だ。

そのため本稿では、削除後の検証について、検索を使わない条件と使う条件、直接的な質問と言い換えた質問、通常利用と意図的な再現テストを分けて記録する方法を提案する。どの範囲を検査したのか分からないまま「再現ゼロ」とだけ示されても、対応が十分だったのか評価しにくい。

独自試算:再学習の負担は、記事の量だけでなく「いつ使ったか」で変わる

除去する記事の数が少なくても、学習の早い段階から使われていれば、やり直す計算量が大きくなる可能性がある。記事数と再学習費用が単純な比例関係になるとは限らない。

分かりやすくするため、モデルの学習全体の計算量を100とする。問題の記事を初めて使う直前に、学習途中の状態を保存した「チェックポイント」があり、その時点まで対象データの影響が一切ないと確認できる場合を考える。

仮定するケース影響のない保存状態そこからやり直す計算量の目安
序盤で対象記事を使った全体の20%まで学習した時点残り80%
終盤で初めて対象記事を使った全体の90%まで学習した時点残り10%
影響のない途中状態を確認できない再利用できるチェックポイントを確定できない最初からの再学習を検討する必要がある

最初の2ケースを比べると、80÷10=8倍の差が生じる。これは、対象データを除いた後も学習量がおおむね同じで、各段階の計算単価も同じと仮定した模式的な試算だ。両社が実際に負担する費用や作業時間を推定したものではない。データ調査、調整、評価、サービス切り替えにかかる費用も含めていない。

この試算から分かるのは、学習履歴を保存しておく実務上の価値だ。どの記事を、どの段階で、どのモデルに使ったのかが分かれば、作り直す範囲を検討しやすい。逆に履歴が分からなければ、「一部だけ直せる」という説明が妥当かどうかも検証しにくくなる。

派生モデルについても確認が必要になる。対象記事を学習した基盤モデルに追加学習を施した場合、追加学習用データから記事を除くだけでは、基盤モデルに残った影響までなくなったとはいえない。ただし、こうした技術的な継承関係があることと、派生モデルが法的な廃棄対象になることは別の問題だ。

反証も確認する:文章の再現、アクセス減少だけで結論は出ない

原告側が示した再現例は重要な検証材料だが、その1例だけで学習経路や通常利用での被害規模まで確定することはできない。

GeekWireは、訴状にボーイング737 MAXに関する報道の連続88語を再現した例が示されていると報じた。見出しとURLを含む入力による例だという。GeekWireの報道

本稿では、この実験自体は再現していない。モデル内部の記憶によって出力されたのか、検索やキャッシュを経由したのかを判断するには、モデル名、実行日、検索設定、取得ログなどを確認する必要がある。検索経由であれば問題がなくなるという意味ではない。どの行為が侵害に当たるとされるのか、それを止めるにはどの手段が必要なのかが変わり得るということだ。

判断材料そこから検討できること追加確認が必要なこと
記事と一致する出力保護される文章表現が再現された可能性情報の取得経路、実験条件、再現頻度、通常利用での発生状況
公開された記事を利用アクセスできる情報だった可能性公開されていることとは別に、許諾やフェアユースが成立するか
出版社へのアクセス減少市場への影響を調べる必要性AI、検索順位変更、ニュース需要など、どの要因による減少か
文章を再現しないよう制限特定条件での出力抑制学習データやモデルへの対応まで完了したのか

フェアユースは、利用目的・性質、著作物の性質、利用した量と重要性、市場への影響などを総合して判断される。米著作権局も、何語以内なら必ず許されるといった基準は設けていない。したがって、88語という長さだけで適法・違法を判断することも、公開記事だから自由に使えると結論付けることもできない。米著作権局の解説

一般的な文章を生成するための学習と、特定の新聞記事を読まずに済むような回答を出す行為とでは、利用目的や市場への影響をめぐる議論も変わってくる。双方の主張を評価するには、「AI学習」という大きなくくりだけで考えず、記事の取得・学習・出力という具体的な行為ごとに分けて見る必要がある。

競合比較:廃棄以外に、許諾契約で利用を続ける道もある

AIと報道をめぐっては訴訟が続く一方、利用範囲を契約で定める動きも進んでいる。OpenAI自身も、すべての報道機関と同じ条件で争っているわけではない。

企業・事例公表された対応比較から分かること
OpenAIとNews Corp
2024年5月発表
複数年の提携。回答へのコンテンツ表示や製品改善のための利用を許諾権利者と利用範囲を合意する方法をOpenAIも採用している
Amazonとニューヨーク・タイムズ
2025年5月発表
AI製品向けの複数年ライセンス契約OpenAIなどを提訴した出版社でも、別の企業には契約で利用を認める場合がある
今回の新聞2社とOpenAI・Microsoft
2026年9月提訴
無断利用への救済として、賠償やモデル廃棄などを請求契約済みの他社事例が、そのまま本件の利用を正当化するわけではない

比較の出典は、News Corpの公式発表と、Amazonとニューヨーク・タイムズの契約に関するロイター報道。契約金額や許諾範囲を同じ条件で比較できる資料は限られているため、ここでは公表されている対応方法を比べた。

新聞2社とAI企業の間には、過去に協力関係もあった。Lenfest Instituteは2024年10月、OpenAIとMicrosoftによる総額1,000万ドルのAI支援プログラムを発表し、初回参加5社にシアトル・タイムズとニューズデイが含まれていた。これはプログラム全体の金額であり、この新聞2社に支払われた記事の学習許諾料ではない。Lenfest Instituteの発表

過去に協力していたからといって、無制限の学習利用まで許諾していたとは限らない。反対に、今回提訴したからといって、新聞社がAIの利用そのものを全面的に否定しているとも限らない。争点になるのは、誰が、どの用途で、どの条件のもとに記事を利用できるのかだ。

本稿では、仮に無断利用が問題になった場合、和解・許諾契約、出力や検索の制限、対象モデルの作り直しなども、全面廃棄と比較すべき選択肢になると考える。ただし、本件が実際にどの方向へ進むのか、各選択肢がどの程度の確率で成立するのかを見積もれるだけの情報はない。

読者への影響:サービス停止より先に、利用条件や回答の変化を確認する

提訴されたという理由だけで、ChatGPTやCopilotが直ちに使えなくなると考える必要はない。今後、具体的な命令や合意が出た場合は、どのモデル・機能・地域が対象となり、いつから適用されるのかを確認することが先になる。

読者今後起こり得る影響確認しておきたいこと
一般のAI利用者特定記事への回答制限、引用やリンクの表示変更AIが挙げる出典を開き、元記事に実際に書かれているか確認する
AIを業務に組み込む企業・開発者モデルの提供終了・変更が生じた場合の再評価や移行利用モデル、提供元の通知、代替モデルでの重要業務の動作
ニュースサイト・ブログ運営者記事利用の条件や、AIからの送客の変化記事の利用許諾、アクセス経路別の流入、再現例の日時と条件
報道を読む人回答の利便性と、取材を支える収益構造の変化要約の根拠や取材元を確認し、必要な情報は原記事で読む

表に挙げた影響は、今後起こり得る可能性であり、すでに決まったサービス変更ではない。この訴訟だけを根拠に、料金の上昇や大規模なサービス停止まで予測することはできない。

サイト運営者が被害の有無を調べる場合も、検索流入全体の減少と、特定のAIが記事を再現した事例は分けて記録したほうがよい。元記事のURLと公開日、出力を得た日時、利用したモデルや検索設定をそろえておけば、後からどの経路で利用されたのかを検討しやすくなる。

今後は「何を廃棄するのか」と「どう確認するのか」を見る

この訴訟で注目したいのは、モデル廃棄という要求の強さだけではない。何を対象とし、どのような条件で実施するのかをどこまで具体化できるかも焦点になる。続報では、少なくとも次の4点を確認したい。

  1. 対象モデルの特定:どの記事が、どのモデルの、どの学習段階や検索経路で使われたと認められるのか。
  2. 侵害と救済の区別:侵害の有無の判断なのか、差し止め・廃棄まで踏み込んだ判断なのか。
  3. 代替措置の扱い:検索からの除外、出力制限、アンラーニング、再学習などで対応できるとされるのか。
  4. 履行の確認:保存コピーや派生モデルをどこまで含め、どの記録・テストで対応を検証するのか。

学習済みモデルそのものを廃棄することは可能だ。ただし、ほかの能力を維持しながら特定の記事だけを忘れさせるとなると、技術面でも検証面でも課題が残る。新聞2社の要求が認められるかどうかは、こうした実務上の問題に加え、個々の利用行為とモデルを法律上どのように評価するかにかかっている。

主な参考情報

本稿では、訴状に書かれた主張、裁判所・FTCの判断、研究結果、本稿独自の試算を区別して記載した。確認日は2026年9月6日。試算は説明用の仮定に基づくもので、両社の実測値や裁判所の認定値ではない。

コメントを送信

You May Have Missed