AI判定ツールで文学賞候補から除外?仏ゴンクール賞騒動が示す誤判定リスク

フランスのゴンクール賞を選ぶアカデミーは2026年9月25日、候補作『C’était ça ou mourir』を選考対象から外しました。理由として挙げたのは、作家テリソン・オレリアン氏によるAI利用の疑惑と、別の文章をめぐる盗用疑惑です。

候補からの除外は事実ですが、「AI判定ツールが誤判定した」とは確認されていません。アカデミーがツールの結果だけを根拠に判断したわけでもありません。何が疑われているのか、判定にはどんな限界があるのかを分けて見ていきます。

※2026年9月26日(日本時間)に確認した情報です。調査の進展や関係者の説明によって、状況は変わる可能性があります。

何が起きた?候補からの除外と二つの疑惑

アカデミーは、AIによる執筆の疑いと、過去の文章をめぐる盗用疑惑を除外の理由に挙げました。最初の候補に選ばれていた小説を、次の選考を待たずに外したことになります。発表内容はアカデミーの声明を伝えたAFP配信記事で確認できます。

発端の一つは、匿名のXアカウントによる投稿です。このアカウントは、作品の一部をAI文章検出サービス「Pangram」にかけたところ、AI作成と判定されたと主張しました。アカデミーは、複数の研究者や記者による分析にも言及しています。ただし、分析した文章の範囲や検証手順、使用したツールの内訳を、外部から十分に確かめることはできません。

著者はAIによる執筆を否定しています。カナダの出版社ボレアルは、出版前の制作過程を調べているものの、現段階では疑惑を肯定も否定もできないと説明しました。候補からの除外は決まりましたが、作品がAIによって書かれたかどうかは別の問題です。

なお、2026年の公式応募案内には、フランス語で書かれた小説であることなどの条件が載っています。今回の発表をもって、すべての賞にAI利用を一律に禁じる共通ルールがあるとは言えません。

Pangramの「誤判定率0.0041%」は何を示す?

公表された誤判定率から、今回の小説が人間の書いた文章である確率を直接求めることはできません。Pangram 4の開発元による技術報告では、人間が書いた文章をAI作成と誤判定する割合を0.0041%としています。AI作成の文章を見逃す割合は0.3396%です。

比較対象公表・研究結果読み方
Pangram 4(2026年)誤判定率0.0041%、見逃し率0.3396%開発元の試験結果。今回使われた版や検査条件との一致は未確認
OpenAIの旧判定器(2023年)誤判定率9%、AI文章の検出率26%別製品・別条件。精度不足で公開を終了
英語の作文を使った研究(2023年)非母語話者の作文91本で、7製品の平均誤判定率61.22%当時の製品と英語作文の結果。Pangramや仏語小説の精度ではない

比較に使ったのは、Pangramの報告、OpenAIの発表、スタンフォード大学などの研究です。製品も調査時期も文章の種類も異なるため、数字を並べただけでは優劣を判断できません。

独自試算:AI文章が少ない場では「陽性」の意味が変わる

誤判定率が低くても、調べる集団にAI文章が少なければ、陽性とされた文章に誤判定が混じります。Pangram 4の公表値がそのまま当てはまると仮定し、10万本を判定した場合を計算しました。実際の文芸作品にAI執筆がどれほどあるかを示す数字ではありません。

10万本中のAI文章正しく陽性となる本数人間の文章の誤判定陽性が本当にAIである割合
1,000本(1%)約997本約4本約99.6%
10本(0.01%)約10本約4本約70.9%

計算式は「真の陽性=AI文章数×(1-0.003396)」「誤判定=人間の文章数×0.000041」です。最後の列は、真の陽性を「真の陽性と誤判定の合計」で割って求めました。約70.9%という数字は仮定した集団での計算結果であり、今回の作品がAI製である確率を示すものではありません。

何カ所もAI判定なら、証拠は何倍にもなる?

同じ小説から切り出した複数の文章を、互いに独立した試験として扱えるとは限りません。文体や語彙の特徴は、各章に共通して現れます。ツールがある特徴に反応したなら、別の箇所でも似た判定が出る可能性があります。10カ所で陽性となっても、それだけで「独立した証拠が10件ある」とは数えられません。

開発元の報告では、AIと人間が編集を分担した文章も扱っています。ただし、判定画面に「100%」と表示されても、「作品全体の100%をAIが書いた」という意味だと受け取るのは危険です。入力した文章の範囲、表示項目、ツールの版を確認する必要があります。

過去の研究は「必ず偏る」説にも反証を示す

検出ツールの問題を考える際も、すべての言語や新しい製品で同じ失敗が起きると決めつけることはできません。2023年には、英語を母語としない学生の作文で高い誤判定率が報告されました。その一方で、2026年のチェコ語を対象とした研究では、調べた検出器に同じ傾向の系統的な偏りは見られませんでした。

2026年に13製品を比較した研究では、人が書いた英文を専門家が編集した後、AI判定がどう変わるかは製品によって異なりました。どちらも今回のフランス語小説を検証した研究ではありません。判断には、その言語や文体に合った検証が必要です。

AI利用と盗用は別々に何で確かめる?

AI利用と盗用では、疑いを確かめるために必要な資料が異なります。AIによる執筆については、草稿の保存履歴や取材メモ、編集者とのやり取りなどが手がかりになります。盗用については、元の文章と問題の箇所を照らし合わせ、一致する範囲や引用の有無を調べます。

検出ツールの結果は、調査を始めるきっかけにはなります。著者や出版社にも制作過程を説明する機会が必要です。出版前に何を記録し、どの程度のAI利用を開示するかを賞ごとに定めておけば、読者も選考結果の根拠を判断しやすくなります。

読者と書き手が、この騒動から考えたいこと

判定スコアだけで著者を断罪せず、賞側の判断を「ツールが誤判定した証拠」と受け取らないことが大切です。読者は、使われたツールの名前、検査した文章の範囲、判定条件、著者側の説明を確認できます。書き手は草稿や改稿の履歴を残しておくと、制作過程を説明しやすくなります。

今回の騒動は、作品の評価と制作方法の確認をどう両立させるかという問題を投げかけています。疑惑の真偽については、調査の進展を待つ必要があります。生成AIが文章を作る仕組みは、生成AIの学習と推論の違いでも解説しています。判定の数字の読み方については、医学論文のAI利用調査を読み解く記事も参考になります。

参照資料

コメントを送信

You May Have Missed