人の脳とAIは、言葉の意味をどのように表しているのでしょうか。2026年9月30日、米ベイラー医科大学などの研究チームが、この問いを調べた論文を「Nature Neuroscience」に発表しました。物語を聞いている人の海馬の活動と、GPT-2などの言語モデルの表現を比較した研究です。[1]
共通していたのは、文脈に応じた意味の表し方です。脳とGPT-2が同じ仕組みで動くと証明されたわけではありません。研究で分かったことと、まだ分からないことを分けて考えると、AIを脳研究に使う意義も見えてきます。
何を調べた研究なのか
研究チームは、参加者が物語の音声を聞いている間、海馬の神経細胞の反応を記録しました。海馬は、記憶に深く関わる脳の領域です。記録した活動を、AIが単語を数値で表したデータと比較しました。[1]
単語の意味は、特定の細胞だけでなく、複数の細胞の活動の組み合わせに表れていました。研究チームによると、音や文法の影響を考慮しても、意味に関わる情報が残っていました。比較したモデルの中では、GPT-2の表現が脳活動と最もよく対応しました。[1]
ここでいう「対応」とは、脳活動とAI内部の数値との間に、分析で捉えられる関係があるという意味です。神経細胞のつながり方がGPT-2の構造と一致した、という話ではありません。
「意味を数値で表す」とは?文脈で変わる言葉を例に考える
意味表現とは、言葉が指す内容や、ほかの言葉との関係を、内部で処理できる形にしたものです。AIでは、多数の数値を並べた「ベクトル」で表します。言葉を、多くの軸がある地図上に配置するような方法です。
説明のために、「銀行にお金を預ける」と「川の岸を歩く」を例に考えます。英語では「銀行」と「岸」のどちらにも「bank」を使います。同じ単語でも、周囲の言葉を手掛かりに意味を区別する必要があります。
文脈を扱うモデルは、周囲の情報に応じて単語の表現を変えます。この例は仕組みを説明するためのもので、今回の実験結果をそのまま再現したものではありません。
細胞の活動の組み合わせは、和音にもたとえられます。音の組み合わせによって響きが変わるように、細胞の反応の組み合わせに意味に関わる情報が表れる、というイメージです。脳が音楽と同じ処理をしているという意味ではありません。
GPT-2・BERT・Word2Vecを比べると何が分かる?
モデルを比較する目的は、どのAIが「最も賢いか」を決めることではなく、意味のどの特徴が脳活動と対応するかを調べることです。今回の論文では、Word2Vec、BERT、GPT-2の表現を比較しています。[1]
| モデル | 基本的な特徴 | 比較する意義 |
|---|---|---|
| Word2Vec | 基本形では、単語ごとに固定のベクトルを持つ | 文脈によって変わらない単語同士の関係を調べる |
| BERT | 左右の文脈を使って表現を作る | 周囲の言葉を踏まえた意味を調べる |
| GPT-2 | それまでの文章から次の言葉を予測するように学習する | それまでの文脈に基づく表現を調べる |
各モデルの基本的な特徴は、原論文や公式資料に基づいています。比較する意義は、本記事で整理したものです。GPT-2は2019年に発表されたモデルで、現在のChatGPTそのものではありません。[2][3][4]
GPT-2と脳活動の対応が強くても、それによってChatGPT、Claude、Geminiの性能順位が決まるわけではありません。文章生成の品質と、特定の脳活動を説明する力は、別々に測る必要があります。
独自計算:92÷356は約25.8%。何の割合なのか
論文の拡張データ図には、356個の神経細胞を使った解析と、そのうち意味表現から活動を有意に予測できた92個の細胞を使った解析が示されています。[1]
本記事で割合を計算すると、92÷356×100=約25.8%です。解析対象となった細胞の約4分の1に当たります。
約25.8%は、解析対象のうち条件を満たした細胞の割合です。「脳の25.8%が意味を理解する」という数字ではありません。残りの細胞が意味の処理に関わらないとも判断できません。
測定する場所や、与える刺激、分析方法が変われば、検出できる反応も変わります。また、細胞数が多くても、参加者の多様性が十分とは限りません。細胞数と人数は、分けて読む必要があります。
過去研究と比較すると、今回の新しさが見える
意味が神経細胞の集団活動に表れるという考えは、今回初めて示されたものではありません。今回の成果は、その表現を、文脈を扱う言語モデルの表現と比較した点にあります。
| 研究 | 測定・課題 | 規模や数値 | 今回との違い |
|---|---|---|---|
| 2019年、PLOS Biology | 内側側頭葉の神経活動を記録し、画像の意味を調べた | 25人、4,917ユニット、100画像 | 視覚刺激を使い、意味のカテゴリーを表す集団活動を調べた |
| 2022年、Scientific Reports | 物語を聞く人のfMRIデータとGPT-2の表現を比較 | 101人、計70分の音声刺激 | 脳活動との対応の強さと、理解度の関係を調べた |
| 2026年、今回の研究 | 物語を聞いている間の海馬の神経細胞の活動を解析 | 拡張データ図の比較では356細胞と92細胞の集団を使用 | 細胞集団の活動と、文脈に応じた意味表現の関係を調べた |
2019年の研究でいう「ユニット」は、記録して区別した神経活動の単位です。各研究の人数、細胞数、刺激数は、それぞれ異なるものを数えています。この表は研究の設計を比べるためのもので、成果の優劣を示すものではありません。[1][5][6]
2022年の研究では、GPT-2と脳活動の対応の強さと、物語の理解度との相関係数は0.50でした。これは「脳とAIが50%一致した」という意味ではありません。相関係数は、二つの指標が一緒に変化する傾向を表します。[6]
「同じ仕組み」といえない理由を3段階で整理する
似た情報を表すこと、同じ計算をすること、同じ経験を持つことは、それぞれ別の主張です。本記事では、証拠を次の3段階に分けて考えます。
| 判断したいこと | 必要な証拠 | 今回の研究からの判断 |
|---|---|---|
| 意味の表し方に共通点がある | 意味の関係と活動パターンの対応 | 共通点があることを支持する結果が得られている |
| 同じ処理手順で意味を作る | 処理過程の比較や、条件を操作したときの因果関係 | 今回見つかった対応だけでは確定できない |
| AIが人と同じ主観的経験を持つ | 主観的経験を検証する別の枠組み | 今回の研究では判断できない |
たとえば、二つの地図に同じ町の位置関係が描かれていても、測量方法まで同じとは限りません。脳とAIについても、内部表現が似ていることから、その作られ方まで同じとはいえません。
同じ物語を処理しているために、両者が似た情報を捉えている可能性もあります。音や文法の影響を考慮した分析は、意味との関係を確かめるうえで大切です。ただし、その結果と、共通の回路や学習方法を直接示す証拠は区別する必要があります。
反証もある。「似た意味なら近い表現」とは限らない
今回の論文には、脳とAIが単純に一致するという見方では説明しにくい結果も含まれています。意味がよく似た単語では、意味の距離と神経活動の距離の関係が逆になる場合がありました。[1]
著者らは、似た意味を区別してノイズの影響を抑える「対比的な符号化」が関係していると解釈しています。似た情報を離して表すことで、混同を減らすという考え方です。ただし、これは観察結果を説明する解釈です。原因が直接確定したわけではありません。
別の研究でも、共通点だけでは全体を説明できないことが報告されています。NeurIPS 2024の論文では、脳磁図という脳活動の測定法を使い、言語モデルとの違いを調べました。社会や感情に関する情報と、物理的な常識を扱う際に、対応が弱くなる場面を報告しています。[7]
この研究では、関連する情報を追加学習させると、対応が改善しました。そのため、「違いがあるからAIは永遠に人に近づけない」ともいえません。どの課題で似ていて、どの課題で異なるのかを調べる必要があります。
次に何を確かめれば「仕組み」の議論が進むのか
次の課題は、似た表現が見つかることに加え、条件を変えると脳とAIがそれぞれどう変化するかを確かめることです。以下は、今回の結果を踏まえて本記事で考えた追加検証の案です。実施済みの研究成果ではありません。
| 検証案 | 確かめたいこと |
|---|---|
| 同じ単語を、異なる意味になる文脈で比べる | 単語の形への反応と、文脈による意味の変化を分ける |
| モデルが参照する文脈の長さを変えて比べる | どこまでさかのぼった情報が、脳活動との対応に必要なのかを調べる |
| 別の参加者や、学習に使わない物語で確かめる | 特定の人や文章にしか当てはまらない結果ではないかを調べる |
こうした検証でも対応が保たれれば、共通する処理を考える材料が増えます。逆に、対応が崩れる条件が分かれば、それも脳とAIの違いを説明する成果になります。
読者への影響:AIを見る目と、脳研究の道具が変わる
今回の成果は、AIを人の脳そのものと見なすよりも、脳の働きを調べる道具として使う根拠になります。言語モデルを使えば、文脈によって変わる意味を数値で表し、神経活動と比較できます。
利点は、曖昧だった問いを、データで検証できる形に近づけられることです。ただし、分析に使ったAIの特徴を、そのまま脳の性質だと思い込む危険もあります。複数のモデルと比較し、異なる課題でも検証する必要があります。
一般のAI利用者も、「脳に似ている」という説明だけで回答の正しさを判断するべきではありません。今回の研究は、AIの意識や個々の回答の信頼性を検証したものではないからです。
今回、文脈に応じた意味表現に共通点が見つかりました。ただし、処理の仕組みが同じかどうかは確定しておらず、違いも研究の手掛かりになります。脳とAIがどこまで似ているのかを知るには、共通点と限界の両方を見る必要があります。
関連ページ
参照できる文脈の量と、その情報を正しく使える力は別です。言語モデルによる文脈の扱い方は、以下の記事でも解説しています。
出典・参考資料
本記事の約25.8%は、原論文に記載された細胞数から独自に計算した値です。証拠を3段階に分けた整理と追加検証案は、本記事の考察です。資料の確認日は2026年10月1日です。
- Franchほか「A population code for semantics in human hippocampus」。Nature Neuroscience、2026年9月30日。論文の要旨と、公開された拡張データ図の説明を参照。
https://www.nature.com/articles/s41593-026-02436-4 - OpenAI「Better language models」。GPT-2の公式発表。
https://openai.com/index/better-language-models/ - Devlinほか「BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding」。NAACL 2019。
https://aclanthology.org/N19-1423/ - Mikolovほか「Efficient Estimation of Word Representations in Vector Space」。2013年。
https://arxiv.org/abs/1301.3781 - Reberほか「Representation of abstract semantic knowledge in populations of human single neurons in the medial temporal lobe」。PLOS Biology、2019年6月3日。
https://journals.plos.org/plosbiology/article?id=10.1371/journal.pbio.3000290 - Caucheteuxほか「Deep language algorithms predict semantic comprehension from brain activity」。Scientific Reports、2022年9月29日。
https://pmc.ncbi.nlm.nih.gov/articles/PMC9522791/ - Zhouほか「Divergences between Language Models and Human Brains」。NeurIPS 2024。
https://proceedings.neurips.cc/paper_files/paper/2024/hash/f96839fc751b67492e17e70f5c9730e4-Abstract-Conference.html



コメントを送信