Google DeepMindは2026年9月8日、ヒトゲノムで起こりうる約90億通りの1文字の置き換えについて、分子レベルでどのような影響が生じるかを予測した「AlphaGenome Atlas」を公開した。AIモデル「AlphaGenome」による予測をあらかじめ計算し、研究者が検索・比較できるようにしたデータベースだ。公式発表によると、非商用利用向けに公開されており、Google Cloudでの商用提供も予定している。
病気の原因となる変異を絞り込む助けにはなるが、90億通りの予測だけで患者の診断が確定するわけではない。予測を実験で裏づけた研究事例がある一方、DeepMindは臨床利用について検証・承認されていないと明記している。
今回の発表によって、病気の理解はどこまで進むのか。予測数、候補の絞り込み、診断の確かさという性質の異なる数字を分けて見ると、その価値と限界が見えてくる。
90億通りとは何か――「30億カ所×3種類」の置き換え
DNAの塩基は、A・C・G・Tの4文字で表される。ある位置の文字がAなら、別の文字への置き換えはC・G・Tの3種類ある。ヒトゲノムを約30億カ所として概算すると、次のようになる。
約30億カ所×各位置で可能な3種類の置き換え=約90億通り
90億という数字は、基準となる配列の各位置を1文字ずつ置き換えた場合の数であり、90億人の患者や90億種類の病気を調べたという意味ではない。公式発表が対象としているのは、こうした単一塩基変異(SNV)が分子に与える影響だ。実際には人から見つかっていない変異も予測対象に含まれる。
1文字の置き換えを網羅していても、DNAの挿入・欠失や大きな構造変化、複数の変異が同時に存在する場合まで網羅したわけではない。「すべてのDNA変異を解明した」と受け取ると、対象範囲を広げすぎることになる。
AlphaGenomeとAtlasの違い――その場で予測するモデルから、検索できる地図へ
AlphaGenomeは2025年6月に発表され、その基盤となる研究は2026年1月28日にNatureへ掲載された。DNA配列から、遺伝子の働きやRNAの処理などを予測するモデルだ。Atlasは、その予測を大規模に事前計算し、参照しやすくしたものになる。初公開時の公式説明とNature論文を見ると、この二つの役割の違いが分かる。
| 比較項目 | AlphaGenome | AlphaGenome Atlas |
|---|---|---|
| 中心となる役割 | 入力されたDNA配列から分子の働きを予測する | 事前に計算した変異の影響を検索・比較する |
| 規模を表す数字 | 約100万塩基の配列を一度に入力 | 約90億通りのSNVを収録 |
| 研究での使い方 | 個別の配列や変異について仮説を調べる | 大量の候補に優先順位をつけ、詳しく調べる変異を選ぶ |
| 数字の読み方 | 入力できる配列の長さ | 予測を用意した変異の件数 |
Atlasの新しさは、個別の予測能力を、多くの研究者が繰り返し使える検索基盤に変えた点にある。地図に例えるなら、必要な場所をその都度測量する仕組みに加えて、広い範囲の地形図をあらかじめ用意したようなものだ。ただし、予測を集めたからといって、その一つひとつが実験で確認済みになるわけではない。
タンパク質の設計図だけでなく、「いつ、どこで働くか」を調べる
ヒトゲノムのうち、タンパク質を直接コードする領域は約2%とされる。残る非コード領域には、遺伝子がいつ、どの細胞で、どれだけ働くかを調整する配列などが含まれる。DeepMindの解説では、AlphaGenomeがこうした遺伝子制御の理解に役立つと説明している。ただし、非コード領域のすべてが、機能の判明した調節スイッチというわけではない。
タンパク質の設計図そのものに大きな問題が見つからなくても、読み出される量やRNAのつなぎ方が変われば、細胞の働きに影響する可能性がある。AlphaGenomeは、そうした変化を複数の角度から調べる。
Atlasでは、AlphaGenomeと、タンパク質のアミノ酸を変える変異を扱うAlphaMissenseの情報をまとめた「AlphaGenome Variant Impact(AVI)」スコアも提供する。AVIは詳しく調べる変異に優先順位をつける指標であり、個人が病気になる確率をそのまま示す数値ではない。どの分子過程の予測が評価に影響したかも確認できる。[公式発表]
原因特定に近づいた事例――DNM1では実験による裏づけも
DeepMindの公式紹介によると、Broad Instituteなどの研究チームは、AVIを使って希少疾患の候補を調べ、てんかん性脳症との関連が知られるDNM1遺伝子に影響する変異を見いだした。予測された仕組みは、RNAを切り貼りするときに異常な部位が生じ、その結果、タンパク質が通常より長くなるというものだった。この予測は実験でも検証された。[研究事例の公式説明]
この事例で重要なのは、AIが候補を示した後に、作用の仕組みを調べ、実験で裏づけたことだ。「AIの点数が高かったから原因と決めた」という手順ではない。
病気の原因を評価するには、分子機能への影響に加えて、患者の症状、遺伝の仕方、集団中での頻度などを照らし合わせる必要がある。2015年のACMG・AMPによる変異解釈の基礎的な指針でも、計算予測、機能実験、家族内での遺伝など、複数の証拠を組み合わせる枠組みが示されている。[ACMG・AMP共同指針]
今回の成功事例は有望だが、これだけでは「未診断の患者の何%が診断できるのか」は分からない。導入前後の診断率を比べるには、成功した症例だけを見るのではなく、対象患者全体を分母にした検証が必要になる。
独自計算①:526候補から4候補へ――約99.24%減でも、診断精度とは違う
エクセター大学の研究では、5万4,000人超のUK Biobank参加者のデータを解析した。公式ページでは、ある領域で候補を526変異から4変異に絞った例が紹介されている。[AlphaGenome公式ページ]
この数字から、候補数がどの程度減ったのかを独自に計算できる。
| 計算するもの | 計算式 | 結果 |
|---|---|---|
| 候補から外れた件数 | 526-4 | 522件 |
| 候補数の削減率 | 522÷526×100 | 約99.24% |
| 残った候補の割合 | 4÷526×100 | 約0.76% |
| 絞り込み前後の件数比 | 526÷4 | 131.5対1 |
候補を約99.24%減らせることと、病気の原因を99.24%の精度で当てられることは、まったく異なる。これは特定領域で候補を絞った例であり、すべての患者や遺伝子に当てはまる削減率でもない。
研究者にとっては、次に実験する対象を選びやすくなる利点がある。ただし、候補を減らしすぎて、本当に重要な変異まで除外していないかも確認しなければならない。性能を評価するなら、残った件数だけでなく、「既知の重要変異をどれだけ残せたか」と「残った候補のうち何件を実験で確認できたか」も見る必要がある。
公式発表では、非コード領域の遺伝的関連を22%多く検出した成果も紹介されている。ここでの分母は、比較手法で検出した関連の件数であり、患者数ではない。「診断率が22ポイント上がった」と読み替えることはできない。比較元を100件と仮定すれば122件になるという相対的な増加であり、この100件は説明のために置いた数字だ。[公式発表]
独自計算②:見逃しが少なくても、候補の大半が外れる場合がある
大量の変異から少数の原因候補を探す難しさは、簡単な仮定計算でイメージできる。以下はAlphaGenomeやAVIの実測性能ではなく、候補選別の仕組みを説明するための架空の例である。
10万件の変異のうち、調べたい病気に本当に関わるものが100件あるとする。選別方法がその90%を拾い、関わらない9万9,900件のうち1%を誤って候補に残した場合、結果は次のようになる。
| 項目 | 計算 | 件数 |
|---|---|---|
| 正しく残した原因関連変異 | 100×90% | 90件 |
| 誤って残した無関係の変異 | 99,900×1% | 999件 |
| 残った候補の合計 | 90+999 | 1,089件 |
| 候補中で本当に関連する割合 | 90÷1,089×100 | 約8.3% |
本当に関連する変異の90%を拾えても、元の集団で関連変異がまれなら、残った候補の大半が無関係ということは起こりうる。AIによる候補選別と診断の確定を分けて考える必要がある理由の一つだ。
この例でも、10万件を約1,000件まで減らせたことには研究上の価値がある。さらに症状や家族の情報などを加えて絞り込めば、候補の内容も変わってくる。予測ツールの有用性は「全自動で正解が出るか」だけで判断するものではない。「重要な候補を残しながら、次の検証をどれだけ進めやすくできるか」も評価する必要がある。
競合比較――Evo 2やSpliceAIとは、得意とする問いが違う
ゲノムAIを比べる際は、扱うデータ量よりも、何を予測し、どの実験で確かめたかをそろえる必要がある。Atlasはデータベースであり、Evo 2などのモデルと同じ種類の製品ではない。
| 技術 | 主な対象・役割 | AlphaGenome Atlasとの関係 |
|---|---|---|
| AlphaMissense | アミノ酸を変えるミスセンス変異の影響 | AVIの構成に使われる補完的なモデル |
| SpliceAI | RNAのスプライシングに関する変化 | 特定機能に絞った予測との比較対象 |
| Enformer・Borzoi | DNA配列から遺伝子発現などを予測 | AlphaGenomeの基盤論文で比較される先行モデル |
| Evo 2 | 幅広い生物のゲノム配列を学習し、変異評価や配列生成に利用 | 汎用的な配列モデル。事前計算したヒト変異データベースとは役割が異なる |
| AlphaGenome Atlas | 約90億通りのSNVの予測結果を検索し、優先順位をつける | 予測を大規模な研究で使うための基盤 |
出典:AlphaMissense公式資料、AlphaGenomeのNature論文、Arc InstituteのEvo 2発表。
Arc Instituteによると、Evo 2は9.3兆超の塩基に相当する学習データを使い、最大約100万塩基を一度に処理する。この「9.3兆」は学習に使った配列量であり、Atlasの「90億」という予測済み変異数とは性質が異なるため、そのまま比較できない。数字が大きいからといって、高性能とは限らない。
一方、2026年1月のAlphaGenome論文では、変異効果予測の26評価中25評価で、最良の外部モデルと同等以上の成績を報告している。25÷26は約96.2%だが、これは比較評価の項目数に占める割合であって、患者の診断精度が96.2%という意味ではない。Atlasの臨床性能を直接示す数字でもない。
反証と限界――100万文字を読めても、遠くの作用を完全には捉えられない
AlphaGenomeの基盤論文では、10万塩基以上離れた調節領域の影響や、細胞・組織による違いを正確に捉えることが課題として挙げられている。また、個人のゲノム全体を対象とした予測は、この研究では評価していない。[Nature論文の限界に関する記述]
「100万塩基を入力できる」は、100万塩基の範囲内にあるすべての相互作用を正しく理解できる、という保証ではない。長い文章を読み込めることと、離れた段落同士の因果関係まで漏れなく理解できることが違うのと似ている。
ここから、Atlasへの期待を検証するうえで新たな問いが出てくる。基準配列で高く評価された変異は、患者本人が持つ別の変異や、病気に関係する細胞の状態を考慮しても重要なのか。予測された分子の変化は、実際に症状へつながるほど大きなものなのか。こうした問題は、収録件数を増やすだけでは解決しない。
低いスコアも「絶対に無害」という証明にはならない。モデルが捉えにくい作用であれば、本来は重要な変異でも低く評価される可能性がある。高いスコアにも低いスコアにも、モデルが扱える範囲という前提がある。
独自計算③:1PBは10Gbpsでも約9.3日――使いやすい公開方法に意味がある
Atlasのデータ規模は約1ペタバイト(PB)だ。公式ページでは、ウェブでの閲覧や関連ツールを通じた利用方法を案内している。この容量を見ると、データをどのように利用するかという別の課題も見えてくる。
1PBを10の15乗バイトとし、全量を一度に転送する単純なケースを考える。8ビット=1バイトで換算した理論上の最短時間は、次の通りとなる。
| 一定と仮定する転送速度 | 計算式 | 1PBの転送時間 |
|---|---|---|
| 1Gbps | 10の15乗×8÷10の9乗 | 約800万秒=約92.6日 |
| 10Gbps | 10の15乗×8÷10の10乗 | 約80万秒=約9.3日 |
注:独自の理論計算。通信の付加情報、混雑、保存装置の速度、再送などは含めていない。圧縮や取得範囲によって転送量は変わる。Atlasの実測ダウンロード時間を示したものではなく、利用に全量取得が必要という意味でもない。
研究者が必要な部分だけを検索できる仕組みは、巨大な予測データを実際に使える研究資源へ変えるための重要な機能だ。全量を手元に置く必要がなければ、保存容量や転送待ちの負担を抑えられる。
本記事では、Atlasを「推論の負担を事前計算へ移し、検索を通じて共有する仕組み」と捉える。ただし、利用が広がるほど検索の再現性や版の管理も重要になる。同じ変異でも更新後に評価が変わる可能性があるため、研究では使用した版、検索条件、選別基準を残しておく意味がある。
過去事例:AlphaFoldが示した、予測データベースと実験の関係
DeepMindとEMBL-EBIは2022年7月、AlphaFoldの構造予測データベースを2億件超へ拡大した。公式発表では、核膜孔複合体の研究など、実験で得た情報と構造予測を組み合わせた例も紹介している。[2022年のAlphaFold公式発表]
AlphaFoldの先行例から得られる教訓は、予測の大量公開が、研究者による検証と解釈を進める足場になることだ。Atlasでも、予測を検索して終わるのではなく、見つかった候補を実験や臨床情報と結びつける段階が価値を左右する。
こう考えると、Atlasの普及後に追うべき成果は収録件数だけではない。同じ実験予算で確認できる重要変異が増えたか、未診断例の再解析で原因を説明できた割合が上がったか、候補を絞ることで見逃しが増えていないか。こうした指標を見た方が、医療への応用がどこまで進んだのかを判断しやすい。
読者への影響――診断の自動化より、原因を探す研究の前進に注目
患者や家族にとって期待できるのは、これまで解釈が難しかった変異を再検討するための手がかりが増えることだ。研究者には候補選別を効率化できる可能性があり、創薬では病気に関係する遺伝子制御の仕組みを調べる材料になる。ただし、これらが実際に診断や治療へどこまで結びつくかは、今後の検証によって決まる。
現時点で一般の利用者がAVIスコアだけを見て、自分の病気や将来の発症を判断することはできない。公式発表でも、医療上の助言・診断・治療の代替ではなく、臨床利用の検証・承認は得ていないとしている。[利用上の位置づけ]
AlphaGenome Atlasによって大きく広がったのは、「この変異を次に調べるべきか」を判断するための情報だ。90億通りという膨大な予測を、実験で裏づけられた発見、さらに患者に役立つ判断へつなげられるのか。今後は、そのつながりを具体的な成果で確かめる段階に入る。
関連ページ・一次資料
モデルの仕組み、Atlasの公開内容、病気との関係の評価は、それぞれ対応する資料で確認できる。
- Google DeepMind:AlphaGenome Atlasの公式発表――公開対象、AVI、研究事例、利用上の位置づけ。
- AlphaGenome公式ページ――Atlasへの入口と研究事例。
- Nature:Advancing regulatory variant effect prediction with AlphaGenome――2026年1月公開の基盤モデルの論文。今回のAtlas発表とは区別して読む。
- Arc Institute:Evo 2の公式発表――異なる方式のゲノムAIとの比較資料。
- ACMG・AMP:遺伝子変異の解釈に関する2015年の共同指針――複数の証拠を組み合わせる基本的な考え方。
- 核融合AI「PACMAN」、20ミリ秒で制御し不安定性を200ミリ秒前に予測――AIの予測能力と実際の成果を分けて読むための関連記事。
情報確認日:2026年9月9日(日本時間)。研究事例は発表元の説明に基づく。本文の独自計算は入力値と前提を併記し、実測結果、仮定例、筆者の分析を区別した。



コメントを送信