Googleの医療AI「AMIE」が、実際の患者を対象とした受診前の問診に使われました。医療者が会話を見守るなか、98人がAIとの問診と外来診療を終えています。医療者からは、診察の準備に役立ったという評価が得られました。
今回の研究で示されたのは、医療者の監督下でAIを問診に使える可能性です。診断や治療をAIだけに任せられると証明したわけではありません。「診断が90%一致」「安全上の中断ゼロ」という数字も、条件と分母を確認する必要があります。
Googleは2026年10月8日、この研究が医学誌「The Lancet」に掲載されたと発表しました。共同研究先は、米国ボストンのベス・イスラエル・ディーコネス医療センター(BIDMC)です。研究結果は同年3月にすでに公開されており、今回は査読を経た論文の掲載がニュースになっています。[1][2]
AMIEは何をした?診察前に症状を聞き、医療者に伝える
AMIEは、Googleが研究を進めている医療向けの対話AIです。患者に追加の質問をしながら、症状や過去にかかった病気を整理します。病名の候補を挙げ、医療者との相談に必要な情報をまとめます。
今回、患者は自宅などから文字チャットでAMIEとやり取りしました。会話の記録と要約は、診察を担当する医療者が確認できるようにしています。AIとの会話中は、別の医療者が画面共有を通じて監督しました。[2]
AIが診察前に情報を集め、その後に人が診察する流れでした。問診で聞き取った情報を、診察室で確かめていく使い方です。患者が詳しく話す時間を確保できれば、伝え忘れを減らせる可能性があります。
ただし、伝え忘れを減らせる可能性と、実際に治療成績が改善したかどうかは別の話です。今回の研究では、AIを使わない患者群との比較を行っていません。通常の診療より良い結果が得られるかを確かめるには、対照群を設けた研究が必要です。[3]
98人は参加者全員ではない——開始から診察までを分けて見る
98人は、AIとの問診と医療者の診察を両方終えた人数です。研究に登録してAIとのやり取りを始めたのは114人でした。AIとの問診を完了したのは100人で、そのうち98人が予定された診察も受けています。[3][4]
| 研究の段階 | 人数 | 114人を基準にした割合 |
|---|---|---|
| 登録してAIとのやり取りを開始 | 114人 | 100% |
| AIとの問診を完了 | 100人 | 87.7% |
| 問診と予定された診察を完了 | 98人 | 86.0% |
割合は本記事で計算しました。100÷114×100=87.7%、98÷114×100=86.0%です。診察まで進まなかった理由は一つではないため、残りの16人をすべて「AIの失敗」と数えることはできません。
ただ、完了した患者だけを評価すると、途中で利用できなくなった人の経験を見落とします。実用化を考える際には、利用後の評価に加え、最後まで利用できた割合も確認する必要があります。文字入力や接続でつまずいた人を誰が支えるかも、検討すべき課題です。
「診断が90%一致」の意味——第一候補の一致は56%
AMIEの評価では、AIが挙げた病名の候補を、診察後の記録に基づく最終診断と照合しました。このように、症状の原因として考えられる病気を候補に挙げて絞り込むことを「鑑別診断」と呼びます。
90%は、七つの候補のどこかに最終診断が含まれていた割合です。最も可能性が高い第一候補が一致した割合は56%でした。上位三つまでなら75%です。同じAIでも、どの順位まで正解に数えるかで数字が変わります。[2][5]
| 一致と数える範囲 | 割合 | 数字の読み方 |
|---|---|---|
| 第一候補 | 56% | 最有力の病名が最終診断と一致 |
| 上位三つの候補 | 75% | 三つの候補の中に最終診断が含まれる |
| 上位七つの候補 | 90% | 七つの候補の中に最終診断が含まれる |
例えば、探し物の場所を一つに絞る場合と、七つ挙げる場合では、当たりやすさが違います。医療でも、候補を広く挙げる力と、最有力の病気を選ぶ力は分けて評価する必要があります。
候補を広く挙げれば、見落としを減らせる可能性があります。その反面、候補を確かめるための検査や説明が増えることも考えられます。筆者は、候補数と一致率に加え、確認にかかる負担も評価する必要があると考えます。
最終診断と一致していても、長期的に病気の見逃しがなかったと保証されるわけではありません。検査結果で確かめた診断と、診察時の判断に基づく診断では、確かさが異なります。病名候補の一致率だけから、治療の有効性まで判断することはできません。
中断ゼロでも誤りはあった——安全性をどう読むか
監督する医療者には、安全上の問題が起きたときに会話を止める基準が設けられていました。患者や他者への危害、AIとの会話による強い苦痛、臨床上の危険、患者からの終了希望などです。この基準に基づく中断はありませんでした。[2]
中断がなかったとしても、誤りや人による補足が一切なかったわけではありません。BIDMCの発表では、AIが事実と異なる内容を生成する「ハルシネーション」が一件確認されています。五件では、監督する医療者が臨床上の補足説明をしました。[3]
研究で検証したのは、監督体制を含む一連の運用です。その結果を、人の監督がない場合のAIの安全性に、そのまま当てはめることはできません。
独自計算:0件/98件から、どこまで判断できる?
98件で中断がゼロでも、まれに中断が必要になる可能性までは否定できません。各問診が独立しており、中断が必要になる確率はどの問診でも同じだと仮定します。この条件では、0件/98件から求める片側95%信頼上限は約3.01%です。
計算式は「1−0.05の98分の1乗」です。今回の観測結果と両立する確率の上限を、統計的に見積もったものです。実際に3%の中断が起きると予測した数字ではありません。
この計算の対象は、研究で定めた「安全上の中断」です。誤診や患者への害全体の発生率を表すものではありません。監督の有無や患者の条件が変わった場合にも、そのまま適用することはできません。
「準備に役立った75%」——分母は44件だった
BIDMCによると、診察前にAIの記録や要約を確認できたケースは44件でした。そのうち75%で、医療者が診察の準備に役立ったと回答しています。57%では、診療の進め方に影響した可能性があると答えました。[3]
75%は、全98件に対する割合ではありません。記録を確認できた44件に対する評価です。この分母を省くと、AIの情報が実際に診療へ届いた範囲を、広く捉えすぎてしまいます。
| 本記事の計算 | 結果 | 意味 |
|---|---|---|
| 44÷98×100 | 44.9% | 全98件のうち、診察前の確認が報告された割合 |
| 44×75% | 33件 | 準備に役立ったと回答された件数 |
| 33÷98×100 | 33.7% | 全98件のうち、役立ったとの回答を確認できる割合 |
ただし、33.7%をAIの「本当の有効率」と捉えるのも適切ではありません。残るケースには、回答が得られていないものなどが含まれます。評価を確認できないケースを、役立たなかったケースとして扱うことはできません。
ここで課題になるのは、作成した要約を医療者に届ける仕組みです。医療者が診察前に要約を読める場所と時間を確保できなければ、AIの働きを十分に生かせません。次の研究では、要約の質に加え、何件で読まれ、診療に使われたかも確認する必要があります。
医療者が優れていたのは、実行しやすさと費用への配慮
評価者がAIと医療者の回答を比較したところ、病名候補の全体的な質や、診療計画の適切さ・安全性には、統計的に明確な差が見つかりませんでした。一方、計画の実行しやすさと費用対効果では、医療者の評価が高くなりました。[5]
病名の候補を挙げる力に加え、その患者が実際に受けられる診療を組み立てる力も問われています。一般論として適切な検査でも、すぐに予約できるとは限りません。通院の負担や費用も含めて考える必要があります。
ただし、比較条件には違いがあります。今回のAMIEは、電子カルテを参照したり、患者の体を診察したりできませんでした。医療者とAIが同じ情報を得たうえでの比較ではないため、結果の差をすべてAIの推論能力だけで説明することはできません。[2]
「明確な差が見つからない」という結果も、「同じ能力だと証明された」という意味ではありません。人数の少ない研究では、差があっても検出できない場合があります。また、診療計画の評価点と、患者の健康が改善したかどうかは、別の指標です。
過去のAMIE、Microsoft、ユビー——何を比べるべきか
医療AIの数字を比較するときは、対象となる患者、課題、正解の数え方をそろえる必要があります。実際の外来、患者役との模擬診療、既存の難しい症例では、測っている能力が異なります。
2024年に発表された初期のAMIE研究は、患者役を使った文字チャットによる模擬診療でした。149の症例シナリオを用い、20人のプライマリケア医と比較しています。2026年8月には、映像と音声を扱うAMIEの模擬診療研究も発表されました。今回の実際の患者を対象とした文字問診とは、別の研究です。[6][7]
| AI・サービス | 確認された用途・評価 | AMIEの外来研究と比較する際の注意 |
|---|---|---|
| AMIEの今回の研究 | 実際の患者を対象とした受診前の問診。医療者がリアルタイムで監督 | 通常診療との比較群は設けていない |
| Microsoft「MAI-DxO」 | NEJMに掲載された難しい304症例を使った診断評価 | 実際の患者への問診ではない。最高85.5%の診断成績と、AMIEの候補内一致90%を単純に比べて優劣を決めることはできない |
| ユビーAI問診 | 患者の回答に応じた質問と、カルテ下書きの生成 | 実際の業務を支える製品。今回の98件と同じ診断試験ではない |
Microsoftの数字は、同社の公式発表に基づきます。ユビーは公式ページで、47都道府県・1,800の医療機関への導入実績を公表しています。導入数は普及の指標であり、診断精度を表す数字ではありません。[8][9]
日本の過去事例も参考になります。ユビーが紹介するこうのす共生病院の事例では、導入初期に操作を支援するため、事務職の負担が一時的に増えました。その後、電子カルテの導入などが進み、医療者の利用も広がったと説明されています。販売元が紹介する一施設の経験ですが、現場でどう使うかを考える材料になります。[10]
独自試算:問診を任せても、医療者の時間は減るとは限らない
AIでどれだけ作業を減らせるかは、短縮できた時間から、監督や確認のために増えた時間を引いて判断します。今回のように人が会話を見守る運用では、AIが質問している間も医療者の時間を使います。
本記事では、その判断に必要な式を「医療者全体の時間削減=従来の作業から短縮した時間−監督・確認・修正に追加した時間」と整理します。担当医の負担が軽くなっても、別の監督者の負担が増えれば、全体として作業が減るとは限りません。
仮に、一人あたりの診察準備が5分短縮され、監督のために20分追加されたとします。他の条件が同じなら、医療者全体の作業時間は15分増えます。100人では1,500分、25時間の増加です。これは説明のための仮定で、AMIE研究で測定された時間ではありません。
それでも、安全性や患者の話しやすさに価値があれば、導入を検討する理由はあります。目的を時間削減だけに限る必要はありません。ただし、「負担を減らす」と主張するなら、担当医、監督者、操作を支える職員の作業時間を合計して確かめる必要があります。
患者への影響——話しやすさと、不安が増える可能性
患者からは、話を聞く姿勢や説明の分かりやすさについて、好意的な評価がありました。一方で、情報の秘密が守られるか、AIの説明を信頼できるかという懸念も残っています。[3]
病名候補を患者に示す価値は、診断との一致率だけでなく、伝え方によっても変わります。BIDMCの発表では、候補にリンパ腫が含まれたことで患者が不安になった可能性を、医療者が指摘した一件も紹介されています。[3]
重い病気を候補に挙げること自体が、必ずしも誤りとは限りません。見落としを避けるために必要な場合もあります。ただし、候補に挙がったことと、その病気だと診断されたことの違いは、患者に伝える必要があります。
筆者は、患者向けの説明と医療者向けの候補一覧を分けて設計する方法が考えられると見ています。患者には不確実な点や、診察で確認する内容を説明します。医療者には、候補を挙げた根拠と不足している情報を示します。こうした設計で不安を減らせるかは、今後の検証課題です。
今回の研究では、対象となる患者にも条件がありました。18歳以上で、英語でやり取りでき、スマートフォン以外の端末を利用できる患者です。救急対応が必要な患者や、妊娠、精神面に関する相談などは対象から外しました。日本語での利用や、対象から外れた患者への安全性まで、今回確かめられたわけではありません。[4]
次に見るべきは、診療全体への効果
次の焦点は、AIを使った診療が、通常の診療より安全で役立つかどうかです。Googleも、より大規模な臨床研究が必要だとしています。98件の結果は、その検証へ進むための材料です。[1]
今後の研究で確認したい項目は、四つあります。病気の見逃しや不要な検査、患者が感じる不安、最後まで利用できた割合、そして職員全体の作業時間です。病名候補の一致率だけでは、これらを評価できません。
今回の研究では、医療者の監督下で問診を進められ、記録を確認した医療者の多くが診察の準備に役立つと答えました。その一方で、AIの誤り、人による補足説明、患者の不安も報告されています。同じ研究で確認された可能性と課題の両方を踏まえて、次の検証を考える必要があります。
関連ページ
AIの評価を読むときは、数字の高さと、実際に任せられる範囲を分けて考えると理解しやすくなります。評価方法や研究の信頼性については、次の記事も参考になります。
出典・計算条件
公式発表の結果と、本記事の独自計算や仮定に基づく試算を分けて記載しています。確認日は2026年10月10日です。査読版の掲載と主要な結果はGoogle・研究機関の公式発表で確認し、研究方法の詳細は公開原稿と照合しました。
本記事では、比較のために関連記事10本を確認しています。ただし、Google検索の順位は取得できておらず、「検索上位10記事のすべてにない」とは断定していません。独自に加えた要素は、完了率の再計算、中断ゼロの統計的な上限、要約を確認した件数を分母に含めた再集計、監督時間を含めた省力化の試算です。
- Google(2026年10月8日):Study in The Lancet suggests AI could improve patient-physician relationships
- Google Research(2026年3月11日公開、10月8日更新):Exploring the feasibility of conversational diagnostic AI in a real-world clinical study
- BIDMC(2026年10月9日):BIDMC Researchers Conduct First Real-World Study of Safety and Quality of Patient-Facing AI in Primary Care
- Brodeurら(2026年3月9日、公開原稿):A prospective clinical feasibility study of a conversational diagnostic AI in an ambulatory primary care clinic。査読版:Conversational diagnostic artificial intelligence in ambulatory primary care: a prospective feasibility study(The Lancet)
- ARISE(2026年10月8日):ARISE, BIDMC and Google AMIE publish prospective clinical AI feasibility study in The Lancet
- Google Research(2024年1月12日):AMIE: A research AI system for diagnostic medical reasoning and conversations
- Google(2026年8月11日):AMIE: Advancing medical AI for video consultations
- Microsoft:医療における超知能への道
- Ubie:ユビーAI問診の公式紹介
- Ubie:こうのす共生病院のAI問診導入事例



コメントを送信