GPT‑Rosalindとは?OpenAIの生命科学AIが世界提供、創薬研究はどう変わる

OpenAIは2026年9月11日、生命科学向けAI「GPT‑Rosalind」の研究プレビューを終了しました。提供地域を世界に広げ、条件を満たす組織が利用できるようになりました。

ただし、「世界提供」といっても、誰でも使える一般公開ではありません。利用できるのは、審査を通った企業や研究機関などです。研究目的や安全管理、組織の運用体制が確認されます。

GPT‑Rosalindが得意なのは、論文やデータを読み、仮説を立てて解析し、次の実験を考えることです。新薬を自動で完成させるAIではありません。

この記事では、OpenAIの一次情報を基に性能と料金を確認します。競合との違いや独自計算、過去のAI創薬事例、期待に対する反証も整理します。情報は2026年9月13日時点です。

GPT‑Rosalindの世界提供で何が変わったのか

最大の変化は、米国中心だった利用対象が、審査制を維持したまま世界へ広がったことです。GPT‑Rosalindは2026年4月に研究プレビューとして発表されました。

6月には、GPT‑5.5を土台にした更新版が登場しました。医薬品化学やゲノム解析、実験支援などの性能が強化されています。

9月11日の更新で、GPT‑Rosalind本体は研究プレビューを終了しました。対象組織は、今後公開される新しいRosalindモデルも利用できます。

ただし、利用前の審査は残ります。正当な研究目的と公共的な利益があり、安全管理と企業向けの情報保護に対応できる組織が対象です。

項目2026年4月2026年9月11日以降
提供段階研究プレビュー研究プレビューを終了
対象地域当初は米国の適格組織世界の適格組織
利用審査必要引き続き必要
主な利用方法ChatGPT、Codex、APIWorkbench、Codex、API
API課金研究プレビュー2026年10月5日から公表料金を適用

地域の制限は緩和されましたが、安全審査は残りました。日本の製薬会社や大学も対象になり得ます。ただし、通常のChatGPT契約だけで自動的に使えるわけではありません。

「Rosalind」「GPT‑Rosalind」「Workbench」は別のもの

Rosalindは生命科学事業の名称で、GPT‑RosalindはAIモデル、Workbenchは研究用の画面です。この3つを分けて考えると、発表内容を理解しやすくなります。

名称役割利用条件
RosalindOpenAIの生命科学向けブランド全体機能ごとに異なる
GPT‑Rosalind生命科学向けに追加学習した推論モデル審査を通った組織
Rosalind Workbenchデータ、解析ツール、AIをまとめる研究画面研究プレビュー
Life Sciencesプラグイン科学データベースや解析処理をCodexから使う仕組み一般モデルでも利用可能

ここは混同しやすい点です。GPT‑Rosalind本体は研究プレビューを終えましたが、Rosalind Workbenchは現在も研究プレビューです。

WorkbenchのExplore modeでは、利用者が使える通常のChatGPTモデルを利用します。より高度なResearch modeでGPT‑Rosalindを使うには、別途承認が必要です。

GPT‑Rosalindは何ができるのか

強みは、1つの予測で終わらず、複数の研究工程をつなげて進められることです。分子、遺伝子、タンパク質、疾患に関する情報を横断して扱います。

たとえば、論文から候補遺伝子を探すだけで終わりません。ゲノムデータと照合して候補を順位付けし、検証実験の案まで作れます。

  • 論文、図表、実験記録から根拠を整理する
  • 薬の標的になりそうな遺伝子やタンパク質を比較する
  • 変異がタンパク質の働きへ与える影響を調べる
  • 薬候補の効き目、毒性、代謝などを比べる
  • ゲノムやRNA解析の手順を作り、コードを実行する
  • 実験が失敗した原因を探し、次の条件を提案する

Codex向けには2種類のプラグインも用意されました。Life Sciences Researchは論文や公開データを調べます。Life Sciences NGS Analysisは、次世代シーケンサーのデータ解析を支援します。

解析結果やコード、途中の判断を残せる点も大切です。生命科学では、答えが速いだけでは足りません。どのデータから結論を出したのか追える必要があります。

性能比較:正答率の伸びは大きいのか

GPT‑RosalindはGPT‑5.5を上回りますが、万能といえるほどの正答率ではありません。特に医薬品化学とゲノム解析では、正答率が20%台にとどまります。

評価GPT‑RosalindGPT‑5.5相対改善率使用トークン
MedChemBench27.5%25.1%+2.4ポイント約9.6%7.2%減
GeneBench21.6%20.4%+1.2ポイント約5.9%31%減
LabWorkBench63.2%55.8%+7.4ポイント約13.3%5.3%減

相対改善率は、GPT‑5.5との差をGPT‑5.5の値で割って計算しました。たとえばMedChemBenchは、2.4÷25.1で約9.6%です。

独自計算1:1トークン当たりの性能は最大約1.54倍

正答率と使用トークンを合わせて見ると、GeneBenchの効率は約53.5%上がります。計算式は「正答率の比÷使用トークンの比−1」です。

  • MedChemBench:1.096÷0.928−1=約18.1%向上
  • GeneBench:1.059÷0.69−1=約53.5%向上
  • LabWorkBench:1.133÷0.947−1=約19.6%向上

丸め前の数値を使ったOpenAIの公表値は、それぞれ18.0%、53.7%、19.6%です。単純な正答率以上に、長い解析を少ない計算量で進められる点が改善しています。

ただし、正答率21.6%が53.7%になったわけではありません。53.7%は、使用トークンを含めた効率の改善率です。この2つは分けて見る必要があります。

料金はいくらかかるのか

API料金は入力100万トークン5ドル、出力100万トークン25ドルです。同じ内容を再利用するキャッシュ入力は、100万トークン0.50ドルです。

APIのモデル名は「gpt-rosalind-research」です。公表料金による課金は2026年10月5日に始まります。

区分100万トークン当たり
入力5ドル
キャッシュ入力0.50ドル
出力25ドル

独自計算2:重い解析を100回行う場合

入力50万、出力10万トークンの解析なら、1回5ドルです。計算は「0.5×5ドル+0.1×25ドル」となります。

同じ規模の解析を100回行うと500ドルです。1ドル150円と仮定すると、約7万5,000円になります。

入力の40万トークンをキャッシュできる場合も計算してみます。未キャッシュ10万、キャッシュ40万、出力10万なら、1回3.20ドルです。

100回では320ドルとなり、単純計算で36%安くなります。長い共通資料を何度も読む研究では、入力を再利用できるかどうかが費用を左右します。

この試算には、外部ツール、計算環境、データ保管、企業契約の費用を含めていません。また、出力は入力の5倍の単価です。長い報告書を毎回作らせると、費用は増えやすくなります。

競合AIと比較すると何が違うのか

GPT‑Rosalindの競争相手は単体のモデルではなく、研究作業全体を動かすAI環境です。AlphaFold 3だけと比べると、全体像を見誤りやすくなります。

サービス主な強み得意な範囲GPT‑Rosalindとの違い
GPT‑Rosalind/Rosalind Workbench生命科学向け推論とツール実行論文、ゲノム、化学、実験計画審査制の専用モデル。CodexとAPIで組み込みやすい
Claude Science監査可能な成果物と研究用の作業環境論文、解析、図表、HPC実行60超のスキルと接続先を備え、Pro以上にもベータ提供
AlphaFold 3分子の立体構造と相互作用の予測タンパク質、DNA、RNA、低分子特定の構造予測が中心。幅広い研究司令塔とは役割が違う
NVIDIA BioNeMoモデル開発とGPU高速化分子設計、仮想探索、タンパク質設計自社モデルを作り、動かす基盤としての性格が強い
FutureHouse科学調査を行うAIエージェント文献探索、仮説、複数エージェント非営利で公開性を重視。企業向け統制の位置付けが異なる

AlphaFold 3について、Googleはタンパク質と別の分子との相互作用で、従来手法より少なくとも50%精度を改善したと説明しています。特定の予測に強いAIです。

GPT‑Rosalindは、AlphaFoldのような道具も使いながら、問いを分解して調査を進める司令塔に近い存在です。どちらが優れているかというより、担当する役割が異なります。

Claude Scienceは最も直接的な競合です。研究用ファイルの表示、計算環境への接続、引用や計算の検査まで含みます。利用対象は、審査制のGPT‑Rosalindより広く設定されています。

創薬研究はどこまで速くなるのか

特に短縮しやすいのは、候補を作る前の「読む・比べる・解析する・考える」工程です。患者を対象にした臨床試験まで、一気に短くなるわけではありません。

創薬の工程GPT‑Rosalindの効果残る壁
標的探索論文と遺伝子データを横断し、候補を増やすデータの偏り、因果関係の誤認
候補分子の検討効き目、毒性、代謝の条件をまとめて比べる予測と生体内の結果が一致するとは限らない
実験計画条件、対照群、失敗原因を整理する実験設備、試料、研究者の確認が必要
前臨床試験結果解析と次の実験選択を支援する細胞・動物試験には実時間がかかる
臨床試験文書、データ解析、試験設計を支援する患者募集、安全確認、長期観察は省けない
承認審査証拠と申請資料を整理する規制当局の審査をAIだけで置き換えられない

OpenAIは、新薬の標的発見から米国での承認まで、通常10〜15年かかると説明しています。GPT‑Rosalindを使えば、この全期間が数日になるわけではありません。

AIで短くしやすいのは、情報処理や候補選びにかかる時間です。生物が反応する時間や、患者の安全を確認する期間は別に必要です。

独自分析3:速さより「外れ候補を早く捨てる価値」が大きい

創薬AIでは、成功薬を当てること以上に、高額な試験へ進む前に失敗候補を減らせるかが大きな意味を持ちます。臨床試験に入った薬でも、承認まで進める確率は高くありません。

BIOなどによる2011〜2020年の調査では、第1相試験から承認へ進む確率は全体で7.9%でした。100件が第1相へ進んでも、平均で承認されるのは約8件という水準です。

仮に成功率が7.9%から9.5%へ上がれば、相対的には約20%の改善です。それでも、100件当たりの承認増加は1.6件にとどまります。

これは将来予測ではなく、改善率の見え方を示すための試算です。AIの性能向上と、新薬の承認数が同じ割合で増えるとは限りません。

実務では、危険な候補を前臨床の段階で止められるかも重要です。後期試験での失敗を1件減らすだけでも、時間と費用への影響は大きくなります。

過去事例:AI創薬はすでに人で効果を示したのか

AIが作った候補薬は臨床試験へ進んでいますが、AIだけで生まれた承認薬はまだ確認できません。期待と実績の間には、まだ距離があります。

代表例が、Insilico Medicineの特発性肺線維症向け候補薬rentosertibです。AIで標的と分子を選び、研究開始から第1相試験まで30カ月未満で進みました。

2025年には第2a相試験の結果が公表されました。安全性と忍容性は確認されましたが、研究者は、さらに大規模な試験が必要だと結論づけています。

Insilico Medicineは2026年7月、中国47施設で第3相試験を始めました。AI創薬は後期臨床まで進みましたが、rentosertibはまだ承認薬ではありません。

この事例から、AIが初期開発を速められる可能性は見えてきました。ただし、少人数の初期試験だけで有効な新薬だと断定することはできません。

Google系のIsomorphic Labsも、AI設計薬の臨床入りを2025年から2026年末へ延期しました。構造予測の精度が高くても、実験や開発計画には時間がかかります。

「創薬を革命的に速める」への反証

公開された数字だけでは、GPT‑Rosalindが新薬の承認率を上げると証明できません。ベンチマークの得点と、実際に患者へ届く薬の成功は別の問題です。

反証1:重要な評価でも正答率は20%台

MedChemBenchは27.5%、GeneBenchは21.6%です。通常モデルより高くても、単独で研究判断を任せられる水準ではありません。

反証2:評価の多くはOpenAI側が設計している

LifeSciBench、MedChemBench、GeneBench、LabWorkBenchは実務を意識した評価です。ただし、開発元による評価であるため、第三者による再現試験も必要です。

反証3:AIは誤った根拠をもっともらしく示す

論文の取り違えや存在しない引用、統計手法の選択ミスは起こり得ます。出典が付いていても、元データと計算コードの確認は欠かせません。

反証4:速く作れると、検証待ちが増える

AIが仮説を10倍作れても、実験設備や人員が同じなら処理できる量は増えません。ボトルネックが「アイデア不足」から「検証能力不足」へ移る可能性があります。

反証5:企業内データをつなげなければ差が出にくい

公開論文だけを使うなら、競合AIも似た情報を読めます。差が出やすいのは、社内の失敗実験や化合物データを安全につなげられるかどうかです。

なぜ誰でも使えるようにしないのか

生命科学AIは治療研究に役立つ一方で、危険な生物研究にも転用できるためです。こうした性質は「デュアルユース」と呼ばれます。

OpenAIはGPT‑Rosalind‑5.5を、生物・化学分野で「High」能力と評価しました。最上位の「Critical」には達していません。

利用組織には、承認された利用者だけが使える管理体制が求められます。OpenAIは利用状況を監視し、問題があれば調査や利用停止を行う方針です。

安全制限は、研究の使いやすさにも関わります。GPT‑Rosalindでは、有益な高度研究を一律に拒否しにくくする代わりに、組織審査を主な防壁としています。

日本の研究者・企業・一般読者への影響

短期的に起きるのは新薬の即時登場ではなく、研究者1人が扱える仕事の範囲が広がることです。特に小さな研究チームほど、恩恵を受ける可能性があります。

製薬会社とバイオ企業

複数部門に分かれていた文献調査、データ解析、実験計画をつなげやすくなります。社内データへ安全に接続できれば、過去の失敗も次の候補選びに生かせます。

大学と研究機関

専任のバイオインフォマティクス人材が少ない研究室でも、解析の下準備を進めやすくなります。ただし、組織審査と費用が導入の壁になります。

研究者の仕事

コードを書く時間や資料を探す時間は減るでしょう。その一方で、AIの計算や引用、前提を検査する仕事は増えます。

患者と一般の人

すぐに薬価が下がるわけではありません。長期的には、候補選びの改善で失敗にかかる費用が減れば、新薬開発の選択肢が増える可能性があります。

ただし、開発費が下がっても、そのまま薬価へ反映される保証はありません。薬価は特許、競争、保険制度、企業戦略にも左右されます。

独自分析4:勝敗を決めるのはモデル性能より「検証の循環」

今後の競争では、AIの得点より「予測→実験→結果→再学習」を速く回せる組織が有利です。モデルを導入するだけでは、創薬工程は変わりません。

GPT‑Rosalindは、仮説を立てたり解析したりする作業を速めます。AlphaFold 3やBioNeMoは、構造予測や分子設計を深く支えます。

それでも、最後に必要なのは実験結果です。AIの提案を自動で記録し、成功と失敗を次の判断へ戻す仕組みが必要になります。

OpenAIとAnthropicは、この点で似た方向へ進んでいます。どちらも単なるチャットではなく、データ、計算、研究履歴をまとめて扱う作業環境を作っています。

今後、本当に確認すべき5つの数字

GPT‑Rosalindの価値は、ベンチマークだけでなく、実際の研究成果で判断する必要があります。今後は、次の数字が公開されるか注目したいところです。

  1. AIが選んだ候補のうち、実験で再現できた割合
  2. 標的選定から開発候補決定までにかかった期間
  3. 前臨床から第1相へ進んだ候補の割合
  4. 研究者が修正した引用、計算、解析コードの割合
  5. AI導入前後で減った実験回数と総費用

これらが競合や人間中心の工程より良ければ、創薬を変えたと評価できます。数字が公表されるまでは、期待と実証済みの効果を分けて見る必要があります。

まとめ:GPT‑Rosalindは創薬の「考える部分」を広げる

GPT‑Rosalindは新薬を自動で作るAIではなく、研究者が調べ、解析し、次の実験を決める作業を支えるAIです。2026年9月の世界展開で、日本の組織にも利用の道が開きました。

性能はGPT‑5.5より高く、特にトークン効率が改善しています。ただし、重要な評価の正答率は20%台で、専門家による確認は欠かせません。

短期的には、文献整理やゲノム解析、実験計画にかかる時間が減るでしょう。長期的な価値は、臨床成功率や開発費を本当に改善できるかで決まります。

参考資料

コメントを送信

You May Have Missed