NASAとIBMは2026年9月10日、月面観測データを学習した「NASA-IBM Lunar Foundation Model」を公開した。モデルの重みと利用コードは、Hugging FaceとGitHubから入手できる。[1][2]
このAIは、月に氷がありそうな場所を予測する際のRMSEを、従来モデルより22%減らした。クレーターの検出や、若い火山地形の抽出にも使える。
ただし、22%は「氷を22%多く発見した」という意味ではない。実際の氷を測定したわけではなく、既存の氷見込み度マップを再現する際の誤差が小さくなったという結果だ。
本記事では、NASAとIBMの発表、技術資料、モデルカードを照合した。数値が何を意味するのか、競合モデルとどの程度差があるのか、公開範囲や実用化までの課題とあわせて整理する。
NASAとIBMが公開した「月面AI」とは
NASA-IBM Lunar Foundation Modelは、異なる種類の月面データを一つのAIで扱うための基盤モデルだ。
基盤モデルとは、大量のデータを使ってあらかじめ学習しておくAIを指す。研究者は少量の正解データを追加し、目的に合わせたAIへ調整できる。
月面研究では、カメラ画像のほか、標高、温度、重力、レーダーなどのデータを使う。解像度や観測条件が異なるため、まとめて解析するのは簡単ではなかった。
新モデルは、NASAのLunar Reconnaissance Orbiter(LRO)のデータを中心に学習した。GRAIL、Lunar Prospector、JAXAのSELENE/かぐやのデータも含まれる。
| 項目 | 公開内容 | 注意点 |
|---|---|---|
| 主な用途 | 氷見込み度、クレーター、火山地形の解析 | 着陸地点を自動決定するAIではない |
| 学習データ | 約196万枚の月面タイル | 高解像度画像の分布には偏りがある |
| 観測情報 | 9機器、4ミッション、30超の整列済みレイヤー | モデルが学習した主要モダリティは11種類 |
| 空間解像度 | 約1m/画素と約100m/画素 | 用途によって見える地形の大きさが違う |
| 公開先 | Hugging Face、GitHub | 事前学習コードは含まれない |
「9機器」「30超のレイヤー」「11モダリティ」は、それぞれ別の数を表している。機器は観測装置、レイヤーは加工済みの地図、モダリティはAIが扱う情報の種類だ。
氷検出の誤差を22%削減した数値の意味
22%削減されたのは、氷の量そのものではなく、予測値と参照マップのずれを示すRMSEだ。
RMSEは、予測がどの程度外れたかを一つの数値にまとめた指標である。数値が小さいほど、参照値に近い。
NASA・IBMモデルのRMSEは0.0293だった。比較対象となるSwinV2-Bは0.0377である。[5]
| モデル | 学習の出発点 | RMSE | NASA・IBMとの差 |
|---|---|---|---|
| NASA-IBM Lunar FM | 月面データで事前学習 | 0.0293 | 基準 |
| SwinV2-B | ImageNetで事前学習 | 0.0377 | 誤差が約28.7%大きい |
| 同じ構造の未学習モデル | ランダム初期化 | 0.0397 | 誤差が約35.5%大きい |
独自計算1 22%を実数に直す
RMSEの低下幅は0.0084で、相対的には約22.3%の改善となる。
計算式は「(0.0377-0.0293)÷0.0377×100」だ。発表されている22%とほぼ一致する。
RMSEを二乗した平均二乗誤差で比較すると、約39.6%減る。誤差を二乗する指標なので、大きな外れが減るほど差が大きく表れる。
ただし、0.0084を「氷が0.84ポイント多く見つかった」と解釈することはできない。予測対象は0から1までの見込み度であり、氷の重量や面積を表す数字ではない。
「氷検出」ではなく「氷見込み度の再現」
AIが学んだ正解データは、掘削や分光器で測った氷ではなく、専門家が作った見込み度マップである。
参照マップは、温度、永久影、斜面、方位など8種類の情報を重ねて作られた。AIは、その計算結果を再現するよう調整されている。
複雑な地図を効率よく作る用途には役立つ一方、元の地図に含まれる仮定や偏りも引き継ぐ。
いわば、AIは「氷を見た探査機」ではなく、「有望な地点をすばやく絞り込む案内役」だ。最終的な確認には、別の観測や現地調査が必要になる。
競合モデルとの比較 すべての課題で圧勝ではない
最大の強みは氷見込み度だが、1m級のクレーター検出では競合とほぼ同等だった。
NASAとIBMは、SwinV2-BやConvNeXtV2-Bなどと性能を比較した。同じデータ分割と評価方法を使い、複数回の結果を平均している。
| 課題 | NASA・IBM | 最良の競合 | 読み取れること |
|---|---|---|---|
| 氷見込み度 | RMSE 0.0293 | 0.0377 | 誤差を約22.3%削減 |
| 100m級クレーター、全データ | mAP 0.2581 | 0.2420 | 相対差は約6.7% |
| 100m級クレーター、半分のデータ | mAP 0.2541 | 0.2313 | 同条件で約9.9%高い |
| 1m級クレーター | mAP 0.1543 | 0.1552 | 競合がわずかに上 |
| 不規則な海の斑点 | IoU 0.5709 | 0.5687 | 差は試行ごとのばらつきより小さい |
mAPは物体検出の性能、IoUは検出した領域が正解とどの程度重なっているかを示す。どちらも高いほど性能がよい。
IBMは、100m級クレーターで「約19%上回った」と説明している。一方、公開モデルカードにある代表mAPから計算すると、半分の学習データ同士では約9.9%の差になる。
19%は、別の評価条件や指標を指している可能性がある。一般読者向けに説明するなら、指標や条件を示さず一つの改善率にまとめない方が正確だ。
独自計算2 半分の学習データでも競合の全データ版を超えた
100m級クレーターでは、学習データを半分にしても、競合の全データ版を約5.0%上回った。
NASA・IBMの半量版はmAP 0.2541だった。SwinV2-Bの全量版は0.2420である。
差は「(0.2541-0.2420)÷0.2420×100=約5.0%」だ。正解ラベルの作成にコストがかかる月面研究では、少ないデータでも性能を出せることに価値がある。
ただし、1m級ではNASA・IBMが0.1543、競合が0.1552だった。細かな地形でも常にNASA・IBMが優れているわけではない。
独自計算3 3種類の入力でも8種類の競合と同水準
斜面方位、傾斜、氷安定深度の3種類だけでも、8種類を使うConvNeXt-Bとほぼ同じ誤差だった。
3種類版のRMSEは0.0434、競合は0.0437である。入力を5種類減らしても、誤差は約0.7%小さい。
すべての観測情報がそろわない地域でも役立つ可能性がある。機器の故障や欠測が起きた場合にも応用しやすい。
ただし、この比較も氷そのものを測った精度ではない。参照マップをどの程度再現できたかを比べた結果だ。
約196万枚、100倍違う解像度を一つのモデルで学習
特徴は、1m級と100m級という100倍の解像度差を、一組の重みで扱う設計にある。
学習タイルは、高解像度側が100万113枚だった。低解像度側は96万3609枚で、合計196万3722枚となる。[6]
高解像度の1枚は約512m四方を表す。低解像度の1枚は約51.2km四方で、同じ512×512画素でもカバーする範囲は大きく異なる。
AIは、細かな地形と広い範囲のつながりを同じ枠組みで学ぶ。人に例えるなら、虫眼鏡と広域地図を持ち替えながら月を見るような仕組みだ。[3]
| 学習トラック | 解像度 | 1枚の範囲 | 枚数 | 公開データ量 |
|---|---|---|---|---|
| NAC高解像度 | 約1m/画素 | 約512m四方 | 1,000,113 | 約1.4TB |
| WAC低解像度 | 約100m/画素 | 約51.2km四方 | 963,609 | 約38TB |
| 合計 | 100倍の差 | ― | 1,963,722 | 約39.4TB |
学習にはH100 GPUを16基使い、約1100GPU時間を要した。単純に16基で割ると、連続稼働で約68.8時間、約2.9日に相当する。
実際の開発時間や前処理にかかった時間は、この数字には含まれない。研究者が一から再学習するには、大規模な計算環境が必要になる。
「オープンソース化」はどこまで本当か
モデルは広く再利用できるが、公開物だけで事前学習を完全再現できる状態ではない。
モデル本体はApache License 2.0で公開された。約12.8GBのリポジトリには、基盤モデルと専用トークナイザーが含まれる。[4]
学習用データセットSomBenchは、CC BY 4.0で公開されている。条件に従えば、利用者は改変や再配布が可能だ。
GitHubには、追加学習と推論に使うコードが公開されている。ただし、READMEには「事前学習コードは含まれない」と明記されている。[7]
| 公開物 | 公開状況 | 実務上の意味 |
|---|---|---|
| 学習済みモデル | 公開 | 追加学習や推論を始められる |
| 専用タスク用モデル | 公開 | 氷、クレーター、火山地形を試せる |
| SomBench | 公開 | 共通条件で比較研究ができる |
| 追加学習・推論コード | 公開 | 別の月面課題へ調整できる |
| 事前学習コード | 未公開 | 基盤モデルを一から完全再現しにくい |
「何もかも完全に公開された」と受け取るのは正確ではない。ただし、公開済みの重みを研究に使うのであれば、実用的な範囲まで公開されている。
過去の月面氷探査と何が違うのか
過去の探査機が証拠を集め、新しいAIが散らばった証拠を一枚の候補地図へまとめる。
1998年のLunar Prospectorは、中性子の変化から極域にある水素を調べた。ただし、水素を確認できても、水がどのような状態で、どこに分布しているかまでは確定できない。[8]
2009年のLCROSSは、南極付近のCabeusクレーターへ衝突体を落とした。そこで巻き上がった物質を分析し、水の存在を直接確認した。[9]
2018年には、Chandrayaan-1のMoon Mineralogy Mapperのデータから、極域表面にある氷が報告された。観測方法によって、調べられる深さや範囲は異なる。[10]
| 方法 | 分かること | 弱点 |
|---|---|---|
| 中性子観測 | 水素が多い地域 | 水や氷を直接見分けるとは限らない |
| 分光観測 | 表面の水・水酸基の特徴 | 影、温度、粒子状態の影響を受ける |
| 衝突・掘削 | 限られた地点の物質 | 広い月面を一度に調べられない |
| NASA・IBMのAI | 複数情報から有望地域を順位付け | 氷の存在や採掘可能量を確定できない |
AIが探査機の代わりになるわけではない。広い範囲のデータから調査先を絞り、限られた観測時間を効率よく使うための道具だ。
反証と限界 22%改善でも着陸地点は決められない
公開モデル自身が、着陸地点の認証、危険回避、資源量の判断には未検証だと明記している。
氷見込み度の評価に使ったデータは、学習108枚、検証23枚、テスト25枚だった。各画像は256×256画素で、解像度は240m/画素である。
テスト25枚でも比較実験はできる。ただし、月の両極にある幅広い地形を十分に代表できているかどうかは、追加の検証が必要だ。
対象範囲も、北極と南極から緯度10度以内に限られている。その外側や、異なる解像度でどの程度動作するかは確認されていない。
月面は、太陽の角度によって見え方が大きく変わる。小さなクレーターでは、別の時期にできた影を地形の変化だと誤認する可能性も残る。
モデルには、絶対的な標高や緯度・経度を保つ仕組みもない。生成結果では、位置が数十度ずれる場合がある。
氷探索では、次の手順を省略できない。
- AIで有望地域を絞る
- 複数の観測機器で再確認する
- 照明、傾斜、温度、通信条件を評価する
- 着陸機やローバーで現地測定する
- 採掘可能な量と深さを確認する
月面基地とロケット燃料への影響
短期的な価値は氷の発見ではなく、高価な現地探査の候補を早く減らせる点にある。
水を現地で利用できれば、飲料水に加えて酸素や水素の原料にもなる。地球から運ぶ物資を減らせる可能性がある。
水18kgは、理論上16kgの酸素と2kgの水素に分けられる。ただし実際には、採掘、精製、電気分解、冷却の各工程でエネルギー損失が生じる。
AIが候補地を誤れば、探査機の移動や観測に使える時間を浪費してしまう。候補を適切に絞れれば、限られたミッションでも多くの地点を比較できる。
一般の利用者が月面の氷を直接探せるようになるわけではない。ただ、大学や企業が同じモデルとデータを使い、検証できるようになった意味は大きい。
公開モデルを使えば、地形分類、変化検出、走行候補地の研究を一から始める必要がない。宇宙AI開発へ参入するハードルは下がる。
独自分析 成果の本体は「月面の共通データ基盤」
今回の本当の価値は22%という一つの数字より、月面研究を同じ条件で比較できる基盤が公開されたことにある。
これまでの研究では、課題ごとに異なる画像や前処理を使うことが多かった。そのため、精度の差がAIによるものなのか、データの違いによるものなのか判断しにくい。
SomBenchでは、異なる観測データを同じ場所に合わせている。学習・検証・テストも地域単位で分け、近い場所の画像が別のデータ群に混ざる問題を抑えた。
今後は、別の研究チームも同じデータを使って新しいモデルを評価できる。NASA・IBMモデルを上回る結果が出た場合も、性能を比較しやすい。
ただし、参照マップを再現するだけでは、氷に関する新しい事実が増えるわけではない。価値がさらに高まるのは、将来の現地測定で予測結果を検証できた時だ。
今後注目したい数字は、AIのRMSEだけではない。候補地点の的中率、現地で確認された氷の濃度、探査時間をどれだけ短縮できたかも重要になる。
まとめ
NASA・IBMの月面AIは有望な地図作成ツールだが、氷を直接発見する装置ではない。
- 氷見込み度のRMSEを0.0377から0.0293へ改善した
- 相対改善は約22.3%、平均二乗誤差では約39.6%減となる
- 100m級クレーターは半分の学習データでも競合の全量版を上回った
- 1m級クレーターでは競合と同等で、すべての課題に圧勝したわけではない
- 重み、データ、追加学習コードは公開されたが、事前学習コードは未公開
- 氷の存在、量、採掘可能性は現地観測で確認する必要がある
22%という数字は、有望な候補地をより正確に絞り込むための一歩だ。ただし、月面基地の実現へ直結する成果と評価するには、現地データを使った検証がまだ足りない。
関連ページ
宇宙観測と科学AIの動きについては、以下の記事でも詳しく解説している。
- Google出資の宇宙企業Pixxelが1億ドル調達 「ハイパースペクトル衛星」は何が見える?
- DeepMind「AlphaGenome Atlas」、90億通りのDNA変異を予測 病気の原因を特定できる?
- 核融合AI「PACMAN」、20ミリ秒で制御し不安定性を200ミリ秒前に予測
主な参考資料
数値は2026年9月11日時点の一次情報と公開モデル資料を優先して確認した。
- NASA:NASA, IBM Launch AI Foundation Model for Lunar Science
- IBM:IBM and NASA Release Open-Source AI Model to Support Lunar Exploration
- IBM Research:Introducing IBM and NASA’s new foundation model for the Moon
- Hugging Face:NASA-IBM Lunar Foundation Model
- Hugging Face:Polar Ice Prospectivity checkpoint
- Hugging Face:SomBench pre-training corpus
- GitHub:NASA-IMPACT/NASA-IBM-Lunar-Foundation-Model
- Science:Fluxes of Fast and Epithermal Neutrons from Lunar Prospector
- Science:Detection of Water in the LCROSS Ejecta Plume
- PNAS:Direct evidence of surface exposed water ice in the lunar polar regions



コメントを送信