生成AIには、大きく分けて「学習」と「推論」の2つの工程があります。
学習はAIを作る工程、推論は完成したAIを使う工程です。
学習では、数千台のGPUを長期間動かすこともあります。推論は1回あたりの処理こそ小さいものの、利用するたびに電力と費用がかかります。
どちらの負担が大きいかは、条件によって変わります。モデルの大きさや利用回数、回答の長さによって逆転するためです。
ここでは、学習と推論の仕組みを初心者向けに整理し、必要なGPUメモリや電力、費用も具体的に計算します。
生成AIの学習と推論の違い
学習ではモデルの中身を更新しますが、推論では原則として更新しません。
たとえるなら、学習は教科書を読んで問題の解き方を身につける段階です。推論は、そこで身につけた知識を使って問題に答える段階にあたります。
| 比較項目 | 学習 | 推論 |
|---|---|---|
| 目的 | モデルの能力を作る・調整する | 質問に答える・画像を作る |
| 主な計算 | 順方向計算、誤差計算、逆伝播、重み更新 | 主に順方向計算 |
| 必要なメモリ | 重み、勾配、最適化用データ、途中結果 | 重み、KVキャッシュ、途中結果 |
| 処理期間 | 数時間から数カ月 | 1回あたり数秒から数分 |
| 重視する性能 | 総計算量、GPU間通信、安定性 | 応答速度、同時処理数、メモリ帯域 |
| 費用の発生 | 開発時に集中する | 利用が続く限り増える |
学習では答えの間違いを逆向きにたどる
学習の負荷が大きい最大の理由は、答えを出すだけでなく、間違いを分析してモデルを修正する必要があるためです。
まず入力から答えを計算し、正解との差を調べます。その後、発生した誤差を後ろから前へ伝えていきます。
この処理が「逆伝播」です。最後に、数千億個にもなる重みを少しずつ更新します。
大量の文章や画像を使って、この処理を何度も繰り返します。計算量が多いだけでなく、GPU同士でデータをやり取りする負担も無視できません。
推論は学習済みモデルから答えを作る
推論では、保存された重みを読み出し、入力に応じた出力を順番に作ります。
文章生成AIでは、次に来る単語などの候補を1トークンずつ計算します。トークンとは、AIが文章を処理するときに使う細かな単位です。
通常、推論ではモデル自体を更新しません。そのため、1回あたりの計算量は学習より少なくなります。
ただし、長い文章を読ませたり、長時間の推論をさせたりすると負担は増えます。利用者が増えれば、同じような処理を何億回も繰り返すことになります。
学習に必要なGPUは何台か
小規模な追加学習ならGPU 1台でも可能ですが、基盤モデルの事前学習になると規模が大きく変わります。
既存モデルを自社データに合わせるLoRAなら、16~24GBのVRAMでも試せます。VRAMは、GPUが使用する専用メモリです。
ゼロから大規模モデルを作る事前学習では、数百~数万個のAI向けGPUが使われます。
MetaはLlama 3.1 405Bの学習に、1万6,000個を超えるH100を使ったと説明しています。学習量は約3,084万H100 GPU時間でした。
| 作業 | 現実的なGPU構成の目安 | 主な利用者 |
|---|---|---|
| API経由で生成AIを使う | 利用者側のGPUは不要 | 個人、一般企業 |
| 7B~14BをLoRAで調整 | VRAM 16~24GBを1台 | 個人、研究室、中小企業 |
| 30B~70Bを本格調整 | VRAM 48GB以上、または複数台 | 研究機関、AI企業 |
| 大規模モデルの事前学習 | 数百~数万個のデータセンター向けGPU | 大手AI企業 |
ただし、同じGPUを大量に並べればよいわけではありません。NVLinkやInfiniBandなどを使った高速なGPU間通信も必要です。
GPU間の通信が遅いと、計算を終えたGPUがほかのGPUを待つ時間が増えます。詳しくは「AI性能の壁はGPUではなく通信?」でも解説しています。
推論に必要なGPUはモデルの大きさで決まる
ローカル推論では、演算性能を見る前にVRAM容量を確認する必要があります。
モデルの重みだけであれば、必要な容量は簡単に概算できます。
必要な重み容量=パラメータ数×1パラメータ当たりのバイト数
FP16は2バイト、INT8は1バイト、4ビット量子化は約0.5バイトです。量子化とは、数値の精度を下げてモデルを軽量化する方法です。
| モデル規模 | FP16の重み | 8ビットの重み | 4ビットの重み | 4ビット推論のVRAM目安 |
|---|---|---|---|---|
| 8B | 16GB | 8GB | 4GB | 6~8GB |
| 14B | 28GB | 14GB | 7GB | 10~12GB |
| 32B | 64GB | 32GB | 16GB | 20~24GB |
| 70B | 140GB | 70GB | 35GB | 40~48GB |
| 405B | 810GB | 405GB | 約203GB | 240GB以上 |
実際の推論では、入力内容を保持するKVキャッシュも必要です。入力する文章が長いほど、また同時利用者が増えるほど、追加のVRAMを消費します。
CPUだけで動かせるモデルもありますが、回答速度が大きく低下する場合があります。
学習は推論の数倍ではなく、桁違いにメモリを使う
同じモデルでも、本格的に学習させるには、推論よりはるかに多くのメモリが必要です。
AdamWを使った混合精度学習では、重みや勾配などを保存するため、1パラメータ当たり約16バイトを使う場合があります。
単純に計算すると、8Bモデルでも約128GBです。70Bなら約1.12TB、405Bなら約6.48TBになります。
これに加えて、計算途中の値を保存する領域も必要です。実際の学習では、データを複数のGPUに分割して処理します。
QLoRAやZeROなどを使えば、必要なメモリ量を減らせます。そのため、ここで示した数字は仕組みを理解するための概算です。
GPU以外のAIチップも学習と推論を担う
生成AIの学習や推論に使われるのは、NVIDIA製GPUだけではありません。
AMDのGPUをはじめ、GoogleのTPU、AWSのTrainiumやInferentiaも使われています。
| 製品・方式 | 主な用途 | 強み | 注意点 |
|---|---|---|---|
| NVIDIA H100 | 学習・推論 | 対応ソフトが多く、汎用性が高い | 80GB、最大700W。導入費も高い |
| AMD Instinct MI300X | 学習・推論 | 192GB HBM3と5.3TB/sの帯域 | ソフトの対応状況を確認する必要がある |
| Google TPU | 学習・推論 | 大規模処理を前提に設計されている | 主にGoogle Cloudで利用する |
| AWS Trainium | 主に学習 | AWS環境で費用を抑えやすい | Neuron SDKへの対応が必要 |
| AWS Inferentia2 | 推論 | 32GB HBM。低遅延と効率を重視 | モデル変換や検証に手間がかかる |
NVIDIA H100は、80GBのHBMと3.35TB/sのメモリ帯域を備えています。AMD MI300Xは、192GBと5.3TB/sです。
メモリ容量だけを比べればAMDが有利です。一方、既存のCUDA向けソフトをそのまま利用しやすいことはNVIDIAの強みです。
そのため、仕様表だけで優劣を決めることはできません。ソフトの移行作業や運用に必要な人員まで含めて選ぶ必要があります。
学習にはどれほどの電力が必要か
Llama 3.1 405BのGPU稼働量から計算すると、GPUだけで約21.6GWhです。
Metaが示した3,084万GPU時間に、H100の最大消費電力700Wを掛けて計算しました。
30,840,000時間×0.7kW=21,588,000kWh
ただし、これはTDPを使った上限寄りの試算です。GPUの実消費電力やCPU、通信機器、冷却設備まで正確に測った数字ではありません。
仮にデータセンター全体のPUEを1.1とすると、消費電力量は約23.7GWhになります。PUEは、冷却なども含めたデータセンター全体の電力効率を表す指標です。
過去事例ではBLOOMが433MWhを使用した
2022年のBLOOMは、最終学習だけで約43万3,196kWhを使いました。
BLOOMは1,760億パラメータの言語モデルです。384個のA100を使い、学習には約118日かかりました。
GPU時間は約108万時間です。研究によると、最終学習では433MWh、関連実験全体では約1,163MWhを使用しました。
最終モデルの学習だけを見ていると、開発全体の負担を小さく見積もってしまいます。BLOOMでは、中間モデルの作成や評価に使った電力が最終学習を上回りました。
なお、Llama 3.1と単純には比較できません。モデル規模や学習データ、使用したGPU、電力の集計方法が異なるためです。
推論1回の電力は小さくても総量は増える
推論は1回あたりの負荷が小さくても、毎日繰り返されるため、製品の運用期間全体では学習を上回る可能性があります。
Googleは2025年、Gemini Appsで処理する文章プロンプトの中央値について、1回あたり0.24Whを消費すると公表しました。
この数字にはAIチップに加えて、CPUやメモリ、待機設備、冷却などの消費電力も含まれています。
もちろん、0.24Whという数字をすべての生成AIに当てはめることはできません。Googleも、モデルや使い方によって電力消費は変わると説明しています。
| 利用回数 | 0.24Whでの電力量 | 電力単価25円/kWhでの費用 |
|---|---|---|
| 100万回 | 240kWh | 約6,000円 |
| 1億回 | 24MWh | 約60万円 |
| 10億回 | 240MWh | 約600万円 |
この試算に含めているのは電気料金だけです。GPUの購入費や保守費、人件費、通信費は含まれていません。
長時間の推論や画像・動画生成では、1回あたり0.24Whを大きく上回ることがあります。回答の精度を高めるために長時間推論するAIも同様です。
独自計算:推論が学習の電力を超える分岐点
1回0.24Whで計算すると、約900億回の推論で21.6GWhに達します。
ここでは、Llama 3.1 405BのGPU電力試算とGeminiの中央値を、あえて同じ式に当てはめてみます。
21,588,000,000Wh÷0.24Wh=約899億5,000万回
異なるモデルの数字を組み合わせた思考実験なので、実際の損益分岐点を示しているわけではありません。
それでも、利用回数によって総消費電力が大きく変わることは分かります。仮に重い推論が1回10Whなら、約21.6億回で同じ電力量に達します。
「学習のほうが必ず多くの電力を使う」とは限りません。利用者の多いサービスでは、長期的には推論の負担が大きくなる場合があります。
独自計算:学習コストは電気代だけでは説明できない
大規模学習では、電気代よりもGPUの調達費やレンタル費の影響が大きくなる場合があります。
先ほど計算した23.7GWhに、1kWh当たり25円を掛けると、電気代は約5億9,400万円です。
これに対して、3,084万GPU時間を1時間2.5~5ドルで借りると仮定すると、費用は約7,710万~1億5,420万ドルになります。
1ドル150円で換算すると、約116億~231億円です。あくまで説明用に設定した条件であり、Metaが実際に支払った金額ではありません。
大手企業はGPUを購入して自社施設で運用するため、レンタル料金とは単純に比較できません。それでも、大規模AIのコストが電気代だけで決まるわけではないことは分かります。
推論はGPUの待機時間もコストになる
推論では、すぐに回答できる状態を保つための待機設備にも費用がかかります。
学習では、大量の処理をまとめてGPUに流せます。推論は利用者がいつ質問するか分からないため、同じ運用はできません。
BLOOMの実験では、16個のA100を使い、18日間で約23万件を処理しました。利用がほとんどない時間でも、10分当たり約0.28kWhを消費しています。
質問にすぐ答えるには、モデルをメモリに載せたまま待機させる必要があります。この「低遅延のための余裕」も、推論にかかる見えにくい費用の一つです。
推論コストは新しいGPUほど下がるのか
新しいGPUは本体価格が高くても、処理量当たりの費用を下げられる場合があります。
NVIDIAは2026年4月時点の外部ベンチマークとして、GPT-OSS-120Bを処理した場合の費用を公開しています。
H100は100万トークン当たり約0.09ドルでした。B200は約0.02ドルで、計算上は約78%安くなります。
同じ条件で1兆トークンを処理すると、H100では約9万ドル、B200では約2万ドルです。
差額は約7万ドルになります。ただし、これは特定のモデルとソフトウェアを使った場合の結果です。
実際の費用は、同時利用者数や回答速度、GPUの稼働率によって変わります。本体価格だけでなく、1秒間に何トークン生成できるかまで確認する必要があります。
反証:GPUを増やせばすべて解決するわけではない
GPUを増やしても、通信、メモリ、電力のどこかがボトルネックになれば性能は伸びません。
大規模学習では、GPU同士が頻繁に計算結果を共有します。ネットワークが遅ければ、高価なGPUでも通信待ちの時間が増えてしまいます。
推論では、演算性能よりメモリ帯域が重要になる場面もあります。巨大なモデルの重みを高速に読み続ける必要があるためです。
電力供給や冷却能力にも限界があります。GPUを設置できるスペースがあっても、必要な電力や冷却能力を確保できず、十分に稼働させられないことがあります。
AIサーバー全体の構造は「AIデータセンターのGPU・CPU・HBM・通信を解説」も参考になります。
競合比較:GPU、TPU、専用チップはどう選ぶべきか
どのチップが適しているかは、学習と推論のどちらに使うのか、既存ソフトを変更できるのかによって変わります。
NVIDIA GPUの強みは、学習と推論の両方に使いやすいことです。開発ツールが充実し、扱える技術者も多いため、別の環境へ移行するリスクを抑えやすくなります。
AMDは大容量メモリが強みです。1枚のGPUに大きなモデルを載せやすく、構成によってはGPU間の通信を減らせます。
Google TPUやAWSの専用チップは、それぞれのクラウドサービスと組み合わせることで効率を高められます。ただし、別の環境へ移行するときには追加の作業が必要です。
小規模な企業なら、最初からGPUを購入する必要はありません。まずAPIで需要を確かめ、利用量が増えてから自社運用を検討する方法もあります。
独自分析:企業が見るべき指標は「GPU台数」ではない
企業が確認したいのはGPUの台数ではなく、1回答の費用、待ち時間、回答品質です。
GPUを大量に用意しても、利用率が低ければ費用効率は上がりません。小型モデルで十分な仕事に、大型モデルを使い続けるのも無駄が増える原因です。
実際の運用では、次の指標をあわせて確認します。
- 100万トークン当たりの総費用
- 1秒当たりの生成トークン数
- 同時に処理できる利用者数
- 最初の文字が出るまでの時間
- 回答品質とやり直し率
- 待機時を含む平均消費電力
料金の安いモデルでも、誤答が多くて再実行が増えれば、結果として費用がかさみます。反対に、高性能なモデルを簡単な作業に使うのも効率的ではありません。
簡単な処理は小型モデルに任せ、難しい質問だけ大型モデルへ回す方法もあります。必要な回答品質を保ちながら、推論費用を抑えやすくなります。
一般利用者にはどんな影響があるのか
推論にかかる費用が高いほど、利用回数の上限や広告、月額料金にも影響しやすくなります。
無料版に回数制限が設けられる理由の一つは、利用するたびに計算費用がかかることです。長時間の推論や動画生成のように処理が重い機能ほど、制限も厳しくなりやすいでしょう。
チップやソフトウェアの効率が上がれば、同じ料金でも利用できる量を増やせます。端末上で直接動く小型AIの普及も進むと考えられます。
企業の場合は、導入時の費用だけでなく、利用量が増えた後にどこまで費用が膨らむかも確認する必要があります。試験導入では安くても、本番運用を始めると費用が大きく増える場合があります。
AI向け通信部品の供給については「AIサーバーの次の不足は光通信チップ?」もあわせてご覧ください。
よくある質問
学習と推論は同じモデルを扱いますが、必要な設備や費用のかかり方は大きく異なります。
ChatGPTを使うだけならGPUは必要ですか?
ブラウザやアプリから使うだけなら、高性能GPUは必要ありません。
AIの計算はサービス提供会社のデータセンターで行われます。利用者側の端末は、主に入力の送信と結果の表示を担当します。
家庭用GPUで生成AIを学習できますか?
小型モデルのLoRAや画像生成AIの追加学習であれば可能です。
ただし、大規模モデルをゼロから作る事前学習は現実的ではありません。必要なVRAM、電力、時間の規模が大きすぎるためです。
推論には必ずGPUが必要ですか?
必須ではありませんが、GPUや専用チップを使ったほうが高速に処理できます。
小型モデルなら、CPUやスマートフォンのNPUでも動かせます。必要な速度や消費電力に応じて使い分けます。
学習と推論のどちらが電力を使いますか?
1回の処理では学習の負荷が大きいものの、サービス全体では推論の電力消費が上回る場合があります。
どちらが多くなるかは、モデルの大きさや回答の長さ、利用回数によって変わります。公表されている数字も測定範囲が異なるため、単純には比較できません。
まとめ
学習は大きな一括投資、推論は利用に応じて積み上がる運用費です。
学習ではモデルを更新するため、大量の計算能力とメモリが必要です。推論は1回あたりの負荷が小さくても、利用回数や出力の長さに応じて総費用が増えていきます。
GPUを選ぶときも、演算性能だけで判断するのは十分ではありません。VRAM容量やメモリ帯域、GPU間通信、消費電力、対応ソフトまで確認する必要があります。
個人や一般企業なら、まずはAPIや小型モデルから始める方法が現実的です。大規模なGPU設備は、継続的な需要が見込める段階になってから検討したほうが無駄を抑えられます。
主な参考資料
数値は一次資料と研究論文を優先し、独自に計算した部分は前提条件を明記しています。



コメントを送信