生成AIは、1枚の高性能GPUだけで動いているわけではありません。多数のGPUやCPU、HBM、ストレージを高速ネットワークで結び、処理を分担しています。
AIデータセンターとは、巨大なAIの学習や実行に必要な計算・記憶・通信を一体で設計した施設です。
どれか1つでも遅いと、ほかの高価な部品まで待たされてしまいます。そのため、GPUの台数だけを見ても性能は判断できません。
- GPU:大量の計算を同時に進める
- CPU:処理の準備や管理を担当する
- HBM:GPUがすぐ使うデータを置く
- ネットワーク:GPUやサーバー同士をつなぐ
- ストレージ:学習データやモデルを長く保存する
この記事では、各部品の役割とデータの流れを図解します。70Bモデルに必要なHBM容量や、通信にかかる時間も独自に計算します。
AIデータセンターとは
AIデータセンターは、大量のAI処理を効率よくこなすための専用工場のような施設です。
一般的なデータセンターでも、Webサイトや業務システムなどを動かしています。ただし、中心となる演算装置はCPUです。
AIデータセンターでは、GPUやAI専用チップが中心になります。生成AIでは、同じ種類の計算を大量に並列処理するためです。
| 比較項目 | 一般的なデータセンター | AIデータセンター |
|---|---|---|
| 主な処理 | Web、メール、データベース | AIの学習、推論、データ処理 |
| 中心の演算装置 | CPU | GPUやAI専用チップ |
| メモリー | 主にDDR系のシステムメモリー | システムメモリーに加えてHBM |
| 通信 | 通常のEthernetが中心 | 低遅延の高速ネットワークを重視 |
| 電力と冷却 | 比較的分散しやすい | 高密度で、液冷も使われる |
ただし、両者が完全に分かれているわけではありません。通常のクラウド施設の中にGPU用の区画を設ける場合もあります。
図解:AIデータセンター全体の仕組み
データはストレージからCPUを経由し、GPUの近くにあるHBMへ運ばれて計算に使われます。
AIデータセンター内の主なデータの流れ
| 順番 | 装置・接続 | 主な役割 |
|---|---|---|
| 1 | 利用者 | 質問や画像を送る |
| ↓ | 要求をAIデータセンターへ送信 | |
| 2 | CPU | 受付、データの準備、処理の管理 |
| ↓ | GPUが使える形へ変換 | |
| 3 | HBM | モデルの重みや途中結果を一時保存 |
| ↕ | HBMとGPUの間でデータを高速転送 | |
| 4 | GPU | AIに必要な行列計算を実行 |
| ↓ | NVLinkなど | 同じサーバー内のGPUを接続 |
| ↓ | InfiniBand/Ethernet | 別のサーバーへデータを転送 |
| 5 | 別のGPU群 | 大きな処理を分担して計算 |
全体を支える設備
- ストレージ:学習データやAIモデルを保存する
- 電源・冷却:大量のGPUを安定して動かす
この図は、それぞれの役割が分かりやすいように単純化しています。実際には複数のネットワークやキャッシュ、管理装置なども加わります。
計算そのものより、データの移動が遅くなる場合もあります。GPUがどれだけ速くても、必要なデータが届かなければ処理を進められません。
GPUは大量の計算を同時に進める
GPUの役割は、AIで多用される行列計算を大量に並列処理することです。
CPUは、複雑で順序のある処理を柔軟にこなすのが得意です。GPUは、同じ種類の計算を大量に並べて処理することに向いています。
生成AIでは、文章を数値の集まりとして扱います。その数値に対して、膨大な回数の掛け算や足し算を行います。
GPUには、こうした計算に適した演算器が多数搭載されています。NVIDIAではTensor Core、AMDではMatrix Coreなどと呼ばれます。
学習と推論ではGPUの使い方が違う
学習はモデルを作る処理、推論は完成したモデルを使って回答を作る処理です。
| 項目 | 学習 | 推論 |
|---|---|---|
| 目的 | 大量のデータから重みを更新する | 入力に対する回答を作る |
| 主な負荷 | 計算、HBM容量、GPU間通信 | HBM帯域、応答時間、同時利用者数 |
| 処理時間 | 数日から数カ月の場合もある | 1回ごとは数秒前後が中心 |
| 重視する指標 | 学習完了までの時間 | 1秒当たりのトークン数や費用 |
学習では、多数のGPUが計算結果を同期します。推論では、HBMからモデルを何度も読み出すため、その速さが性能に大きく関わります。
CPUはGPUへ仕事を渡す司令塔
CPUは、GPUが計算に集中できるように、準備・制御・入出力を担当します。
CPUはOSやコンテナを動かし、利用者からの要求を受け付けます。文章の分割や画像の前処理、計算順序の管理もCPUの役割です。
ストレージやネットワークから届いたデータもCPUが整理します。その後、GPUで処理できる形にして渡します。
CPUが遅いと、GPUへ十分な量の仕事を渡せません。高価なGPUが入力待ちになってしまうため、CPUを減らしすぎる設計にも注意が必要です。
NVIDIAのGH200は、CPUとGPUを900GB/秒のNVLink-C2Cで接続します。CPUとGPUの間も高速化が必要になっていることが分かります。
HBMはGPUのすぐ隣にある高速な作業机
HBMは、AIモデルの重みや途中結果を置くための、データ転送速度が非常に高いメモリーです。
HBMは「High Bandwidth Memory」の略で、日本語では広帯域メモリーと呼ばれます。
複数のメモリーチップを縦に積み、GPUの近くに配置します。短い距離で大量のデータをやり取りできるため、高速な転送が可能です。
容量と帯域は別の指標です。容量は保存できるデータ量、帯域は1秒間に転送できるデータ量を表します。
| 代表例 | HBM容量 | メモリー帯域 | GPU間接続 |
|---|---|---|---|
| NVIDIA H100 SXM | 80GB | 3.35TB/秒 | NVLink 900GB/秒 |
| AMD Instinct MI300X | 192GB | 5.3TB/秒 | Infinity Fabric 最大1,024GB/秒 |
数値は各社の公称値です。接続方式や測定範囲が異なるため、この数字だけで製品の優劣を判断することはできません。
HBMと普通のメモリーは何が違うのか
HBMを高速な作業机、システムメモリーを広い準備場所と考えると分かりやすいでしょう。
サーバーのDDRメモリーは、主にCPUが使います。大容量にしやすい反面、GPUから利用する場合はHBMほど高速ではありません。
その外側にはSSDや共有ストレージがあります。大容量のデータを保存できますが、速度はHBMより大幅に遅くなります。
そこで、頻繁に使うデータほどGPUの近くに置きます。よく使う資料を倉庫ではなく、机の上に置いておくのと同じ考え方です。
ネットワークは数千基のGPUを1台のように結ぶ
巨大なAIを動かす場合、ネットワークも計算装置の一部として考える必要があります。
1基のGPUに収まらないモデルは、複数のGPUに分けて処理します。学習中には、それぞれのGPUが計算した結果も頻繁に共有します。
通信が遅ければ、計算を先に終えたGPUはほかのGPUを待つことになります。GPUを増やしても、性能が台数に比例して伸びない原因の1つです。
| 通信の層 | 主な技術 | つなぐ範囲 | 主な役割 |
|---|---|---|---|
| Scale-up | NVLink、NVSwitch、Infinity Fabric | 同じサーバーやラック内 | GPU同士を非常に高速に接続 |
| Scale-out | InfiniBand、RoCE、Ethernet | 複数のサーバー間 | 大規模なGPU群へ拡張 |
| フロント側 | Ethernet、ロードバランサー | 利用者からAIサービスまで | 質問を受け、回答を返す |
| ストレージ側 | Ethernet、InfiniBandなど | 計算機と保存装置の間 | 学習データやモデルを運ぶ |
NVIDIA DGX H100は、8基のH100と4基のNVSwitchを搭載しています。外部接続には最大400GbpsのInfiniBandまたはEthernetを利用できます。
NVLinkとInfiniBandは単純な競合ではない
NVLinkは近距離のGPU接続、InfiniBandはサーバー間接続で使われることが多く、それぞれ役割が異なります。
NVLinkは、同じ装置内にあるGPUを高い帯域で接続します。NVSwitchを使うと、多数のGPU間でデータを交換しやすくなります。
InfiniBandや高速Ethernetは、別のサーバーまで接続範囲を広げるために使われます。実際のAI基盤では、両方を組み合わせる構成が一般的です。
推論時にデータはどう流れるのか
利用者が質問を送ってから回答が返るまでに、データは複数の装置を行き来します。
- 利用者の質問が、インターネット経由で受付サーバーへ届く
- CPUが文章を細かな単位に分け、数値へ変換する
- 処理できるGPUを選び、要求を待ち行列へ入れる
- モデルの重みや過去の会話をHBMへ用意する
- GPUが次に出す単語を計算する
- 複数GPUを使う場合は、途中結果をネットワークで交換する
- CPU側で結果を整え、利用者へ回答を返す
文章を生成するときは、5番と6番の処理を何度も繰り返します。1回ごとの遅れは小さくても、長い回答になるほど影響が積み重なります。
独自計算1:70BモデルにはHBMが何GB必要か
700億個のパラメーターを持つモデルでは、FP16なら重みだけで約140GB必要です。
パラメーターとは、AIが学習によって得た数値です。70Bは700億個を意味します。
| 重みの形式 | 1パラメーター当たり | 70Bモデルの重み | 80GB HBMに収まるか |
|---|---|---|---|
| FP16/BF16 | 2バイト | 約140GB | 収まらない |
| 8ビット | 1バイト | 約70GB | 重みだけなら収まる |
| 4ビット | 0.5バイト | 約35GB | 余裕が増える |
計算式は「700億×1個当たりのバイト数」です。ただし、推論では会話履歴を保持するKVキャッシュなどの容量も必要になります。
学習では、勾配や最適化に使う数値も保存します。単純化して1パラメーター当たり16バイトとすると、70Bでは約1.12TBです。
実際に必要な容量は、学習方法や分散方式によって変わります。この試算には活性化データなどを含めていません。
独自計算2:HBM帯域は回答速度へどう効くか
140GBの重みを1回読み出すだけでも、3.35TB/秒なら理論上約41.8ミリ秒かかります。
NVIDIA H100 SXMの公称メモリー帯域は3.35TB/秒です。140GBを3,350GB/秒で割ると、約0.0418秒になります。
AMD MI300Xの5.3TB/秒で同じ計算をすると、約26.4ミリ秒です。これはデータ移動だけを考えた理想値です。
| 例 | 公称帯域 | 140GBを読む理論上の最短時間 |
|---|---|---|
| H100 SXM | 3.35TB/秒 | 約41.8ミリ秒 |
| MI300X | 5.3TB/秒 | 約26.4ミリ秒 |
実際のAIでは、キャッシュや並列処理も使われます。公称帯域を100%使えるわけでもないため、この数値がそのまま実測の生成速度になるわけではありません。
それでも、AIの性能には演算回数だけでなくHBM帯域も関係することが分かります。演算器が速くても、必要な重みを十分な速さで運べなければ性能を生かせません。
独自計算3:8基のGPUを同期すると何ミリ秒かかるか
8基のGPUで1GBのデータをリング方式で同期すると、各GPUは理論上約1.75GBを送受信します。
リングAll-Reduceを単純化すると、通信量は「2×7÷8×データ量」です。1GBなら1.75GBになります。
400Gbpsをバイトに換算すると毎秒50GBです。1.75GBを転送する理論上の最短時間は約35ミリ秒になります。
100Gbpsでは毎秒12.5GBなので、約140ミリ秒です。同じ処理でも、約105ミリ秒の差が生まれます。
| 回線速度 | 1秒当たりのデータ量 | 1.75GBを運ぶ理論時間 |
|---|---|---|
| 100Gbps | 12.5GB/秒 | 約140ミリ秒 |
| 400Gbps | 50GB/秒 | 約35ミリ秒 |
実際には、通信制御や混雑、スイッチを通過する時間なども加わります。複数のポートを並列で使う構成では、条件も変わります。
独自計算4:GPU利用率60%と90%では何台違うか
90基分の実効性能を得るには、利用率90%なら100基、60%なら150基必要です。
計算式は「必要な実効台数÷利用率」です。90÷0.9は100、90÷0.6は150になります。
通信やデータ供給を改善できなければ、同じ仕事をこなすために50基多く必要になる計算です。GPU単体の速さだけを比べていると、この差を見落とします。
ただし、利用率が低くなる原因は通信だけではありません。障害やソフトウェア、ジョブ待ち、電力制限なども影響します。
どこが遅いかを症状から見分ける
AI基盤を改善するには、GPU使用率だけでなく、HBM帯域や通信待ちの時間も確認する必要があります。
| 見える症状 | 疑う場所 | 確認する指標 |
|---|---|---|
| GPU使用率が上下する | CPU、ストレージ、入力処理 | CPU負荷、待ち行列、読み込み速度 |
| GPUは動くが計算性能が伸びない | HBM帯域 | メモリー帯域使用率、キャッシュ命中率 |
| GPUを増やすほど効率が落ちる | GPU間ネットワーク | 通信時間、再送、All-Reduce時間 |
| 最初の回答だけ遅い | モデル読み込み、入力処理 | 初回応答時間、ストレージI/O |
| 長い会話で急に遅くなる | HBM容量、KVキャッシュ | 使用メモリー量、キャッシュ退避 |
この表だけで原因を断定できるわけではありません。複数の問題が同時に発生している場合もあります。
GPU・CPU・HBM・ネットワークの関係
AIデータセンターの性能は、最も弱い部分に引っ張られます。
| 部品 | たとえるなら | 不足したときに起きること |
|---|---|---|
| GPU | 計算する作業員 | 学習や回答生成が遅くなる |
| CPU | 仕事を配る管理者 | GPUへ仕事を供給できない |
| HBM | 高速な作業机 | モデルが載らない、データ待ちになる |
| ネットワーク | 工場同士を結ぶ道路 | GPUの同期に時間がかかる |
| ストレージ | 材料を置く倉庫 | 学習開始やデータ供給が遅れる |
| 電源・冷却 | 工場の電気と空調 | 設置できるGPU数が制限される |
道路が細ければ、作業員を増やしても材料が十分に届きません。作業机が狭ければ、大きな模型を広げることもできません。
AIデータセンターは、単に高性能な部品を集めた設備ではありません。それぞれの性能を釣り合わせて動かすシステムです。
よくある誤解
「GPUが多いほど必ず速い」とは限りません。
HBMはGPUを増やせば自動で1つになる?
複数GPUのHBMは、通常の1枚のメモリーのように自動でまとまるわけではありません。
モデルを複数のGPUに分割し、GPU同士の通信方法もソフトウェア側で設計します。HBMの合計容量が同じでも、1基の大容量GPUと同じように使えるとは限りません。
ネットワークが速ければGPU性能は不要?
通信を速くしても、演算量の多い処理には高いGPU性能が必要です。
反対に、1基のGPUだけで処理できる小さなモデルなら、外部ネットワークの影響は小さくなります。どこがボトルネックになるかは処理によって変わります。
AIデータセンターは学習専用?
現在のAIデータセンターでは、学習に加えて、利用者へ回答を返す推論も大きな比重を占めています。
推論では、素早い応答と多くの利用者への同時提供が求められます。AIエージェントでは、複数のモデルや外部サービスとの通信も増えます。
一般利用者にはどんな影響があるのか
AIデータセンターの効率は、回答速度や利用料金、サービスの混雑にも影響します。
同じGPU台数でも、HBMやネットワークを効率よく使えれば、処理できる質問数を増やせます。1回の回答にかかる原価も抑えやすくなります。
ただし、設備投資が増えたからといって、すぐに利用料金が下がるとは限りません。GPU以外にも、電力や冷却、建物、保守などに費用がかかります。
利用者からは見えにくい部分ですが、AIの使いやすさはモデル性能だけでは決まりません。裏側にあるインフラの設計も大きく関係します。
まとめ:AIデータセンターは「GPUの集合」ではない
AIデータセンターは、GPU・CPU・HBM・ネットワークを一体で動かす巨大な計算システムです。
GPUが計算を進め、CPUが仕事を準備します。HBMは必要なデータをGPUの近くに置き、ネットワークは複数のGPUをつなぎます。
70Bモデルでは、FP16の重みだけで約140GB必要です。学習では、さらに勾配や最適化用のデータも加わります。
そのため、GPUの演算性能だけを見ていては全体の性能を判断できません。HBMの容量と帯域、GPU間通信、GPU利用率まで確認する必要があります。
今後のAI競争では、速いチップそのものに加えて、高価なチップを待たせず効率よく動かせる設計も大きな差になります。
関連ページ
AIインフラの通信、メモリー、計算能力についてさらに詳しく知りたい方は、次の記事も参考にしてください。
- AI性能の壁はGPUではなく通信?元Intel幹部のDelos Dataが1億ドル調達
- メモリ不足は2027年が最悪?スマホ・ノートPC値上げが長期化する理由
- 欧州のAI計算能力不足は10年で6倍へ?ECB総裁が米国依存へ警告
- AIエージェントとは?生成AIとの違い・仕組み・できることを初心者向けに解説
出典
製品仕様は、各社が公開している一次情報を基にしています。



コメントを送信