AIデータセンターとは?GPU・CPU・HBM・ネットワークの仕組みを図解

生成AIは、1枚の高性能GPUだけで動いているわけではありません。多数のGPUやCPU、HBM、ストレージを高速ネットワークで結び、処理を分担しています。

AIデータセンターとは、巨大なAIの学習や実行に必要な計算・記憶・通信を一体で設計した施設です。

どれか1つでも遅いと、ほかの高価な部品まで待たされてしまいます。そのため、GPUの台数だけを見ても性能は判断できません。

  • GPU:大量の計算を同時に進める
  • CPU:処理の準備や管理を担当する
  • HBM:GPUがすぐ使うデータを置く
  • ネットワーク:GPUやサーバー同士をつなぐ
  • ストレージ:学習データやモデルを長く保存する

この記事では、各部品の役割とデータの流れを図解します。70Bモデルに必要なHBM容量や、通信にかかる時間も独自に計算します。

AIデータセンターとは

AIデータセンターは、大量のAI処理を効率よくこなすための専用工場のような施設です。

一般的なデータセンターでも、Webサイトや業務システムなどを動かしています。ただし、中心となる演算装置はCPUです。

AIデータセンターでは、GPUやAI専用チップが中心になります。生成AIでは、同じ種類の計算を大量に並列処理するためです。

比較項目一般的なデータセンターAIデータセンター
主な処理Web、メール、データベースAIの学習、推論、データ処理
中心の演算装置CPUGPUやAI専用チップ
メモリー主にDDR系のシステムメモリーシステムメモリーに加えてHBM
通信通常のEthernetが中心低遅延の高速ネットワークを重視
電力と冷却比較的分散しやすい高密度で、液冷も使われる

ただし、両者が完全に分かれているわけではありません。通常のクラウド施設の中にGPU用の区画を設ける場合もあります。

図解:AIデータセンター全体の仕組み

データはストレージからCPUを経由し、GPUの近くにあるHBMへ運ばれて計算に使われます。

AIデータセンター内の主なデータの流れ

順番装置・接続主な役割
1利用者質問や画像を送る
要求をAIデータセンターへ送信
2CPU受付、データの準備、処理の管理
GPUが使える形へ変換
3HBMモデルの重みや途中結果を一時保存
HBMとGPUの間でデータを高速転送
4GPUAIに必要な行列計算を実行
NVLinkなど同じサーバー内のGPUを接続
InfiniBand/Ethernet別のサーバーへデータを転送
5別のGPU群大きな処理を分担して計算

全体を支える設備

  • ストレージ:学習データやAIモデルを保存する
  • 電源・冷却:大量のGPUを安定して動かす

この図は、それぞれの役割が分かりやすいように単純化しています。実際には複数のネットワークやキャッシュ、管理装置なども加わります。

計算そのものより、データの移動が遅くなる場合もあります。GPUがどれだけ速くても、必要なデータが届かなければ処理を進められません。

GPUは大量の計算を同時に進める

GPUの役割は、AIで多用される行列計算を大量に並列処理することです。

CPUは、複雑で順序のある処理を柔軟にこなすのが得意です。GPUは、同じ種類の計算を大量に並べて処理することに向いています。

生成AIでは、文章を数値の集まりとして扱います。その数値に対して、膨大な回数の掛け算や足し算を行います。

GPUには、こうした計算に適した演算器が多数搭載されています。NVIDIAではTensor Core、AMDではMatrix Coreなどと呼ばれます。

学習と推論ではGPUの使い方が違う

学習はモデルを作る処理、推論は完成したモデルを使って回答を作る処理です。

項目学習推論
目的大量のデータから重みを更新する入力に対する回答を作る
主な負荷計算、HBM容量、GPU間通信HBM帯域、応答時間、同時利用者数
処理時間数日から数カ月の場合もある1回ごとは数秒前後が中心
重視する指標学習完了までの時間1秒当たりのトークン数や費用

学習では、多数のGPUが計算結果を同期します。推論では、HBMからモデルを何度も読み出すため、その速さが性能に大きく関わります。

CPUはGPUへ仕事を渡す司令塔

CPUは、GPUが計算に集中できるように、準備・制御・入出力を担当します。

CPUはOSやコンテナを動かし、利用者からの要求を受け付けます。文章の分割や画像の前処理、計算順序の管理もCPUの役割です。

ストレージやネットワークから届いたデータもCPUが整理します。その後、GPUで処理できる形にして渡します。

CPUが遅いと、GPUへ十分な量の仕事を渡せません。高価なGPUが入力待ちになってしまうため、CPUを減らしすぎる設計にも注意が必要です。

NVIDIAのGH200は、CPUとGPUを900GB/秒のNVLink-C2Cで接続します。CPUとGPUの間も高速化が必要になっていることが分かります。

HBMはGPUのすぐ隣にある高速な作業机

HBMは、AIモデルの重みや途中結果を置くための、データ転送速度が非常に高いメモリーです。

HBMは「High Bandwidth Memory」の略で、日本語では広帯域メモリーと呼ばれます。

複数のメモリーチップを縦に積み、GPUの近くに配置します。短い距離で大量のデータをやり取りできるため、高速な転送が可能です。

容量と帯域は別の指標です。容量は保存できるデータ量、帯域は1秒間に転送できるデータ量を表します。

代表例HBM容量メモリー帯域GPU間接続
NVIDIA H100 SXM80GB3.35TB/秒NVLink 900GB/秒
AMD Instinct MI300X192GB5.3TB/秒Infinity Fabric 最大1,024GB/秒

数値は各社の公称値です。接続方式や測定範囲が異なるため、この数字だけで製品の優劣を判断することはできません。

HBMと普通のメモリーは何が違うのか

HBMを高速な作業机、システムメモリーを広い準備場所と考えると分かりやすいでしょう。

サーバーのDDRメモリーは、主にCPUが使います。大容量にしやすい反面、GPUから利用する場合はHBMほど高速ではありません。

その外側にはSSDや共有ストレージがあります。大容量のデータを保存できますが、速度はHBMより大幅に遅くなります。

そこで、頻繁に使うデータほどGPUの近くに置きます。よく使う資料を倉庫ではなく、机の上に置いておくのと同じ考え方です。

ネットワークは数千基のGPUを1台のように結ぶ

巨大なAIを動かす場合、ネットワークも計算装置の一部として考える必要があります。

1基のGPUに収まらないモデルは、複数のGPUに分けて処理します。学習中には、それぞれのGPUが計算した結果も頻繁に共有します。

通信が遅ければ、計算を先に終えたGPUはほかのGPUを待つことになります。GPUを増やしても、性能が台数に比例して伸びない原因の1つです。

通信の層主な技術つなぐ範囲主な役割
Scale-upNVLink、NVSwitch、Infinity Fabric同じサーバーやラック内GPU同士を非常に高速に接続
Scale-outInfiniBand、RoCE、Ethernet複数のサーバー間大規模なGPU群へ拡張
フロント側Ethernet、ロードバランサー利用者からAIサービスまで質問を受け、回答を返す
ストレージ側Ethernet、InfiniBandなど計算機と保存装置の間学習データやモデルを運ぶ

NVIDIA DGX H100は、8基のH100と4基のNVSwitchを搭載しています。外部接続には最大400GbpsのInfiniBandまたはEthernetを利用できます。

NVLinkとInfiniBandは単純な競合ではない

NVLinkは近距離のGPU接続、InfiniBandはサーバー間接続で使われることが多く、それぞれ役割が異なります。

NVLinkは、同じ装置内にあるGPUを高い帯域で接続します。NVSwitchを使うと、多数のGPU間でデータを交換しやすくなります。

InfiniBandや高速Ethernetは、別のサーバーまで接続範囲を広げるために使われます。実際のAI基盤では、両方を組み合わせる構成が一般的です。

推論時にデータはどう流れるのか

利用者が質問を送ってから回答が返るまでに、データは複数の装置を行き来します。

  1. 利用者の質問が、インターネット経由で受付サーバーへ届く
  2. CPUが文章を細かな単位に分け、数値へ変換する
  3. 処理できるGPUを選び、要求を待ち行列へ入れる
  4. モデルの重みや過去の会話をHBMへ用意する
  5. GPUが次に出す単語を計算する
  6. 複数GPUを使う場合は、途中結果をネットワークで交換する
  7. CPU側で結果を整え、利用者へ回答を返す

文章を生成するときは、5番と6番の処理を何度も繰り返します。1回ごとの遅れは小さくても、長い回答になるほど影響が積み重なります。

独自計算1:70BモデルにはHBMが何GB必要か

700億個のパラメーターを持つモデルでは、FP16なら重みだけで約140GB必要です。

パラメーターとは、AIが学習によって得た数値です。70Bは700億個を意味します。

重みの形式1パラメーター当たり70Bモデルの重み80GB HBMに収まるか
FP16/BF162バイト約140GB収まらない
8ビット1バイト約70GB重みだけなら収まる
4ビット0.5バイト約35GB余裕が増える

計算式は「700億×1個当たりのバイト数」です。ただし、推論では会話履歴を保持するKVキャッシュなどの容量も必要になります。

学習では、勾配や最適化に使う数値も保存します。単純化して1パラメーター当たり16バイトとすると、70Bでは約1.12TBです。

実際に必要な容量は、学習方法や分散方式によって変わります。この試算には活性化データなどを含めていません。

独自計算2:HBM帯域は回答速度へどう効くか

140GBの重みを1回読み出すだけでも、3.35TB/秒なら理論上約41.8ミリ秒かかります。

NVIDIA H100 SXMの公称メモリー帯域は3.35TB/秒です。140GBを3,350GB/秒で割ると、約0.0418秒になります。

AMD MI300Xの5.3TB/秒で同じ計算をすると、約26.4ミリ秒です。これはデータ移動だけを考えた理想値です。

公称帯域140GBを読む理論上の最短時間
H100 SXM3.35TB/秒約41.8ミリ秒
MI300X5.3TB/秒約26.4ミリ秒

実際のAIでは、キャッシュや並列処理も使われます。公称帯域を100%使えるわけでもないため、この数値がそのまま実測の生成速度になるわけではありません。

それでも、AIの性能には演算回数だけでなくHBM帯域も関係することが分かります。演算器が速くても、必要な重みを十分な速さで運べなければ性能を生かせません。

独自計算3:8基のGPUを同期すると何ミリ秒かかるか

8基のGPUで1GBのデータをリング方式で同期すると、各GPUは理論上約1.75GBを送受信します。

リングAll-Reduceを単純化すると、通信量は「2×7÷8×データ量」です。1GBなら1.75GBになります。

400Gbpsをバイトに換算すると毎秒50GBです。1.75GBを転送する理論上の最短時間は約35ミリ秒になります。

100Gbpsでは毎秒12.5GBなので、約140ミリ秒です。同じ処理でも、約105ミリ秒の差が生まれます。

回線速度1秒当たりのデータ量1.75GBを運ぶ理論時間
100Gbps12.5GB/秒約140ミリ秒
400Gbps50GB/秒約35ミリ秒

実際には、通信制御や混雑、スイッチを通過する時間なども加わります。複数のポートを並列で使う構成では、条件も変わります。

独自計算4:GPU利用率60%と90%では何台違うか

90基分の実効性能を得るには、利用率90%なら100基、60%なら150基必要です。

計算式は「必要な実効台数÷利用率」です。90÷0.9は100、90÷0.6は150になります。

通信やデータ供給を改善できなければ、同じ仕事をこなすために50基多く必要になる計算です。GPU単体の速さだけを比べていると、この差を見落とします。

ただし、利用率が低くなる原因は通信だけではありません。障害やソフトウェア、ジョブ待ち、電力制限なども影響します。

どこが遅いかを症状から見分ける

AI基盤を改善するには、GPU使用率だけでなく、HBM帯域や通信待ちの時間も確認する必要があります。

見える症状疑う場所確認する指標
GPU使用率が上下するCPU、ストレージ、入力処理CPU負荷、待ち行列、読み込み速度
GPUは動くが計算性能が伸びないHBM帯域メモリー帯域使用率、キャッシュ命中率
GPUを増やすほど効率が落ちるGPU間ネットワーク通信時間、再送、All-Reduce時間
最初の回答だけ遅いモデル読み込み、入力処理初回応答時間、ストレージI/O
長い会話で急に遅くなるHBM容量、KVキャッシュ使用メモリー量、キャッシュ退避

この表だけで原因を断定できるわけではありません。複数の問題が同時に発生している場合もあります。

GPU・CPU・HBM・ネットワークの関係

AIデータセンターの性能は、最も弱い部分に引っ張られます。

部品たとえるなら不足したときに起きること
GPU計算する作業員学習や回答生成が遅くなる
CPU仕事を配る管理者GPUへ仕事を供給できない
HBM高速な作業机モデルが載らない、データ待ちになる
ネットワーク工場同士を結ぶ道路GPUの同期に時間がかかる
ストレージ材料を置く倉庫学習開始やデータ供給が遅れる
電源・冷却工場の電気と空調設置できるGPU数が制限される

道路が細ければ、作業員を増やしても材料が十分に届きません。作業机が狭ければ、大きな模型を広げることもできません。

AIデータセンターは、単に高性能な部品を集めた設備ではありません。それぞれの性能を釣り合わせて動かすシステムです。

よくある誤解

「GPUが多いほど必ず速い」とは限りません。

HBMはGPUを増やせば自動で1つになる?

複数GPUのHBMは、通常の1枚のメモリーのように自動でまとまるわけではありません。

モデルを複数のGPUに分割し、GPU同士の通信方法もソフトウェア側で設計します。HBMの合計容量が同じでも、1基の大容量GPUと同じように使えるとは限りません。

ネットワークが速ければGPU性能は不要?

通信を速くしても、演算量の多い処理には高いGPU性能が必要です。

反対に、1基のGPUだけで処理できる小さなモデルなら、外部ネットワークの影響は小さくなります。どこがボトルネックになるかは処理によって変わります。

AIデータセンターは学習専用?

現在のAIデータセンターでは、学習に加えて、利用者へ回答を返す推論も大きな比重を占めています。

推論では、素早い応答と多くの利用者への同時提供が求められます。AIエージェントでは、複数のモデルや外部サービスとの通信も増えます。

一般利用者にはどんな影響があるのか

AIデータセンターの効率は、回答速度や利用料金、サービスの混雑にも影響します。

同じGPU台数でも、HBMやネットワークを効率よく使えれば、処理できる質問数を増やせます。1回の回答にかかる原価も抑えやすくなります。

ただし、設備投資が増えたからといって、すぐに利用料金が下がるとは限りません。GPU以外にも、電力や冷却、建物、保守などに費用がかかります。

利用者からは見えにくい部分ですが、AIの使いやすさはモデル性能だけでは決まりません。裏側にあるインフラの設計も大きく関係します。

まとめ:AIデータセンターは「GPUの集合」ではない

AIデータセンターは、GPU・CPU・HBM・ネットワークを一体で動かす巨大な計算システムです。

GPUが計算を進め、CPUが仕事を準備します。HBMは必要なデータをGPUの近くに置き、ネットワークは複数のGPUをつなぎます。

70Bモデルでは、FP16の重みだけで約140GB必要です。学習では、さらに勾配や最適化用のデータも加わります。

そのため、GPUの演算性能だけを見ていては全体の性能を判断できません。HBMの容量と帯域、GPU間通信、GPU利用率まで確認する必要があります。

今後のAI競争では、速いチップそのものに加えて、高価なチップを待たせず効率よく動かせる設計も大きな差になります。

関連ページ

AIインフラの通信、メモリー、計算能力についてさらに詳しく知りたい方は、次の記事も参考にしてください。

出典

製品仕様は、各社が公開している一次情報を基にしています。

コメントを送信

You May Have Missed