AI性能の壁はGPUではなく通信?元Intel幹部のDelos Dataが1億ドル調達

AIの性能を左右するのは、GPUだけではなくなりつつあります。複数のGPUやメモリーを結ぶ「通信」が、新たなボトルネックとして目立ってきたからです。

米Delos Dataは2026年9月15日、1億ドル超を調達したと発表しました。同社は、Intelの元幹部らが設立した半導体スタートアップです。

Delos Dataが狙うのは、GPUそのものを作る市場ではありません。高価なGPUを待たせずに働かせる「データの通り道」です。

とはいえ、「GPUはもうボトルネックではない」と断定するのは早すぎます。この記事ではDelosの発表内容を競合製品や過去の研究と比べながら、実力と課題を整理します。

Delos Dataが1億ドル超を調達

Delos Dataは1億ドル超を調達し、通信チップとソフトウェアの開発を加速します。

出資したのはMatrix、Playground、Socratic Partners、CapricornのTechnology Impact Fund、Matter Venture Partners、IAGなどです。調達した資金は、技術者の採用や製品開発、販売体制の拡大に使います。

CEOのEd Doe氏は、IntelでConnectivity Groupの副社長を務めていました。CTOのDan Daly氏も、Intelでネットワーク関連の開発に携わった人物です。

資金調達には、Intel元CEOのPat Gelsinger氏が所属するPlaygroundも参加しています。同氏は、演算装置がデータを待っている時間は、電力と投資の大きな無駄になると説明しました。

なお、Delosの発表には「今回のラウンドだけで1億ドルを調達した」とは書かれていません。同社とAIwireはいずれも、「これまでに1億ドル超を調達した」と表現しています。

なぜAIの壁がGPUから通信へ移るのか

大規模AIでは、1個のGPUが高速でも、別のGPUからデータが届かなければ計算を続けられません。

巨大なAIモデルは、複数のGPUに分割して動かします。その過程で、計算結果やメモリー内のデータを何度もやり取りします。

特に生成時の推論では、利用者へ答えを返すまでの速さが重要です。AIエージェントは複数のモデルや外部ツールを使うため、データの移動も複雑になります。

道路にたとえるなら、GPUは高性能な工場です。工場を増やしても、道路が渋滞すれば製品は次の工程へ届きません。

2024年に公開されたMegaScaleの論文でも、この問題が確認されています。1万2,288基のGPUで1750億パラメータのモデルを学習させたとき、演算性能の利用率は55.2%でした。

ただし、残りの44.8%がすべて通信で失われたわけではありません。通信のほか、処理の待ち時間や障害、ソフトウェアなどを含めたシステム全体の損失です。

Delos Dataの「Nonstop AI」とは

Delosの特徴は、通信チップだけを提供するのではなく、サーバー設計や監視ソフトまでまとめて扱う点です。

基盤となる設計は「MoXI」と呼ばれます。GPU、CPU、AI専用チップ、メモリー、ストレージを、1つのデータ領域として結ぶ考え方です。

Delosは、接続用のData Interfaceを3種類用意します。

形状公称帯域主な接続先1秒あたりのデータ量に換算
I/Oチップレット30Tbps超GPU、XPU、AIアクセラレーター3.75TB/秒超
Near-packaged optics10Tbps超光接続を使う演算装置1.25TB/秒超
PCIeカード400Gbps超CPU、フラッシュ、メモリー50GB/秒超

換算は、8ビット=1バイトとして計算しました。実際の通信には符号化や制御情報が含まれるため、利用できる速度はこれより低くなります。

DelosはData Interfaceについて、従来の接続点と比べて10倍の速度、10倍の耐障害性、10倍の規模を目標に掲げています。最小遅延は約100ナノ秒と説明しています。

ただし、これらは第三者が共通のベンチマークで検証した数値ではありません。製品全体の速度と、部品単体の帯域も分けて考える必要があります。

NVIDIAやAMDと何が違うのか

Delosの大きな違いは、特定メーカーのGPUだけで構成を閉じず、異なる装置を同じ通信基盤につなごうとしている点です。

方式公表された規模・帯域強み注意点
Delos Nonstop AI30Tbps超のI/Oチップレット。数千基以上への拡張を想定GPU、CPU、メモリー、ストレージを混在できる設計大規模な第三者検証は未公表
NVIDIA NVLink 672GPUで260TB/秒。1GPUあたり3.6TB/秒GPU、スイッチ、ソフトを一体で最適化NVIDIA中心の構成になる
AMD Helios72GPUで260TB/秒。規格はUALinkとUECを採用オープン規格を使い、選択肢を広げるHeliosは完成品ではなく設計図

NVIDIAのVera Rubin NVL72は、72基のGPUをNVLink 6で接続します。公称の合計帯域は260TB/秒で、1基あたり3.6TB/秒です。

AMD Heliosも72基のMI455Xを結び、合計260TB/秒を掲げています。こちらはUALinkやUltra Ethernetなどのオープン規格を採用します。

Delosの30Tbpsをバイトに換算すると3.75TB/秒です。数字だけを見ると、Rubinの1GPUあたり3.6TB/秒に近く見えます。

ただし、単純には比較できません。Delosは接続部品のI/O帯域、NVIDIAはGPU単位の双方向帯域を示しているためです。測定する範囲が違うので、数字だけで優劣は判断できません。

独自計算1:通信遅延は何回で大きな差になるか

1回あたりの通信遅延が小さくても、処理中に何十万回も待てば、無視できない差になります。

Delosは最小遅延を約100ナノ秒と説明しています。AIwireは、一般的なNICではマイクロ秒単位になると報じました。

単純化して、Delosを0.1マイクロ秒、従来方式を1マイクロ秒とします。直列のデータ受け渡しが100万回発生すると、待ち時間はそれぞれ0.1秒と1秒です。

差は0.9秒になります。ただし、実際の通信は並列で動き、ソフトウェアの処理時間も加わります。この計算は実測性能ではなく、遅延が積み重なる仕組みを示したものです。

独自計算2:GPUの10%待機はどれだけ電力を失うか

通信を改善する意味は処理速度の向上だけではありません。使われない電力や設備投資を減らせる可能性もあります。

ここでは、1基あたり1kWを使うGPUが1,000基あると仮定します。通信待ちで10%の時間を失うなら、平均すると100kW分の計算能力が止まる計算です。

1日では2,400kWh、1年では87万6,000kWhになります。電力単価を1kWhあたり0.10ドルとすると、年間8万7,600ドルです。

これはGPU本体や冷却設備、建物の費用を含まない控えめな試算です。また、待機中も常に最大電力を消費するとは限らないため、実際の損失額を示すものではありません。

独自計算3:規模を増やすほど障害対策が重要になる

数千基を1つにつなぐシステムでは、速さと同じくらい「壊れても止まらない仕組み」が重要です。

仮に、それぞれの装置が1日で問題を起こす確率を0.01%とします。各装置の障害が互いに独立していると単純化すると、1,000基のうちどれかに問題が起きる確率は約9.5%です。

10万基まで増えると、その確率は約99.995%になります。大規模な環境では、障害そのものをなくすより、障害が起きても処理を続けられる設計が必要です。

Delosは、故障した装置や切断された回線を接続部で検知し、ハードウェア側で復旧すると説明しています。通信を速くするだけでなく、復旧にかかる時間も短くする狙いです。

過去事例から見える通信改善の効果と限界

GPUを増やしても、性能が台数に比例して伸びないことは、過去の大規模学習でも確認されています。

MegaScaleは、通信と計算を重ねて実行するなどの工夫を取り入れました。その結果、1万2,288基で55.2%の演算利用率を達成し、従来方式より1.34倍改善しました。

通信設計を改善する効果の大きさが分かる結果です。その一方で、改善後でも利用できた演算性能は理論値の約半分にとどまりました。

性能を下げる原因は通信だけではありません。メモリー容量やデータの読み込み、ソフトウェア、故障、電力制限なども影響します。

「GPUではなく通信が壁」への反証

正確には、通信が新たな重要課題として目立ってきたのであり、GPUやメモリーの壁がなくなったわけではありません。

小さなモデルを1基のGPUだけで動かす場合、外部との通信はほとんど発生しません。この条件では、GPUの演算速度やメモリー帯域のほうが重要です。

巨大なモデルでも、処理方法によって必要な通信量は変わります。通信が少ない処理では、Delosを導入しても効果は小さくなります。

NVIDIAも通信の問題を放置しているわけではありません。NVLink 6、専用スイッチ、GPU、ソフトウェアをまとめて設計し、同じ課題への対応を進めています。

Delosには、対応機器や消費電力、価格、量産時期が十分に公開されていないという課題もあります。サーバーは2026年末にサンプル提供予定で、本格的な普及はこれからです。

Delos Dataが勝つための3つの条件

Delosの成否を左右するのは最高速度より、「異なる機器を本当に簡単につなげられるか」です。

1.主要GPUとの接続を実証できること

NVIDIA、AMD、専用AIチップを混在させた環境での実測結果が必要です。

公称帯域だけを見ても、AIが1秒間に何トークン速く生成できるかは分かりません。導入を判断するには、第三者による同条件での比較が欠かせません。

2.障害時の性能低下を数字で示すこと

「止まらない」という強みは、回線を抜いた後にどれだけ早く回復できるかで評価する必要があります。

Delosは、障害が起きても処理を続けるデモを公開しています。今後は、復旧までの時間や処理速度がどれだけ低下するのかを数字で示す必要があります。

3.オープン規格との関係を明確にすること

複数の規格を橋渡しできればDelosの強みになります。ただし、独自部分が増えすぎれば新たな囲い込みにもなります。

UALink、Ethernet、InfiniBand、NVLinkにどこまで対応するのかが重要です。利用者が部品を自由に交換できるかどうかも確認したい点です。

企業と一般利用者への影響

通信効率が上がれば、企業は同じGPU台数でも、より多くのAI処理をこなせるようになります。

クラウド事業者にとっては、1トークンあたりの原価を下げる効果が期待できます。特定のメーカーだけに依存しにくくなる可能性もあります。

一般利用者にも、AIの応答時間や利用料金という形で影響する可能性があります。画像や動画を扱うAIエージェントでも、処理途中の待ち時間を減らせるかもしれません。

ただし、すぐに個人向けAIの料金が安くなるとは限りません。通信装置の価格や導入費が高ければ、コスト削減の効果が利用料金へ反映されるまで時間がかかります。

まとめ:Delosが問うのはGPUの性能より利用率

今回の1億ドル超の調達からは、AI競争の焦点が「GPUの台数」だけでなく、「GPUをどれだけ効率よく働かせるか」にも広がっていることが分かります。

Delos Dataは、異なる演算装置やメモリー、ストレージを高速につなごうとしています。実現すれば、AI基盤のメーカー依存を弱める選択肢になる可能性があります。

ただし、10倍という性能目標や100ナノ秒の遅延は、まだ第三者の実測では確認されていません。NVIDIAとAMDも、同じ通信課題に大規模な投資を続けています。

現時点で「GPUの壁が消えた」と考えるのは適切ではありません。GPU、メモリー、電力、通信のうち、通信の弱さがシステム全体の性能を止める場面が増えていると見るのが正確です。

出典

コメントを送信

You May Have Missed