MetaとPanmnesiaが新しいアーキテクチャを提案 AIデータセンターを単一の大型コンピュータのように動作させる

·著者 Henderson
MetaとPanmnesiaが新しいアーキテクチャを提案 AIデータセンターを単一の大型コンピュータのように動作させる
要点
  • MetaとPanmnesiaが新しいアーキテクチャを提案し、データセンターを一台の大型コンピュータとして扱う。
  • このアーキテクチャはCXLを利用してCPU、アクセラレータ、メモリを接続し、共同運用効率を向上させる。
  • 新しいシステムはデータ転送の遅延を減らし、AIワークロードの実行効率を高める。
  • Panmnesiaはシリコン上でコアコンポーネントを実現し、商業供給の準備を進めている。

人工知能データセンターの設計が間もなく変わる可能性がある。将来は、独立したマシンの集合体ではなく、一台の巨大なコンピュータのように機能するようになる。これは半導体会社PanmnesiaとMetaが提案する新しいアーキテクチャ設計理念である。この設計はコンピュート・エクスプレス・リンク(CXL)を利用して、ラック間で中央処理装置(CPU)、人工知能アクセラレータ、メモリを接続し、それらが高度に協調して動作するようにする。人工知能モデルの成長に伴い、この問題はますます深刻になっている。数兆のパラメータを含むモデルをトレーニングするには、数百または数千のアクセラレータが数TBのデータを交換する必要がある。

ほとんどのデバイスが迅速にタスクを完了できたとしても、速度が遅いコンポーネントが一つでもあると全体の動作が遅れ、遅延の予測可能性が重要性を増している。

新しいアーキテクチャの設計理念

ラック内では、アクセラレータが専用の高速接続を介して通信できるようになっている。しかし、ラック間では、データは従来のネットワーク機器やソフトウェア層を介して転送されることが多く、これにより個々のリクエストに必要な時間の変動が生じる。PanmnesiaとMetaのアプローチは、CXLドメインを個々のラックを超えて、より広範なデータセンターに拡張する。このアーキテクチャは、施設内のリソースが共同運用されるように設計されており、各ラックを独立した計算の孤島として扱うのではない。設計において重要なハードウェアコンポーネントは3つある。高ファンアウト・ノン・ブロッキングCXLスイッチ、リンクアクセラレーションユニット、ファブリックコントローラである。

この3つの組み合わせは、デバイス間のデータ転送における不確実な遅延を減らすことを目的としている。

遅延削減の重要性

このアーキテクチャはまた、光接続を利用して電気信号の物理的距離の制限を克服するため、CXL-over-opticsはファブリックをデータセンターのより広い範囲に拡張し、基礎となるCXLモデルを犠牲にしない。提案されているシステムは、計算リソースの共同運用の規模を変えている。参照構成では、1つのCPUが2つのアクセラレータに接続されている。新しいアーキテクチャの下では、この数は16に上がり、単一の一貫性ドメインは最大960のアクセラレータをカバーすることができる。

遅延が新たな戦場となっている。研究者は、通常ラックを出て従来のネットワークを通過する必要があるアクセスが、より予測可能な経路をたどるようになると述べている。往復遅延はマイクロ秒の範囲から数百ナノ秒に削減される可能性があり、これは最大で10倍の減少を意味する。この予測可能性は、元の計算能力と同様に重要である可能性がある。大規模なAIワークロードは通常、共同操作であり、これは最も遅い参加者が全体の操作のタイミングを決定することを意味する。これらの遅延を減らすことで、より多くのアクセラレータが実行環境として動作できるようになる可能性がある。このアーキテクチャはまた、障害の影響を減らす可能性もある。

問題が発生した場合、提案されているシステムは個々のデバイスを交換し、サーバー全体ではない。

Panmnesiaの最高経営責任者であるMyoungsoo Jung氏は、「人工知能システムの継続的な拡張に伴い、大量のアクセラレータやメモリデバイスに迅速かつ効率的に接続する能力は、単一のアクセラレータの性能と同様に重要になっている。本研究は、次世代の人工知能インフラの方向性を示しており、CXLはデータセンター全体が単一の計算システムとして動作できるようにする。」と述べている。Panmnesiaは、シリコン上でコアコンポーネントを実現し、検証を完了し、商業供給の準備を進めている。

この研究の結果は「ネイチャー・レビュー・エレクトリカル・エンジニアリング」に掲載されている。

項目仕様
CPUに接続されるアクセラレータの数16
カバー可能なアクセラレータの数960

新しいアーキテクチャが人工知能インフラに与える影響

人工知能技術の急速な発展に伴い、データセンターの設計要件も変化し続けている。MetaとPanmnesiaの新しいアーキテクチャは、データ転送の効率を向上させるだけでなく、遅延を削減することで全体的なパフォーマンスを最適化し、複数のアクセラレータがより効果的に共同作業できるようにする。この変革は、大規模な人工知能ワークロードを扱う上で非常に重要である。なぜなら、これらのワークロードは通常、複数の計算ユニットの協力を必要とするからだ。新しいアーキテクチャの実装は、将来のデータセンターの運用モデルを変え、商業用途により効率的なソリューションを提供する可能性がある。

H
著者について
Henderson