Meta 與 Panmnesia 提出新架構 使 AI 數據中心如同單一大型計算機運作

·作者 Henderson·Engineering
Meta 與 Panmnesia 提出新架構 使 AI 數據中心如同單一大型計算機運作
重點
  • Meta 與 Panmnesia 提出新架構,將數據中心視為一台大型計算機。
  • 該架構利用 CXL 連接 CPU、加速器及內存,提升協同運作效率。
  • 新系統可減少數據傳輸延遲,提升人工智能工作負載的執行效率。
  • Panmnesia 已在硅片中實現核心組件,準備商業供應。

人工智能數據中心的設計可能即將轉變,未來將不再僅僅是獨立機器的集合,而更像是一台巨型計算機。這是半導體公司 Panmnesia 與 Meta 提出的新架構設計理念。該設計利用計算擴展鏈接(CXL)在機架之間連接中央處理器(CPU)、人工智能加速器和內存,同時保持它們的運作高度協調。隨著人工智能模型的增長,這一問題變得愈加嚴重。訓練擁有數兆參數的模型可能需要數百或數千個加速器來交換數 TB 的數據。

即使大多數設備能迅速完成任務,任何一個速度較慢的組件都可能拖延整個操作,這使得延遲的可預測性變得日益重要。

新架構的設計理念

在機架內,加速器已能通過專用的高速連接進行通信。然而,在機架之間,數據通常通過傳統的網絡設備和軟件層傳輸,這引入了個別請求所需時間的變化。Panmnesia 和 Meta 的方法將 CXL 域擴展到個別機架之外,進入更廣泛的數據中心。這種架構旨在使整個設施內的資源協同運作,而不是將每個機架視為獨立的計算孤島。設計中有三個硬件組件至關重要:高風扇非阻塞 CXL 交換機、鏈路加速單元和織物控制器。

這三者的結合旨在減少數據在設備之間傳輸時的不確定延遲。

減少延遲的重要性

該架構還利用光學連接克服電信號的物理距離限制,因此 CXL-over-optics 可以將織物擴展到數據中心的更大部分,而不會放棄底層的 CXL 模型。所提出的系統改變了計算資源協同工作的規模。在參考配置中,一個 CPU 連接到兩個加速器。在新架構下,這一數字上升到 16,而單一的一致性域則可以涵蓋多達 960 個加速器。

延遲成為新的戰場。研究人員表示,那些通常需要離開機架並通過傳統網絡的訪問,可能會沿著更可預測的路徑進行。往返延遲可能從微秒範圍降低至幾百納秒,這代表著最多十倍的減少。這種可預測性可能與原始的計算能力同樣重要。大型人工智能工作負載通常是集體操作,這意味著最慢的參與者可以決定整個操作何時進行。減少這些延遲可能使得更多加速器能夠作為一個執行環境運行。該架構還可能使故障的影響減少。

當出現問題時,所提出的系統將替換單個設備,而非整個伺服器。

Panmnesia 首席執行官 Myoungsoo Jung 表示:「隨著人工智能系統的持續擴展,快速且高效地連接大量加速器和內存設備的能力變得與單個加速器的性能同樣重要。本研究勾勒了下一代人工智能基礎設施的方向,CXL 使整個數據中心能夠作為一個單一的計算系統運作。」Panmnesia 表示,它已經在硅片中實現了核心組件,完成了驗證,並正在為商業供應做準備。

該研究的成果已發表在《自然評論:電氣工程》上。

項目規格
CPU 連接的加速器數量16
可涵蓋的加速器數量960

新架構對人工智能基礎設施的影響

隨著人工智能技術的快速發展,數據中心的設計需求也在不斷變化。Meta 與 Panmnesia 的新架構不僅提升了數據傳輸的效率,還通過減少延遲來優化整體性能,使得多個加速器可以更有效地協同工作。這一變革對於處理大型人工智能工作負載至關重要,因為這些工作負載通常依賴於多個計算單元的協作。新架構的實施,將可能改變未來數據中心的運作模式,並為商業應用提供更高效的解決方案。

H
關於作者
Henderson