AI 數據基礎設施公司 Weka 與高性能計算平台 Andromeda 近期宣佈達成戰略合作,Weka 的 NeuralMesh 平台將作為 Andromeda 管理型 GPU 集羣的核心 AI 數據存儲層。通過專用 NeuralMesh 或 GPU 原生方式的 NeuralMesh Axon 部署,Andromeda 的客户可在不同超大規模計算服務商和 AI 雲環境中獲得一致的存儲性能。
Andromeda 致力於讓開發前沿技術的所有團隊都能獲取高性能計算資源,使創新由想法本身而非硬件可及性驅動。該公司與主要 AI 研究機構、數據中心和雲服務提供商合作,在全球供應鏈中分配訓練和推理工作負載。目前,Andromeda 已與全球 50 餘家計算提供商建立合作,通過不斷增長的管理型集羣網絡路由訓練和推理工作負載。
Andromeda 與 Weka 的合作提升了 AI 數據存儲性能
Andromeda 平台上的所有集羣無論由哪家運營商管理,都必須滿足相同的質量標準。公司在向客户提供服務前,會對每個集羣的 GPU、存儲、網絡架構和安全進行認證。在此過程中,不同供應商的存儲環境差異導致集羣間性能參差不齊的問題逐漸顯現。
通過與 Weka 合作,Andromeda 在現有硬件上實現了顯著的性能提升,可在幾分鐘內完成部署,確保所有供應商的一致性,同時降低存儲成本。Andromeda 首席執行官威爾·穆謝表示,公司的目標是實現計算的全球流動,這意味著提供的每個集羣無論容量來自何處都必須正常運行。通過 Weka NeuralMesh 實現標準化後,客户在決定性能的存儲和內存層時,同時獲得了超大規模服務商級別的一致性和開放市場的靈活性。
他補充道,閒置的 GPU 正在阻礙 AI 創新的速度,Weka 幫助 Andromeda 管理的所有 GPU 都能充分發揮作用。NeuralMesh Axon 是 NeuralMesh 軟件平台的 GPU 原生部署方式,將存儲直接集成到 Andromeda 的 GPU 伺服器中,通過將集羣現有的 NVMe 轉換為統一的高性能數據層,以最高速度為訓練和推理提供數據。
由於該基礎設施已安裝在機架中並通電運行,成本也已支付,因此可在不增加額外空間、電力消耗和費用的情況下僅提升性能。藉助 NeuralMesh Kubernetes Operator,Andromeda 可在幾分鐘內構建完整的 NeuralMesh 集羣,並通過管理堆棧其他所有層的相同工作流管理整個集羣網絡。
Andromeda 的 NeuralMesh 部署中約一半採用 NeuralMesh Axon 方式運營,另一半則為需要將所有 GPU 核心和每 GB 內存專用於自身工作負載的客户提供專用 NeuralMesh 部署。無論部署位置如何,NeuralMesh 都能為底層任何供應商的硬件提供相同的性能標準。這種可靠性使 Andromeda 能夠將客户接入此前沒有共享存儲的集羣。
合作帶來的實際效果已經顯現。新的 NeuralMesh Axon 集羣可在最短 10 分鐘內完成部署,AI 團隊從集羣上線當天即可運行工作負載。環境啟動加載時間從 3 分鐘縮短至 30 秒,使 AI 團隊每天能夠進行更多實驗。採用 NeuralMesh Axon 運營的 Andromeda 集羣實現了每集羣每秒超過 400GB 的持續吞吐量和實際運營環境中每秒超過 600 萬 IOPS 的性能。
得益於此,Andromeda 的一家生物技術客户可在幾分鐘而非幾小時內完成涉及每目錄 10 億文件的元數據密集型傳輸任務。當集羣存在故障擴散風險時,NeuralMesh 能夠阻斷故障傳播,維持集羣可用性,保護所有客户的工作負載。
| 項目 | 規格 |
|---|---|
| 持續吞吐量 | 每集羣每秒超過 400GB |
| IOPS | 每秒超過 600 萬 |

