- Meta 与 Panmnesia 提出新架构,将数据中心视为一台大型计算机。
- 该架构利用 CXL 连接 CPU、加速器及内存,提升协同运作效率。
- 新系统可减少数据传输延迟,提升人工智能工作负载的执行效率。
- Panmnesia 已在硅片中实现核心组件,准备商业供应。
人工智能数据中心的设计可能即将转变,未来将不再仅仅是独立机器的集合,而更像是一台巨型计算机。这是半导体公司 Panmnesia 与 Meta 提出的新架构设计理念。该设计利用计算快速链接(CXL)在机架之间连接中央处理器(CPU)、人工智能加速器和内存,同时保持它们的运作高度协调。随着人工智能模型的增长,这一问题变得愈加严重。训练包含数万亿参数的模型可能需要数百或数千个加速器来交换数 TB 的数据。
即使大多数设备能迅速完成任务,任何一个速度较慢的组件都可能拖延整个操作,这使得延迟的可预测性变得日益重要。
新架构的设计理念
在机架内,加速器已能通过专用的快速连接进行通信。然而,在机架之间,数据通常通过传统的网络设备和软件层传输,这引入了个别请求所需时间的波动。Panmnesia 和 Meta 的方法将 CXL 域扩展到个别机架之外,进入更广泛的数据中心。这种架构旨在使整个设施内的资源协同运作,而不是将每个机架视为独立的计算孤岛。设计中有三个硬件组件至关重要:高扇区非阻塞 CXL 交换机、链路加速单元和结构控制器。
这三者的结合旨在减少数据在设备之间传输时的不确定延迟。
减少延迟的重要性
该架构还利用光学连接克服电信号的物理距离限制,因此 CXL-over-optics 可以将结构扩展到数据中心的更大部分,而不会放弃底层的 CXL 模型。所提出的系统改变了计算资源协同工作的规模。在参考配置中,一个 CPU 连接到两个加速器。在新架构下,这一数字上升到 16,而单一的一致性域则可以涵盖多达 960 个加速器。
延迟成为新的战场。研究人员表示,那些通常需要离开机架并通过传统网络的访问,可能会沿着更可预测的路径进行。往返延迟可能从微秒范围降低至几百纳秒,这代表着最多十倍的减少。这种可预测性可能与原始的计算能力同样重要。大型人工智能工作负载通常是集体操作,这意味着最慢的参与者可以决定整个操作何时进行。减少这些延迟可能使得更多加速器能够作为一个执行环境运行。该架构还可能使故障的影响减少。
当出现问题时,所提出的系统将替换单个设备,而非整个服务器。
Panmnesia 首席执行官 Myoungsoo Jung 表示:“随着人工智能系统的持续扩展,快速且高效地连接大量加速器和内存设备的能力变得与单个加速器的性能同样重要。本研究勾勒了下一代人工智能基础设施的方向,CXL 使整个数据中心能够作为一个单一的计算系统运作。”Panmnesia 表示,它已经在硅片中实现了核心组件,完成了验证,并正在为商业供应做准备。
该研究的成果已发表在《自然评论:电气工程》上。
项目 规格 CPU 连接的加速器数量 16 可涵盖的加速器数量 960
新架构对人工智能基础设施的影响
随着人工智能技术的快速发展,数据中心的设计需求也在不断变化。Meta 与 Panmnesia 的新架构不仅提升了数据传输的效率,还通过减少延迟来优化整体性能,使得多个加速器可以更有效地协同工作。这一变革对于处理大型人工智能工作负载至关重要,因为这些工作负载通常依赖于多个计算单元的协作。新架构的实施,将可能改变未来数据中心的运作模式,并为商业应用提供更高效的解决方案。

