- Meta y Panmnesia presentan una nueva arquitectura que considera los centros de datos como una única computadora grande.
- Esta arquitectura utiliza CXL para conectar CPU, aceleradores y memoria, mejorando la eficiencia de la operación conjunta.
- El nuevo sistema puede reducir la latencia en la transmisión de datos, mejorando la eficiencia en la ejecución de cargas de trabajo de inteligencia artificial.
- Panmnesia ha implementado los componentes principales en silicio y está preparada para el suministro comercial.
El diseño de los centros de datos de inteligencia artificial está a punto de transformarse, pasando de ser una colección de máquinas independientes a parecerse más a una computadora gigantesca. Esta es la nueva propuesta de arquitectura presentada por la empresa de semiconductores Panmnesia y Meta. El diseño utiliza el enlace de cómputo extendido (CXL) para conectar unidades centrales de procesamiento (CPU), aceleradores de inteligencia artificial y memoria entre bastidores, manteniendo al mismo tiempo una alta coordinación en sus operaciones. A medida que los modelos de inteligencia artificial crecen, este problema se vuelve cada vez más grave. Entrenar un modelo con billones de parámetros puede requerir cientos o incluso miles de aceleradores para intercambiar decenas de terabytes de datos.
Incluso si la mayoría de los dispositivos pueden completar sus tareas rápidamente, cualquier componente más lento puede retrasar toda la operación, lo que hace que la previsibilidad de la latencia sea cada vez más importante.
La filosofía de diseño de la nueva arquitectura
Dentro de un bastidor, los aceleradores ya pueden comunicarse a través de conexiones dedicadas de alta velocidad. Sin embargo, entre bastidores, los datos generalmente se transmiten a través de dispositivos de red tradicionales y capas de software, lo que introduce variaciones en el tiempo requerido para solicitudes individuales. El enfoque de Panmnesia y Meta extiende el dominio de CXL más allá de los bastidores individuales hacia el centro de datos más amplio. Esta arquitectura está diseñada para que los recursos de toda la instalación funcionen de manera conjunta, en lugar de tratar cada bastidor como una isla de cómputo independiente. Tres componentes de hardware son cruciales en el diseño: un conmutador CXL no bloqueante de alta velocidad, una unidad de aceleración de enlace y un controlador de tejido.
La combinación de estos tres elementos tiene como objetivo reducir la incertidumbre en la latencia durante la transmisión de datos entre dispositivos.
La importancia de reducir la latencia
La arquitectura también utiliza conexiones ópticas para superar las limitaciones de distancia física de las señales eléctricas, por lo que CXL-over-optics puede expandir el tejido a una porción más grande del centro de datos sin abandonar el modelo subyacente de CXL. El sistema propuesto cambia la escala a la que los recursos informáticos pueden trabajar de manera conjunta. En una configuración de referencia, una CPU se conecta a dos aceleradores. Bajo la nueva arquitectura, esta cifra aumenta a 16, y un único dominio de coherencia puede abarcar hasta 960 aceleradores.
La latencia se convierte en el nuevo campo de batalla. Los investigadores señalan que los accesos que normalmente requieren salir del bastidor y pasar por la red tradicional podrían seguir rutas más predecibles. La latencia de ida y vuelta podría reducirse de decenas de microsegundos a unos pocos cientos de nanosegundos, lo que representa una disminución de hasta diez veces. Esta previsibilidad podría ser tan importante como la capacidad de cómputo original. Las grandes cargas de trabajo de inteligencia artificial suelen ser operaciones colectivas, lo que significa que el participante más lento puede determinar cuándo se realiza toda la operación. Reducir estas latencias podría permitir que más aceleradores funcionen como un entorno de ejecución. La arquitectura también podría reducir el impacto de las fallas.
Cuando surge un problema, el sistema propuesto reemplazará un solo dispositivo en lugar de todo el servidor.
Myoungsoo Jung, CEO de Panmnesia, dijo: "A medida que los sistemas de inteligencia artificial continúan expandiéndose, la capacidad de conectar rápidamente y de manera eficiente una gran cantidad de aceleradores y dispositivos de memoria se vuelve tan importante como el rendimiento de un solo acelerador. Este estudio esboza la dirección de la próxima generación de infraestructura de inteligencia artificial, donde CXL permite que todo el centro de datos funcione como un único sistema de cómputo". Panmnesia afirma que ya ha implementado los componentes principales en silicio, ha completado la verificación y se está preparando para el suministro comercial.
Los resultados de la investigación han sido publicados en la revista Nature Reviews Electrical Engineering.
Proyecto Especificaciones Número de aceleradores conectados a la CPU 16 Número de aceleradores que se pueden abarcar 960
El impacto de la nueva arquitectura en la infraestructura de inteligencia artificial
Con el rápido desarrollo de la tecnología de inteligencia artificial, las necesidades de diseño de los centros de datos también están cambiando constantemente. La nueva arquitectura de Meta y Panmnesia no solo mejora la eficiencia de la transmisión de datos, sino que también optimiza el rendimiento general al reducir la latencia, permitiendo que múltiples aceleradores trabajen de manera más efectiva de forma conjunta. Este cambio es crucial para manejar grandes cargas de trabajo de inteligencia artificial, ya que estas suelen depender de la colaboración de múltiples unidades de cómputo. La implementación de esta nueva arquitectura podría cambiar el modo de operación de los futuros centros de datos y proporcionar soluciones más eficientes para aplicaciones comerciales.

