- Meta และ Panmnesia เสนอสถาปัตยกรรมใหม่ ที่มองศูนย์ข้อมูลเป็นคอมพิวเตอร์ขนาดใหญ่
- สถาปัตยกรรมนี้ใช้ CXL เชื่อมต่อ CPU, เร่งการ (accelerator) และหน่วยความจำ เพื่อเพิ่มประสิทธิภาพในการทำงานร่วมกัน
- ระบบใหม่สามารถลดความล่าช้าในการส่งข้อมูล เพิ่มประสิทธิภาพในการประมวลผลงาน AI
- Panmnesia ได้นำส่วนประกอบหลักไปใช้ในซิลิคอนแล้ว และเตรียมที่จะขายให้กับการค้า
แนวคิดในการออกแบบศูนย์ข้อมูลปัญญาประดิษฐ์ (AI) อาจกำลังจะเปลี่ยนแปลง โดยในอนาคตอาจไม่ใช่เพียงการรวมกลุ่มของเครื่องจักรที่เป็นอิสระ แต่จะเป็นเหมือนคอมพิวเตอร์ขนาดใหญ่มากขึ้น สิ่งนี้เป็นแนวคิดในการออกแบบสถาปัตยกรรมใหม่ที่บริษัทซีมิคอนดักเตอร์ Panmnesia และ Meta ได้เสนอ การออกแบบนี้ใช้การเชื่อมต่อเชิงขยาย (CXL) เพื่อเชื่อมต่อหน่วยประมวลผลกลาง (CPU), เร่งการประมวลผล AI และหน่วยความจำภายในระบบเครื่องคอมพิวเตอร์ โดยทำให้การทำงานของมันเป็นไปอย่างสอดคล้องกันอย่างสูง ด้วยการเติบโตของแบบจำลอง AI ปัญหานี้กลายเป็นสิ่งที่ทวีความรุนแรงมากขึ้น การฝึกแบบจำลองที่มีพารามิเตอร์หลายล้านอาจต้องใช้ร้อยหรือพันเร่งการประมวลผลเพื่อแลกเปลี่ยนข้อมูลหลาย TB
แม้ว่าส่วนใหญ่ของอุปกรณ์สามารถทำงานได้อย่างรวดเร็ว แต่คอมโพเนนต์ที่ทำงานช้ากว่าอาจทำให้การดำเนินงานทั้งหมดล่าช้า ซึ่งทำให้ความสามารถในการคาดการณ์ความล่าช้ามีความสำคัญมากขึ้น
แนวคิดในการออกแบบสถาปัตยกรรมใหม่
ภายในระบบ rack, เร่งการประมวลผลสามารถสื่อสารผ่านการเชื่อมต่อความเร็วสูงที่เฉพาะเจาะจงได้ แต่ภายนอก rack, ข้อมูลโดยทั่วไปจะถูกส่งผ่านอุปกรณ์เครือข่ายและชั้นของซอฟต์แวร์แบบดั้งเดิม ซึ่งนำมาซึ่งการเปลี่ยนแปลงของเวลาที่ต้องการสำหรับแต่ละคำขอ วิธีการของ Panmnesia และ Meta ขยาย CXL domain ไปข้างนอก rack เข้าสู่ศูนย์ข้อมูลที่กว้างขวางขึ้น สถาปัตยกรรมนี้มุ่งทำให้ทรัพยากรภายในทั้งหมดในสถานที่ทำงานร่วมกัน แทนที่จะมอง rack แต่ละแห่งเป็นเกาะคำนวณที่อิสระ มีสามส่วนประกอบทางฮาร์ดแวร์ที่สำคัญ: CXL switch ที่ไม่มีการบล็อกและมีพัดลมสูง, หน่วยเร่งการเชื่อมต่อลิงก์ และตัวควบคุมผ้าทอ
การรวมกันของสามส่วนประกอบนี้มุ่งลดความไม่แน่นอนในความล่าช้าของการส่งข้อมูลระหว่างอุปกรณ์
ความสำคัญของการลดความล่าช้า
สถาปัตยกรรมนี้ยังใช้การเชื่อมต่อแบบแสง (optical connection) ในการเอาชนะข้อจำกัดของระยะทางทางกายภาพของสัญญาณไฟฟ้า ดังนั้น CXL-over-optics สามารถขยายผ้าทอไปสู่ส่วนที่กว้างขวางขึ้นของศูนย์ข้อมูลโดยไม่ต้องสละแบบจำลอง CXL พื้นฐานที่อยู่ด้านล่าง ระบบที่ได้เสนอเปลี่ยนแปลงขนาดของการทำงานร่วมกันของทรัพยากรคำนวณ ในการตั้งค่าอ้างอิง, CPU เชื่อมต่อกับสองเร่งการประมวลผล ในสถาปัตยกรรมใหม่, ตัวเลขนี้สูงขึ้นเป็น 16 และโดเมนความสอดคล้องเดียวสามารถครอบคลุมได้ถึง 960 เร่งการประมวลผล
ความล่าช้าเป็นสนามรบใหม่ วิจัยนักวิจัยระบุว่าการเข้าถึงที่โดยทั่วไปต้องออกจาก rack และผ่านเครือข่ายแบบดั้งเดิมอาจเดินทางตามเส้นทางที่คาดการณ์ได้มากขึ้น ความล่าช้าในการไปกลับอาจลดลงจากระยะหลายไมโครวินาทีเป็นไม่กว่าไม่กว่าไม่กว่าไม่กว่าไม่กว่าไม่กว่าไม่กว่าไม่กว่าไม่กว่าไม่กว่าไม่กว่าไม่กว่าไม่กว่าไม่กว่าไม่กว่าหลายร้อยนาโนวินาที ซึ่งหมายถึงการลดลงมากถึง 10 เท่า ความสามารถในการคาดการณ์นี้อาจมีความสำคัญพอ ๆ กับความสามารถในการคำนวณเดิม งาน AI ขนาดใหญ่โดยทั่วไปเป็นการดำเนินงานร่วมกัน หมายความว่าผู้เข้าร่วมที่ช้าที่สุดสามารถกำหนดเวลาที่การดำเนินงานทั้งหมดจะดำเนินไป การลดความล่าช้าเหล่านี้อาจทำให้เร่งการประมวลผลเพิ่มเติมสามารถทำงานเป็นสภาพแวดล้อมการดำเนินงานเดียว สถาปัตยกรรมนี้ยังอาจทำให้ผลกระทบของความล้มเหลวลดลง
เมื่อมีปัญหา, ระบบที่ได้เสนอจะแทนที่อุปกรณ์แต่ละตัว ไม่ใช่ทั้งเซิร์ฟเวอร์
ประธานเจ้าหน้าที่บริหารของ Panmnesia Myoungsoo Jung ได้กล่าวว่า: "เมื่อระบบ AI ยังคงขยายต่อเนื่อง, ความสามารถในการเชื่อมต่อเร่งการประมวลผลและหน่วยความจำขนาดมากได้อย่างรวดเร็วและมีประสิทธิภาพเท่ากับประสิทธิภาพของเร่งการประมวลผลแต่ละตัว การศึกษานี้ได้วาดภาพทิศทางของโครงสร้างพื้นฐาน AI รุ่นใหม่ โดย CXL ทำให้ศูนย์ข้อมูลทั้งหมดสามารถทำงานเป็นระบบคำนวณเดียว" Panmnesia ได้กล่าวว่า, มันได้นำส่วนประกอบหลักไปใช้ในซิลิคอนแล้ว, เสร็จสิ้นการตรวจสอบ, และกำลังเตรียมที่จะเตรียมให้การค้า
ผลลัพธ์ของการศึกษาได้ตีพิมพ์ใน "Nature Reviews: Electrical Engineering"
รายการ ข้อมูล จำนวนเร่งการประมวลผลที่ CPU เชื่อมต่อ 16 จำนวนเร่งการประมวลผลที่สามารถครอบคลุม 960
ผลกระทบของสถาปัตยกรรมใหม่ต่อโครงสร้างพื้นฐาน AI
ด้วยการเติบโตอย่างรวดเร็วของเทคโนโลยี AI, ความต้องการในการออกแบบศูนย์ข้อมูลก็ยังคงเปลี่ยนแปลงอย่างต่อเนื่อง Meta และ Panmnesia ในสถาปัตยกรรมใหม่ไม่เพียงแต่เพิ่มประสิทธิภาพในการส่งข้อมูล แต่ยังเพิ่มประสิทธิภาพในการทำงานโดยรวมของระบบ โดยลดความล่าช้า และทำให้เร่งการประมวลผลหลายตัวสามารถทำงานร่วมกันได้อย่างมีประสิทธิภาพมากขึ้น การเปลี่ยนแปลงนี้มีความสำคัญมากสำหรับการประมวลผลงาน AI ขนาดใหญ่ เนื่องจากงานเหล่านี้มักจะต้องพึ่งพาการทำงานร่วมกันของหลายหน่วยคำนวณ การนำระบบนี้ไปใช้อาจเปลี่ยนแปลงแนวทางการทำงานของศูนย์ข้อมูลในอนาคต และให้คำตอบที่มีประสิทธิภาพมากขึ้นสำหรับการใช้งานทางการค้า

