How XPUs Meet a World-Class AI Factory
Para generar inteligencia a gran escala, las fábricas de IA operan de manera continua, y su economía se define por la producción entregada: tokens por segundo, tokens por vatio, costo por token, utilización y tiempo de actividad. Esto requiere una infraestructura de IA diseñada y construida como una fábrica completa, no como una colección de aceleradores individuales.
Las empresas hiperescalares y nativas de IA que construyen XPUs personalizadas deben considerar no solo el diseño de las XPUs, sino también el diseño y desarrollo de toda la plataforma de IA, incluyendo la red de escalado, la arquitectura a nivel de rack, el software de producción y un ecosistema robusto de proveedores. A escala de fábrica de IA, este camino es complejo y costoso, representando un obstáculo fundamental para llevar las XPUs al mercado rápidamente.
Romper esta limitación significa combinar XPUs personalizadas con una infraestructura probada y madura, permitiendo a los constructores enfocar la innovación donde más importa mientras aprovechan la tecnología establecida para el resto. NVLink Fusion responde a esta necesidad, conectando XPUs a la infraestructura de IA líder mundial de NVIDIA para aumentar el rendimiento, acelerar el tiempo de comercialización y mitigar riesgos para fábricas de IA semi-personalizadas.
Para cargas de trabajo modernas como modelos de trillones de parámetros, arquitecturas de mezcla de expertos y IA agentiva, si la estructura de escalado no puede mantenerse, la utilización cae y el costo por token aumenta. Una solución de red de escalado debe sobresalir en tres dimensiones: rendimiento entregado, resiliencia de la fábrica y madurez de la plataforma.
Como ejemplo, NVLink Fusion lleva las XPUs al dominio de escalado de NVLink de NVIDIA. La sexta generación de NVLink proporciona una red de alta capacidad y baja latencia en un dominio de 72 XPUs. La latencia de extremo a extremo para transferencias de XPU a XPU es 3 veces menor que las soluciones alternativas basadas en Ethernet estándar, y la tasa de paquetes es 10 veces mayor.
NVLink Fusion también incluye NVLink-C2C de NVIDIA para conectar XPUs a CPUs Vera de NVIDIA u otras CPUs del ecosistema, ofreciendo hasta 6 veces la eficiencia energética de una interfaz PCIe, ayudando a eliminar barreras entre control y computación para sistemas agentivos.
Los equipos que desarrollan XPUs personalizadas a menudo subestiman el esfuerzo y la complejidad de convertir la innovación de XPU en un despliegue en centros de datos. Esto incluye la integración de CPU de alta velocidad e interfaces de escalado, la validación de soluciones de red de escalado, el diseño de bandejas de computación y conmutación, la integración de seguridad y almacenamiento, y la gestión de un ecosistema complejo de proveedores.
NVLink Fusion está respaldado por un ecosistema diseñado para un desarrollo, integración y despliegue rápidos, abarcando diseño ASIC, CPU y socios de interconexión óptica e IP. Los adoptantes de NVLink Fusion pueden usar la arquitectura a escala de rack MGX de NVIDIA y la misma cadena de suministro utilizada para sistemas basados en MGX como NVIDIA Vera Rubin NVL72.
La plataforma de infraestructura de IA de NVIDIA está integrada verticalmente y abierta horizontalmente. Los adoptantes de NVLink Fusion pueden incorporar opcionalmente GPUs Rubin de NVIDIA, CPUs Vera, conmutadores de óptica empaquetada, SuperNICs ConnectX, DPUs BlueField, software de Misión Control y soluciones de rack completas, incluyendo NVIDIA Vera Rubin NVL72, Rack de CPU Vera, LPX, STX y SPX.
La planificación de fábricas de IA no espera al silicio. La adquisición de energía, el diseño de instalaciones, la refrigeración, la disposición de racks y la arquitectura de red comienzan mucho antes de que esté disponible la mezcla final de aceleradores. Un centro de datos bloqueado a un solo chip puede convertirse en un riesgo de programación.
Fuente: https://blogs.nvidia.com/blog/nvlink-fusion-xpu-ai-factory/