NVIDIA Vera Rubin NVL72 Delivers Leading Performance in MLPerf Inference v6.1 Debut
El sistema NVIDIA Vera Rubin NVL72 ha debutado con un rendimiento líder en la última versión de MLPerf Inference v6.1, destacándose por su capacidad de ofrecer un rendimiento hasta 3.7 veces superior al del GB300 NVL72. Este avance se ha logrado gracias a una combinación de mejoras en el hardware y optimizaciones continuas en el software.
En su primera presentación en MLPerf Inference, el sistema Vera Rubin NVL72 ha demostrado su capacidad para manejar dos de los benchmarks más exigentes de la suite: DeepSeek-R1 y Qwen3-VL. Utilizando el marco de inferencia de código abierto NVIDIA Dynamo y la biblioteca NVIDIA TensorRT-LLM, el sistema ha mostrado un rendimiento superior en escenarios offline, de servidor e interactivos.
Los resultados de MLPerf Inference v6.1, obtenidos el 16 de septiembre de 2026, reflejan un diseño conjunto de hardware y software que maximiza la eficiencia y el rendimiento. Las mejoras en los núcleos Tensor y el motor Transformer de Vera Rubin, junto con la precisión NVFP4, han reducido el uso de memoria y aumentado el rendimiento sin pérdida significativa de calidad de salida.
La eficiencia de escalado es un aspecto crítico para la productividad de la infraestructura de IA. NVIDIA ha demostrado que su sistema GB300 NVL72 puede escalar eficientemente, alcanzando un 99% de eficiencia de escalado con 288 GPUs en cuatro racks, lo que significa que el rendimiento crece casi proporcionalmente al hardware añadido.
La plataforma NVIDIA no solo se centra en el rendimiento, sino también en la economía a largo plazo de la inferencia de IA, proporcionando una infraestructura que puede manejar cualquier modelo o carga de trabajo, desde entrenamiento hasta inferencia, recomendación o razonamiento, manteniendo una alta utilización.
Fuente: https://blogs.nvidia.com/blog/vera-rubin-nvl72-mlperf-inference/