Up to 30x More Work Per Watt: NVIDIA Vera Rubin NVL72 Sets a New Efficiency Standard for AI Agents
La nueva plataforma de NVIDIA, Vera Rubin NVL72, ha establecido un nuevo estándar de eficiencia en el procesamiento de cargas de trabajo de agentes de inteligencia artificial (IA). Según datos de OpenRouter, las cargas de trabajo de IA agentic consumen hasta 15 veces más tokens que una solicitud de chat simple. Esto se debe a que, durante tareas complejas como la investigación para decisiones de inversión, los agentes de IA consultan bases de datos financieras, buscan noticias y archivos, y utilizan sub-agentes para realizar comparaciones y valoraciones. Este proceso continuo incrementa la demanda de tokens, haciendo que el manejo de contextos largos sea crucial para el rendimiento de la IA agentic.
En comparación con la arquitectura NVIDIA GB300 NVL72, los sistemas Vera Rubin NVL72 ofrecen hasta 30 veces más rendimiento por megavatio en cargas de trabajo agentic. Esta mejora se ha medido utilizando el conjunto de trabajo SemiAnalysis AgentX, que incluye sesiones de codificación agentic del mundo real con crecimiento de contexto real, llamadas a herramientas y generación de sub-agentes preservadas. Para fábricas de IA con restricciones de energía, esto se traduce directamente en 30 veces más trabajo agentic con el mismo consumo energético.
Los resultados iniciales de Vera Rubin NVL72 demuestran el ritmo acelerado de innovación de NVIDIA. Con optimizaciones continuas de software, se espera que el rendimiento de las plataformas Vera Rubin NVL72 y GB300 NVL72 siga mejorando. Las cargas de trabajo agentic son fundamentalmente diferentes de las de chat o resumen de documentos, donde las secuencias de entrada y salida suelen variar entre 1,000 y 8,000 tokens. En las sesiones agentic, el contexto se acumula a lo largo de los pasos y puede alcanzar cientos de miles de tokens de entrada, con una amplia variabilidad en las longitudes de entrada y salida.
La tecnología NVIDIA DSX MaxLPS gestiona la energía a través de los niveles de GPU, rack y carga de trabajo para provisionar hasta un 40% más de GPUs dentro del mismo presupuesto de megavatios, aumentando aún más el rendimiento por megavatio a escala de fábrica de IA. Además, el costo por millón de tokens producido es hasta 35 veces menor que con la arquitectura GB300 NVL72, permitiendo a Vera Rubin NVL72 ejecutar agentes de manera continua y a gran escala en toda la amplitud de las cargas de trabajo de los clientes.
La optimización moderna de inferencia abarca una gama de técnicas críticas para la IA agentic. NVIDIA Vera Rubin NVL72 permite todas estas técnicas y más a través de un diseño extremo en cada capa de la plataforma para ofrecer ganancias de rendimiento multifacéticas. Desde la separación del procesamiento de contexto y la generación de respuestas, hasta la sincronización de velocidades de producción de tokens y el paralelismo experto a gran escala, NVIDIA continúa liderando la innovación en el ámbito de la IA agentic.
Fuente: https://blogs.nvidia.com/blog/vera-rubin-nvl72-efficiency-ai-agents/