NVIDIA Vera Rubin NVL72 Lidera el Rendimiento en el Debut de MLPerf Inference v6.1

NVIDIA Vera Rubin NVL72 Delivers Leading Performance in MLPerf Inference v6.1 Debut

El rendimiento del sistema, la escalabilidad eficiente de la infraestructura y la optimización continua del software son palancas clave que determinan la economía de inferencia de la inteligencia artificial. Un mayor rendimiento del sistema implica la generación de más tokens, lo que se traduce en mayores ingresos. La escalabilidad eficiente implica que el rendimiento crece proporcionalmente a medida que se agrega hardware, requiriendo menos recursos para servir a los usuarios a gran escala, mientras que la optimización continua permite generar más valor a partir de inversiones en infraestructura.

La fungibilidad de la plataforma es el fundamento de estos tres aspectos: la misma infraestructura puede ejecutar cualquier modelo y carga de trabajo, desde el entrenamiento hasta la inferencia, desde recomendaciones hasta razonamiento, desde lenguaje hasta video, manteniendo una alta utilización.

La plataforma de NVIDIA está diseñada específicamente para optimizar a través de estas áreas, como se destaca en los resultados de MLPerf Inference v6.1 anunciados recientemente. El sistema NVIDIA Vera Rubin NVL72 debutó con un rendimiento líder, ofreciendo hasta 3.7 veces más rendimiento que el GB300 NVL72. Además, la eficiencia de escalado del NVIDIA GB300 NVL72 resulta impresionante, alcanzando un 99% de eficiencia de escalado en una presentación de 288 GPU a través de cuatro racks. Las continuas optimizaciones del software han proporcionado mejoras en el rendimiento de hasta 1.6 veces más en comparación con la versión anterior, v6.0.

Para las organizaciones que toman decisiones sobre infraestructura de IA, el rendimiento, la eficiencia del escalado y la velocidad del software son consideraciones importantes que determinan las economías de la inferencia a largo plazo.

Vera Rubin NVL72 mostró resultados excepcionales en las pruebas de referencia más exigentes de la suite MLPerf Inference v6.1, como DeepSeek-R1 y Qwen3-VL. El nuevo sistema proporciona 3.7 veces más rendimiento que el anterior GB300 NVL72 en varios escenarios, ya sea offline, servidor o interactivo. Este notable avance subraya el ritmo acelerado de la innovación de NVIDIA y cómo el rendimiento continuará mejorando con optimizaciones de software continuas.

Este rendimiento se traduce en racks Vera Rubin NVL72 capaces de generar significativamente más tokens, servir a más usuarios y generar más ingresos que los racks GB300 NVL72, mientras se reduce el costo por token. Los resultados reflejan un diseño co-desarrollado en hardware y software, con núcleos tensoriales mejorados y una ingeniería transformadora que acelera las etapas de prellenado y decodificación de la inferencia.

En términos de eficiencia, NVIDIA GB300 NVL72 también ha demostrado su capacidad de escalado con gran eficiencia, alcanzando un 99% de eficiencia de escalado al expandirse de un único rack a cuatro. En escenarios de texto-a-video, la eficiencia de escalado a nivel de rack demostró una mayor producción de videos y una menor latencia.

La plataforma de NVIDIA continúa en desarrollo continuo con optimizaciones de software que aportan mejoras de rendimiento y funcionalidad. A través de optimizaciones post-periodo de presentación, se han logrado aún más avances en rendimiento en modelos y cargas de trabajo posteriores.

Más allá de sus resultados, NVIDIA sigue avanzando en el rendimiento a través de todo el stack tecnológico, con muestras de participación a lo largo de una amplia gama de socios, desde ASUS hasta Wiwynn, demostrando su capacidad para ofrecer tecnología a gran escala. Con dispositivos compactos en el borde y hasta las más grandes fábricas de inteligencia artificial, NVIDIA avanza cada año en sus arquitecturas de plataforma, constantemente mejorando su software y su ecosistema para ofrecerlo a escala.
Fuente: Zona de blogs y prensa de Nvidia

Scroll al inicio