La inteligencia artificial (IA) se encuentra en una fase de transformación con la incorporación de los llamados workloads agenticos. Estos sistemas, en contraste con aplicaciones simples de chat, requieren un consumo de tokens significativamente mayor, hasta 15 veces más. Una de las razones se encuentra en la complejidad de las tareas que los agentes de IA deben abordar, como investigar empresas para decisiones de inversión, lo que implica la consulta de bases de datos financieras, análisis de noticias y documentos, comparación entre pares y modelado de valoraciones, proceso en el cual agentes y sub-agentes colaboran hasta obtener una recomendación completa.
En este contexto, la necesidad de manejar un entorno de largo contexto se convierte en un factor central para el desempeño de estas aplicaciones. Dicho proceso lleva a un incremento en la demanda de tokens, presentando un desafío para la infraestructura subyacente que inicia su fase de producción en diversas industrias, desde el desarrollo de software hasta la atención al cliente y la investigación profunda.
NVIDIA ha logrado destacar en este campo gracias a los avances en sus sistemas Vera Rubin NVL72, que presentan un throughput de hasta 30 veces superior por megavatio respecto al modelo GB300 NVL72 en cargas de trabajo agenticas. Estos progresos se evidencian en experimentos con el Semianálisis AgentX, que combinan sesiones reales de codificación con crecimiento contextual verdadero, uso de herramientas y proliferación de sub-agentes. Para las fábricas de IA con limitaciones energéticas, esta eficiencia se traduce en 30 veces más trabajo agentico por el mismo consumo energético.
Vera Rubin NVL72 no solo ofrecen un rendimiento elevado, sino también un costo de token 35 veces menor. Esto permite a las empresas ejecutar agentes de manera continua y a gran escala, mejorando los márgenes de ganancia debido a un menor costo por cada millón de tokens procesados.
La extrema co-diseño, que caracteriza los procesos de NVIDIA, incorpora técnicas de optimización modernas necesarias para la IA agentica. Entre estas técnicas se encuentran la separación de procesos de contexto y generación de respuestas, sincronización de velocidad entre GPUs, y el uso de modelos especializados y caché distribuido. Estas mejoras, junto a las innovaciones en la tecnología de interconexión NVLink, destacan el enfoque multifacético y altamente integrado que NVIDIA ha adoptado para liderar en el rendimiento de IA agentica.
Con el respaldo de tecnologías como los Tensor Cores de quinta generación y el Transformer Engine de tercera generación, la plataforma Vera Rubin NVL72 continúa estableciendo nuevos estándares en eficiencia y capacidad para aplicaciones agenticas. Avalada por una continua co-ingeniería con socios estratégicos, Vera Rubin ya está en plena producción, extendiendo su huella en la industria de IA.
Así, NVIDIA no solo avanza en el rendimiento por vatio, sino que redefine las economías de escala en IA, permitiendo que sus clientes optimicen sus procesos y ofrezcan resultados efectivos en aplicaciones complejas y desafiantes. La eficiencia energética y el coste ajustado de procesamiento de tokens en la plataforma Vera Rubin NVL72 prometen un futuro sostenible y rentable para la IA a gran escala.
Fuente: Zona de blogs y prensa de Nvidia












