NVIDIA Lanza Groq 3 LPX en Producción Completa con Velocidad de Clase Mundial para IA Agente

En un desarrollo significativo para el mundo de la inteligencia artificial, NVIDIA ha anunciado que su innovador Groq 3 LPX, un acelerador de inferencia AI interactivo, ha entrado en plena producción. Este avance revolucionario, que amplía la plataforma NVIDIA Vera Rubin, promete acelerar notablemente la generación de tokens, un componente crucial para la operatividad de los sistemas AI que requieren respuestas rápidas y eficientes en tiempo real.

Los sistemas Vera Rubin NVL72 ya son reconocidos por su versatilidad al entrenar e inferir modelos AI, y la integración del Groq 3 LPX lleva esta capacidad a un nuevo nivel. El reciente benchmarking de Artificial Analysis demostró que Groq 3 LPX puede generar hasta 3,400 tokens de salida por segundo utilizando el modelo agente Gemma 4 31B, posicionándose como el más rápido registrado en dicha prueba.

Esta tecnología es especialmente crítica para las tareas agenticas, donde la capacidad de completar miles de ciclos de inferencia de manera expedita es esencial para que los agentes puedan razonar y ejecutar tareas complejas de manera efectiva y eficiente. Además, el Groq 3 LPX permite que las tareas de codificación, que solían tardar horas, ahora puedan completarse en cuestión de minutos, mejorando la capacidad de respuesta de los sistemas AI en cuatro veces en comparación con las alternativas más cercanas.

Nebius, un importante proveedor de AI en la nube, ha tomado la delantera como el primer adoptante de esta tecnología, incorporando Groq 3 LPX en su plataforma de producción de inferencia, Nebius Token Factory. Esto ofrece a los desarrolladores acceso a una velocidad de generación de tokens sin precedentes, favoreciendo la creación de aplicaciones agenticas altamente receptivas.

Esta innovación no solo representa un avance en la velocidad y eficiencia de la AI, sino que también subraya el impulso continuo hacia la optimización de las fábricas de AI a través de diseños conjuntos extremos. La combinación de múltiples chips y racks especialmente diseñados dentro de la plataforma NVIDIA Vera Rubin no solo promete maximizar el rendimiento por vatio, sino que también garantiza la inferencia de menor latencia posible. A medida que la demanda global por cómputo de AI continúa creciendo, estas innovaciones ponen de manifiesto que la evolución del procesamiento agentico está lejos de haberse detenido, abriendo nuevas posibles para el futuro de la inteligencia artificial.
Fuente: Zona de blogs y prensa de Nvidia

Scroll al inicio