GH200 Grace Hopper: el superchip de NVIDIA para la IA generativa

NVIDIA presentó la plataforma GH200 Grace Hopper, una nueva versión de su superchip pensada para entrenar e inferir los modelos de IA generativa más pesados del momento. La novedad principal es la memoria HBM3e, la primera vez que este tipo de memoria llega integrada en un procesador de este tipo, según la compañía.

El objetivo declarado es cubrir cargas de trabajo muy específicas: modelos de lenguaje de gran tamaño, sistemas de recomendación y bases de datos vectoriales, que necesitan mover muchísima memoria a toda velocidad entre CPU y GPU.

Qué cambia frente a la generación anterior

En su configuración dual, la plataforma ofrece hasta 3,5 veces más capacidad de memoria y 3 veces más ancho de banda que el Superchip Grace Hopper original. Un solo servidor integra 144 núcleos Arm Neoverse, ocho petaflops de rendimiento en IA y 282 GB de memoria HBM3e, un 50% más rápida que la HBM3 que montaban los chips anteriores. El ancho de banda combinado llega a 10 TB por segundo.

La clave técnica está en NVLink, la interconexión propia de NVIDIA que permite unir varios Superchips y dar a la GPU acceso directo a toda la memoria del CPU. En configuración dual, eso se traduce en 1,2 TB de memoria rápida compartida, suficiente para mover modelos 3,5 veces más grandes que en la generación anterior sin cambiar de arquitectura.

Jensen Huang, fundador y consejero delegado de NVIDIA, lo resumió así en la presentación: «Los centros de datos necesitan plataformas de computación acelerada con requisitos especializados para atender el auge de la IA generativa. GH200 Grace Hopper ofrece memoria y ancho de banda excepcionales, capacidad de conectar GPU y un diseño de servidor fácil de escalar».

Compatibilidad con MGX y despliegue previsto

NVIDIA ha diseñado esta generación para que sea plug and play dentro de la especificación de servidor NVIDIA MGX, presentada previamente en COMPUTEX. En la práctica, eso permite a cualquier fabricante de sistemas montar Grace Hopper en más de 100 variantes de servidor distintas sin diseñar una placa desde cero, algo que abarata y acelera la adopción para los grandes proveedores de nube.

Varios fabricantes ya tenían sistemas basados en el Superchip Grace Hopper original en el mercado antes de este anuncio, lo que sugiere que la transición a la versión con HBM3e será relativamente rápida. NVIDIA prevé que los principales fabricantes empiecen a vender equipos con esta plataforma a partir del segundo trimestre de 2024.

El movimiento llega en un momento en el que la memoria de alto ancho de banda se ha convertido en el cuello de botella real para entrenar modelos cada vez más grandes, por delante incluso de la potencia de cálculo bruta. No es casualidad que fabricantes de memoria como SK hynix hayan pasado a ocupar un papel central en la cadena de suministro de la IA, como recogimos al hablar de la salida a bolsa de SK hynix apoyada precisamente en la demanda de HBM.

La apuesta de NVIDIA por chips cada vez más especializados para IA generativa también se explica por la presión de sus propios clientes, que empiezan a buscar alternativas para no depender de un solo proveedor. OpenAI ya trabaja en su propio chip con Broadcom para abaratar la inferencia de sus modelos, y otros grandes actores del sector siguen un camino similar, como reflejan las inversiones de NVIDIA junto a sus socios para asegurar capacidad de fabricación a largo plazo.

Preguntas frecuentes

¿Qué es el Superchip Grace Hopper?

Es el chip de NVIDIA que combina en una sola pieza una CPU Arm Neoverse y una GPU conectadas mediante NVLink, diseñado para cargas de IA generativa que necesitan mucha memoria y ancho de banda.

¿Qué aporta la memoria HBM3e frente a la HBM3?

Un 50% más de velocidad, según NVIDIA, lo que permite a la plataforma GH200 mover datos más rápido entre CPU y GPU y ejecutar modelos de mayor tamaño sin cambiar de arquitectura.

¿Cuánta memoria tiene la configuración dual de GH200?

1,2 TB de memoria rápida compartida entre CPU y GPU, con un ancho de banda combinado de 10 TB por segundo.

¿Qué es NVIDIA MGX y por qué importa aquí?

Es una especificación de servidor de NVIDIA que permite a distintos fabricantes integrar Grace Hopper en más de 100 configuraciones de servidor distintas sin diseñar hardware desde cero, lo que acelera su llegada al mercado.

Scroll al inicio