OpenAI Jalapeño pone a prueba el dominio de NVIDIA en la inferencia de IA

OpenAI ha mostrado los primeros resultados de Jalapeño, su primer ASIC diseñado específicamente para inferencia de inteligencia artificial, y las cifras sitúan al chip por delante de los sistemas NVIDIA Blackwell utilizados como referencia en varias métricas importantes. El acelerador alcanza hasta 1.459 tokens por segundo por usuario con GPT-OSS 120B y ofrece entre 1,5 y 1,9 veces más rendimiento por kilovatio en las tres cargas publicadas. La comparación procede de InferenceX, el benchmark de SemiAnalysis, que verificó las ejecuciones en el laboratorio de OpenAI.

Las claves de OpenAI Jalapeño en 30 segundos

  • Jalapeño alcanza 85.448 tokens mixtos/s/kW con GPT-OSS 120B, frente a 44.960 del sistema NVIDIA GB200 comparado.
  • Con DeepSeek R1 llega a 700 tokens/s por usuario frente a 169 del GB300.
  • También ha sido probado con Kimi K2.5, un modelo de un billón de parámetros.
  • SemiAnalysis afirma que supera en distintas pruebas a hardware de NVIDIA, AMD y Google, aunque todavía faltan benchmarks de cargas agénticas más representativas de producción.
  • OpenAI prevé comenzar a desplegarlo en su propia infraestructura antes de acabar 2026.

Jalapeño merece atención por una razón que va más allá de que OpenAI haya fabricado un chip. La compañía intenta resolver uno de los mayores problemas económicos de la IA generativa: producir más tokens con la misma electricidad disponible.

La inferencia está adquiriendo cada vez más peso frente al entrenamiento. Agentes que ejecutan decenas de pasos, modelos de razonamiento y millones de usuarios concurrentes convierten la latencia, el ancho de banda de memoria y el consumo eléctrico en variables tan importantes como la capacidad teórica de cálculo.

Y es precisamente en esa combinación donde Jalapeño obtiene sus mejores resultados.

Jalapeño frente a NVIDIA Blackwell: qué dicen realmente las pruebas

OpenAI ha utilizado tres modelos públicos de tamaños y arquitecturas diferentes: GPT-OSS 120B, DeepSeek R1 670B y Kimi K2.5 1T.

La comparación directa publicada por la compañía enfrenta Jalapeño al GB200 para GPT-OSS y al GB300 para DeepSeek y Kimi. Las pruebas emplean una secuencia nominal 8k/1k y Single Token Prediction (STP).

ModeloJalapeñoNVIDIAVentaja Jalapeño
GPT-OSS 120B85.448 tokens/s/kWGB200: 44.9601,9x
DeepSeek R1 670B19.641 tokens/s/kWGB300: 11.7811,7x
Kimi K2.5 1T18.195 tokens/s/kWGB300: 11.8621,5x

La diferencia también aparece cuando se mide la velocidad máxima de generación para cada usuario.

Jalapeño llega a 1.459 tokens/s por usuario con GPT-OSS, mientras el GB200 utilizado en la comparación alcanza 535. Con DeepSeek R1 son 700 frente a 169 tokens/s y con Kimi K2.5, 694 frente a 182.

ModeloJalapeñoBlackwellDiferencia
GPT-OSS 120B1.459 tokens/s535 tokens/s2,7x
DeepSeek R1 670B700 tokens/s169 tokens/s4,1x
Kimi K2.5 1T694 tokens/s182 tokens/s3,8x

Para un chatbot convencional estas velocidades pueden parecer excesivas porque superan ampliamente la velocidad de lectura humana. Para los agentes de IA, sin embargo, la situación cambia. Un agente puede generar código, llamar a una herramienta, analizar el resultado y comenzar otra inferencia sin esperar a una persona. Reducir unos segundos cada paso puede acortar de forma considerable una tarea compuesta por numerosas llamadas consecutivas.

OpenAI también mide la latencia completa. Jalapeño registra 1,03 segundos con GPT-OSS frente a 1,80 del GB200; 1,65 frente a 5,99 segundos con DeepSeek R1; y 1,56 frente a 5,31 segundos con Kimi K2.5.

AMD demuestra por qué la comparación necesita matices

Decir simplemente que Jalapeño «vence a las GPU» sería demasiado amplio.

InferenceX permite observar además cómo compiten actualmente NVIDIA B200 y AMD Instinct MI355X utilizando el mismo GPT-OSS 120B. Y los resultados cambian considerablemente dependiendo de la velocidad exigida a cada usuario.

A 104 tokens/s por usuario, el B200 entrega 32.860 tokens/s por chip, frente a 23.358 del MI355X. A 171 tokens/s, los resultados son 20.448 frente a 13.182. Cuando se aumenta la interactividad hasta 238 tokens/s, NVIDIA mantiene 13.725 tokens/s por chip y AMD baja hasta 3.911. Son resultados InferenceX para una configuración 8k/1k y FP4.

GPT-OSS 120BNVIDIA B200AMD MI355X
A 104 tokens/s/usuario32.860 tokens/s/chip23.358
A 171 tokens/s/usuario20.44813.182
A 238 tokens/s/usuario13.7253.911

Estos números no pueden colocarse directamente junto a los 85.448 tokens/s/kW de Jalapeño, porque son métricas distintas. Sirven, sin embargo, para entender el mercado contra el que llega el ASIC de OpenAI: Blackwell ya mantiene una ventaja importante sobre MI355X en GPT-OSS en buena parte de la curva de interactividad analizada por InferenceX.

Tampoco NVIDIA domina necesariamente cada punto de cada modelo. En Kimi K2.5/K2.6/K2.7, por ejemplo, InferenceX registra al B200 por delante del MI355X a 38 y 67 tokens/s por usuario, pero a unos 95 tokens/s el resultado publicado es 1.643 tokens/s por chip para B200 y 1.739 para MI355X. El rendimiento depende del modelo y del punto de operación, por lo que las clasificaciones absolutas esconden parte de la realidad.

El verdadero rival de Jalapeño podría ser Rubin

Hay otro matiz especialmente relevante. SemiAnalysis considera que Blackwell no es necesariamente la comparación más adecuada para Jalapeño.

El ASIC de OpenAI utiliza HBM4 y su versión B0 está fabricada mediante el nodo N3P de TSMC. Por generación tecnológica, su rival natural sería NVIDIA Rubin, no Blackwell.

Según SemiAnalysis, el B0 de Jalapeño ofrece 13,4 PFLOPS MXFP4, con 700 W de TDP, y alcanza 15,4 TB/s de ancho de banda de memoria HBM4. Un compute die Rubin comparable llega a 17,5 PFLOPS densos NVFP4, aunque con un presupuesto energético superior. Son especificaciones teóricas y no equivalen por sí mismas al rendimiento que finalmente obtiene un modelo completo.

La comparación con Rubin será por ello mucho más interesante cuando existan suficientes sistemas de producción y benchmarks equivalentes.

SemiAnalysis advierte además de otra limitación: las pruebas actuales utilizan principalmente secuencias 8k/1k y todavía no se han publicado resultados completos de AgentX para Jalapeño. Ese benchmark reproduce cargas agénticas con contextos largos y múltiples turnos, donde entran en juego la gestión del KV cache, el enrutamiento, la transferencia entre nodos y otras partes del sistema que una prueba de una única interacción no reproduce completamente.

Eso impide convertir los buenos resultados iniciales en una victoria definitiva sobre las GPU.

Un ASIC menos especializado de lo que podría parecer

Jalapeño tampoco sigue exactamente el planteamiento de otros aceleradores especializados que sacrifican flexibilidad para maximizar una carga concreta.

OpenAI explica que diseñó conjuntamente cálculo, memoria, red y software para reducir el movimiento de datos durante la inferencia. El estado del modelo, incluido el KV cache, puede mantenerse local mientras el sistema distribuye los recursos según se encuentre en prefill o decode.

SemiAnalysis confirma además que las pruebas se realizaron con Single Token Prediction, sin decodificación especulativa ni separación entre prefill y decode. A pesar de ello, Jalapeño obtuvo resultados competitivos tanto en escenarios orientados a throughput como en los de baja latencia.

Esto es relevante porque OpenAI necesita que su inversión pueda sobrevivir a una industria donde las arquitecturas de modelos cambian rápidamente.

GPT-OSS, DeepSeek R1 y Kimi K2.5 tampoco formaban una única familia diseñada alrededor del hardware. Que los tres puedan ejecutarse con buenos resultados aporta una primera evidencia de que Jalapeño tiene cierta capacidad de generalización.

La compañía ha llevado además esa integración hasta el desarrollo del software. OpenAI utilizó Codex con GPT-Astra para adaptar tres modelos de pesos abiertos al nuevo acelerador y asegura que consiguió llevarlos a un rendimiento elevado en unos dos meses. En algunos bloques concretos de atención y Mixture of Experts de GPT-OSS, las implementaciones creadas con ayuda de IA funcionaron entre 1,5 y 1,8 veces más rápido que las anteriores escritas por especialistas. Esas cifras corresponden a bloques seleccionados, no al modelo completo.

NVIDIA seguirá dentro de la infraestructura de OpenAI

Jalapeño tampoco significa que OpenAI vaya a abandonar NVIDIA.

La propia compañía afirma que continuará desplegando ampliamente aceleradores NVIDIA y de otros proveedores para entrenamiento e inferencia. Jalapeño añade capacidad propia a una demanda de computación que continúa aumentando.

La consecuencia más interesante puede ser económica.

Un laboratorio que controla modelo, compilador, kernels, acelerador, memoria, red y sistema completo puede ajustar cada capa utilizando información procedente de sus propias cargas de producción. Si además obtiene entre 1,5 y 1,9 veces más trabajo por unidad de potencia en determinados modelos, la ventaja se multiplica cuando se traslada a centros de datos limitados por decenas o cientos de megavatios.

OpenAI prevé comenzar a desplegar Jalapeño internamente antes de terminar 2026 y ya trabaja en una segunda generación, mientras empieza a definir una tercera.

Todavía tendrá que demostrar que los resultados sobreviven a modelos con contextos largos, cargas agénticas, producción continua y despliegues a gran escala. También habrá que enfrentar el silicio definitivo con Rubin y con las próximas generaciones de AMD.

Pero Jalapeño ya introduce un cambio relevante en la carrera de infraestructura de IA: OpenAI deja de ser únicamente un gran cliente de los fabricantes de aceleradores y pasa a competir también en el diseño del hardware que determina cuánto cuesta generar cada token.

Preguntas frecuentes

¿Jalapeño es realmente más rápido que NVIDIA Blackwell?

En los tres modelos y condiciones publicados por OpenAI, sí. Jalapeño supera a los sistemas GB200 o GB300 utilizados como comparación tanto en rendimiento máximo por kilovatio como en velocidad de decodificación por usuario. Eso no demuestra que sea superior en cualquier modelo o carga.

¿Cómo se compara Jalapeño con AMD Instinct MI355X?

OpenAI no publica en su informe principal una comparación directa equivalente Jalapeño-MI355X. SemiAnalysis afirma que Jalapeño superó al hardware de NVIDIA, AMD y Google que pudo probar en múltiples modelos, pero las tablas públicas más detalladas de OpenAI enfrentan Jalapeño principalmente con GB200 y GB300.

¿Cuál es la velocidad máxima publicada de Jalapeño?

Alcanza 1.459 tokens por segundo por usuario con GPT-OSS 120B. Con DeepSeek R1 registra 700 tokens/s y con Kimi K2.5, 694 tokens/s.

¿OpenAI dejará de comprar GPU NVIDIA?

No. OpenAI asegura que seguirá desplegando aceleradores de NVIDIA y otros socios para entrenamiento e inferencia mientras incorpora progresivamente Jalapeño a su infraestructura.

Scroll al inicio