CPU, GPU, TPU y NPU: qué chips están compitiendo por ejecutar la IA

La inteligencia artificial ya no depende de un único tipo de procesador. CPU, GPU, TPU y NPU desempeñan funciones diferentes, desde coordinar un ordenador hasta entrenar grandes modelos o ejecutar IA directamente en un portátil. A ellos se suman FPGA, ASIC especializados y procesadores de infraestructura como las DPU. Entender las diferencias ayuda a explicar por qué la próxima generación de sistemas de IA será cada vez más heterogénea.

Las claves de los procesadores para IA en 20 segundos

  • Las GPU dominan buena parte del entrenamiento y la inferencia de IA por su capacidad de cálculo paralelo.
  • Las TPU son aceleradores especializados desarrollados por Google para machine learning.
  • Las NPU llevan determinadas cargas de IA al PC, móvil y dispositivos edge con menor consumo.
  • Las CPU siguen coordinando el sistema y ejecutando código general.
  • FPGA y otros ASIC amplían las alternativas para cargas especializadas.

La popularización de la IA generativa ha situado a las GPU en el centro de la conversación tecnológica, pero reducir toda la infraestructura de inteligencia artificial a este tipo de chips ofrece una imagen incompleta.

Un servidor que ejecuta un gran modelo puede combinar CPU y varios aceleradores. Un portátil reciente puede integrar CPU, GPU y NPU dentro del mismo sistema. En un centro de datos pueden aparecer además procesadores dedicados a redes y almacenamiento.

La cuestión ya no consiste simplemente en decidir cuál es el chip más rápido. Importan la carga que se ejecutará, el consumo, la memoria disponible, el software compatible y la posibilidad de conectar muchos aceleradores entre sí.

CPU y GPU: de la computación general al paralelismo masivo

La CPU (Central Processing Unit) sigue siendo el procesador general de un sistema informático.

Está diseñada para ejecutar instrucciones muy diferentes, gestionar el sistema operativo, coordinar aplicaciones y responder a tareas con abundante lógica y decisiones. Sus núcleos son relativamente complejos y están preparados para cambiar rápidamente entre diferentes tipos de trabajo.

También puede ejecutar modelos de inteligencia artificial.

Modelos pequeños, algoritmos tradicionales de machine learning y determinadas cargas de inferencia pueden funcionar exclusivamente sobre CPU. En algunos casos resulta incluso innecesario incorporar otro acelerador.

La GPU responde a una filosofía diferente.

Las GPU (Graphics Processing Unit) nacieron para procesar gráficos. Renderizar una escena exige realizar muchas operaciones similares simultáneamente, por lo que estos procesadores evolucionaron hacia arquitecturas capaces de manejar enormes cantidades de trabajo paralelo.

Las redes neuronales tienen una característica que encaja bien con ese diseño: utilizan intensivamente operaciones con matrices y vectores.

Esto convirtió a las GPU en aceleradores especialmente adecuados para machine learning y posteriormente para la IA generativa.

Hoy pueden utilizarse tanto para entrenar modelos como para ejecutar inferencia, aunque su utilidad va mucho más allá de la inteligencia artificial: gráficos, simulaciones científicas, vídeo y computación de alto rendimiento también pueden aprovecharlas.

CPU vs GPU vs TPU vs NPU

TecnologíaDiseño principalFlexibilidadUso habitual en IAEntorno
CPUComputación generalMuy altaCoordinación e inferencia ligeraCualquier sistema
GPUComputación paralelaAltaEntrenamiento e inferenciaPC y centros de datos
TPUMachine learningEspecializadaEntrenamiento e inferenciaInfraestructura de Google
NPURedes neuronales eficientesEspecializadaPrincipalmente inferencia localPC, móviles y edge
FPGAHardware configurableConfigurableInferencia y cargas específicasEdge y centros de datos
ASIC de IAFunción específicaMuy especializadaEntrenamiento o inferenciaCentros de datos y dispositivos

La especialización no implica automáticamente mayor rendimiento. Una arquitectura diseñada específicamente para determinadas operaciones puede ser extremadamente eficiente cuando la carga encaja con ella y bastante menos apropiada para otros trabajos.

TPU: Google lleva la especialización al centro de datos

Las TPU (Tensor Processing Unit) son un caso particular porque no constituyen una categoría genérica creada por toda la industria. Es el nombre que Google utiliza para sus aceleradores especializados en machine learning.

Técnicamente son ASIC (Application-Specific Integrated Circuit), circuitos diseñados para ejecutar determinadas operaciones con mucha más especialización que una CPU convencional.

Google desarrolló la arquitectura alrededor de las operaciones matriciales utilizadas intensivamente por las redes neuronales.

Las distintas generaciones han ido aumentando capacidad de cálculo, memoria y posibilidades de interconexión para construir sistemas formados por numerosos aceleradores.

Las TPU pueden utilizarse para entrenamiento y para inferencia. Su utilización está además estrechamente relacionada con el software capaz de aprovechar su arquitectura y con el entorno de Google.

Esta última cuestión resulta especialmente importante al comparar TPU y GPU.

GPU frente a TPU

CaracterísticaGPUTPU
Objetivo originalGráficos y paralelismoMachine learning
Entrenamiento de IA
Inferencia
FlexibilidadMayorMás especializada
GráficosNo es su finalidad
Operaciones matricialesMuy eficientesDiseño específico para ML
DisponibilidadAmpliaEcosistema de Google
Uso en PCNo es su escenario habitual
Escalado en centros de datos

Preguntar si una TPU es mejor que una GPU sin especificar la carga tiene poco sentido.

El resultado puede cambiar según el modelo, framework, precisión numérica, memoria, tamaño del lote, interconexión y generación concreta de cada acelerador.

Para grandes sistemas de IA aparece además otra variable: mantener alimentados los chips con suficientes datos.

Un acelerador extremadamente rápido pierde rendimiento si pasa demasiado tiempo esperando información procedente de memoria, almacenamiento o de otros nodos del clúster.

Por eso las arquitecturas modernas de IA dependen cada vez más del sistema completo y no únicamente de las operaciones por segundo anunciadas para cada procesador.

NPU: llevar la inferencia de IA al dispositivo

Mientras GPU y TPU ocupaban buena parte del debate sobre centros de datos, otro tipo de acelerador ha empezado a hacerse habitual en los dispositivos personales: la NPU (Neural Processing Unit).

Las NPU están diseñadas específicamente para ejecutar operaciones de redes neuronales con una atención especial a la eficiencia energética.

Esto las hace apropiadas para portátiles, smartphones y sistemas edge.

Un ordenador puede utilizar su NPU para determinadas funciones de procesamiento de imagen, audio, reconocimiento de voz, videollamadas o inferencia local sin tener que mantener continuamente ocupada una GPU de mayor consumo.

La llegada de los denominados AI PC está haciendo más visible esta arquitectura.

Muchos procesadores recientes combinan CPU, GPU y NPU, permitiendo que el sistema distribuya las tareas entre distintos motores.

Cómo puede repartirse el trabajo en un AI PC

CargaCPUGPUNPU
Sistema operativoPrincipalSecundariaNo
Aplicaciones generalesPrincipalPuntualPuntual
VideojuegosNecesariaPrincipalPoco habitual
RenderizadoApoyoPrincipalNo
LLM local exigenteApoyoHabitualDepende del modelo
Efectos de IA continuosPosibleEspecialmente adecuada
Inferencia
Entrenamiento intensivoLimitadoNo es su objetivo habitual

La NPU tampoco sustituye automáticamente a una GPU.

Uno de sus principales límites actuales es el software. Una aplicación necesita utilizar runtimes y modelos compatibles para aprovechar el acelerador.

Que un ordenador disponga de una NPU de decenas de TOPS no significa que cualquier programa de inteligencia artificial pueda ejecutar automáticamente sus modelos sobre ella.

La memoria también decide qué acelerador puede ejecutar un modelo

Las comparaciones entre CPU, GPU, TPU y NPU suelen centrarse en la capacidad de cálculo, pero la IA generativa ha convertido la memoria en otro factor determinante.

Un modelo necesita que sus pesos y otros datos estén disponibles durante la ejecución.

En una GPU dedicada esto convierte la cantidad de VRAM en una especificación especialmente relevante. Un acelerador puede disponer de enorme capacidad matemática y, aun así, no ser adecuado para un modelo determinado si carece de memoria suficiente.

En grandes sistemas sucede algo similar.

Los aceleradores para centros de datos utilizan memorias de gran ancho de banda y enlaces específicos para comunicarse entre sí. Cuando un modelo se distribuye entre varios chips, la velocidad de esas conexiones puede afectar directamente al rendimiento.

Por eso comparar únicamente TOPS, TFLOPS o cualquier otra cifra máxima proporciona una visión parcial.

Para evaluar hardware de IA hay que considerar conjuntamente cálculo, memoria, ancho de banda, interconexión, consumo y software.

FPGA, ASIC, DPU y otras XPU que aparecen alrededor de la IA

CPU, GPU, TPU y NPU no son las únicas siglas presentes en la infraestructura moderna.

Los FPGA (Field-Programmable Gate Array) son circuitos cuya lógica puede reconfigurarse después de fabricarlos. Esa característica permite construir pipelines específicos para determinadas aplicaciones.

Pueden utilizarse para IA, pero también para telecomunicaciones, procesamiento de vídeo, redes, sistemas industriales y numerosas tareas donde interesa adaptar el hardware a una función concreta.

Los ASIC llevan la especialización todavía más lejos.

Se diseñan para realizar determinadas funciones y posteriormente no ofrecen la flexibilidad de un FPGA. A cambio, cuando el volumen y la carga justifican su desarrollo, pueden alcanzar relaciones muy interesantes entre rendimiento y consumo.

Numerosos aceleradores de IA son precisamente ASIC. Las TPU de Google pertenecen a esta categoría.

También aparecen las DPU (Data Processing Unit) e IPU orientadas a infraestructura.

Su función principal no consiste en ejecutar el modelo de IA, sino en descargar de la CPU operaciones relacionadas con redes, almacenamiento, seguridad y movimiento de información.

En grandes clústeres esto puede resultar relevante porque alimentar cientos o miles de aceleradores requiere también una infraestructura capaz de transportar enormes cantidades de datos.

Las principales XPU relacionadas con IA

Procesador¿Calcula modelos de IA?Función principal
CPUComputación general
GPUParalelismo e IA
TPUMachine learning especializado
NPUIA eficiente y local
FPGAPuede hacerloAceleración configurable
ASIC de IAIA altamente especializada
DPU/IPUNo como función principalRed, almacenamiento e infraestructura

Existe además el término XPU, pero debe utilizarse con cuidado.

No describe una arquitectura universal concreta. Suele emplearse como concepto paraguas para hablar de sistemas heterogéneos donde diferentes unidades de procesamiento trabajan conjuntamente.

También existen denominaciones como LPU (Language Processing Unit) asociadas a arquitecturas específicas para modelos de lenguaje. Son procesadores reales, pero LPU no tiene actualmente el mismo carácter general que CPU, GPU o NPU.

Añadir indiscriminadamente cualquier sigla terminada en PU a una comparación puede generar más confusión que claridad.

Qué procesador necesita realmente la inteligencia artificial

La respuesta depende primero de dónde se ejecuta el modelo.

Un usuario que utiliza ChatGPT, Gemini u otra plataforma de IA en la nube no necesita disponer en su ordenador de la GPU utilizada para ejecutar el modelo. El trabajo pesado se realiza en los servidores del proveedor.

La IA local cambia completamente la situación.

Un modelo pequeño puede ejecutarse sobre CPU. Una NPU puede resultar adecuada para cargas compatibles que necesiten bajo consumo. Para modelos generativos locales más grandes suele resultar especialmente útil una GPU con suficiente memoria.

El entrenamiento plantea requisitos todavía mayores.

Entrenar grandes modelos implica ejecutar cantidades enormes de operaciones durante largos periodos y mover información constantemente entre memoria y aceleradores. Ahí entran GPU, TPU y otros ASIC especializados desplegados en grandes clústeres.

UsoHardware habitual
Chatbot ejecutado en la nubeEl dispositivo local no realiza el cálculo principal
IA básica localCPU
Funciones IA de portátilNPU, GPU y CPU
LLM localGPU o acelerador compatible
IA en smartphoneNPU/accelerador integrado
IA en edgeNPU, FPGA o ASIC
Entrenamiento de modelosGPU, TPU u otros aceleradores
Grandes modelos fundacionalesClústeres de aceleradores
Redes y almacenamiento del clústerCPU + DPU/IPU según arquitectura

La evolución del hardware de IA apunta así hacia sistemas donde varios procesadores cooperan en lugar de competir por hacer exactamente el mismo trabajo.

La CPU seguirá gestionando buena parte de la lógica general. La GPU continuará siendo un acelerador muy versátil. Las NPU asumirán más inferencia local cuando el software pueda aprovecharlas. TPU y otros ASIC buscarán eficiencia y escala en cargas específicas.

La pregunta que determinará qué hardware termina imponiéndose en cada escenario probablemente no será cuál tiene más TOPS, sino cuánto cuesta ejecutar un modelo, cuánta energía consume, qué memoria necesita y qué software puede aprovechar realmente el acelerador.

Preguntas frecuentes

¿Qué es mejor para IA, una GPU o una NPU?

Depende de la carga. Las GPU suelen ser más flexibles y adecuadas para modelos generativos exigentes, mientras que las NPU están especialmente orientadas a ejecutar determinadas operaciones de IA con menor consumo energético.

¿Una TPU es más rápida que una GPU?

No puede afirmarse de forma general. El rendimiento depende de la generación del hardware, el modelo, la precisión utilizada, el software, la memoria y la forma en que se distribuya la carga.

¿Hace falta una GPU para utilizar inteligencia artificial?

No necesariamente. Los servicios de IA en la nube ejecutan sus modelos en infraestructura remota y los modelos pequeños también pueden funcionar sobre CPU. Una GPU resulta especialmente útil cuando se quieren ejecutar localmente modelos más exigentes o entrenarlos.

¿Qué significa XPU en hardware de inteligencia artificial?

XPU suele utilizarse como término general para hablar de diferentes unidades de procesamiento dentro de sistemas heterogéneos. No corresponde a una única arquitectura estandarizada comparable directamente con CPU, GPU o NPU.

Scroll al inicio