La inteligencia artificial ya no depende de un único tipo de procesador. CPU, GPU, TPU y NPU desempeñan funciones diferentes, desde coordinar un ordenador hasta entrenar grandes modelos o ejecutar IA directamente en un portátil. A ellos se suman FPGA, ASIC especializados y procesadores de infraestructura como las DPU. Entender las diferencias ayuda a explicar por qué la próxima generación de sistemas de IA será cada vez más heterogénea.
Las claves de los procesadores para IA en 20 segundos
- Las GPU dominan buena parte del entrenamiento y la inferencia de IA por su capacidad de cálculo paralelo.
- Las TPU son aceleradores especializados desarrollados por Google para machine learning.
- Las NPU llevan determinadas cargas de IA al PC, móvil y dispositivos edge con menor consumo.
- Las CPU siguen coordinando el sistema y ejecutando código general.
- FPGA y otros ASIC amplían las alternativas para cargas especializadas.
La popularización de la IA generativa ha situado a las GPU en el centro de la conversación tecnológica, pero reducir toda la infraestructura de inteligencia artificial a este tipo de chips ofrece una imagen incompleta.
Un servidor que ejecuta un gran modelo puede combinar CPU y varios aceleradores. Un portátil reciente puede integrar CPU, GPU y NPU dentro del mismo sistema. En un centro de datos pueden aparecer además procesadores dedicados a redes y almacenamiento.
La cuestión ya no consiste simplemente en decidir cuál es el chip más rápido. Importan la carga que se ejecutará, el consumo, la memoria disponible, el software compatible y la posibilidad de conectar muchos aceleradores entre sí.
CPU y GPU: de la computación general al paralelismo masivo
La CPU (Central Processing Unit) sigue siendo el procesador general de un sistema informático.
Está diseñada para ejecutar instrucciones muy diferentes, gestionar el sistema operativo, coordinar aplicaciones y responder a tareas con abundante lógica y decisiones. Sus núcleos son relativamente complejos y están preparados para cambiar rápidamente entre diferentes tipos de trabajo.
También puede ejecutar modelos de inteligencia artificial.
Modelos pequeños, algoritmos tradicionales de machine learning y determinadas cargas de inferencia pueden funcionar exclusivamente sobre CPU. En algunos casos resulta incluso innecesario incorporar otro acelerador.
La GPU responde a una filosofía diferente.
Las GPU (Graphics Processing Unit) nacieron para procesar gráficos. Renderizar una escena exige realizar muchas operaciones similares simultáneamente, por lo que estos procesadores evolucionaron hacia arquitecturas capaces de manejar enormes cantidades de trabajo paralelo.
Las redes neuronales tienen una característica que encaja bien con ese diseño: utilizan intensivamente operaciones con matrices y vectores.
Esto convirtió a las GPU en aceleradores especialmente adecuados para machine learning y posteriormente para la IA generativa.
Hoy pueden utilizarse tanto para entrenar modelos como para ejecutar inferencia, aunque su utilidad va mucho más allá de la inteligencia artificial: gráficos, simulaciones científicas, vídeo y computación de alto rendimiento también pueden aprovecharlas.
CPU vs GPU vs TPU vs NPU
| Tecnología | Diseño principal | Flexibilidad | Uso habitual en IA | Entorno |
|---|---|---|---|---|
| CPU | Computación general | Muy alta | Coordinación e inferencia ligera | Cualquier sistema |
| GPU | Computación paralela | Alta | Entrenamiento e inferencia | PC y centros de datos |
| TPU | Machine learning | Especializada | Entrenamiento e inferencia | Infraestructura de Google |
| NPU | Redes neuronales eficientes | Especializada | Principalmente inferencia local | PC, móviles y edge |
| FPGA | Hardware configurable | Configurable | Inferencia y cargas específicas | Edge y centros de datos |
| ASIC de IA | Función específica | Muy especializada | Entrenamiento o inferencia | Centros de datos y dispositivos |
La especialización no implica automáticamente mayor rendimiento. Una arquitectura diseñada específicamente para determinadas operaciones puede ser extremadamente eficiente cuando la carga encaja con ella y bastante menos apropiada para otros trabajos.
TPU: Google lleva la especialización al centro de datos
Las TPU (Tensor Processing Unit) son un caso particular porque no constituyen una categoría genérica creada por toda la industria. Es el nombre que Google utiliza para sus aceleradores especializados en machine learning.
Técnicamente son ASIC (Application-Specific Integrated Circuit), circuitos diseñados para ejecutar determinadas operaciones con mucha más especialización que una CPU convencional.
Google desarrolló la arquitectura alrededor de las operaciones matriciales utilizadas intensivamente por las redes neuronales.
Las distintas generaciones han ido aumentando capacidad de cálculo, memoria y posibilidades de interconexión para construir sistemas formados por numerosos aceleradores.
Las TPU pueden utilizarse para entrenamiento y para inferencia. Su utilización está además estrechamente relacionada con el software capaz de aprovechar su arquitectura y con el entorno de Google.
Esta última cuestión resulta especialmente importante al comparar TPU y GPU.
GPU frente a TPU
| Característica | GPU | TPU |
|---|---|---|
| Objetivo original | Gráficos y paralelismo | Machine learning |
| Entrenamiento de IA | Sí | Sí |
| Inferencia | Sí | Sí |
| Flexibilidad | Mayor | Más especializada |
| Gráficos | Sí | No es su finalidad |
| Operaciones matriciales | Muy eficientes | Diseño específico para ML |
| Disponibilidad | Amplia | Ecosistema de Google |
| Uso en PC | Sí | No es su escenario habitual |
| Escalado en centros de datos | Sí | Sí |
Preguntar si una TPU es mejor que una GPU sin especificar la carga tiene poco sentido.
El resultado puede cambiar según el modelo, framework, precisión numérica, memoria, tamaño del lote, interconexión y generación concreta de cada acelerador.
Para grandes sistemas de IA aparece además otra variable: mantener alimentados los chips con suficientes datos.
Un acelerador extremadamente rápido pierde rendimiento si pasa demasiado tiempo esperando información procedente de memoria, almacenamiento o de otros nodos del clúster.
Por eso las arquitecturas modernas de IA dependen cada vez más del sistema completo y no únicamente de las operaciones por segundo anunciadas para cada procesador.
NPU: llevar la inferencia de IA al dispositivo
Mientras GPU y TPU ocupaban buena parte del debate sobre centros de datos, otro tipo de acelerador ha empezado a hacerse habitual en los dispositivos personales: la NPU (Neural Processing Unit).
Las NPU están diseñadas específicamente para ejecutar operaciones de redes neuronales con una atención especial a la eficiencia energética.
Esto las hace apropiadas para portátiles, smartphones y sistemas edge.
Un ordenador puede utilizar su NPU para determinadas funciones de procesamiento de imagen, audio, reconocimiento de voz, videollamadas o inferencia local sin tener que mantener continuamente ocupada una GPU de mayor consumo.
La llegada de los denominados AI PC está haciendo más visible esta arquitectura.
Muchos procesadores recientes combinan CPU, GPU y NPU, permitiendo que el sistema distribuya las tareas entre distintos motores.
Cómo puede repartirse el trabajo en un AI PC
| Carga | CPU | GPU | NPU |
|---|---|---|---|
| Sistema operativo | Principal | Secundaria | No |
| Aplicaciones generales | Principal | Puntual | Puntual |
| Videojuegos | Necesaria | Principal | Poco habitual |
| Renderizado | Apoyo | Principal | No |
| LLM local exigente | Apoyo | Habitual | Depende del modelo |
| Efectos de IA continuos | Posible | Sí | Especialmente adecuada |
| Inferencia | Sí | Sí | Sí |
| Entrenamiento intensivo | Limitado | Sí | No es su objetivo habitual |
La NPU tampoco sustituye automáticamente a una GPU.
Uno de sus principales límites actuales es el software. Una aplicación necesita utilizar runtimes y modelos compatibles para aprovechar el acelerador.
Que un ordenador disponga de una NPU de decenas de TOPS no significa que cualquier programa de inteligencia artificial pueda ejecutar automáticamente sus modelos sobre ella.
La memoria también decide qué acelerador puede ejecutar un modelo
Las comparaciones entre CPU, GPU, TPU y NPU suelen centrarse en la capacidad de cálculo, pero la IA generativa ha convertido la memoria en otro factor determinante.
Un modelo necesita que sus pesos y otros datos estén disponibles durante la ejecución.
En una GPU dedicada esto convierte la cantidad de VRAM en una especificación especialmente relevante. Un acelerador puede disponer de enorme capacidad matemática y, aun así, no ser adecuado para un modelo determinado si carece de memoria suficiente.
En grandes sistemas sucede algo similar.
Los aceleradores para centros de datos utilizan memorias de gran ancho de banda y enlaces específicos para comunicarse entre sí. Cuando un modelo se distribuye entre varios chips, la velocidad de esas conexiones puede afectar directamente al rendimiento.
Por eso comparar únicamente TOPS, TFLOPS o cualquier otra cifra máxima proporciona una visión parcial.
Para evaluar hardware de IA hay que considerar conjuntamente cálculo, memoria, ancho de banda, interconexión, consumo y software.
FPGA, ASIC, DPU y otras XPU que aparecen alrededor de la IA
CPU, GPU, TPU y NPU no son las únicas siglas presentes en la infraestructura moderna.
Los FPGA (Field-Programmable Gate Array) son circuitos cuya lógica puede reconfigurarse después de fabricarlos. Esa característica permite construir pipelines específicos para determinadas aplicaciones.
Pueden utilizarse para IA, pero también para telecomunicaciones, procesamiento de vídeo, redes, sistemas industriales y numerosas tareas donde interesa adaptar el hardware a una función concreta.
Los ASIC llevan la especialización todavía más lejos.
Se diseñan para realizar determinadas funciones y posteriormente no ofrecen la flexibilidad de un FPGA. A cambio, cuando el volumen y la carga justifican su desarrollo, pueden alcanzar relaciones muy interesantes entre rendimiento y consumo.
Numerosos aceleradores de IA son precisamente ASIC. Las TPU de Google pertenecen a esta categoría.
También aparecen las DPU (Data Processing Unit) e IPU orientadas a infraestructura.
Su función principal no consiste en ejecutar el modelo de IA, sino en descargar de la CPU operaciones relacionadas con redes, almacenamiento, seguridad y movimiento de información.
En grandes clústeres esto puede resultar relevante porque alimentar cientos o miles de aceleradores requiere también una infraestructura capaz de transportar enormes cantidades de datos.
Las principales XPU relacionadas con IA
| Procesador | ¿Calcula modelos de IA? | Función principal |
|---|---|---|
| CPU | Sí | Computación general |
| GPU | Sí | Paralelismo e IA |
| TPU | Sí | Machine learning especializado |
| NPU | Sí | IA eficiente y local |
| FPGA | Puede hacerlo | Aceleración configurable |
| ASIC de IA | Sí | IA altamente especializada |
| DPU/IPU | No como función principal | Red, almacenamiento e infraestructura |
Existe además el término XPU, pero debe utilizarse con cuidado.
No describe una arquitectura universal concreta. Suele emplearse como concepto paraguas para hablar de sistemas heterogéneos donde diferentes unidades de procesamiento trabajan conjuntamente.
También existen denominaciones como LPU (Language Processing Unit) asociadas a arquitecturas específicas para modelos de lenguaje. Son procesadores reales, pero LPU no tiene actualmente el mismo carácter general que CPU, GPU o NPU.
Añadir indiscriminadamente cualquier sigla terminada en PU a una comparación puede generar más confusión que claridad.
Qué procesador necesita realmente la inteligencia artificial
La respuesta depende primero de dónde se ejecuta el modelo.
Un usuario que utiliza ChatGPT, Gemini u otra plataforma de IA en la nube no necesita disponer en su ordenador de la GPU utilizada para ejecutar el modelo. El trabajo pesado se realiza en los servidores del proveedor.
La IA local cambia completamente la situación.
Un modelo pequeño puede ejecutarse sobre CPU. Una NPU puede resultar adecuada para cargas compatibles que necesiten bajo consumo. Para modelos generativos locales más grandes suele resultar especialmente útil una GPU con suficiente memoria.
El entrenamiento plantea requisitos todavía mayores.
Entrenar grandes modelos implica ejecutar cantidades enormes de operaciones durante largos periodos y mover información constantemente entre memoria y aceleradores. Ahí entran GPU, TPU y otros ASIC especializados desplegados en grandes clústeres.
| Uso | Hardware habitual |
|---|---|
| Chatbot ejecutado en la nube | El dispositivo local no realiza el cálculo principal |
| IA básica local | CPU |
| Funciones IA de portátil | NPU, GPU y CPU |
| LLM local | GPU o acelerador compatible |
| IA en smartphone | NPU/accelerador integrado |
| IA en edge | NPU, FPGA o ASIC |
| Entrenamiento de modelos | GPU, TPU u otros aceleradores |
| Grandes modelos fundacionales | Clústeres de aceleradores |
| Redes y almacenamiento del clúster | CPU + DPU/IPU según arquitectura |
La evolución del hardware de IA apunta así hacia sistemas donde varios procesadores cooperan en lugar de competir por hacer exactamente el mismo trabajo.
La CPU seguirá gestionando buena parte de la lógica general. La GPU continuará siendo un acelerador muy versátil. Las NPU asumirán más inferencia local cuando el software pueda aprovecharlas. TPU y otros ASIC buscarán eficiencia y escala en cargas específicas.
La pregunta que determinará qué hardware termina imponiéndose en cada escenario probablemente no será cuál tiene más TOPS, sino cuánto cuesta ejecutar un modelo, cuánta energía consume, qué memoria necesita y qué software puede aprovechar realmente el acelerador.
Preguntas frecuentes
¿Qué es mejor para IA, una GPU o una NPU?
Depende de la carga. Las GPU suelen ser más flexibles y adecuadas para modelos generativos exigentes, mientras que las NPU están especialmente orientadas a ejecutar determinadas operaciones de IA con menor consumo energético.
¿Una TPU es más rápida que una GPU?
No puede afirmarse de forma general. El rendimiento depende de la generación del hardware, el modelo, la precisión utilizada, el software, la memoria y la forma en que se distribuya la carga.
¿Hace falta una GPU para utilizar inteligencia artificial?
No necesariamente. Los servicios de IA en la nube ejecutan sus modelos en infraestructura remota y los modelos pequeños también pueden funcionar sobre CPU. Una GPU resulta especialmente útil cuando se quieren ejecutar localmente modelos más exigentes o entrenarlos.
¿Qué significa XPU en hardware de inteligencia artificial?
XPU suele utilizarse como término general para hablar de diferentes unidades de procesamiento dentro de sistemas heterogéneos. No corresponde a una única arquitectura estandarizada comparable directamente con CPU, GPU o NPU.











