AMD ha adquirido Taalas, una compañía especializada en aceleradores de inteligencia artificial que propone una forma muy distinta de ejecutar modelos: incorporar sus pesos directamente en el silicio. Su primer chip de demostración, HC1, ha alcanzado alrededor de 16.960 tokens por segundo con Llama 3.1 8B, según las pruebas publicadas por la empresa. Más que el récord de velocidad, la operación interesa porque plantea una alternativa al modelo basado en GPU y memoria HBM que domina actualmente los centros de datos de IA.
Las claves de AMD y Taalas en 30 segundos
- AMD anunció la compra de Taalas el 6 de agosto de 2026 y no hizo público el importe.
- HC1, fabricado en 6 nm por TSMC, está especializado en ejecutar Llama 3.1 8B y alcanza cerca de 16.960 tokens por segundo, según Taalas.
- Su arquitectura incorpora los pesos del modelo al silicio, reduciendo la dependencia de memoria externa.
- El rendimiento tiene una contrapartida: cambiar sustancialmente de modelo puede exigir fabricar otro chip.
- AMD prevé combinar esta tecnología con sus aceleradores Instinct, no sustituirlos.
La operación encaja además con una transformación más amplia del mercado de inferencia. NVIDIA y AMD continúan aumentando la capacidad y el ancho de banda de la memoria de sus GPU, mientras compañías como Cerebras, Groq y Taalas buscan arquitecturas más especializadas para evitar algunos de los límites del modelo convencional.
En el caso de Taalas, la solución lleva esa especialización particularmente lejos: convertir parte del propio modelo en hardware.
Taalas cambia memoria por silicio
El movimiento de datos es uno de los principales condicionantes de la inferencia de los grandes modelos de lenguaje. Durante la generación de tokens, el acelerador necesita acceder repetidamente a los pesos del modelo.
Las GPU intentan resolver esta necesidad mediante memorias HBM (High Bandwidth Memory) cada vez más rápidas. Taalas propone eliminar buena parte de esos accesos.
Su tecnología incorpora los pesos en una estructura que denomina mask-ROM recall fabric. De esta manera, la información necesaria para ejecutar el modelo queda físicamente integrada en el acelerador.
La SRAM continúa utilizándose para información que necesita modificarse durante la ejecución, como la caché KV y determinados adaptadores.
El resultado presentado por Taalas con HC1 resulta llamativo precisamente porque se ha conseguido con un chip fabricado mediante el proceso de 6 nanómetros de TSMC, sin recurrir a uno de los nodos más avanzados actualmente disponibles.
HC1 está diseñado específicamente para Llama 3.1 8B, presentado por Meta en 2024. Taalas ha mostrado velocidades próximas a los 17.000 tokens por segundo por usuario.
Las comparaciones con otras plataformas deben tomarse con cautela porque los tokens por segundo dependen de factores como la longitud del contexto, precisión numérica, tamaño de lote, concurrencia y configuración del servidor. Aun así, sirven para visualizar hasta qué punto cambia el rendimiento cuando se elimina buena parte del tráfico de memoria.
Taalas frente a NVIDIA, AMD, Cerebras y Groq
No existe una comparación completamente equivalente entre estas arquitecturas. NVIDIA y AMD ofrecen aceleradores programables para numerosos modelos y cargas, mientras que HC1 está construido alrededor de un modelo concreto. Cerebras y Groq utilizan a su vez arquitecturas especializadas diferentes.
| Plataforma | Enfoque | Memoria/modelo | Flexibilidad | Principal ventaja |
|---|---|---|---|---|
| Taalas HC1 | ASIC específico para inferencia | Pesos incorporados al silicio | Muy baja frente a GPU | Velocidad y reducción del movimiento de datos |
| NVIDIA Blackwell | GPU de propósito amplio para IA | HBM externa de gran ancho de banda | Muy alta | Amplio ecosistema CUDA y múltiples cargas |
| AMD Instinct | GPU/acelerador para IA y HPC | HBM de gran ancho de banda | Muy alta | IA, HPC y modelos diversos |
| Cerebras WSE | Procesador wafer-scale | Gran memoria integrada + memoria externa según sistema | Alta dentro de su plataforma | Baja latencia y elevada velocidad de inferencia |
| Groq LPU | Arquitectura especializada en inferencia | Arquitectura determinista orientada al flujo de datos | Alta entre modelos compatibles | Generación de tokens con baja latencia |
Por eso afirmar simplemente que HC1 es «48 veces más rápido que NVIDIA» puede inducir a error.
Taalas ha realizado esa comparación bajo unas condiciones concretas, pero una GPU NVIDIA puede cargarse con modelos diferentes sin modificar físicamente el procesador. HC1 obtiene parte de su ventaja precisamente renunciando a esa característica.
Cerebras constituye una referencia más interesante desde el punto de vista de la velocidad de generación. La compañía anunció en 2024 más de 1.800 tokens por segundo con Llama 3.1 8B, y posteriormente ha mostrado cifras superiores en su servicio de inferencia.
Frente a esos resultados, los aproximadamente 16.960 tokens/s comunicados por Taalas muestran la magnitud potencial de su arquitectura, pero siguen sin constituir una comparación directa entre sistemas equivalentes.
El problema aparece cuando llega un modelo nuevo
La arquitectura de Taalas traslada parte de un problema tradicionalmente resuelto mediante software al proceso de fabricación.
En una GPU convencional, sustituir Llama por Qwen, DeepSeek u otro modelo consiste esencialmente en cargar pesos y software diferentes, siempre que existan memoria y compatibilidad suficientes.
En Taalas la situación cambia.
La compañía puede mantener elementos modificables mediante SRAM y soportar adaptaciones como LoRA, pero una modificación suficientemente profunda del modelo requiere modificar el hardware.
Taalas sostiene que su proceso permite adaptar diseños modificando únicamente determinadas capas metálicas, lo que podría reducir el tiempo y coste frente al desarrollo completo de un nuevo ASIC. Pero continúa existiendo una diferencia fundamental respecto a cargar otro archivo de pesos en una GPU.
Eso convierte la longevidad del modelo en una variable económica.
Un acelerador de NVIDIA o AMD comprado hoy puede utilizarse con sucesivas generaciones de modelos. Un procesador extremadamente especializado tendrá más sentido cuando existe suficiente certeza de que una carga permanecerá estable durante un periodo prolongado.
Fraude financiero, clasificación documental, recomendación, procesamiento industrial, visión artificial o determinados modelos internos podrían encajar mejor en este planteamiento que servicios que cambian de LLM cada pocos meses.
AMD puede combinar GPU y aceleradores especializados
La adquisición tampoco significa que AMD esté abandonando su familia Instinct.
La propia compañía ha explicado que pretende combinar la tecnología adquirida con AMD Instinct para desarrollar soluciones de inferencia a nivel de sistema.
Esa frase probablemente sea una de las partes más relevantes del anuncio.
La inferencia de un modelo generativo puede dividirse principalmente entre prefill, cuando se procesa el contexto inicial, y decode, cuando se van generando los tokens posteriores. Ambas fases tienen perfiles computacionales y de memoria diferentes.
La industria está estudiando precisamente arquitecturas desagregadas en las que distintos recursos se encarguen de cada etapa.
Una infraestructura podría utilizar GPU programables para las cargas variables y aceleradores mucho más especializados allí donde exista un volumen elevado y predecible de inferencia.
Taalas afirma además que su siguiente generación podrá almacenar alrededor de 20.000 millones de parámetros por chip. Si alcanza ese objetivo, la densidad necesaria para servir modelos muy grandes podría cambiar considerablemente, aunque extrapolar directamente esa capacidad a un número determinado de chips no permite comparar un sistema completo con un clúster GPU: intervienen interconexión, caché KV, contexto, redundancia, concurrencia y rendimiento requerido.
La cuestión pasa entonces de cuántos aceleradores necesita un modelo a qué acelerador merece utilizar cada parte del modelo.
Y ahí AMD tiene una posición interesante. Instinct proporciona el componente programable; Taalas puede aportar hardware extremadamente especializado para aquellas cargas cuya estabilidad permita justificar fabricar el modelo en silicio.
El planteamiento también expone su principal riesgo.
El sector de la IA cambia con enorme rapidez. Un modelo considerado competitivo cuando comienza el diseño de un chip puede haber sido superado cuando ese hardware llega a producción.
Por eso los casi 17.000 tokens por segundo son posiblemente la parte menos importante de la compra. Taalas plantea una pregunta mucho más incómoda para quienes están diseñando infraestructura de inferencia: cuánto vale la flexibilidad de cambiar de modelo.
Hasta ahora esa flexibilidad se daba prácticamente por descontada. Si la inferencia alcanza el volumen que espera la industria, algunas empresas podrían descubrir que para determinadas cargas resulta más rentable renunciar a ella.
Preguntas frecuentes
¿Qué es Taalas?
Taalas es una empresa dedicada al desarrollo de aceleradores especializados para inteligencia artificial. AMD anunció su adquisición el 6 de agosto de 2026 sin revelar el importe de la operación.
¿Cuántos tokens por segundo alcanza Taalas HC1?
La compañía ha mostrado aproximadamente 16.960 tokens por segundo ejecutando Llama 3.1 8B. La cifra debe entenderse dentro de las condiciones específicas de su demostración y no como una comparación universal frente a cualquier GPU.
¿Taalas es más rápido que NVIDIA?
Taalas ha publicado comparaciones en las que HC1 obtiene ventajas muy grandes frente a determinadas configuraciones NVIDIA, pero son arquitecturas diferentes. Una GPU NVIDIA es reprogramable para numerosos modelos, mientras HC1 obtiene parte de su rendimiento al estar construido específicamente alrededor de uno.
¿AMD utilizará Taalas para sustituir las GPU Instinct?
AMD no ha anunciado esa sustitución. Su planteamiento consiste en combinar la tecnología de Taalas con AMD Instinct dentro de futuras soluciones de inferencia.











