Qué GPU comprar para ejecutar LLMs en local en 2026: VRAM, precio y velocidad real

Comprar una GPU para ejecutar modelos de lenguaje en local en 2026 no consiste simplemente en buscar la tarjeta con más potencia gráfica. Para inferencia de LLM, la cantidad de memoria disponible y su ancho de banda suelen determinar qué modelos caben y a qué velocidad pueden generar tokens. Además, los precios han cambiado tanto durante 2026 que algunas referencias habituales de la RTX 5090 ya se han quedado desfasadas.

Las claves de las GPU para LLMs en local en 20 segundos

  • La RTX 3090 usada sigue destacando por sus 24 GB de VRAM y precios cercanos a 580 € en el mercado de segunda mano.
  • La RTX 5090 ofrece 32 GB, pero su precio europeo se ha disparado y ya no puede considerarse automáticamente una ganga para IA local.
  • Dos RTX 3090 permiten llegar a 48 GB y ejecutar modelos de 70B en Q4 con unos 18-22 tokens/s según pruebas publicadas.
  • La RTX PRO 5000 Blackwell tiene 48 GB y puede ejecutar un 70B en Q4, pero pertenece a otra categoría de precio.
  • Apple ofrece hasta 512 GB de memoria unificada en el M3 Ultra, aunque con mucha menos velocidad de generación que una GPU NVIDIA para modelos pequeños.

La regla de mirar €/GB de memoria tiene sentido, pero se queda corta si se utiliza como único criterio. En inferencia local hay que distinguir entre la capacidad necesaria para cargar los pesos, el ancho de banda de memoria y la posibilidad de mantener todo el modelo dentro de la memoria de la GPU.

También conviene separar los benchmarks. Un resultado de llama.cpp con Llama 3.1 8B Q4_K_M no puede compararse directamente con otro obtenido con otro modelo, otra longitud de contexto o un backend diferente. Incluso en la misma tarjeta aparecen diferencias importantes: pruebas públicas sitúan una RTX 3090 entre unos 92 y más de 130 tokens/s con Llama 3.1 8B Q4_K_M dependiendo de la configuración y el contexto.

Por eso esta guía utiliza los tokens por segundo como referencia orientativa y pone por delante una pregunta más básica: qué modelo se quiere ejecutar y cuánta memoria necesita realmente.

RTX 3090: el mercado de segunda mano sigue teniendo sentido

La GeForce RTX 3090 es una pieza atípica en 2026. Tiene 24 GB de GDDR6X y un ancho de banda de 936 GB/s, cifras que siguen siendo útiles para inferencia local pese a que la tarjeta pertenece a la generación Ampere.

Su ventaja está en el mercado de segunda mano. Se encuentran unidades alrededor de los 580 € en anuncios europeos, aunque el precio cambia mucho según fabricante, estado, garantía y procedencia. En España también aparecen unidades en ese entorno, aunque otras pueden superar ampliamente esa cifra.

En Llama 3.1 8B Q4_K_M, las pruebas publicadas ofrecen una horquilla amplia. Kunal Ganglani registra 92 tokens/s en llama.cpp, mientras que FitMyLLM obtiene 132,7 tokens/s a 4K y 107,6 tokens/s a 16K. Esa diferencia demuestra por qué conviene evitar una cifra única como si fuese universal.

La 3090 también tiene una ventaja decisiva frente a tarjetas nuevas con menos VRAM: sus 24 GB permiten cargar modelos más grandes con menos compromisos.

Valoración: sigue siendo una de las opciones más interesantes para quien quiera montar un PC de IA local con presupuesto contenido, especialmente si encuentra una unidad usada en buen estado.

El problema de las dos RTX 3090

Aquí aparece una de las configuraciones más interesantes para usuarios avanzados: 2 × RTX 3090 = 48 GB de VRAM.

Con dos tarjetas se puede ejecutar Llama 3.1 70B en Q4_K_M. Las pruebas publicadas sitúan el rendimiento alrededor de 18-22 tokens/s, aunque otras mediciones ofrecen una horquilla de 21-30 tokens/s dependiendo de cómo se reparta el modelo y del software utilizado.

La cifra de 48 GB tampoco significa que el sistema disponga de una única memoria de 48 GB. Cada GPU conserva sus 24 GB y el modelo debe distribuirse entre ambas. Esto introduce trabajo adicional y hace que la configuración del sistema, PCIe, backend y método de reparto importen.

Aun así, para un usuario que quiere ejecutar modelos de unos 70.000 millones de parámetros en Q4 sin comprar una tarjeta profesional, dos 3090 siguen siendo una alternativa difícil de ignorar.

RTX 4060 Ti 16 GB: barata, pero no confundir precio con velocidad

La RTX 4060 Ti de 16 GB puede resultar atractiva por precio, pero tiene una limitación que importa mucho en LLM: su ancho de banda de memoria es de 288 GB/s.

Las mediciones públicas de Llama 3.1 8B Q4_K_M rondan los 48-50 tokens/s en algunos sistemas, muy lejos de los 80-90 tokens/s que puede ofrecer una 3090 en determinadas configuraciones.

Con un precio cercano a 480 € en determinados mercados, ofrece unos 30 €/GB si se toma esa referencia. Es una tarjeta razonable para modelos pequeños y medianos, pero no debería presentarse como una alternativa directa a la 3090 solo porque ambas sean relativamente asequibles.

Para inferencia de LLM, los 16 GB también empiezan a limitar rápidamente el tamaño de los modelos. Un modelo de 30B puede exigir ya una cuantización ajustada y una gestión cuidadosa de la memoria.

Valoración: buena puerta de entrada si se quiere comprar nuevo y el presupuesto no permite más, pero la relación capacidad/rendimiento de la 3090 usada es más interesante para IA local.

RTX 4090: mucha velocidad, pero los 24 GB siguen ahí

La RTX 4090 mejora de forma considerable el ancho de banda frente a la 3090 y llega a 1.008 GB/s. Sin embargo, conserva los mismos 24 GB de VRAM.

En Llama 3.1 8B Q4_K_M se han registrado desde aproximadamente 113 hasta 145 tokens/s en distintas pruebas, con resultados superiores en algunas ejecuciones de llama.cpp.

Eso significa que la 4090 compra principalmente velocidad, no una categoría superior de capacidad de modelo.

Para alguien que trabaja casi siempre con modelos de 7B, 8B, 14B o determinados 20B/30B cuantizados, esa velocidad puede tener sentido. Para quien necesita ejecutar un modelo que requiere más de 24 GB, la situación cambia: habrá que recurrir a otra cuantización, offload o varias GPU.

Valoración: excelente tarjeta para velocidad de inferencia dentro de 24 GB, pero difícil de justificar si el objetivo principal es maximizar los modelos que caben en memoria.

RTX 5090: 32 GB y mucha velocidad, pero el precio cambia la ecuación

La RTX 5090 tiene 32 GB de GDDR7 y un ancho de banda de 1.792 GB/s. NVIDIA confirma oficialmente esa configuración de memoria.

En Llama 3.1 8B Q4_K_M, una prueba de llama.cpp publicada en 2026 registra 215 tokens/s a 4K de contexto, aunque la propia fuente la clasifica como resultado comunitario no verificado. Otra recopilación sitúa las mediciones independientes alrededor de 185-213 tokens/s.

Aquí hay que corregir una de las ideas más habituales de la comparativa original: 2.400 € ya no es una referencia segura para comprar una RTX 5090 en Europa en septiembre de 2026.

Un seguimiento de precios alemán situaba la RTX 5090 en torno a 5.000 € el 8 de septiembre de 2026, frente a 3.400 € en enero y 2.400 € en junio de 2025. Los precios concretos dependen del mercado y del modelo, pero la tendencia deja claro que no conviene calcular su relación €/GB utilizando automáticamente 2.400 €.

Con 32 GB, la 5090 sí ofrece una capacidad superior a 24 GB y permite ejecutar determinados modelos de 30B con más margen. Pero el salto de precio hace que la relación entre coste y capacidad sea mucho peor que la de una 3090 usada.

Valoración: la elección para quien prioriza velocidad y puede asumir el precio, no necesariamente la mejor compra por euro para montar un servidor doméstico de LLM.

48 GB: hay que distinguir la RTX PRO 5000 de la RTX PRO 6000

Aquí existe un error importante en muchas comparativas.

La RTX PRO 5000 Blackwell sí existe con 48 GB de GDDR7 y 1.344 GB/s de ancho de banda. NVIDIA la posiciona explícitamente para inferencia de LLM y cargas profesionales de IA.

La RTX PRO 6000 Blackwell, en cambio, tiene 96 GB, no 48 GB, además de 1.792 GB/s de ancho de banda.

Por tanto, una lista que incluya una “RTX 6000 Blackwell 48GB” está mezclando dos productos distintos.

La RTX PRO 5000 de 48 GB puede ejecutar Llama 3.3 70B en Q4 dentro de la VRAM, según pruebas de Hardware Corner. Ese mismo laboratorio registra 22,4 tokens/s a 16K de contexto para ese modelo. Otra medición publicada para Llama 3.1 70B Q4_K_M sitúa la tarjeta en torno a 18 tokens/s.

Su problema es el precio. Una referencia europea de una workstation con RTX PRO 5000 Blackwell 48 GB aparece por encima de 5.000 €, mientras que una tarjeta profesional independiente puede superar esa cifra dependiendo del vendedor.

RTX PRO 6000: la opción de 96 GB

Si se quiere ejecutar un 70B en una sola GPU con mucho margen para contexto, la RTX PRO 6000 Blackwell juega en otra liga.

Sus 96 GB permiten cargar Llama 3.1 70B Q4_K_M sin depender de una segunda tarjeta. Una medición publicada registra 30,5 tokens/s para ese modelo en llama.cpp.

No obstante, es una GPU profesional y su precio hace que deje de ser una comparación directa con las GeForce. Su sentido aparece cuando una sola tarjeta, la memoria ECC y la capacidad de 96 GB tienen más valor que el coste por GB.

Mac Studio M3 Ultra: la memoria gana, el ancho de banda manda

El Mac Studio M3 Ultra merece una categoría aparte porque sus 512 GB de memoria unificada cambian completamente el límite de tamaño de los modelos.

Apple ofrecía configuraciones M3 Ultra con hasta 512 GB de memoria unificada.

Eso permite cargar modelos que quedarían completamente fuera del alcance de una GPU GeForce de 24, 32 o incluso 48 GB. Pero tener mucha memoria no significa generar tokens a la velocidad de una RTX 5090.

En pruebas publicadas, un M3 Ultra con 512 GB alcanza alrededor de 9-10 tokens/s con Llama 3.1/3.3 70B en Q4, mientras que otra medición con MLX registra 16,8 tokens/s para Llama 3.3 70B 4-bit en un M3 Ultra de 96 GB. Las diferencias vuelven a demostrar la importancia del backend, la versión del software, el contexto y la configuración.

El M3 Ultra tiene, por tanto, una ventaja muy concreta: capacidad de memoria. Es especialmente interesante para investigadores, desarrolladores y usuarios que necesitan cargar modelos enormes que no caben en una GPU convencional.

Además, hay una actualización importante para quien compre ahora. Apple presentó en septiembre de 2026 nuevos Mac Studio con M5 Ultra, y la configuración de 512 GB estaba prevista para finales de octubre. Por tanto, el M3 Ultra de 512 GB ya no debería presentarse como la única opción de Mac Studio con tanta memoria.

La tabla que realmente importa

HardwareVRAM / memoriaReferencia de rendimientoMejor uso
RTX 3090 usada24 GB~90-130+ t/s en 8B Q4Mejor relación coste/capacidad
RTX 4060 Ti16 GB~48-50 t/s en 8B Q4Presupuesto ajustado, compra nueva
RTX 409024 GB~113-145 t/s en 8B Q4Máxima velocidad en 24 GB
RTX 509032 GB~185-215 t/s en 8B Q4Velocidad y modelos algo mayores
2 × RTX 309048 GB~18-30 t/s en 70B Q470B económico
RTX PRO 5000 Blackwell48 GB~18-22 t/s en 70B Q470B en una GPU profesional
RTX PRO 6000 Blackwell96 GB~30 t/s en 70B Q470B con mucho margen
Mac Studio M3 Ultrahasta 512 GB~10-17 t/s en 70B Q4Modelos enormes por memoria

Las cifras de la tabla no constituyen un benchmark común. Proceden de pruebas diferentes y deben interpretarse como órdenes de magnitud, no como una clasificación científica entre tarjetas.

También hay una razón para no ordenar las GPU únicamente por tokens/s. Un modelo que no cabe en VRAM puede obligar a hacer offload hacia RAM o CPU y sufrir una caída de rendimiento mucho mayor que la diferencia entre dos tarjetas que sí lo cargan completamente.

Entonces, ¿qué comprar?

Para un usuario doméstico que quiere empezar con LLM locales y encuentra una RTX 3090 usada alrededor de 580 €, la 3090 sigue siendo probablemente la opción más equilibrada. Sus 24 GB y 936 GB/s permiten ejecutar modelos que quedan fuera de muchas tarjetas nuevas de precio similar.

Para un usuario que quiere 70B Q4 gastando lo mínimo posible, dos RTX 3090 forman una configuración muy atractiva si la placa base, fuente, refrigeración y espacio permiten instalar ambas.

Para quien quiere velocidad con una sola GPU, la RTX 5090 es mucho más rápida, pero su precio real de 2026 cambia por completo la relación €/GB.

Para quien necesita 48 GB en una sola tarjeta, la RTX PRO 5000 Blackwell es la referencia correcta, no una supuesta RTX 6000 de 48 GB.

Y para quien necesita 96 GB o más de memoria en una única GPU, la RTX PRO 6000 Blackwell entra en juego, mientras que los Mac Studio con memoria unificada ofrecen una alternativa distinta cuando el tamaño del modelo importa más que la velocidad de generación.

La mejor compra, por tanto, no empieza preguntando cuántos tokens por segundo anuncia una GPU. Empieza por el modelo que se quiere ejecutar, la cuantización elegida, el contexto necesario y si todo puede permanecer en la memoria rápida disponible.

Preguntas frecuentes

¿Cuánta VRAM hace falta para ejecutar un LLM en local?

Depende del número de parámetros, la cuantización y el contexto. Como referencia, un 70B en Q4_K_M necesita alrededor de 42-48 GB para sus pesos y el sistema necesita memoria adicional para la caché y el runtime.

¿Sigue mereciendo la pena una RTX 3090 para IA en 2026?

Sí, especialmente en el mercado de segunda mano. Sus 24 GB y 936 GB/s de ancho de banda siguen siendo una combinación competitiva para inferencia local.

¿Qué es mejor para un 70B: una RTX PRO 5000 o dos RTX 3090?

Las dos RTX 3090 ofrecen 48 GB combinados por menos dinero en determinadas configuraciones, pero requieren repartir el modelo entre dos GPU. La RTX PRO 5000 ofrece 48 GB en una sola tarjeta y puede ejecutar un 70B Q4 completamente en VRAM.

¿La RTX 6000 Blackwell tiene 48 GB?

No. La RTX PRO 6000 Blackwell tiene 96 GB de GDDR7. La RTX PRO 5000 Blackwell es la que dispone de una configuración de 48 GB, aunque también existe una variante de 72 GB.

Scroll al inicio