Los mejores modelos de IA abiertos en 2026: tabla y comparativa

Los modelos de inteligencia artificial descargables ya cubren desde asistentes que funcionan en un portátil hasta sistemas de cientos de miles de millones de parámetros pensados para centros de datos. La oferta ha crecido tanto que el problema en 2026 no es encontrar un modelo, sino elegir uno que encaje con la tarea, el hardware, la licencia y el coste real de mantenerlo en producción.

Las claves de los modelos de IA abiertos en 30 segundos

  • Los modelos pequeños permiten crear asistentes privados y aplicaciones locales sin mantener grandes servidores.
  • Las familias de 20.000 a 40.000 millones de parámetros ofrecen un equilibrio interesante entre calidad, coste y capacidad para usar herramientas.
  • Los grandes modelos MoE compiten en programación y razonamiento, pero necesitan servidores con varias GPU o servicios externos.
  • Apache 2.0 y MIT ofrecen condiciones comerciales más sencillas que las licencias propias.
  • Publicar los pesos no convierte automáticamente un modelo en inteligencia artificial de código abierto.

La comparación debe tomarse como una fotografía del mercado a 15/07/2026. Las familias cambian con rapidez, las cuantizaciones reducen los requisitos de memoria y los resultados varían según el motor de inferencia, la longitud del contexto y la tarea evaluada. El modelo que lidera una prueba de programación puede no ser el más adecuado para redactar en español, extraer datos de facturas o responder sobre documentación interna.

Comparativa de los principales modelos abiertos y de pesos abiertos

La siguiente tabla reúne modelos cuyas fichas oficiales o repositorios estaban disponibles al preparar este artículo. El tamaño total no equivale siempre al cálculo utilizado en cada token: las arquitecturas de mezcla de expertos (MoE) activan solo una parte de sus parámetros durante la inferencia.

ModeloTamaño y arquitecturaContexto anunciadoLicenciaUso recomendadoInfraestructura orientativa
Phi-4-mini-instruct3.800 millones, denso128.000 tokensMITChat local, clasificación, RAG, lógica y aplicaciones con pocos recursosCPU potente, portátil moderno o GPU pequeña
OLMo 3 7B7.000 millones, densoContexto extendido según varianteAbierto con datos, código y artefactos publicadosInvestigación, docencia, auditoría y adaptaciónPortátil con memoria suficiente o GPU de consumo
Ministral 33B, 8B y 14BDepende de la varianteApache 2.0Asistentes locales, visión, dispositivos y automatización ligeraDesde edge hasta una GPU de consumo
Gemma 4E2B, E4B, 12B, 26B y 31BDepende de la varianteTérminos propios de GemmaAplicaciones locales, multimodalidad y razonamientoMóvil, portátil o estación de trabajo según tamaño
gpt-oss-20b21B totales, 3,6B activos, MoESegún configuración oficialApache 2.0Razonamiento, agentes, herramientas y despliegues locales avanzadosAlrededor de 16 GB con la cuantización oficial
Qwen3.6-35B-A3B35B totales, 3B activos, MoE y visión262.144 nativos; ampliable a 1.010.000Apache 2.0Programación, agentes, documentos, imágenes y tareas multilingüesEstación potente o servidor; varias GPU para contexto máximo
Llama 4 Scout109B totales, 17B activos, MoE multimodalHasta 10 millonesLicencia comunitaria de MetaRepositorios grandes, documentos extensos, visión y aplicaciones LlamaServidor de alta memoria o proveedor cloud
gpt-oss-120b117B totales, 5,1B activos, MoESegún configuración oficialApache 2.0Agentes, razonamiento general y servicios internos de mayor calidadUna GPU de 80 GB con MXFP4, según OpenAI
Mistral Large 3675B totales, 41B activos, MoE multimodalDepende del despliegueApache 2.0Aplicaciones empresariales, idiomas, visión y alto rendimientoNodo con ocho A100/H100 o sistemas Blackwell optimizados
DeepSeek-V3.2685B, MoEContexto largo con atención dispersaMITRazonamiento, programación y agentes con herramientasClúster de GPU o servicio de inferencia
GLM-5.2753B, MoEUn millón de tokensMITProgramación prolongada, investigación y agentes de larga duraciónClúster de GPU o API alojada

Microsoft presenta Phi-4-mini-instruct como un modelo de 3.800 millones de parámetros con 128.000 tokens de contexto, orientado a entornos con memoria limitada y escenarios sensibles a la latencia. Su licencia MIT simplifica el uso comercial, aunque su tamaño reduce la cantidad de conocimiento que puede conservar y obliga a acompañarlo de búsqueda o generación aumentada por recuperación (RAG) en tareas documentales.

En el siguiente nivel aparecen gpt-oss-20b y Qwen3.6-35B-A3B. OpenAI indica que gpt-oss-20b puede ejecutarse dentro de unos 16 GB gracias a su cuantización MXFP4, mientras que Qwen combina 35.000 millones de parámetros totales con unos 3.000 millones activos y añade procesamiento de imágenes. Su contexto nativo alcanza los 262.144 tokens, aunque utilizarlo completo incrementa mucho la memoria destinada a la caché de atención.

Mistral ofrece una separación clara entre sus modelos locales y su propuesta para centros de datos. Ministral 3 se distribuye en versiones de 3.000, 8.000 y 14.000 millones de parámetros, mientras que Mistral Large 3 utiliza 675.000 millones en total y activa 41.000 millones. La compañía sitúa su versión comprimida de mayor tamaño en nodos con ocho GPU A100 o H100, lejos de un despliegue doméstico.

DeepSeek-V3.2 y GLM-5.2 se encuentran también en esa categoría de infraestructura avanzada. El primero publica 685.000 millones de parámetros bajo MIT y está orientado al razonamiento y al uso de herramientas. GLM-5.2 eleva el tamaño hasta 753.000 millones y anuncia un contexto de un millón de tokens para tareas prolongadas. Estas cifras permiten ampliar el alcance del modelo, pero no convierten su alojamiento propio en una opción económica para cualquier empresa.

Llama 4 Scout ocupa una posición particular. Meta anuncia 109.000 millones de parámetros totales, 17.000 millones activos y una ventana máxima de diez millones de tokens. Utiliza una licencia comunitaria propia, no Apache 2.0 ni MIT, por lo que sus condiciones deben revisarse antes de integrarlo en un servicio comercial o redistribuir una versión modificada.

Qué modelo elegir según el hardware y la tarea

El tamaño máximo que un ordenador puede cargar no siempre es el tamaño que debería utilizar. Un modelo que ocupa toda la memoria disponible deja menos espacio para el contexto, las peticiones simultáneas y otros procesos. También puede responder tan despacio que una demostración aceptable se convierta en un producto frustrante.

EscenarioModelos que conviene evaluarVentaja principalRiesgo o limitación
Ordenador sin GPU dedicadaPhi-4-mini, OLMo 3 7B cuantizado, Ministral 3 3BBajo coste y privacidad localMenor conocimiento y razonamiento limitado
Portátil con memoria unificadaGemma 4 pequeña, Ministral 3 8B, OLMo 3 7BFácil instalación y uso sin nubeVelocidad variable y contexto limitado por la memoria
GPU de 16 GBgpt-oss-20b MXFP4, modelos de 7B a 14B cuantizadosBuen equilibrio para agentes localesLa caché de contexto puede agotar la memoria
GPU de 24 a 48 GBQwen3.6 cuantizado, Gemma 4 26B/31B, modelos especializados de códigoMás calidad y multimodalidadMenor concurrencia que en un servidor
GPU de 80 GBgpt-oss-120b, modelos medianos en mayor precisiónInferencia empresarial en un solo aceleradorCoste del hardware y consumo eléctrico
Servidor con varias GPUMistral Large 3, DeepSeek-V3.2, GLM-5.2, Llama 4Más capacidad para agentes complejosOperación, refrigeración y paralelización
Uso ocasional o imprevisibleAPI de modelos abiertos alojadosSin inversión inicial en GPUDependencia del proveedor y coste por token

Para un asistente que consulta documentación interna, un modelo de 7B a 20B con un buen sistema RAG puede ser suficiente. El sistema recupera los párrafos relevantes y evita exigir al modelo que memorice todo el conocimiento de la empresa.

En programación conviene probar el modelo sobre incidencias reales del repositorio. Qwen3.6 está diseñado con especial atención al código y a los flujos con herramientas, mientras que gpt-oss incorpora razonamiento configurable y llamadas a funciones. Los modelos de mayor tamaño pueden resolver tareas más largas, pero también consumen más contexto al inspeccionar archivos, ejecutar pruebas y corregir intentos fallidos.

Para documentos, imágenes y reconocimiento óptico de caracteres resulta más razonable comenzar por una familia multimodal como Qwen, Gemma, Mistral o Llama. Un modelo exclusivamente textual necesita un sistema externo que convierta antes la imagen en texto, lo que añade otra etapa y posibles errores.

En investigación reproducible, OLMo 3 mantiene una ventaja distinta: Ai2 publica el flujo completo del modelo, incluidos conjuntos de datos, herramientas de preparación, código de entrenamiento y variantes de 7B y 32B. No necesariamente encabezará todas las pruebas, pero permite estudiar cómo se obtuvo el resultado y repetir partes del proceso.

Licencia, coste y privacidad: la comparación que suele olvidarse

La etiqueta «open source» no debería utilizarse como sinónimo de «se puede descargar». La Open Source Initiative considera que un sistema de IA abierto debe permitir usarlo, estudiarlo, modificarlo y compartirlo. También reclama información suficiente sobre los datos, el código de entrenamiento y los parámetros para crear un sistema sustancialmente equivalente. Bajo este criterio, muchos productos populares son modelos de pesos abiertos, no sistemas completamente abiertos.

Tipo de licenciaModelos de la comparativaLectura práctica
Apache 2.0gpt-oss, Qwen3.6, Mistral 3Permisiva, permite uso comercial y contiene una concesión expresa de patentes
MITPhi-4-mini, DeepSeek-V3.2, GLM-5.2Muy permisiva y sencilla, con obligación principal de conservar el aviso
Licencia propiaLlama 4, Gemma 4Puede permitir uso comercial, pero incorpora condiciones que deben revisarse
Flujo completamente abiertoOLMo 3Añade datos, código, artefactos y proceso de entrenamiento a los pesos

El ahorro tampoco debe calcularse comparando únicamente el precio por millón de tokens. Un despliegue propio necesita comprar o alquilar GPU, almacenar los modelos, actualizar controladores, vigilar la seguridad y mantener el servicio disponible. Cuando la demanda es baja o irregular, una API puede resultar más barata que un acelerador encendido durante todo el día.

El alojamiento propio gana atractivo cuando existe una carga estable, datos que no deben salir de la organización o necesidad de adaptar el modelo. Aun así, ejecutar los pesos dentro de la empresa no garantiza por sí solo la privacidad: la aplicación, las extensiones, el motor de inferencia y las herramientas de observabilidad pueden enviar telemetría o registros a terceros.

La cuantización añade otra variable. Reducir los pesos a cuatro u ocho bits permite cargar modelos mayores en el mismo equipo, pero puede alterar la precisión, especialmente en cálculos, programación y salidas estructuradas. Una cuantización debe evaluarse como una versión diferente, no como una copia idéntica que simplemente ocupa menos.

La mejor elección suele surgir de una prueba breve con varios candidatos. El equipo debería medir calidad, latencia, consumo de memoria, tokens por segundo, coste por consulta, cumplimiento de formatos y frecuencia de errores. El modelo más grande solo merece la inversión cuando esa diferencia aparece en el trabajo real.

Preguntas frecuentes

¿Cuál es el mejor modelo abierto para empezar en local?

Phi-4-mini, OLMo 3 7B y las versiones pequeñas de Ministral 3 son opciones razonables para equipos modestos. En una GPU de 16 GB también puede probarse gpt-oss-20b con su cuantización oficial.

¿Qué modelo resulta más interesante para programación?

Qwen3.6-35B-A3B, gpt-oss y los grandes modelos DeepSeek o GLM merecen una evaluación. La elección depende del tamaño del repositorio, las herramientas utilizadas y el hardware disponible.

¿Un modelo con un millón de tokens entiende todo el contexto?

No necesariamente. La ventana indica cuánto contenido puede aceptar, pero la precisión puede disminuir en documentos largos. Además, la memoria y el tiempo de procesamiento aumentan con el contexto.

¿Es siempre más barato alojar un modelo propio?

No. Puede resultar rentable con uso constante y requisitos de privacidad, pero una API suele ser más económica para cargas pequeñas, variables o experimentales.

Scroll al inicio