Los modelos de inteligencia artificial descargables ya cubren desde asistentes que funcionan en un portátil hasta sistemas de cientos de miles de millones de parámetros pensados para centros de datos. La oferta ha crecido tanto que el problema en 2026 no es encontrar un modelo, sino elegir uno que encaje con la tarea, el hardware, la licencia y el coste real de mantenerlo en producción.
Las claves de los modelos de IA abiertos en 30 segundos
- Los modelos pequeños permiten crear asistentes privados y aplicaciones locales sin mantener grandes servidores.
- Las familias de 20.000 a 40.000 millones de parámetros ofrecen un equilibrio interesante entre calidad, coste y capacidad para usar herramientas.
- Los grandes modelos MoE compiten en programación y razonamiento, pero necesitan servidores con varias GPU o servicios externos.
- Apache 2.0 y MIT ofrecen condiciones comerciales más sencillas que las licencias propias.
- Publicar los pesos no convierte automáticamente un modelo en inteligencia artificial de código abierto.
La comparación debe tomarse como una fotografía del mercado a 15/07/2026. Las familias cambian con rapidez, las cuantizaciones reducen los requisitos de memoria y los resultados varían según el motor de inferencia, la longitud del contexto y la tarea evaluada. El modelo que lidera una prueba de programación puede no ser el más adecuado para redactar en español, extraer datos de facturas o responder sobre documentación interna.
Comparativa de los principales modelos abiertos y de pesos abiertos
La siguiente tabla reúne modelos cuyas fichas oficiales o repositorios estaban disponibles al preparar este artículo. El tamaño total no equivale siempre al cálculo utilizado en cada token: las arquitecturas de mezcla de expertos (MoE) activan solo una parte de sus parámetros durante la inferencia.
| Modelo | Tamaño y arquitectura | Contexto anunciado | Licencia | Uso recomendado | Infraestructura orientativa |
|---|---|---|---|---|---|
| Phi-4-mini-instruct | 3.800 millones, denso | 128.000 tokens | MIT | Chat local, clasificación, RAG, lógica y aplicaciones con pocos recursos | CPU potente, portátil moderno o GPU pequeña |
| OLMo 3 7B | 7.000 millones, denso | Contexto extendido según variante | Abierto con datos, código y artefactos publicados | Investigación, docencia, auditoría y adaptación | Portátil con memoria suficiente o GPU de consumo |
| Ministral 3 | 3B, 8B y 14B | Depende de la variante | Apache 2.0 | Asistentes locales, visión, dispositivos y automatización ligera | Desde edge hasta una GPU de consumo |
| Gemma 4 | E2B, E4B, 12B, 26B y 31B | Depende de la variante | Términos propios de Gemma | Aplicaciones locales, multimodalidad y razonamiento | Móvil, portátil o estación de trabajo según tamaño |
| gpt-oss-20b | 21B totales, 3,6B activos, MoE | Según configuración oficial | Apache 2.0 | Razonamiento, agentes, herramientas y despliegues locales avanzados | Alrededor de 16 GB con la cuantización oficial |
| Qwen3.6-35B-A3B | 35B totales, 3B activos, MoE y visión | 262.144 nativos; ampliable a 1.010.000 | Apache 2.0 | Programación, agentes, documentos, imágenes y tareas multilingües | Estación potente o servidor; varias GPU para contexto máximo |
| Llama 4 Scout | 109B totales, 17B activos, MoE multimodal | Hasta 10 millones | Licencia comunitaria de Meta | Repositorios grandes, documentos extensos, visión y aplicaciones Llama | Servidor de alta memoria o proveedor cloud |
| gpt-oss-120b | 117B totales, 5,1B activos, MoE | Según configuración oficial | Apache 2.0 | Agentes, razonamiento general y servicios internos de mayor calidad | Una GPU de 80 GB con MXFP4, según OpenAI |
| Mistral Large 3 | 675B totales, 41B activos, MoE multimodal | Depende del despliegue | Apache 2.0 | Aplicaciones empresariales, idiomas, visión y alto rendimiento | Nodo con ocho A100/H100 o sistemas Blackwell optimizados |
| DeepSeek-V3.2 | 685B, MoE | Contexto largo con atención dispersa | MIT | Razonamiento, programación y agentes con herramientas | Clúster de GPU o servicio de inferencia |
| GLM-5.2 | 753B, MoE | Un millón de tokens | MIT | Programación prolongada, investigación y agentes de larga duración | Clúster de GPU o API alojada |
Microsoft presenta Phi-4-mini-instruct como un modelo de 3.800 millones de parámetros con 128.000 tokens de contexto, orientado a entornos con memoria limitada y escenarios sensibles a la latencia. Su licencia MIT simplifica el uso comercial, aunque su tamaño reduce la cantidad de conocimiento que puede conservar y obliga a acompañarlo de búsqueda o generación aumentada por recuperación (RAG) en tareas documentales.
En el siguiente nivel aparecen gpt-oss-20b y Qwen3.6-35B-A3B. OpenAI indica que gpt-oss-20b puede ejecutarse dentro de unos 16 GB gracias a su cuantización MXFP4, mientras que Qwen combina 35.000 millones de parámetros totales con unos 3.000 millones activos y añade procesamiento de imágenes. Su contexto nativo alcanza los 262.144 tokens, aunque utilizarlo completo incrementa mucho la memoria destinada a la caché de atención.
Mistral ofrece una separación clara entre sus modelos locales y su propuesta para centros de datos. Ministral 3 se distribuye en versiones de 3.000, 8.000 y 14.000 millones de parámetros, mientras que Mistral Large 3 utiliza 675.000 millones en total y activa 41.000 millones. La compañía sitúa su versión comprimida de mayor tamaño en nodos con ocho GPU A100 o H100, lejos de un despliegue doméstico.
DeepSeek-V3.2 y GLM-5.2 se encuentran también en esa categoría de infraestructura avanzada. El primero publica 685.000 millones de parámetros bajo MIT y está orientado al razonamiento y al uso de herramientas. GLM-5.2 eleva el tamaño hasta 753.000 millones y anuncia un contexto de un millón de tokens para tareas prolongadas. Estas cifras permiten ampliar el alcance del modelo, pero no convierten su alojamiento propio en una opción económica para cualquier empresa.
Llama 4 Scout ocupa una posición particular. Meta anuncia 109.000 millones de parámetros totales, 17.000 millones activos y una ventana máxima de diez millones de tokens. Utiliza una licencia comunitaria propia, no Apache 2.0 ni MIT, por lo que sus condiciones deben revisarse antes de integrarlo en un servicio comercial o redistribuir una versión modificada.
Qué modelo elegir según el hardware y la tarea
El tamaño máximo que un ordenador puede cargar no siempre es el tamaño que debería utilizar. Un modelo que ocupa toda la memoria disponible deja menos espacio para el contexto, las peticiones simultáneas y otros procesos. También puede responder tan despacio que una demostración aceptable se convierta en un producto frustrante.
| Escenario | Modelos que conviene evaluar | Ventaja principal | Riesgo o limitación |
| Ordenador sin GPU dedicada | Phi-4-mini, OLMo 3 7B cuantizado, Ministral 3 3B | Bajo coste y privacidad local | Menor conocimiento y razonamiento limitado |
| Portátil con memoria unificada | Gemma 4 pequeña, Ministral 3 8B, OLMo 3 7B | Fácil instalación y uso sin nube | Velocidad variable y contexto limitado por la memoria |
| GPU de 16 GB | gpt-oss-20b MXFP4, modelos de 7B a 14B cuantizados | Buen equilibrio para agentes locales | La caché de contexto puede agotar la memoria |
| GPU de 24 a 48 GB | Qwen3.6 cuantizado, Gemma 4 26B/31B, modelos especializados de código | Más calidad y multimodalidad | Menor concurrencia que en un servidor |
| GPU de 80 GB | gpt-oss-120b, modelos medianos en mayor precisión | Inferencia empresarial en un solo acelerador | Coste del hardware y consumo eléctrico |
| Servidor con varias GPU | Mistral Large 3, DeepSeek-V3.2, GLM-5.2, Llama 4 | Más capacidad para agentes complejos | Operación, refrigeración y paralelización |
| Uso ocasional o imprevisible | API de modelos abiertos alojados | Sin inversión inicial en GPU | Dependencia del proveedor y coste por token |
Para un asistente que consulta documentación interna, un modelo de 7B a 20B con un buen sistema RAG puede ser suficiente. El sistema recupera los párrafos relevantes y evita exigir al modelo que memorice todo el conocimiento de la empresa.
En programación conviene probar el modelo sobre incidencias reales del repositorio. Qwen3.6 está diseñado con especial atención al código y a los flujos con herramientas, mientras que gpt-oss incorpora razonamiento configurable y llamadas a funciones. Los modelos de mayor tamaño pueden resolver tareas más largas, pero también consumen más contexto al inspeccionar archivos, ejecutar pruebas y corregir intentos fallidos.
Para documentos, imágenes y reconocimiento óptico de caracteres resulta más razonable comenzar por una familia multimodal como Qwen, Gemma, Mistral o Llama. Un modelo exclusivamente textual necesita un sistema externo que convierta antes la imagen en texto, lo que añade otra etapa y posibles errores.
En investigación reproducible, OLMo 3 mantiene una ventaja distinta: Ai2 publica el flujo completo del modelo, incluidos conjuntos de datos, herramientas de preparación, código de entrenamiento y variantes de 7B y 32B. No necesariamente encabezará todas las pruebas, pero permite estudiar cómo se obtuvo el resultado y repetir partes del proceso.
Licencia, coste y privacidad: la comparación que suele olvidarse
La etiqueta «open source» no debería utilizarse como sinónimo de «se puede descargar». La Open Source Initiative considera que un sistema de IA abierto debe permitir usarlo, estudiarlo, modificarlo y compartirlo. También reclama información suficiente sobre los datos, el código de entrenamiento y los parámetros para crear un sistema sustancialmente equivalente. Bajo este criterio, muchos productos populares son modelos de pesos abiertos, no sistemas completamente abiertos.
| Tipo de licencia | Modelos de la comparativa | Lectura práctica |
| Apache 2.0 | gpt-oss, Qwen3.6, Mistral 3 | Permisiva, permite uso comercial y contiene una concesión expresa de patentes |
| MIT | Phi-4-mini, DeepSeek-V3.2, GLM-5.2 | Muy permisiva y sencilla, con obligación principal de conservar el aviso |
| Licencia propia | Llama 4, Gemma 4 | Puede permitir uso comercial, pero incorpora condiciones que deben revisarse |
| Flujo completamente abierto | OLMo 3 | Añade datos, código, artefactos y proceso de entrenamiento a los pesos |
El ahorro tampoco debe calcularse comparando únicamente el precio por millón de tokens. Un despliegue propio necesita comprar o alquilar GPU, almacenar los modelos, actualizar controladores, vigilar la seguridad y mantener el servicio disponible. Cuando la demanda es baja o irregular, una API puede resultar más barata que un acelerador encendido durante todo el día.
El alojamiento propio gana atractivo cuando existe una carga estable, datos que no deben salir de la organización o necesidad de adaptar el modelo. Aun así, ejecutar los pesos dentro de la empresa no garantiza por sí solo la privacidad: la aplicación, las extensiones, el motor de inferencia y las herramientas de observabilidad pueden enviar telemetría o registros a terceros.
La cuantización añade otra variable. Reducir los pesos a cuatro u ocho bits permite cargar modelos mayores en el mismo equipo, pero puede alterar la precisión, especialmente en cálculos, programación y salidas estructuradas. Una cuantización debe evaluarse como una versión diferente, no como una copia idéntica que simplemente ocupa menos.
La mejor elección suele surgir de una prueba breve con varios candidatos. El equipo debería medir calidad, latencia, consumo de memoria, tokens por segundo, coste por consulta, cumplimiento de formatos y frecuencia de errores. El modelo más grande solo merece la inversión cuando esa diferencia aparece en el trabajo real.
Preguntas frecuentes
¿Cuál es el mejor modelo abierto para empezar en local?
Phi-4-mini, OLMo 3 7B y las versiones pequeñas de Ministral 3 son opciones razonables para equipos modestos. En una GPU de 16 GB también puede probarse gpt-oss-20b con su cuantización oficial.
¿Qué modelo resulta más interesante para programación?
Qwen3.6-35B-A3B, gpt-oss y los grandes modelos DeepSeek o GLM merecen una evaluación. La elección depende del tamaño del repositorio, las herramientas utilizadas y el hardware disponible.
¿Un modelo con un millón de tokens entiende todo el contexto?
No necesariamente. La ventana indica cuánto contenido puede aceptar, pero la precisión puede disminuir en documentos largos. Además, la memoria y el tiempo de procesamiento aumentan con el contexto.
¿Es siempre más barato alojar un modelo propio?
No. Puede resultar rentable con uso constante y requisitos de privacidad, pero una API suele ser más económica para cargas pequeñas, variables o experimentales.












