El Instituto Allen de Inteligencia Artificial (AI2) ha lanzado OLMo 7B, un modelo de lenguaje que se distingue de la mayoría de «modelos abiertos» del mercado por un detalle poco habitual: publica no solo los pesos, sino también el conjunto completo de datos de preentrenamiento y el código usado para entrenarlo. Es la diferencia entre poder usar un modelo y poder entender cómo se construyó.
Qué incluye el paquete OLMo
- Datos completos de preentrenamiento: el modelo se construye sobre Dolma, el corpus abierto de AI2 con tres billones de tokens, incluido el código que generó ese conjunto de datos.
- Código y pesos completos: cuatro variantes del modelo a escala de 7.000 millones de parámetros, cada una entrenada con al menos dos billones de tokens, junto con el código de inferencia y los registros de entrenamiento.
- Evaluación completa: más de 500 puntos de control por modelo, uno cada 1.000 pasos de entrenamiento, junto con el código de evaluación del proyecto Catwalk.
El modelo está disponible para descarga directa en Hugging Face y en GitHub. Parte del entrenamiento se hizo con el superordenador público LUMI, en colaboración con el Instituto Kempner de Harvard, AMD, CSC (Finlandia), la Escuela Allen de la Universidad de Washington y Databricks.
Por qué importa la diferencia entre «pesos abiertos» y «open source»
Hanna Hajishirzi, líder del proyecto OLMo y profesora en la Escuela Allen de la UW, lo resume así: «muchos modelos de lenguaje hoy se publican con transparencia limitada. Sin acceso a los datos de entrenamiento, los investigadores no pueden entender científicamente cómo funciona un modelo». Publicar solo los pesos permite ejecutar el modelo, pero no auditar qué datos lo formaron, algo que se ha convertido en un debate recurrente en el sector, como muestra el caso de otros lanzamientos donde solo se abre la mitad de la ecuación.
Yann LeCun, científico jefe de IA en Meta, respaldó el enfoque: «los modelos de fundación abiertos han sido críticos en impulsar una explosión de innovación y desarrollo alrededor de la IA generativa. La comunidad que surge del open source es la manera más rápida y efectiva de construir el futuro de la IA». Eric Horvitz, jefe científico de Microsoft y miembro de la junta asesora de AI2, añadió que la oferta «continúa la tradición de AI2 de proporcionar modelos, herramientas y datos abiertos que han impulsado avances en la comunidad global».
No es el único proyecto que apuesta por la transparencia total
OLMo llega en un momento en el que la etiqueta «open» se aplica cada vez a más modelos con grados muy distintos de apertura real, algo que analiza en detalle este repaso de cómo los LLM de código abierto han pasado de alternativa a marcar la agenda del sector. Años después, Suiza ha seguido un camino similar al de AI2 con Apertus, un modelo pensado para cumplir normas de transparencia desde el diseño, lo que confirma que publicar los datos de entrenamiento, y no solo los pesos, se ha convertido en un criterio cada vez más exigido para hablar de verdadero código abierto.
Qué viene después
AI2 ha anunciado que seguirá iterando sobre la familia OLMo, con nuevos tamaños de modelo, modalidades adicionales y conjuntos de datos en los próximos meses. El objetivo declarado es que investigadores y desarrolladores externos puedan construir sobre una base completamente auditable, en lugar de depender de modelos cuyo comportamiento solo se puede observar desde fuera.
Preguntas frecuentes
¿Qué diferencia a OLMo de otros modelos que se llaman «abiertos»?
Que publica, además de los pesos, el conjunto completo de datos de preentrenamiento (Dolma) y el código de entrenamiento, algo que la mayoría de modelos etiquetados como abiertos no ofrece.
¿Dónde se puede descargar OLMo?
OLMo 7B está disponible para descarga directa en Hugging Face y en GitHub, junto con el código de entrenamiento y evaluación.
¿Qué es el corpus Dolma?
Es el conjunto de datos abierto de AI2 usado para preentrenar OLMo, con tres billones de tokens, publicado junto al código que lo generó.
¿Qué organizaciones han colaborado en el desarrollo de OLMo?
El Instituto Kempner de Harvard, AMD, CSC – IT Center for Science de Finlandia, la Escuela Allen de la Universidad de Washington y Databricks, además del cómputo aportado por el superordenador público LUMI.













