Apple presenta MM1, su primer modelo de IA multimodal

Apple publicó en marzo de 2024 la investigación de MM1, su primera familia de modelos de IA multimodal, firmada por un equipo interno de unos treinta investigadores. El paper llegó tres meses antes de que la compañía presentara Apple Intelligence en la WWDC de aquel año, y sirvió como primera pista pública de por dónde iba a tirar Cupertino en generación de imagen, texto y comprensión visual.

Qué es MM1 y cómo funciona

MM1 no es un producto, es una familia de modelos de investigación que va de 3.000 a 30.000 millones de parámetros, con variantes densas y de mezcla de expertos (MoE). Combina un codificador de imagen con un modelo de lenguaje, y se entrena con tres tipos de datos a la vez: pares imagen-texto, documentos donde imagen y texto se intercalan, y texto puro. Apple detalla en el paper qué combinación de estos datos da mejores resultados en tareas de comprensión visual, algo que la mayoría de laboratorios rivales no suele publicar con ese nivel de detalle.

El resultado, según los propios benchmarks del paper, es un modelo capaz de responder preguntas sobre imágenes, contar objetos en una foto o seguir instrucciones que combinan texto e imagen, con una precisión que Apple sitúa por delante de modelos abiertos de tamaño similar en la época, como algunas versiones de LLaVA.

Frente a GPT-4 y Claude 3

En parámetros, MM1 se queda corto frente a los gigantes de 2024: GPT-4 se estimaba entonces en más de un billón de parámetros y Claude 3 Opus manejaba una arquitectura de escala similar, aunque ninguna de las dos compañías confirmó cifras oficiales. Apple no compite en tamaño, compite en foco. Mientras GPT-4 y Claude 3 son modelos de propósito general y cerrados, MM1 nace como un ejercicio de transparencia académica, con detalles de arquitectura y datos de entrenamiento que ni OpenAI ni Anthropic suelen compartir.

Para quién es esta investigación

MM1 no llega al usuario final. El paper está pensado para la comunidad investigadora de IA multimodal y para los propios equipos de Apple, que meses después usarían parte de este trabajo como base para Apple Intelligence. Si trabajas en visión por computador o entrenamiento de modelos, o simplemente quieres entender por qué Apple llegó tarde a la carrera de los chatbots pero no a la de la investigación en IA, el paper de MM1 es lectura obligada.

Limitaciones

El propio paper reconoce sus límites: MM1 no genera vídeo, algo que ya prometían entonces otros laboratorios, y su rendimiento en razonamiento puramente textual queda por debajo de los modelos de frontera. Apple tampoco ha confirmado qué datos concretos usó para entrenarlo más allá de las categorías generales, así que la transparencia tiene un techo: se explica el método, no siempre la fuente exacta.

Disponibilidad

MM1 nunca se lanzó como producto ni como API pública. Es investigación interna que Apple documentó en un paper en arXiv, sin repositorio de pesos abiertos. El salto a algo que sí puedes tocar como usuario llegó después: primero con Apple Intelligence y, más adelante, con la apertura del framework de modelos a Python y Linux que la compañía detalló en 2026.

Preguntas frecuentes

¿Qué significa MM1 en el nombre del modelo?

Apple no ha explicado el origen exacto de las siglas, pero sigue la misma lógica minimalista que usa en sus chips, como el M1. MM1 se entiende como abreviatura de «multimodal 1», su primera generación de modelos de este tipo.

¿Cuántos parámetros tiene MM1?

El paper describe variantes de 3.000 millones a 30.000 millones de parámetros, además de versiones de mezcla de expertos que igualan el rendimiento de un modelo denso mayor sin disparar el coste de cómputo.

¿MM1 puede generar vídeo?

No. A diferencia de otros modelos multimodales que ya trabajaban con generación de vídeo en 2024, MM1 se entrena con imagen, texto y audio, pero no genera contenido en vídeo.

¿Es MM1 lo mismo que Apple Intelligence?

No directamente. MM1 es un trabajo de investigación previo. Apple Intelligence, presentado meses después, es el conjunto de funciones de IA que llegó a iPhone, iPad y Mac, y que con el tiempo incorporó partes de esta investigación junto a otros modelos, incluidos los de terceros como Gemini.

¿Se puede descargar o usar MM1?

No. Apple no ha publicado los pesos del modelo ni una API pública. El acceso se limita a la lectura del paper técnico en arXiv.

Scroll al inicio