Un equipo de investigadores de Apple publicó en diciembre de 2023 el documento técnico LLM in a Flash, en el que describen cómo ejecutar modelos de lenguaje grande (LLM, por sus siglas en inglés) en dispositivos con poca RAM, como el iPhone, usando el almacenamiento Flash como alternativa. El resultado práctico: inferencia local sin conexión a Internet, con rendimientos que llegan a multiplicar por 20 la velocidad obtenida en GPU frente a métodos convencionales.
El problema: los LLM necesitan más RAM de la que tiene un móvil
Los modelos de lenguaje actuales funcionan cargando sus parámetros en memoria RAM para hacer inferencia rápida. El problema es que los iPhones, incluso los de gama alta, tienen entre 6 y 8 GB de RAM unificada, insuficiente para alojar modelos con decenas de miles de millones de parámetros. El paper de Apple propone una solución: usar el almacenamiento Flash del propio dispositivo, que en los modelos recientes ofrece entre 128 GB y 1 TB, como memoria de trabajo.
La Flash es más lenta que la RAM para lecturas aleatorias, así que el equipo de Apple diseñó dos técnicas para compensar esa diferencia:
- Windowing (ventana deslizante): el sistema reutiliza los datos de activación calculados en pasos anteriores en lugar de recalcularlos en cada token. Esto reduce el número de lecturas a Flash y baja la latencia.
- Row-Column Bundling: reorganiza los datos del modelo para que las lecturas a Flash sean secuenciales en lugar de aleatorias. Las lecturas secuenciales son mucho más rápidas en almacenamiento Flash que las aleatorias, por lo que este agrupamiento mejora el throughput de forma notable.
Resultados: hasta 25 veces más rápido en GPU
Con estas dos técnicas combinadas, los investigadores de Apple miden mejoras de velocidad de inferencia de entre 4 y 5 veces en CPU frente a cargar el modelo entero en RAM (que no cabe). En GPU, la ganancia sube hasta 20-25 veces. Los benchmarks del paper no especifican el modelo exacto ni la versión del hardware, aunque la referencia implícita es Apple Silicon (chips de la serie A y M).
El trabajo no describe un producto comercial concreto, sino una dirección de investigación. Meses después, en la WWDC de junio de 2024, Apple presentó oficialmente Apple Intelligence, su estrategia de IA, que combina modelos en dispositivo con llamadas selectivas a la nube bajo un esquema de privacidad por diseño. El paper LLM in a Flash es coherente con ese enfoque.
IA local: una tendencia que va más allá de Apple
La IA en local, sin envíar datos a servidores externos, es una de las líneas de trabajo más activas del sector. No solo Apple: compañías como Liquid AI ya han demostrado modelos que corren en móvil con menos de 1 GB, y aplicaciones como Locally AI llevan LLMs directamente al iPhone sin necesidad de cuenta ni nube. El paper de Apple aporta una base teórica sólida para una dirección que el sector ya consideraba inevitable.
La ventaja concreta de los LLMs en dispositivo es doble: privacidad (los datos del usuario no salen del teléfono) y disponibilidad sin conexión (el asistente funciona en aviones, zonas sin cobertura o entornos corporativos con restricciones de red). Ambas características tienen valor real para usuarios y empresas, no son solo argumentos de marketing.
Preguntas frecuentes sobre ‘LLM in a Flash’ de Apple
¿Qué es ‘LLM in a Flash’?
Un paper de investigación de Apple publicado en diciembre de 2023 que describe cómo ejecutar modelos de lenguaje grande en dispositivos móviles con poca RAM usando almacenamiento Flash como memoria de trabajo.
¿Cuáles son las dos técnicas clave del paper?
Windowing, que reutiliza activaciones calculadas en pasos anteriores para reducir lecturas a Flash, y Row-Column Bundling, que reorganiza los pesos del modelo para que las lecturas sean secuenciales y más rápidas.
¿Qué mejora de velocidad consigue Apple con estas técnicas?
Según el paper, entre 4 y 5 veces en CPU y hasta 20-25 veces en GPU frente a métodos de inferencia convencionales en Flash sin estas optimizaciones.
¿Estos avances son los que usa Apple Intelligence?
Apple no lo ha confirmado explícitamente, pero la dirección es coherente: Apple Intelligence, presentada en WWDC 2024, combina modelos en dispositivo con llamadas selectivas a la nube, exactamente el tipo de arquitectura que ‘LLM in a Flash’ hace posible.













