AirLLM ha incorporado soporte experimental para ejecutar Kimi K3, el modelo abierto de 2,8 billones de parámetros de Moonshot AI, utilizando menos de 4 GB de memoria gráfica. La demostración reduce la barrera de VRAM mediante la carga selectiva de expertos, pero está lejos de convertir el modelo en un asistente local para uso cotidiano: necesita descargar 1,56 TB de pesos, disponer de almacenamiento rápido y puede tardar alrededor de cinco minutos en generar cada token.
Las claves de Kimi K3 en menos de 4 GB de VRAM en 30 segundos
- AirLLM asegura haber ejecutado el modelo completo con un máximo de 3,72 GB de VRAM.
- La prueba se realizó en una Nvidia RTX 6000 Ada de 48 GB, aunque solo se ocupó una pequeña parte de su memoria.
- Kimi K3 tiene 2,8 billones de parámetros, pero activa unos 104.000 millones por token.
- El sistema carga únicamente los expertos necesarios en cada paso.
- El resultado es técnicamente llamativo, pero extremadamente lento y exige unos 1,6 TB de almacenamiento.
El matiz resulta importante. Decir que Kimi K3 funciona “en una GPU de 4 GB” puede llevar a pensar que cualquier portátil modesto podría ejecutar el modelo con una experiencia similar a la de ChatGPT o una API comercial. AirLLM ha demostrado que el límite de memoria gráfica puede rebajarse hasta ese nivel, pero su medición se realizó sobre una RTX 6000 Ada, una tarjeta profesional con 48 GB de VRAM, acompañada de la infraestructura de almacenamiento necesaria para mover un modelo de más de un terabyte.
La prueba muestra que es posible completar inferencias con solo 3,72 GB de VRAM ocupada. No demuestra que el modelo resulte práctico en cualquier equipo con una tarjeta de 4 GB ni que el resto del hardware deje de importar.
Un modelo de 2,8 billones de parámetros y 1,56 TB
Moonshot AI presentó Kimi K3 como un modelo multimodal de pesos abiertos orientado a programación prolongada, razonamiento y trabajo con herramientas. Su arquitectura contiene 2,8 billones de parámetros, una ventana de contexto de hasta un millón de tokens y capacidades nativas para procesar texto e imágenes.
El repositorio oficial ocupa alrededor de 1,56 TB en Hugging Face. Descargarlo completo ya requiere una conexión estable, tiempo y una unidad de almacenamiento con capacidad suficiente.
Kimi K3 utiliza una arquitectura de mezcla de expertos, conocida como Mixture of Experts o MoE. En lugar de activar todos sus parámetros para procesar cada token, el sistema selecciona solo una parte del modelo.
Moonshot AI detalla que Kimi K3 dispone de 896 expertos y elige 16 para cada token, además de dos expertos compartidos. De sus 2,8 billones de parámetros totales, activa aproximadamente 104.000 millones en cada paso de inferencia.
Esta arquitectura permite aumentar el tamaño total del modelo sin multiplicar en la misma proporción el cálculo necesario para generar cada respuesta. Aun así, una implementación convencional continúa necesitando una gran cantidad de memoria porque debe mantener disponibles los pesos y trasladarlos con suficiente rapidez entre almacenamiento, memoria principal y GPU.
AirLLM deja de cargar capas completas y trabaja experto a experto
AirLLM es un proyecto abierto diseñado para ejecutar modelos grandes con poca memoria gráfica. Su método tradicional consiste en cargar las capas del modelo una a una: incorpora una capa a la GPU, realiza el cálculo, libera la memoria y continúa con la siguiente.
Esta técnica ya se había aplicado a modelos como Llama 3.1 de 405.000 millones de parámetros o DeepSeek-V3, pero encontraba un problema con Kimi K3. Cada una de sus capas contiene cientos de expertos y puede superar la capacidad de una GPU si todos se descomprimen al mismo tiempo.
La nueva implementación desciende un nivel más. En vez de cargar una capa completa, AirLLM identifica qué expertos ha seleccionado el enrutador del modelo y mueve únicamente esos componentes.
El proyecto afirma haber instalado puntos de control sobre los expertos individuales de Kimi K3. Cuando el modelo necesita uno, sus pesos se leen desde el almacenamiento, se transfieren a la GPU, se utilizan para el cálculo y se eliminan inmediatamente de la memoria.
Los otros cientos de expertos que no participan en ese token no llegan a cargarse. Esta selección explica cómo la ocupación máxima de VRAM puede mantenerse en 3,72 GB, pese al enorme tamaño total del modelo.
AirLLM también conserva los pesos comprimidos en formato MXFP4 durante la transferencia. La expansión se realiza en la GPU y solo para el experto que se está utilizando. De esta manera reduce tanto el pico de memoria como la cantidad de información que debe atravesar el bus PCIe.
La GPU deja de ser el principal problema y el cuello de botella pasa al disco
La reducción de VRAM no elimina el coste computacional. Lo desplaza.
AirLLM reconoce que Kimi K3 tarda aproximadamente cinco minutos por token en su prueba. Una respuesta breve de 20 tokens podría necesitar cerca de una hora y cuarenta minutos, sin contar el procesamiento inicial ni las posibles variaciones del equipo.
El principal cuello de botella es la lectura del almacenamiento. Cada token obliga al sistema a recorrer y cargar numerosos pesos desde un conjunto de archivos que ocupa 1,56 TB. Aunque solo se activen 16 expertos por capa, el proceso se repite a lo largo de las 93 capas del modelo.
Por eso un SSD rápido resulta mucho más importante que en una instalación convencional de un modelo pequeño. Un disco duro mecánico o una unidad externa lenta harían que los tiempos fueran todavía mayores.
El proyecto también tuvo que resolver un problema adicional relacionado con la preparación de los archivos. AirLLM suele reorganizar los pesos para generar una copia dividida por capas, lo que habría elevado la ocupación total por encima de los 3 TB.
En el caso de Kimi K3, los desarrolladores detectaron que los archivos originales ya contenían módulos separados. El sistema puede crear enlaces físicos a esos datos en vez de duplicarlos, por lo que el espacio necesario permanece alrededor de 1,56 TB.
No es una alternativa práctica a una API ni a un clúster de GPU
La demostración tiene interés técnico, pero su utilidad diaria es limitada. Kimi K3 no se convierte con este método en un chatbot local fluido ni en una herramienta adecuada para programación interactiva.
Un desarrollador que necesite respuestas en segundos continuará dependiendo de la API de Moonshot AI, de un proveedor de inferencia o de un despliegue distribuido con múltiples aceleradores.
AirLLM orienta esta modalidad a escenarios en los que la latencia no sea prioritaria. Puede servir para comprobar que el modelo se carga correctamente, estudiar su arquitectura, realizar análisis sin conexión, ejecutar pequeños experimentos o decidir si merece la pena contratar infraestructura más potente.
También puede facilitar el acceso de investigadores que necesiten inspeccionar los pesos completos pero no dispongan de un clúster con varias GPU de gama alta. La ventaja no está en la velocidad, sino en demostrar que la capacidad de memoria gráfica ya no tiene por qué ser un impedimento absoluto.
Aun así, el equipo necesita cumplir varios requisitos. AirLLM indica que Kimi K3 depende de FlashAttention, una compilación de PyTorch compatible con CUDA 12 y una versión 4.56.x de Transformers. También requiere instalar la biblioteca compressed-tensors y aceptar la ejecución del código remoto incluido con el modelo.
Estos requisitos pueden cambiar conforme avance el soporte, por lo que la instalación debe considerarse todavía experimental.
Una demostración sobre los límites de la inferencia local
El caso de Kimi K3 refleja una diferencia que suele perderse en los titulares sobre modelos locales: caber en la memoria no equivale a funcionar con rapidez.
Las técnicas de streaming permiten mantener una fracción muy pequeña del modelo en la GPU, pero obligan a leer continuamente datos desde unidades mucho más lentas que la memoria gráfica. El usuario ahorra VRAM a cambio de multiplicar la latencia.
Tampoco se trata de una versión destilada o reducida. AirLLM trabaja con los pesos completos publicados por Moonshot AI y no elimina expertos del modelo. La reducción se consigue modificando cuándo y cómo se cargan, no recortando su arquitectura.
El avance puede abrir nuevas líneas de investigación sobre la ejecución de grandes modelos dispersos en equipos limitados. También deja claro por qué los centros de datos continúan desplegando miles de GPU: para que un modelo de este tamaño responda en tiempo útil no basta con lograr que sus pesos entren por turnos en una tarjeta.
Preguntas frecuentes
¿Kimi K3 funciona realmente en una GPU de 4 GB?
AirLLM afirma haber limitado el uso de memoria gráfica a 3,72 GB. Sin embargo, la prueba se realizó en una RTX 6000 Ada de 48 GB y también necesitó almacenamiento suficiente para guardar 1,56 TB de pesos.
¿Cuánto tarda Kimi K3 en generar una respuesta con AirLLM?
El proyecto comunica una velocidad aproximada de cinco minutos por token en su prueba. Esto lo hace inadecuado para conversaciones interactivas o tareas que necesiten respuestas rápidas.
¿Por qué Kimi K3 puede usar tan poca VRAM?
Porque utiliza una arquitectura de mezcla de expertos. AirLLM carga únicamente los expertos seleccionados para cada token, realiza el cálculo y los elimina de la GPU antes de continuar.
¿Para qué puede resultar útil esta instalación?
Puede servir para investigación, pruebas sin conexión, inspección de los pesos, análisis por lotes o evaluación del modelo antes de contratar una infraestructura de inferencia más rápida.
Fuentes:
- Moonshot AI, repositorio oficial y ficha técnica de Kimi K3.
- Moonshot AI, archivos oficiales de Kimi K3 en Hugging Face.
- AirLLM, repositorio oficial y documentación del soporte para Kimi K3.












