Ollama está cambiando la forma de ejecutar modelos de inteligencia artificial en los Mac con Apple Silicon. La incorporación de MLX, el framework de aprendizaje automático desarrollado por Apple, permite aprovechar una ruta de inferencia diferente a la tradicional basada en llama.cpp. En las pruebas publicadas por Ollama, Qwen3.5-35B-A3B pasó de 58 a 112 tokens por segundo en generación, mientras una configuración int4 alcanzó los 134 tokens/s. La mejora, sin embargo, depende del modelo, su formato y la cuantización utilizada.
Las claves de Ollama con MLX en 30 segundos
- Ollama incorporó MLX para Apple Silicon en la versión 0.19, publicada en marzo de 2026.
- Su prueba con Qwen3.5-35B-A3B elevó el decode de 58 a 112 tokens/s y el prefill de 1.154 a 1.810 tokens/s.
- Una variante int4 alcanzó 134 tokens/s de generación.
- Los modelos GGUF continúan utilizando llama.cpp, por lo que actualizar Ollama no acelera automáticamente la biblioteca existente.
- Las mejoras posteriores incluyen optimizaciones de kernels y Multi-Token Prediction para Gemma 4.
Para quienes utilizan modelos locales para programar, trabajar con documentos o experimentar con agentes de IA, el cambio tiene consecuencias prácticas. Un mismo Mac puede ofrecer velocidades muy diferentes dependiendo de si el modelo pasa por llama.cpp o MLX, incluso antes de considerar otras variables como el contexto utilizado o la memoria disponible.
También obliga a mirar más allá del nombre del modelo. Ejecutar Qwen, Gemma u otro LLM ya no describe por completo el entorno: el formato de los pesos, la cuantización y el motor de inferencia pueden ser determinantes para el rendimiento.
Ollama pasa de 58 a 112 tokens/s en su primera comparación
Ollama introdujo el nuevo motor MLX en fase preliminar con la versión 0.19.0, publicada el 27 de marzo de 2026. La compañía presentó públicamente la integración tres días después.
Su comparación inicial utilizó Qwen3.5-35B-A3B.
Con Ollama 0.18, llama.cpp y una cuantización Q4_K_M, el procesamiento inicial del prompt alcanzaba 1.154 tokens/s, mientras la generación se situaba en 58 tokens/s.
Con Ollama 0.19, MLX y NVFP4, los resultados publicados subieron hasta 1.810 tokens/s en prefill y 112 tokens/s en decode.
Esto representa mejoras de 1,57 y 1,93 veces respectivamente.
Una variante MLX int4 llegó todavía más lejos: 1.851 tokens/s de prefill y 134 tokens/s de generación, 2,31 veces la cifra de decode utilizada como referencia para Ollama 0.18.
Los números son relevantes, pero la comparación necesita una precisión técnica. No cambia únicamente el motor. También se están comparando formatos y cuantizaciones diferentes, así que no puede atribuirse todo el incremento exclusivamente a MLX.
Una prueba independiente realizada por Ante Kapetanovic con Qwen3.5-35B-A3B en un M4 Max de 128 GB ofrece otra referencia.
Ollama utilizando internamente llama.cpp alcanzó 48,1 tokens/s. La ejecución directa con llama.cpp y Q4_K_XL consiguió 72,4 tokens/s, mientras mlx-lm con cuantización MLX de 4 bits llegó a 131,8 tokens/s.
En pruebas adicionales del mismo autor, mlx-lm se mantuvo por encima de 120 tokens/s tanto con razonamiento activado como desactivado y en diferentes configuraciones de generación.
Las condiciones tampoco son idénticas entre motores, pero los resultados refuerzan una idea: en Apple Silicon, la capa de inferencia puede cambiar considerablemente el rendimiento observado por el usuario.
MLX no sustituye a llama.cpp dentro de Ollama
La llegada de MLX no significa que Ollama haya abandonado llama.cpp.
Ambos motores conviven.
La documentación de desarrollo de Ollama establece que el motor MLX permite ejecutar modelos basados en safetensors y que está habilitado por defecto en macOS ARM64. Los modelos GGUF continúan utilizando la ruta basada en llama.cpp.
Esta decisión mantiene la compatibilidad con el enorme catálogo de modelos GGUF existente, pero introduce una consecuencia fácil de pasar por alto: actualizar Ollama no hace más rápidos automáticamente los modelos que ya estaban descargados.
Si un modelo continúa almacenado como GGUF, seguirá utilizando llama.cpp.
Para entrar en la nueva ruta es necesario disponer de una variante compatible con MLX. Durante el lanzamiento, Ollama utilizó qwen3.5:35b-a3b-coding-nvfp4 como uno de sus principales ejemplos.
El soporte se ha ampliado posteriormente a otras familias. Gemma 4 recibió soporte y durante junio llegaron también nuevas mejoras del motor y compatibilidad con más arquitecturas.
La integración llevaba además bastante tiempo en desarrollo. Daniel Hiltgen abrió en febrero de 2025 un primer pull request para experimentar con un backend MLX en Ollama. Aquella implementación inicial estaba lejos de la versión que finalmente llegó al producto.
Apple Silicon permite optimizaciones difíciles de trasladar a otras plataformas
MLX fue creado específicamente alrededor de la arquitectura de los chips de Apple.
Una de sus características es el uso natural de la memoria unificada. CPU y GPU pueden acceder al mismo conjunto de memoria sin que el framework tenga que tratar ambos espacios como memorias físicamente independientes.
Pero atribuir toda la diferencia a esta característica sería simplificar demasiado.
llama.cpp también dispone de un backend Metal muy trabajado y puede aprovechar la arquitectura de memoria de los Mac. MLX incorpora además evaluación diferida, compilación y optimizaciones que permiten adaptar el grafo de cálculo al hardware.
Ollama detalló en junio nuevas mejoras sobre su primera implementación. La compañía asegura que consiguió incrementar hasta otro 20 % el rendimiento del motor MLX mediante la fusión de varias operaciones en kernels Metal utilizando el compilador JIT de MLX y cambios en el muestreo realizado por la GPU.
Estas optimizaciones reducen operaciones intermedias y lanzamientos separados de kernels, algo especialmente relevante cuando un LLM repite miles de operaciones para generar una respuesta.
Apple está reforzando además esta dirección mediante el propio hardware.
La generación M5 incorpora Neural Accelerators dentro de cada núcleo de la GPU. Apple los utiliza para acelerar las operaciones matriciales frecuentes en cargas de inteligencia artificial.
En pruebas publicadas por Apple Machine Learning Research, diferentes modelos ejecutados con MLX sobre M5 redujeron considerablemente el tiempo hasta el primer token respecto al M4. Apple midió mejoras de entre 3,33 y 4,06 veces dependiendo del modelo.
La generación sostenida mejoró bastante menos, entre 1,19 y 1,27 veces.
La diferencia responde a dos fases distintas de una inferencia.
El prefill procesa en paralelo el prompt y tiene una fuerte dependencia de la capacidad de cálculo. El decode genera progresivamente los tokens y está mucho más condicionado por el ancho de banda disponible para mover los pesos del modelo.
Por eso una mejora enorme en procesamiento del prompt no implica necesariamente multiplicar en la misma proporción la velocidad con la que posteriormente aparece el texto.
La cuantización NVFP4 también explica parte del cambio
Otro elemento que acompaña al nuevo motor es NVFP4, un formato de cuantización de 4 bits desarrollado por NVIDIA.
La cuantización permite representar los pesos utilizando menos bits. Esto reduce el espacio necesario para almacenar el modelo y la cantidad de información que debe moverse desde memoria durante la inferencia.
Ollama está utilizando NVFP4 en algunas variantes destinadas a MLX.
La compañía publicó también pruebas con Gemma 4 12B en las que sostiene que NVFP4 reduce aproximadamente a la mitad la pérdida de calidad asociada a la cuantización frente a Q4_K_M, tomando BF16 como referencia.
La comparación procede de Ollama y no demuestra que NVFP4 sea siempre superior para cualquier modelo o tarea.
También explica por qué las comparaciones entre el antiguo y el nuevo Ollama necesitan cierta cautela: motor y cuantización están cambiando simultáneamente.
El resultado que importa al usuario puede ser claramente superior, pero determinar cuánto corresponde a MLX, cuánto al formato de pesos y cuánto a otras optimizaciones requiere pruebas controladas.
Multi-Token Prediction vuelve a acelerar Gemma 4
La evolución de Ollama en Apple Silicon tampoco terminó con el cambio de motor.
La versión 0.31.1 incorporó Multi-Token Prediction (MTP) para Gemma 4. Esta técnica intenta generar varios tokens durante una misma etapa y ajusta dinámicamente la longitud utilizada.
Ollama publicó una prueba con Gemma 4 12B NVFP4 sobre un M5 Max utilizando el benchmark Aider Polyglot.
Sin MTP, la generación se situó en 50,2 tokens/s. Con MTP activado alcanzó 95 tokens/s.
La diferencia se acerca al 90 %.
Ollama señala que la función se activa automáticamente y no requiere configuración adicional. Es una optimización diferente de la migración a MLX, por lo que ambas mejoras no deberían sumarse como si formaran parte de una única comparación.
Todo ello deja una situación diferente para quienes ejecutan LLM localmente en un Mac. La pregunta ya no es únicamente cuánta memoria tiene el ordenador o qué modelo cabe en ella.
Dos usuarios pueden seleccionar la misma familia de modelo y obtener comportamientos muy distintos dependiendo del archivo descargado, su cuantización y el motor utilizado.
Para Ollama, mantener llama.cpp permite conservar compatibilidad con GGUF y con una comunidad enorme de modelos ya preparados. MLX ofrece a cambio una ruta mucho más vinculada al hardware de Apple y susceptible de incorporar rápidamente características específicas de las nuevas generaciones de chips.
Los resultados publicados durante 2026 muestran que esa diferencia puede superar ampliamente unos pocos puntos porcentuales. Pero también aconsejan comprobar exactamente qué se está comparando antes de atribuir cualquier cifra a un único componente.
Preguntas frecuentes
¿Cuánto más rápido es Ollama con MLX?
En la comparación inicial publicada por Ollama con Qwen3.5-35B-A3B, la generación pasó de 58 a 112 tokens/s, mientras una variante int4 llegó a 134 tokens/s. Son resultados de configuraciones concretas y no representan todos los modelos.
¿Los modelos GGUF utilizan MLX en Ollama?
No. Los modelos GGUF continúan utilizando la ruta basada en llama.cpp. Las variantes compatibles distribuidas en safetensors pueden utilizar el motor MLX en Apple Silicon.
¿Actualizar Ollama mejora automáticamente los modelos ya descargados?
No necesariamente. Si los modelos instalados son GGUF, seguirán utilizando llama.cpp. Para beneficiarse del motor MLX hay que ejecutar una variante compatible.
¿Qué es Multi-Token Prediction en Ollama?
Es una técnica que permite proponer varios tokens durante la generación. En una prueba de Ollama con Gemma 4 12B NVFP4 sobre un M5 Max, la velocidad pasó de 50,2 a 95 tokens/s.
Fuentes:
- Ollama, “Ollama is now powered by MLX on Apple Silicon in preview”, 30/03/2026.
- Ollama, “Ollama’s highest performance on Apple Silicon yet with MLX”, 11/06/2026.
- Ollama v0.19.0, notas de la versión, 27/03/2026.
- Ollama v0.31.1, notas de la versión, 30/06/2026.
- Apple Machine Learning Research, “Exploring LLMs with MLX and the Neural Accelerators in the M5 GPU”, 19/11/2025.
- MLX, proyecto de Apple para Apple Silicon.
- Ante Kapetanovic, “Ollama vs. llama.cpp vs. MLX with Qwen3.5 35B on Apple Silicon”, 18/03/2026.
- NVIDIA, documentación técnica de NVFP4.












