
Ollama acelera los modelos de IA en Mac con MLX: hasta 134 tokens por segundo
Ollama está cambiando la forma de ejecutar modelos de inteligencia artificial en los Mac con Apple Silicon. La incorporación de MLX, el framework de aprendizaje automático desarrollado por Apple, permite aprovechar una ruta de inferencia diferente a la tradicional basada en llama.cpp. En las pruebas publicadas por Ollama, Qwen3.5-35B-A3B pasó de 58 a 112 tokens por segundo en generación, mientras







