Apple lleva la IA local a 512 GB y desafía el dominio de las GPU dedicadas

Apple ha presentado sus nuevos M6 y M5 Ultra con una apuesta cada vez más clara por ejecutar inteligencia artificial directamente en el ordenador. El M6 estrena los 2 nanómetros dentro de Apple Silicon, mientras que el M5 Ultra lleva el Mac Studio hasta 512 GB de memoria unificada y 1,2 TB/s de ancho de banda, unas cifras que abren la puerta a trabajar localmente con modelos de IA demasiado grandes para la memoria de muchas GPU profesionales.

Las claves de Apple M6 y M5 Ultra para IA en 30 segundos

  • El M6 es el primer chip de 2 nm de Apple, con CPU y GPU de 12 núcleos y un Neural Engine dual de 16 núcleos.
  • El M5 Ultra escala hasta 36 núcleos de CPU, 80 de GPU y 512 GB de memoria unificada.
  • Sus 1,2 TB/s de ancho de banda favorecen la inferencia de grandes modelos en local.
  • NVIDIA sigue ofreciendo más aceleración especializada y un ecosistema de IA más maduro, mientras AMD compite con Radeon AI PRO e Instinct.
  • La gran baza de Apple no son los TOPS aislados: es poder entregar cientos de GB de memoria accesibles por la GPU dentro de una estación de trabajo.

Apple está entrando así en una parte del mercado de IA que hasta hace poco estaba mucho más vinculada a servidores equipados con aceleradores. No pretende sustituir directamente a las plataformas de centros de datos de NVIDIA o AMD, pero sí plantea una alternativa peculiar para desarrolladores, investigadores y empresas que quieren ejecutar modelos localmente.

La diferencia está en la arquitectura. Mientras NVIDIA y AMD utilizan GPU con memoria dedicada, Apple mantiene CPU, GPU y otros aceleradores alrededor de un gran espacio de memoria unificada. Con el M5 Ultra ese espacio puede alcanzar medio terabyte.

El M5 Ultra convierte la memoria en su principal argumento para IA

El M5 Ultra incorpora una CPU de hasta 36 núcleos, formada por 12 supernúcleos y 24 núcleos de rendimiento. Su GPU llega a 80 núcleos e incorpora Neural Accelerators, mientras que el ancho de banda de memoria aumenta un 50 % frente al M3 Ultra hasta alcanzar 1,2 TB/s.

Apple asegura que el nuevo chip consigue hasta 4,3 veces el pico de procesamiento de IA del M3 Ultra y 9,8 veces el del M1 Ultra. Son comparaciones realizadas por la propia compañía y no equivalen a benchmarks independientes contra aceleradores de NVIDIA o AMD.

Pero hay una especificación menos llamativa que puede resultar más interesante para determinados usos: 512 GB de memoria unificada.

En IA generativa, tener una GPU muy rápida sirve de poco cuando el modelo no cabe en su memoria. Un modelo de 70.000 millones de parámetros cuantizado a 4 bits puede necesitar aproximadamente 35 GB únicamente para sus pesos. A partir de ahí hay que sumar la caché KV, el contexto y otras necesidades de memoria.

Al aumentar el tamaño de los modelos, la VRAM termina siendo uno de los límites físicos del sistema.

El nuevo Mac Studio puede evitar parte de ese problema porque su GPU puede trabajar sobre una reserva de memoria enormemente superior a la disponible en una única GPU profesional convencional.

Apple afirma que esta configuración permite ejecutar grandes modelos íntegramente en el dispositivo. Además, varios Mac Studio pueden conectarse mediante Thunderbolt 5 y acceso directo remoto a memoria (RDMA). Según las pruebas de Apple, cuatro equipos pueden ofrecer hasta tres veces el rendimiento de inferencia de una sola máquina.

Apple frente a NVIDIA y AMD: tres aproximaciones diferentes

Comparar directamente el M5 Ultra con una GPU NVIDIA o AMD únicamente mediante TOPS sería engañoso. Las arquitecturas, precisiones numéricas, software, consumo y finalidad de los productos son diferentes.

La comparación resulta más útil observando memoria, ancho de banda y mercado objetivo.

PlataformaMemoria máximaAncho de bandaOrientación
Apple M5 Ultra512 GB unificada1,2 TB/sIA local / workstation
NVIDIA RTX PRO 6000 Blackwell96 GB GDDR7 ECC1,792 TB/sIA / workstation profesional
AMD Radeon AI PRO R970032 GB GDDR6640 GB/sIA local / workstation
AMD Instinct MI350X288 GB HBM3E8 TB/sCentro de datos / IA y HPC

La tabla requiere una precaución importante: no son productos equivalentes. Especialmente el Instinct MI350X, diseñado para servidores y centros de datos, que pertenece a una categoría diferente al Mac Studio. Las cifras sirven para entender las distintas decisiones arquitectónicas, no para determinar automáticamente cuál ejecutará más rápido un determinado modelo.

La NVIDIA RTX PRO 6000 Blackwell es probablemente una referencia más razonable para observar las diferencias. Ofrece 96 GB de GDDR7 ECC, 1.792 GB/s de ancho de banda y hasta 4.000 TOPS de IA FP4 con sparsity, además de Tensor Cores de quinta generación. Su consumo máximo alcanza los 600 W.

Frente a ella, Apple ofrece más de cinco veces la capacidad máxima de memoria, aunque la RTX PRO dispone de aproximadamente un 49 % más de ancho de banda.

Esto no convierte automáticamente al M5 Ultra en un acelerador más rápido. NVIDIA dispone además de una ventaja difícil de reflejar en una tabla: CUDA y su enorme ecosistema de software para IA.

Para muchas aplicaciones profesionales esa compatibilidad puede pesar más que disponer de cientos de gigabytes adicionales.

AMD plantea otra alternativa. La Radeon AI PRO R9700 cuenta con 32 GB de GDDR6, 640 GB/s y 300 W de consumo. Su arquitectura RDNA 4 alcanza teóricamente hasta 1.531 TOPS INT4 utilizando sparsity. AMD la orienta expresamente hacia inferencia local y desarrollo de IA mediante ROCm.

El salto a la familia Instinct cambia completamente la escala. Una MI350X dispone de 288 GB de HBM3E y hasta 8 TB/s de ancho de banda, con un consumo máximo de 1.000 W por módulo. Una plataforma de ocho aceleradores reúne 2,3 TB de memoria HBM3E. Es infraestructura de centro de datos, no una estación de trabajo de sobremesa.

Apple busca un espacio propio para ejecutar grandes LLM en local

Aquí aparece probablemente la parte más interesante del anuncio.

Apple no necesita superar a NVIDIA en entrenamiento de grandes modelos ni competir con AMD Instinct dentro de los clústeres de IA para que el M5 Ultra encuentre su mercado.

Puede ocupar un espacio intermedio.

Un Mac Studio con cientos de gigabytes de memoria permite cargar localmente modelos que necesitarían varias GPU de menor capacidad. Para investigadores, desarrolladores y empresas que prioricen privacidad, experimentación o inferencia sin depender continuamente de servicios cloud, esta característica puede resultar atractiva.

También cambia la economía de determinados proyectos. Una infraestructura basada en GPU dedicada ofrece más posibilidades de expansión y, dependiendo del hardware, un rendimiento muy superior. Pero ejecutar inferencia local elimina el coste variable por token de una API externa.

Apple está reforzando además la parte de software. El nuevo Mac Studio utiliza Core AI, Core ML y Metal, mientras que MLX continúa siendo el framework abierto de Apple para machine learning sobre Apple Silicon. La compañía afirma que estos entornos permiten ejecutar, entrenar y ajustar modelos directamente en el Mac.

El M5 Ultra no elimina, sin embargo, la principal ventaja competitiva de NVIDIA. CUDA lleva años integrado en frameworks, aplicaciones científicas, herramientas de inferencia y software empresarial. AMD intenta reducir esa distancia con ROCm, mientras Apple construye su propio entorno alrededor de MLX, Metal y Core AI.

Por eso habrá que esperar a pruebas independientes con modelos reales para saber dónde queda exactamente el nuevo Mac Studio. Métricas como tokens por segundo, tiempo hasta el primer token, consumo eléctrico y rendimiento con distintos niveles de cuantización serán mucho más informativas que comparar simplemente TOPS.

Lo que Apple sí ha cambiado es el límite de memoria disponible en un ordenador de sobremesa de su catálogo. El Mac Studio con M5 Ultra partirá de 5.499 dólares en Estados Unidos, mientras que la configuración con 512 GB llegará a finales de octubre.

Con 512 GB de memoria unificada, Apple está llevando a una estación de trabajo compacta una capacidad que resulta especialmente interesante justo cuando los modelos abiertos crecen y la inferencia local empieza a ganar peso frente al uso exclusivo de servicios cloud.

Preguntas frecuentes

¿Cuánta memoria admite el Apple M5 Ultra?

El nuevo Mac Studio con M5 Ultra puede configurarse con hasta 512 GB de memoria unificada, accesible por los diferentes bloques de procesamiento del SoC.

¿Es el M5 Ultra más rápido para IA que una NVIDIA RTX PRO 6000?

No puede afirmarse de forma general. La RTX PRO 6000 dispone de aceleradores especializados, mayor ancho de banda y el ecosistema CUDA, mientras que el M5 Ultra destaca especialmente por sus hasta 512 GB de memoria unificada. El resultado dependerá del modelo, software, precisión y carga utilizada.

¿Cómo queda AMD frente al M5 Ultra?

La Radeon AI PRO R9700 compite en IA local con 32 GB de memoria, mientras que Instinct MI350X pertenece al segmento de centros de datos y ofrece 288 GB de HBM3E y hasta 8 TB/s por acelerador. Son arquitecturas dirigidas a necesidades distintas.

¿Por qué son importantes los 512 GB para ejecutar IA?

Porque permiten mantener en memoria modelos mucho mayores sin repartirlos entre varias GPU o descargar parte de sus datos hacia memoria más lenta. El tamaño real del modelo ejecutable dependerá también de su cuantización, contexto y requisitos adicionales durante la inferencia.

Scroll al inicio