El iPhone 18 Pro ejecuta un modelo de IA de 27.000 millones de parámetros en local

Una demostración realizada por el desarrollador Adrien Grondin muestra un iPhone 18 Pro ejecutando localmente el modelo Bonsai 27B, con 27.000 millones de parámetros, y generando tokens a una velocidad que, según la comparación publicada por el propio desarrollador, duplica la obtenida con el iPhone 17 Pro. El resultado pone el foco en una de las mejoras del nuevo A20 Pro: su capacidad para ejecutar modelos de inteligencia artificial (IA) directamente en el dispositivo, sin depender de un servidor en la nube.

Las claves del A20 Pro y la IA local en 20 segundos

  • El iPhone 18 Pro puede ejecutar Bonsai 27B de forma local, sin enviar la inferencia a la nube.
  • La demostración de Adrien Grondin apunta a una generación de tokens aproximadamente dos veces más rápida que en el iPhone 17 Pro.
  • El A20 Pro incorpora un Neural Engine doble de 16 núcleos y el teléfono utiliza 12 GB de memoria LPDDR5X.
  • Apple especifica un ancho de banda de memoria de 115,2 GB/s para esta generación.
  • La memoria sigue siendo el límite: modelos de 2 bits más grandes, como Bonsai 2, no resultan adecuados para ejecutarse localmente con la misma configuración.

La demostración resulta especialmente interesante porque el modelo no es pequeño en términos de parámetros. Bonsai 27B pertenece a una clase de modelos que hasta hace poco estaba mucho más asociada a ordenadores y servidores que a un teléfono. En este caso, la cuantización a 1 bit reduce de forma drástica los requisitos de memoria y permite mantener el modelo dentro de las limitaciones de un dispositivo móvil.

El dato de velocidad debe interpretarse con cierta cautela. La cifra de dos veces procede de la demostración y de la comparación difundida por Grondin, no de un benchmark oficial publicado por Apple. Tampoco se trata de una prueba independiente con una metodología estandarizada que permita generalizar ese multiplicador a cualquier modelo o aplicación.

El A20 Pro cambia el papel del Neural Engine

El hardware del iPhone 18 Pro ofrece varias piezas que ayudan a explicar el resultado. Apple confirma que el A20 Pro incorpora una doble Neural Engine de 16 núcleos, además de una CPU de seis núcleos y una GPU de siete núcleos con aceleradores neuronales.

La compañía también ha ampliado la capacidad de memoria utilizada por los modelos Pro. Tanto el iPhone 18 Pro como el iPhone 18 Pro Max disponen de 12 GB de LPDDR5X, según la información recopilada en las pruebas y especificaciones disponibles. La interfaz de memoria es de 96 bits y el ancho de banda citado para el sistema alcanza los 115,2 GB/s.

Esta combinación importa especialmente para la inferencia local. En un modelo de lenguaje, la capacidad de cálculo del acelerador es solo una parte del problema. Los pesos del modelo, la caché necesaria durante la generación y los datos temporales también tienen que mantenerse en memoria y moverse con suficiente rapidez.

En el caso de Bonsai 27B, la cuantización a 1 bit reduce de forma considerable el tamaño necesario. Las fuentes que han recogido la demostración señalan que esta versión puede ejecutarse incluso en dispositivos con 4 GB de RAM, aunque la mayor capacidad y velocidad de memoria de un iPhone 18 Pro proporciona un margen mucho mayor.

Apple, por su parte, confirma oficialmente la existencia del doble Neural Engine de 16 núcleos en el A20 Pro, pero no publica en sus especificaciones el resultado concreto de dos veces la velocidad para Bonsai 27B. Esa diferencia entre las especificaciones del fabricante y una demostración de terceros es importante para interpretar correctamente el dato.

La memoria sigue marcando el límite

El experimento también deja una conclusión menos evidente: disponer de un acelerador de IA mucho más potente no significa que cualquier modelo pueda ejecutarse en el teléfono.

La principal limitación aparece con Bonsai 2, una versión con cuantización de 2 bits. Según la información difundida junto con la demostración, este modelo ocupa demasiado espacio para funcionar de forma eficiente en la memoria disponible del iPhone 18 Pro. El problema no es únicamente conseguir que los pesos quepan, sino conservar memoria suficiente para el sistema, la aplicación y las estructuras que necesita la inferencia.

Ahí aparece una diferencia importante entre ejecutar un modelo comprimido y utilizar una versión con mayor precisión. La cuantización permite reducir memoria a costa de representar los valores del modelo con menos bits. En Bonsai 27B, la versión de 1 bit hace posible un escenario que sería mucho más difícil con una representación más pesada.

Una prueba independiente publicada por iGeneration también señala las limitaciones térmicas y de batería que aparecen cuando se mantiene una carga intensa de IA durante periodos prolongados. El propio medio sitúa la memoria como otro límite para ejecutar modelos más densos con suficiente margen.

El resultado apunta así a una evolución interesante de la IA en los móviles. Un teléfono ya puede ejecutar localmente un modelo de 27.000 millones de parámetros con una respuesta suficientemente rápida para que el escenario resulte práctico, al menos con una versión muy comprimida del modelo. Eso permite realizar determinadas tareas sin enviar cada consulta a un servicio remoto.

Para el usuario, esa arquitectura puede tener ventajas en situaciones donde la conectividad sea limitada o cuando una aplicación quiera mantener determinados datos y procesos en el propio dispositivo. Pero el rendimiento final dependerá del modelo utilizado, su cuantización, la aplicación, la temperatura del teléfono y la memoria disponible.

La demostración del iPhone 18 Pro no significa, por tanto, que los móviles puedan ejecutar indistintamente modelos de 27.000 millones de parámetros en cualquier formato. Lo que muestra es que una combinación de memoria rápida, mayor capacidad de aceleración neuronal y modelos altamente cuantizados permite llevar modelos que antes parecían demasiado grandes al propio teléfono.

El siguiente límite está bastante claro: para ejecutar modelos más densos y con menos compresión, la capacidad de memoria tendrá que crecer. El A20 Pro puede acelerar la inferencia, pero no elimina la cantidad de memoria que necesita un modelo para funcionar.

Preguntas frecuentes

¿Puede el iPhone 18 Pro ejecutar un modelo de 27.000 millones de parámetros?

Sí. La demostración de Adrien Grondin muestra un iPhone 18 Pro ejecutando localmente Bonsai 27B, una versión cuantizada a 1 bit.

¿Es realmente el doble de rápido que el iPhone 17 Pro?

La demostración difundida por Grondin apunta a una velocidad aproximadamente dos veces superior. Es un resultado de una prueba de desarrollador y no una cifra de rendimiento oficial publicada por Apple.

¿Qué Neural Engine tiene el A20 Pro?

El A20 Pro incorpora una doble Neural Engine de 16 núcleos. Apple también especifica una CPU de seis núcleos y una GPU de siete núcleos con aceleradores neuronales.

¿Por qué Bonsai 2 tiene problemas para funcionar localmente?

La versión Bonsai 2 utiliza una cuantización de 2 bits y requiere más memoria que la versión de 1 bit empleada en la demostración. Según las fuentes consultadas, esa mayor exigencia limita su ejecución eficiente en los 12 GB disponibles del iPhone 18 Pro.

Scroll al inicio