Cloudflare ha presentado nuevas optimizaciones para Workers AI que permiten ejecutar modelos abiertos de última generación como Kimi K2.6 de Moonshot AI y GLM 5.2 de Z.ai utilizando menos memoria GPU, manteniendo prácticamente la misma precisión y aumentando el número de solicitudes simultáneas. La compañía considera que este tipo de mejoras será determinante para abaratar la inferencia de modelos de IA cada vez más grandes y con ventanas de contexto más extensas.
Las claves de las optimizaciones de Workers AI en 20 segundos
- Cloudflare reduce el consumo de memoria al ejecutar modelos como Kimi K2.6 y GLM 5.2.
- La compañía combina cuantización FP8 para la KV Cache e INT4 para los pesos del modelo.
- Las mejoras permiten aumentar la concurrencia y reducir el coste por inferencia sin afectar de forma apreciable a la precisión.
- El objetivo es hacer más rentable el despliegue de modelos abiertos de gran tamaño.
Durante los últimos meses, gran parte de la atención de la industria se ha centrado en lanzar modelos cada vez más capaces. Sin embargo, una vez entrenados, el verdadero reto pasa a ser otro: cómo servir millones de peticiones al menor coste posible. Ahí es donde entran en juego las técnicas que Cloudflare acaba de describir.
La memoria se ha convertido en el nuevo cuello de botella de la IA
Modelos como Kimi K2.6 o GLM 5.2 destacan por ofrecer contextos muy largos y arquitecturas Mixture of Experts (MoE), pero esas mismas capacidades disparan el consumo de memoria durante la inferencia.
Cloudflare explica que, en muchas ocasiones, el problema ya no reside únicamente en el tamaño del modelo, sino en la KV Cache, la estructura que almacena las claves y valores de atención para evitar recalcular todo el historial de una conversación cada vez que el modelo genera un nuevo token.
En conversaciones largas, esta caché puede ocupar más memoria que los propios parámetros del modelo, limitando el número de usuarios que pueden compartir una misma GPU.
FP8 permite duplicar el contexto disponible
La primera optimización consiste en almacenar la KV Cache utilizando formato FP8 en lugar del habitual BF16.
Según los datos publicados por Cloudflare, este cambio reduce aproximadamente a la mitad el espacio necesario para almacenar la caché. En Kimi K2.6 eso permite aumentar el contexto residente en memoria desde unos 686.000 tokens hasta aproximadamente 1,37 millones de tokens.
Aunque cada petición individual resulta ligeramente más lenta debido a las conversiones entre formatos, el beneficio aparece cuando aumenta la concurrencia.
Mientras que una GPU configurada con BF16 agotaba la memoria alrededor de las 32 solicitudes simultáneas, la versión FP8 puede mantener hasta 64 peticiones concurrentes, alcanzando cerca de 2.192 tokens por segundo, alrededor de un 41 % más de rendimiento agregado.
Cloudflare asegura además que las diferencias de precisión entre ambos formatos son prácticamente inapreciables en sus pruebas internas, incluyendo benchmarks como GSM8K, MMLU o ARC.
GLM 5.2 también reduce el tamaño del modelo
La segunda técnica afecta directamente al modelo.
Cloudflare utiliza una cuantización INT4 para GLM 5.2 que reduce el tamaño del checkpoint desde aproximadamente 705 GB hasta 421 GB, un ahorro cercano al 40 %.
Esta reducción libera memoria GPU y acelera especialmente la fase de generación de texto, donde el rendimiento depende en gran medida del ancho de banda de memoria.
En las cifras compartidas por la compañía, GLM pasa de generar unos 60 tokens por segundo utilizando FP8 a alrededor de 92 tokens por segundo con INT4 cuando solo existe una petición activa.
Durante la fase inicial de procesamiento (prefill), Cloudflare continúa utilizando FP8, ya que en ese escenario la limitación principal es la capacidad de cálculo y no el acceso a memoria.
Más solicitudes compartiendo GPU requieren nuevas medidas de seguridad
Permitir que más usuarios compartan una misma GPU también aumenta la complejidad de gestionar correctamente la memoria compartida.
Por ello, Cloudflare ha desarrollado un sistema de verificación de integridad de la KV Cache que comprueba que cada solicitud únicamente acceda a las páginas de memoria que le corresponden.
Si detecta cualquier inconsistencia durante la generación, la petición se cancela automáticamente antes de devolver una respuesta potencialmente incorrecta.
La compañía afirma que este mecanismo añade menos de un 1 % de impacto tanto en latencia como en rendimiento, lo que considera un coste asumible para mejorar la fiabilidad de la plataforma.
La eficiencia será uno de los grandes factores competitivos de la IA
El anuncio pone de manifiesto una tendencia cada vez más visible en el sector. La carrera ya no consiste únicamente en entrenar modelos más grandes, sino en hacerlos económicamente viables.
Cada punto porcentual de ahorro en memoria permite ejecutar más inferencias por GPU, reducir el coste operativo y ofrecer precios más competitivos para desarrolladores y empresas que consumen modelos abiertos.
Cloudflare adelanta que seguirá ampliando estas optimizaciones durante los próximos meses. Entre sus líneas de trabajo figuran la extensión del uso de FP8 al resto de su infraestructura, nuevas técnicas de cuantización como NVFP4 para GPUs Blackwell de NVIDIA y la expansión de los mecanismos de protección de memoria a más despliegues de producción.
Todo ello refleja cómo la innovación en IA ya no depende únicamente del entrenamiento de nuevos modelos, sino también de la capacidad de ejecutarlos de forma más eficiente, segura y rentable.
Preguntas frecuentes
¿Qué modelos optimiza Cloudflare?
Las mejoras descritas se aplican principalmente a Kimi K2.6 de Moonshot AI y GLM 5.2 de Z.ai, disponibles en Workers AI.
¿Por qué es importante reducir el consumo de memoria?
Porque permite atender más usuarios con la misma infraestructura GPU, reduciendo el coste por inferencia y mejorando la escalabilidad de los servicios de IA.
¿Qué es la KV Cache?
Es la estructura donde un modelo almacena la información necesaria para recordar el contexto de una conversación sin recalcularlo continuamente.
¿Estas optimizaciones modifican el comportamiento del modelo?
Según los benchmarks publicados por Cloudflare, las diferencias de precisión respecto a las versiones originales son mínimas y no resultan significativas en las pruebas realizadas.













