GLM-5.5 apunta a agosto, pero sus supuestos 1 billón de parámetros siguen sin confirmar

Zhipu AI prepara GLM-5.5 como la próxima evolución de su familia de modelos abiertos, con un lanzamiento previsto para agosto de 2026, según una estimación de JPMorgan recogida por Reuters. Todo lo demás, incluidos sus supuestos más de un billón de parámetros, el mantenimiento de una ventana de un millón de tokens y su posible licencia abierta, continúa sin confirmación oficial por parte de la compañía china.

Las claves de GLM-5.5 en 20 segundos

  • JPMorgan sitúa la posible llegada de GLM-5.5 en agosto de 2026.
  • Zhipu AI todavía no ha publicado ficha técnica, pesos, precios ni resultados.
  • Los rumores hablan de más de un billón de parámetros y un millón de tokens.
  • GLM-5.2 es la referencia confirmada: 744.000 millones de parámetros y licencia MIT.
  • El objetivo declarado de Zhipu son los agentes capaces de ejecutar tareas prolongadas.

La distinción entre información confirmada y filtraciones resulta especialmente importante en este caso. A fecha de finales de julio, la web de Z.ai, su documentación para desarrolladores y la organización oficial de Hugging Face siguen presentando GLM-5.2 como el modelo más avanzado de la compañía. No existe un repositorio denominado GLM-5.5, tampoco un identificador público para utilizarlo mediante API y no se ha difundido una tarjeta técnica.

El único dato sólido sobre su calendario procede del análisis de JPMorgan recogido por Reuters el 25 de junio. Esa información señalaba agosto como fecha esperada y describía GLM-5.5 como uno de los próximos hitos de la inteligencia artificial china. No equivale a un compromiso de lanzamiento por parte de Zhipu AI y podría cambiar.

Los rumores apuntan a un modelo mayor, pero falta la arquitectura

Las publicaciones aparecidas durante julio atribuyen a GLM-5.5 más de un billón de parámetros totales. También sugieren que utilizará una arquitectura de mezcla de expertos, conocida como Mixture of Experts o MoE, y que conservará el contexto de un millón de tokens introducido por GLM-5.2.

Zhipu AI no ha confirmado ninguno de estos puntos.

La cifra de parámetros totales tampoco permite anticipar por sí sola el coste o el rendimiento del modelo. En una arquitectura MoE solo una parte de los expertos participa en el procesamiento de cada token. Esto permite aumentar la capacidad total sin ejecutar todos los parámetros en cada paso.

GLM-5 ofrece una referencia concreta. La compañía declaró oficialmente que ese modelo cuenta con 744.000 millones de parámetros totales y alrededor de 40.000 millones activos. También indicó que había sido preentrenado con 28,5 billones de tokens, frente a los 23 billones utilizados en GLM-4.5.

Si GLM-5.5 superase el billón de parámetros manteniendo un número activo moderado, el salto podría ampliar su capacidad sin multiplicar en la misma proporción el cálculo necesario por token. Pero todavía no se conoce su número de expertos, cuántos se activarían, el tamaño de sus capas ni los requisitos de memoria.

Tampoco está confirmado que Zhipu vaya a saltarse las denominaciones GLM-5.3 y GLM-5.4. La numeración GLM-5.5 aparece en la información financiera difundida por Reuters, pero la compañía puede modificar el nombre antes del lanzamiento.

GLM-5.2 marca un punto de partida exigente

El modelo que permite valorar las expectativas es GLM-5.2, publicado en junio de 2026. Zhipu lo presenta como su sistema abierto para tareas de larga duración, programación avanzada y agentes que necesitan mantener grandes cantidades de información durante una ejecución.

Su principal novedad es una ventana de contexto de un millón de tokens, frente a los 200.000 de la generación anterior. Esto permite cargar repositorios extensos, historiales de herramientas, documentación y resultados intermedios, aunque disponer de esa capacidad máxima no significa que todas las consultas deban utilizarla.

GLM-5.2 también incorpora IndexShare, una técnica que reutiliza el mismo indexador en varios bloques de atención dispersa. Según la documentación del modelo, esta arquitectura reduce en 2,9 veces las operaciones por token asociadas a esa parte del procesamiento cuando se trabaja con el contexto completo de un millón de tokens.

La licencia MIT permite descargar los pesos, modificarlos y desplegarlos en infraestructura propia sin las restricciones comerciales habituales de algunos modelos que se presentan de forma más amplia como abiertos. Esa decisión hace razonable esperar que Zhipu mantenga una estrategia similar con GLM-5.5, pero sigue siendo una previsión, no una característica anunciada.

Artificial Analysis otorga a la configuración de máximo razonamiento de GLM-5.2 una puntuación de 51 en su índice de inteligencia. El resultado lo sitúa entre los modelos de pesos abiertos mejor valorados en esa clasificación, aunque el sistema necesitó generar una cantidad elevada de tokens durante la prueba y su rendimiento puede cambiar según el proveedor, la cuantización y el entorno de inferencia.

ModeloParámetros totalesParámetros activosContextoLicenciaEstado
GLM-5.5Más de 1 billón, rumoreadoSin confirmar1 millón, esperadoSin confirmarNo publicado
GLM-5.2En torno a 744.000 millonesEn torno a 40.000 millones1 millónMITDisponible
GLM-5744.000 millones40.000 millonesInferior a GLM-5.2MITDisponible

La tabla deja clara la diferencia entre una ficha técnica real y una previsión. En GLM-5.5 todavía no puede afirmarse la arquitectura, el tamaño, la licencia ni el contexto.

Los agentes de programación son el objetivo más creíble

Más que competir por la mejor respuesta en una conversación breve, Zhipu AI está orientando la familia GLM hacia tareas de larga duración. La propia compañía ha señalado que sus futuros modelos trabajarán sobre agentes autónomos capaces de mantener procesos extensos y mejorar su comportamiento durante la ejecución. Reuters atribuye estas líneas de desarrollo a declaraciones de la empresa, no a filtraciones comunitarias.

El caso más evidente es la programación. Un agente que modifica un repositorio completo necesita leer archivos, buscar dependencias, ejecutar pruebas, interpretar errores, volver atrás y conservar el estado durante decenas o cientos de acciones.

Un contexto de un millón de tokens ayuda, pero no resuelve por sí solo el problema. También hacen falta:

  • selección fiable de herramientas;
  • memoria estructurada;
  • recuperación de información relevante;
  • gestión de errores y reintentos;
  • capacidad para comprobar el resultado;
  • límites de ejecución y aprobación humana.

El reto no consiste simplemente en mantener más código dentro del prompt. Un agente puede disponer de todo el repositorio y aun así elegir el archivo equivocado, aplicar un cambio incompleto o interpretar mal una prueba.

Por eso los primeros resultados realmente útiles de GLM-5.5 no serán las comparaciones generales de conocimiento, sino las evaluaciones de programación con repositorios reales, terminales y tareas que requieren varias horas de trabajo.

Un modelo abierto de esta escala no será sencillo de ejecutar

La posible publicación de los pesos no significa que GLM-5.5 vaya a funcionar en un servidor convencional.

GLM-5.2 ya presenta unos requisitos elevados. Sus cientos de miles de millones de parámetros exigen varias GPU o aceleradores con gran capacidad de memoria, incluso cuando se utilizan técnicas de cuantización. Mantener un contexto de un millón de tokens añade además una caché KV considerable, tráfico entre dispositivos y una carga importante para la CPU y el sistema de almacenamiento.

Un modelo de más de un billón de parámetros podría necesitar configuraciones aún mayores. La cantidad exacta dependerá del formato de los pesos, la cuantización, los expertos activos, el paralelismo y las optimizaciones disponibles en motores como vLLM, SGLang o frameworks adaptados a hardware chino.

Esto limitaría el despliegue local a empresas con infraestructura especializada, proveedores cloud y centros de investigación. Para buena parte de los desarrolladores, la forma práctica de utilizarlo sería una API o un servicio administrado.

La condición de pesos abiertos seguiría teniendo valor. Permitirá auditar el modelo, crear versiones cuantizadas, adaptarlo a sectores concretos y desplegarlo en entornos donde los datos no pueden salir de la organización. Pero no debe confundirse apertura con bajo coste operativo.

Qué falta para considerar GLM-5.5 un competidor real

Las comparaciones con modelos cerrados de Anthropic, OpenAI o Google son prematuras. GLM-5.5 no ha sido probado públicamente y ni siquiera existe una versión accesible para evaluadores independientes.

Antes de valorar su posición harán falta al menos cinco elementos: una tarjeta técnica, los pesos o la API, los parámetros activos, resultados reproducibles y datos sobre el coste de inferencia.

También será necesario comprobar si el contexto de un millón de tokens conserva información útil cerca del límite. Una ventana extensa puede aceptar un documento enorme sin que el modelo recupere correctamente todos sus detalles o mantenga un razonamiento coherente durante cientos de acciones.

El lanzamiento esperado para agosto merece atención porque Zhipu AI ya ha demostrado que puede publicar modelos abiertos competitivos. Pero convertir GLM-5.5 en un rival de los sistemas cerrados más avanzados exigirá algo más que superar el billón de parámetros.

Preguntas frecuentes

¿Cuándo se publicará GLM-5.5?

JPMorgan sitúa su lanzamiento en agosto de 2026, según información recogida por Reuters. Zhipu AI todavía no ha anunciado una fecha exacta.

¿GLM-5.5 tendrá más de un billón de parámetros?

Es una cifra difundida por fuentes comunitarias y publicaciones no oficiales. La empresa no ha confirmado el tamaño ni la arquitectura del modelo.

¿Será GLM-5.5 un modelo de pesos abiertos?

Es probable por el precedente de GLM-5 y GLM-5.2, publicados con licencia MIT, pero Zhipu AI aún no ha comunicado la licencia de GLM-5.5.

¿Qué puede utilizarse mientras llega GLM-5.5?

GLM-5.2 ya está disponible mediante los canales oficiales de Z.ai y en Hugging Face. Ofrece un contexto de un millón de tokens y está orientado a programación, agentes y tareas de larga duración.

Scroll al inicio