Qwen3.8-Flash-Next se acerca a Claude Fable 5 y puede ejecutarse en local

Alibaba ha publicado Qwen3.8-Flash-Next, un modelo de pesos abiertos que sirve como anticipo de la arquitectura que utilizará la futura familia Qwen4. La cifra que más llama la atención no es únicamente su tamaño: el modelo principal tiene 125.000 millones de parámetros, pero activa alrededor de 6.000 millones por token gracias a su arquitectura Mixture-of-Experts (MoE). En el Agentic Index de Artificial Analysis alcanza 56 puntos, solo uno menos que Claude Fable 5 en la configuración mostrada actualmente por el índice.

Las claves de Qwen3.8-Flash-Next en 30 segundos

  • Alibaba presentó Qwen3.8-Flash-Next el 26/08/2026 como anticipo abierto de la arquitectura de Qwen4.
  • Su modelo principal suma 125.000 millones de parámetros, pero activa unos 6.000 millones por token.
  • Obtiene 56 puntos en el Agentic Index mostrado por Artificial Analysis, frente a 57 de Claude Fable 5.
  • Qwen asegura que su entrenamiento necesitó alrededor de una novena parte del coste computacional de Qwen3.7-Plus.
  • Ya existen versiones para ejecución local, aunque sus requisitos de memoria siguen siendo elevados.

La comparación necesita una precisión importante. Los 56 puntos de la captura corresponden al Artificial Analysis Agentic Index, que pondera evaluaciones orientadas al trabajo con agentes, y no significa que Qwen3.8-Flash-Next esté a un punto de Claude Fable 5 en todas las capacidades posibles. Tampoco convierte automáticamente al modelo de Alibaba en equivalente al de Anthropic para cualquier aplicación.

Aun con esa cautela, el resultado resulta interesante por otra razón: Qwen3.8-Flash-Next publica sus pesos y puede desplegarse fuera de una API comercial, mientras que Claude Fable 5 es un modelo propietario. Esa diferencia permite plantear instalaciones controladas por la propia organización, incluido hardware local, siempre que se disponga de suficiente memoria y capacidad de cómputo.

125.000 millones de parámetros, pero solo 6.000 millones activos

Qwen3.8-Flash-Next utiliza una arquitectura Mixture-of-Experts, donde no todos los parámetros del modelo intervienen para procesar cada token.

Qwen declara un modelo principal de 125.000 millones de parámetros y aproximadamente 6.000 millones activados por token. La arquitectura distribuye buena parte de su capacidad entre numerosos expertos y selecciona solo una fracción durante cada paso de inferencia.

Pero incluso esa cifra de 125.000 millones necesita una explicación adicional.

El modelo incorpora también una tabla de N-gram Embedding de unos 51.000 millones de parámetros, que eleva el tamaño efectivo del conjunto de pesos. SemiAnalysis contabiliza unos 176.000 millones entre el modelo principal y esa tabla, además de parámetros adicionales asociados al sistema de predicción de múltiples tokens.

La tabla de embeddings tiene una característica especialmente interesante para equipos que trabajan con hardware limitado: Qwen ha diseñado la arquitectura para que pueda descargarse a memoria del host y utilizar prefetching asíncrono, reduciendo la necesidad de mantener todos esos parámetros dentro de la memoria de la GPU.

El segundo cambio importante está en la atención.

Qwen combina Gated DeltaNet (GDN) con su nueva Qwen Sparse Attention (QSA). Esta última utiliza un indexador más pequeño para seleccionar las partes relevantes del contexto en lugar de aplicar atención completa indiscriminadamente sobre todos los tokens.

El objetivo es especialmente importante cuando las conversaciones empiezan a acumular decenas o cientos de miles de tokens.

Qwen3.8-Flash-Next ofrece además una ventana de contexto nativa de 262.144 tokens y admite texto e imágenes. La compañía presenta el modelo principalmente como una plataforma para programación agéntica, uso de herramientas, tareas de oficina, visión y flujos de trabajo con contextos extensos.

Entrenarlo habría costado una novena parte que Qwen3.7-Plus

La otra cifra relevante está en el entrenamiento.

Según Qwen, Qwen3.8-Flash-Next necesitó aproximadamente una novena parte del coste de entrenamiento de Qwen3.7-Plus, pese a superar al modelo anterior en determinadas evaluaciones de programación y tareas de oficina. Es una comparación publicada por el propio desarrollador y debe tratarse como tal, no como una medición independiente.

La reducción no procede únicamente del MoE.

Alibaba ha modificado cuatro áreas principales de la arquitectura: atención, conexiones residuales, embeddings y optimización.

Entre ellas aparece Gated Residual, que amplía el flujo residual a cuatro ramas y controla dinámicamente las operaciones de lectura y escritura. También utiliza el optimizador Muon junto con AdamW para distintas categorías de pesos.

Más que un simple Qwen3 con más parámetros, la compañía presenta este lanzamiento como un banco de pruebas público para Qwen4.

Es una estrategia que Qwen ya utilizó anteriormente. Qwen3-Next anticipó elementos arquitectónicos que después aparecieron en las familias Qwen3.5, Qwen3.6, Qwen3.7 y Qwen3.8. Ahora Qwen3.8-Flash-Next desempeña un papel parecido antes de la llegada de Qwen4.

Eso también obliga a moderar las expectativas. Se trata de un anticipo arquitectónico y el soporte de los motores de inferencia acaba de comenzar, por lo que tanto el rendimiento como las cuantizaciones disponibles pueden evolucionar rápidamente.

Ejecutarlo en un Mac es posible, pero 128 GB empiezan a tener sentido

La consecuencia práctica más interesante está en el despliegue local.

Ollama ya distribuye una versión MLX de Qwen3.8-Flash-Next orientada a Apple Silicon. En el momento de esta publicación, la variante qwen3.8-flash-next:125b-mlx ocupa aproximadamente 103 GB y ofrece una ventana de contexto de 256K.

Eso coloca el modelo dentro de un territorio peculiar.

No es un modelo que pueda ejecutarse cómodamente en cualquier portátil, pero tampoco exige necesariamente desplegar un clúster de aceleradores de centro de datos para experimentar con él.

Un Mac con 128 GB de memoria unificada entra ya en una categoría donde determinadas versiones cuantizadas pueden resultar viables. La memoria unificada de Apple permite que CPU y GPU trabajen sobre el mismo espacio de memoria, algo especialmente útil cuando los modelos superan la VRAM disponible en las GPU de consumo convencionales.

La situación con una NVIDIA GeForce RTX 5090 merece más cautela. Sus 32 GB de VRAM no permiten cargar por sí solos una cuantización que ocupe del orden de 80, 100 GB o más. Algunas configuraciones pueden descargar partes del modelo a la RAM del sistema, pero el resultado depende del motor de inferencia, la cuantización, el ancho de banda y la distribución concreta de los pesos. Por tanto, una RTX 5090 no debe presentarse como equivalente directo a un Mac con 128 GB de memoria unificada para ejecutar este modelo.

El repositorio oficial en Hugging Face ayuda a poner las cifras en perspectiva: los pesos originales ocupan aproximadamente 360 GB. Las versiones locales reducen esa cantidad mediante cuantización y otras técnicas.

En servidores, las primeras mediciones también empiezan a mostrar hasta dónde puede llegar la arquitectura. InferenceX de SemiAnalysis ha medido el modelo sobre NVIDIA H100 y H200 utilizando SGLang y FP8. En H200 registra 16.353 tokens por segundo y GPU manteniendo un objetivo de 50 tokens por segundo por usuario, frente a 4.974 tokens por segundo y GPU en H100 bajo el mismo criterio. Son pruebas concretas de servicio concurrente, no velocidades que deba esperar un único usuario ejecutando el modelo en un ordenador local.

La relevancia de Qwen3.8-Flash-Next está precisamente en esa amplitud de posibilidades.

El mismo modelo puede estudiarse en infraestructuras con aceleradores H200 y, mediante cuantización, trasladarse a una estación de trabajo con suficiente memoria. Las prestaciones y el número de usuarios atendidos serán completamente diferentes, pero los pesos pueden permanecer bajo control de quien opera la infraestructura.

Para empresas preocupadas por soberanía del dato, información confidencial o dependencia de APIs externas, esa característica cambia parte del cálculo.

Ejecutar un modelo local no significa automáticamente que resulte más barato. Hay que contabilizar hardware, electricidad, administración, actualizaciones y capacidad desaprovechada. Una API puede continuar siendo económicamente superior para cargas pequeñas o irregulares.

Pero los modelos MoE eficientes están reduciendo la barrera de entrada al self-hosting.

Qwen3.8-Flash-Next muestra hasta qué punto está cambiando esa frontera: un modelo con más de cien mil millones de parámetros puede activar solo una pequeña parte para cada token y ofrecer versiones cuantizadas capaces de funcionar en una estación de trabajo de gama alta.

No significa que un Mac Studio se haya convertido en sustituto de un rack de GPUs.

Significa algo más concreto: cada nueva generación permite trasladar al escritorio capacidades que hasta hace poco exigían una infraestructura considerablemente mayor. Para quienes necesitan mantener modelos y datos dentro de su propia infraestructura, esa evolución puede terminar siendo tan relevante como subir unos puntos en cualquier benchmark.

Preguntas frecuentes

¿Qué es Qwen3.8-Flash-Next?

Es un modelo multimodal de pesos abiertos presentado por el equipo Qwen de Alibaba el 26/08/2026. La compañía lo considera un anticipo de la arquitectura que utilizará Qwen4.

¿Cuántos parámetros tiene Qwen3.8-Flash-Next?

El modelo principal tiene 125.000 millones de parámetros y activa aproximadamente 6.000 millones por token. Además incorpora una tabla N-gram Embedding de unos 51.000 millones de parámetros.

¿Puede ejecutarse Qwen3.8-Flash-Next en un Mac?

Sí, existen versiones MLX preparadas para Apple Silicon. Ollama distribuye actualmente una variante de unos 103 GB, por lo que los Mac con grandes cantidades de memoria unificada son los candidatos más adecuados.

¿Qwen3.8-Flash-Next es mejor que Claude Fable 5?

No puede afirmarse de forma general. En el Agentic Index mostrado por Artificial Analysis obtiene 56 puntos frente a 57 de Claude Fable 5, pero un benchmark concreto no determina qué modelo es superior para todas las tareas.

Scroll al inicio