China ha concentrado en pocos días tres movimientos que muestran hasta qué punto se ha acelerado su industria de inteligencia artificial. Moonshot AI ha lanzado Kimi K3, un modelo de 2,8 billones de parámetros; Alibaba ha abierto la vista previa de Qwen 3.8 Max, con 2,4 billones, y DeepSeek prepara la retirada de sus antiguas API para concentrar el servicio en DeepSeek V4 Pro y V4 Flash. Frente a ellos aparecen las últimas propuestas estadounidenses, GPT-5.6 Sol y Claude Opus 5, más caras y cerradas, pero todavía por delante en varias pruebas de capacidad general.
Las claves de la carrera de IA entre China y Estados Unidos en 30 segundos
- Kimi K3 alcanza 2,8 billones de parámetros, combina texto y visión y admite contextos de un millón de tokens.
- Qwen 3.8 Max llega como una vista previa de 2,4 billones de parámetros orientada a programación, análisis y automatización de oficina.
- DeepSeek V4 ofrece versiones Pro y Flash con razonamiento opcional y compatibilidad con las API de OpenAI y Anthropic.
- GPT-5.6 Sol y Claude Opus 5 mantienen ventaja en determinadas pruebas, pero con modelos cerrados y precios superiores.
- La capacidad de inferencia, el coste y la disponibilidad empiezan a ser tan importantes como la calidad del modelo.
Las cifras de parámetros llaman la atención, pero no explican por sí solas el rendimiento. Kimi K3 y Qwen 3.8 Max utilizan arquitecturas de mezcla de expertos, conocidas como MoE (Mixture of Experts), en las que solo una parte del modelo participa en cada petición. Esto permite aumentar la capacidad total sin activar todos los parámetros a la vez, aunque sigue exigiendo grandes cantidades de memoria, interconexiones rápidas y una infraestructura considerable para atender a miles de usuarios.
Esa es una de las grandes diferencias entre esta etapa de la carrera y la vivida durante 2023 y 2024. El desafío ya no consiste únicamente en entrenar un modelo competitivo. También hay que servirlo con una latencia razonable, controlar el coste de cada respuesta y disponer de suficientes aceleradores para absorber los picos de demanda.
Kimi K3 lleva los modelos abiertos hasta los 2,8 billones de parámetros
Moonshot AI presentó Kimi K3 como su modelo más capaz hasta la fecha. Cuenta con 2,8 billones de parámetros, capacidades visuales nativas y una ventana de contexto de un millón de tokens. La compañía lo dirige a programación de larga duración, trabajo con conocimiento, investigación y razonamiento complejo.
Su arquitectura combina Kimi Delta Attention y Attention Residuals, dos tecnologías desarrolladas para reducir el coste del procesamiento de secuencias largas y mejorar el flujo de información entre las capas del modelo. Kimi K3 dispone de 896 expertos, aunque activa 16 para procesar cada token.
Moonshot sostiene que estos cambios proporcionan una mejora aproximada de 2,5 veces en la eficiencia de escalado frente a Kimi K2. La cifra procede de las evaluaciones de la propia empresa y tendrá que contrastarse cuando estén disponibles los pesos completos, el informe técnico y más pruebas independientes.
La compañía reconoce que el rendimiento general de Kimi K3 todavía queda por debajo de Claude Fable 5 y GPT-5.6 Sol, aunque asegura haber logrado resultados competitivos en programación, razonamiento visual y tareas prolongadas con herramientas. En una prueba interna de optimización de núcleos para GPU, Kimi afirma haber superado a GPT-5.6 Sol y Claude Opus 4.8, pero los resultados de un fabricante no permiten establecer por sí solos una clasificación general.
Kimi K3 está disponible mediante la web de Kimi, Kimi Work, Kimi Code y su API. Moonshot anunció además la publicación de los pesos completos, una decisión que puede trasladar parte del coste de inferencia a empresas, proveedores de infraestructura y comunidades que decidan desplegar el modelo por su cuenta.
No será un despliegue sencillo. Moonshot recomienda configuraciones con al menos 64 aceleradores para mantener el tráfico entre expertos dentro de un dominio de comunicaciones de alta velocidad. Por eso, aunque se publique como modelo de pesos abiertos, su tamaño lo aleja de las instalaciones locales convencionales y lo sitúa principalmente en centros de datos, nubes especializadas y grandes organizaciones.
DeepSeek V4 apuesta por precio, contexto largo y compatibilidad
DeepSeek V4 empezó a estar disponible en abril de 2026 con dos variantes: V4 Pro y V4 Flash. Ambas admiten un contexto de un millón de tokens, llamadas a herramientas y modos con o sin razonamiento.
La versión Pro está pensada para los trabajos que requieren más capacidad, mientras que Flash reduce el coste y la latencia para tareas frecuentes. DeepSeek también ofrece interfaces compatibles con los formatos de OpenAI y Anthropic, de modo que muchas aplicaciones pueden cambiar de proveedor con modificaciones limitadas en su configuración.
La empresa programó para el 24 de julio de 2026 la retirada de los antiguos nombres de modelo deepseek-chat y deepseek-reasoner. Durante el periodo de transición, ambos identificadores apuntaban en realidad a V4 Flash, con el razonamiento desactivado o activado según el caso.
Este detalle importa para los equipos que hayan evaluado el servicio sin revisar la documentación. Una aplicación que creyera estar utilizando el modelo de mayor capacidad podría haber estado trabajando con Flash. La migración a los identificadores deepseek-v4-pro y deepseek-v4-flash permite escoger de forma explícita la variante.
DeepSeek continúa compitiendo especialmente mediante el precio. Su propuesta resulta muy inferior a las tarifas de los modelos estadounidenses de gama alta, aunque la comparación debe hacerse con cuidado. El precio por millón de tokens no refleja cuánto texto genera cada modelo, cuántos intentos necesita para terminar una tarea o qué porcentaje de respuestas requiere correcciones.
Un modelo barato por token puede terminar siendo más caro si consume más tokens o falla con mayor frecuencia. Del mismo modo, un modelo con una tarifa elevada puede resultar rentable cuando resuelve un trabajo complejo en menos pasos.
Qwen 3.8 Max entra todavía como una vista previa
Alibaba ha incorporado Qwen 3.8 Max Preview a sus servicios Qoder y Alibaba Cloud Model Studio. El modelo tiene 2,4 billones de parámetros y se presenta como una evolución orientada a programación, automatización de tareas profesionales, análisis de datos y flujos de trabajo con herramientas.
A diferencia de un lanzamiento comercial definitivo, esta versión se encuentra en fase de vista previa. Alibaba advierte de que sus capacidades pueden seguir cambiando durante el periodo de prueba y que el modelo podría ser sustituido por una versión estable más adelante.
La empresa ha aplicado temporalmente un fuerte descuento al consumo de créditos. Durante la promoción, las llamadas utilizan una décima parte de los créditos habituales, con una reducción adicional durante la noche en horario de Pekín. No existe todavía una tarifa pública convencional por millón de tokens que permita compararlo directamente con Kimi, DeepSeek, OpenAI o Anthropic.
El gran tamaño de Qwen 3.8 Max tampoco permite calcular su coste real de inferencia porque Alibaba no ha publicado cuántos parámetros activa para cada token. En un modelo MoE, ese dato es más útil que el número total de parámetros para estimar las necesidades de cómputo.
La ausencia de resultados técnicos completos también obliga a tratar con cautela las afirmaciones sobre su posición frente a los modelos estadounidenses. Alibaba sostiene que la nueva generación mejora de forma clara a Qwen 3.7 Max, pero todavía faltan evaluaciones independientes sobre programación, razonamiento, uso de herramientas, multimodalidad y consumo de tokens.
Comparativa con GPT-5.6 Sol y Claude Opus 5
Las propuestas chinas compiten con precios agresivos, contextos largos y una mayor apertura. OpenAI y Anthropic responden con modelos propietarios que, por ahora, conservan una posición fuerte en trabajos profesionales, programación autónoma y tareas que requieren utilizar herramientas durante periodos prolongados.
| Modelo | Tipo y disponibilidad | Contexto | Precio de entrada | Precio de salida | Punto diferencial |
|---|---|---|---|---|---|
| Kimi K3 | MoE, pesos abiertos anunciados | 1 millón | Según API de Kimi | 15 dólares por millón de tokens de salida | 2,8 billones de parámetros y visión nativa |
| DeepSeek V4 Pro | MoE, API y pesos abiertos | 1 millón | Tarifa variable según caché y horario | Menos de 1 dólar fuera de horas punta, según su tabla comercial | Bajo coste y compatibilidad con API de OpenAI y Anthropic |
| Qwen 3.8 Max Preview | MoE, vista previa cerrada | Cerca de 1 millón | Sin tarifa estándar publicada | Sin tarifa estándar publicada | 2,4 billones de parámetros y foco en código y trabajo de oficina |
| GPT-5.6 Sol | Modelo propietario | Hasta 1 millón, según modalidad | 5 dólares por millón | 30 dólares por millón | Programación, herramientas, diseño y trabajo profesional |
| Claude Opus 5 | Modelo propietario | 1 millón | 5 dólares por millón | 25 dólares por millón | Programación autónoma, razonamiento prolongado y uso de ordenador |
Los precios no son completamente equivalentes. Alibaba utiliza créditos durante la vista previa, DeepSeek aplica diferencias por caché y franja horaria, y algunos proveedores cobran aparte el uso de herramientas, los modos rápidos o el razonamiento de mayor esfuerzo.
GPT-5.6 Sol, presentado por OpenAI el 9 de julio de 2026, es el modelo principal de una familia que también incluye Terra y Luna. Sol cuesta 5 dólares por millón de tokens de entrada y 30 dólares por millón de salida. OpenAI lo dirige a programación, investigación, ciencia, ciberseguridad, diseño y automatización con herramientas.
La compañía asegura que Sol obtiene mejores resultados que su generación anterior utilizando menos tokens y añade los niveles max y ultra para tareas especialmente exigentes. Ultra coordina varios agentes en paralelo, por lo que el coste final puede superar ampliamente la tarifa básica cuando se utiliza durante flujos de trabajo prolongados.
Claude Opus 5, disponible desde el 24 de julio, cuesta 5 dólares por millón de tokens de entrada y 25 dólares por millón de salida. Anthropic lo presenta como un modelo cercano a Claude Fable 5 por aproximadamente la mitad del coste por tarea.
Opus 5 admite un millón de tokens de contexto y hasta 128.000 tokens de salida. La empresa destaca su rendimiento en programación, agentes, automatización empresarial y uso del ordenador. También dispone de un modo rápido que funciona, según Anthropic, aproximadamente 2,5 veces más deprisa, aunque duplica la tarifa base.
China compite con apertura y coste, Estados Unidos con servicio y producto
La diferencia entre los dos mercados no puede reducirse a una tabla de puntuaciones. Las empresas chinas están utilizando los pesos abiertos y los precios bajos para acelerar la adopción, atraer desarrolladores y reducir la dependencia de proveedores estadounidenses.
Moonshot y DeepSeek permiten que terceros adapten o desplieguen sus modelos, aunque el tamaño de Kimi K3 obliga a contar con una infraestructura fuera del alcance de la mayoría de las empresas. Alibaba, por su parte, combina el desarrollo de modelos con su nube, sus plataformas de programación y sus aplicaciones empresariales.
OpenAI y Anthropic mantienen un modelo más cerrado, pero ofrecen servicios maduros, integraciones comerciales y capacidad para atender cargas de producción a gran escala. También controlan con mayor precisión la experiencia completa, desde el modelo hasta las herramientas, las interfaces y la facturación.
Las restricciones estadounidenses a la exportación de aceleradores siguen condicionando a los laboratorios chinos. Esa limitación ha favorecido arquitecturas que intentan extraer más rendimiento de cada GPU, pero no elimina el problema de la capacidad. Un modelo puede entrenarse con técnicas muy eficientes y seguir necesitando miles de aceleradores para responder a millones de usuarios.
Kimi K3 resume esa contradicción. Sus pesos abiertos facilitan que el modelo se distribuya, pero sus 2,8 billones de parámetros exigen una infraestructura de alto nivel. La apertura reduce la dependencia del proveedor original, aunque traslada el coste del servicio a quien decida alojarlo.
La carrera entre China y Estados Unidos entra así en una fase menos sencilla de medir. Los parámetros y los resultados de laboratorio seguirán ocupando titulares, pero la decisión empresarial dependerá también del coste por tarea terminada, la velocidad, la estabilidad de la API, la privacidad, la posibilidad de instalar el modelo y la disponibilidad real de capacidad.
Preguntas frecuentes
¿Es Kimi K3 más potente que GPT-5.6 Sol y Claude Opus 5?
Moonshot reconoce que Kimi K3 todavía queda por debajo de GPT-5.6 Sol y Claude Fable 5 en capacidad general. Puede superar a modelos propietarios en pruebas concretas, pero aún faltan evaluaciones independientes amplias.
¿DeepSeek V4 es más barato que GPT-5.6 y Claude Opus 5?
Su precio por token es mucho menor, especialmente fuera de las horas punta. El coste real depende también de la cantidad de tokens generados, la calidad de las respuestas y el número de intentos necesarios.
¿Qwen 3.8 Max ya está disponible de forma definitiva?
No. Alibaba lo ofrece como Qwen3.8-Max-Preview, una versión que puede seguir cambiando y que podría ser reemplazada por el modelo estable cuando termine el periodo de prueba.
¿Se pueden instalar estos modelos chinos en servidores propios?
DeepSeek y Kimi han apostado por los pesos abiertos, pero Kimi K3 necesita una infraestructura con decenas de aceleradores para funcionar de forma eficiente. Qwen 3.8 Max todavía no dispone de unos pesos públicos confirmados para descarga.












