Grok 4.6 alcanza a GPT-5.6 Sol y se acerca a Fable 5 por mucho menos dinero

SpaceXAI ha presentado Grok 4.6, una nueva versión de su modelo de inteligencia artificial que da un salto importante frente a Grok 4.5 y entra directamente en la pelea con los modelos frontera de OpenAI y Anthropic. En las primeras mediciones difundidas por Artificial Analysis, Grok 4.6 High obtiene 61 puntos en su Intelligence Index, el mismo resultado mostrado para GPT-5.6 Sol Max y solo un punto por debajo de Claude Fable 5 Max. La diferencia más llamativa está en el precio: Grok 4.6 cuesta 2 dólares por millón de tokens de entrada y 6 dólares por millón de salida.

Las claves de Grok 4.6 en 30 segundos

  • Grok 4.6 High obtiene 61 puntos en el Artificial Analysis Intelligence Index.
  • Iguala en esa métrica a GPT-5.6 Sol Max y queda a un punto de Fable 5 Max.
  • Lidera la comparación mostrada en GDPVal-AA v2, AA-Briefcase y Harvey LAB.
  • Su API cuesta 2 dólares por millón de tokens de entrada y 6 dólares de salida.
  • Fable 5 cuesta 10/50 dólares y GPT-5.6 Sol, 5/30 dólares, por lo que la diferencia de precio es considerable.

El salto es relevante porque Grok 4.5 High obtenía 56 puntos en la tabla mostrada, mientras Grok 4.6 sube hasta 61. Esa mejora sitúa a SpaceXAI en un nivel muy distinto al de generaciones anteriores y refuerza la estrategia de competir no solo por capacidad absoluta, sino también por rendimiento por dólar.

La comparación debe leerse con cautela. Los benchmarks no convierten automáticamente un modelo en mejor para cualquier tarea y las puntuaciones varían según configuración, nivel de razonamiento y metodología. Artificial Analysis, además, actualiza periódicamente sus evaluaciones a medida que incorpora nuevas pruebas. Su propio ranking de GDPVal-AA muestra cómo diferentes niveles de esfuerzo de un mismo modelo pueden producir resultados muy distintos.

Aun así, la fotografía inicial deja un mensaje claro: Grok 4.6 ya no está compitiendo únicamente con modelos rápidos o de coste medio.

Grok 4.6 recorta cinco puntos de distancia en una sola generación

La tabla publicada con los primeros resultados compara Grok 4.6 High con Grok 4.5 High, GPT-5.6 Sol Max y Fable 5 Max.

En el AA Intelligence Index, Fable 5 obtiene 62 puntos, Grok 4.6 y GPT-5.6 Sol aparecen empatados con 61 y Grok 4.5 queda en 56.

La mejora generacional de SpaceXAI es, por tanto, de cinco puntos.

En GDPVal-AA v2, una evaluación orientada a tareas profesionales reales, Grok 4.6 alcanza 1.753 puntos, por delante de Fable 5 con 1.741 y GPT-5.6 Sol con 1.728 en la comparación facilitada.

También logra 1.577 puntos en AA-Briefcase, ligeramente por encima de los 1.574 de Fable 5, mientras GPT-5.6 Sol alcanza 1.502.

En Harvey LAB, orientado al trabajo legal, Grok 4.6 consigue un 15,8 %, frente al 11,3 % de Fable 5 y el 2,5 % de GPT-5.6 Sol.

No domina, sin embargo, todas las pruebas.

Fable 5 lidera CursorBench v3.2 con un 70,5 %, frente al 69,9 % de Grok 4.6. También obtiene mejores resultados en FrontierCode v1.1 Extended y APEX-Agents.

GPT-5.6 Sol destaca especialmente en DeepSWE v1.1, con un 73 %, frente al 70 % de Fable 5 y el 65,9 % de Grok 4.6, y consigue el mejor resultado en Terminal-Bench v3.0 con un 34,6 %.

BenchmarkGrok 4.6 HighGPT-5.6 Sol MaxFable 5 Max
AA Intelligence Index616162
GDPVal-AA v21.7531.7281.741
CursorBench v3.269,9 %67,2 %70,5 %
DeepSWE v1.165,9 %73 %70 %
FrontierCode v1.1 Extended61,3 %60,6 %64,9 %
APEX-Agents57,5 %56,7 %59,2 %
Terminal-Bench v3.026 %34,6 %34,1 %
AA-Briefcase1.5771.5021.574
Harvey LAB15,8 %2,5 %11,3 %

La conclusión no es que Grok 4.6 sea mejor que todos sus rivales, sino que ya se mueve en el mismo grupo de rendimiento.

El precio es donde Grok 4.6 cambia la comparación

El apartado más interesante aparece al pasar de los benchmarks a la factura de la API.

Grok 4.6 está anunciado a:

2 dólares por millón de tokens de entrada y 6 dólares por millón de salida.

GPT-5.6 Sol cuesta actualmente 5 dólares de entrada y 30 dólares de salida por millón de tokens. OpenAI ofrece además el input almacenado en caché a 0,50 dólares por millón.

Claude Fable 5 es considerablemente más caro: 10 dólares por millón de tokens de entrada y 50 dólares por millón de salida, según Anthropic.

La diferencia es especialmente grande en generación.

ModeloEntrada / 1 M tokensSalida / 1 M tokens
Grok 4.62 $6 $
GPT-5.6 Sol5 $30 $
Claude Fable 510 $50 $

Frente a Fable 5, Grok cuesta un 80 % menos en entrada y un 88 % menos en salida según las tarifas base.

Por eso hablar simplemente de un «80 % de descuento» se queda incluso corto para determinadas cargas, aunque tampoco existe un único porcentaje aplicable al coste real.

La mezcla de tokens de entrada y salida, el uso de caché y la cantidad total de razonamiento pueden modificar mucho el coste de una tarea completa.

Frente a GPT-5.6 Sol, la diferencia también es notable: Grok cuesta un 60 % menos en entrada y un 80 % menos en salida.

Aquí aparece una cuestión mucho más importante que quién obtiene uno o dos puntos adicionales en un benchmark.

Para un desarrollador que ejecuta millones de peticiones, el coste por tarea útil puede ser más relevante que la puntuación máxima absoluta.

Precio por token no significa precio por respuesta

Existe, sin embargo, una trampa habitual en estas comparaciones.

Un modelo barato por token puede utilizar muchos más tokens de razonamiento para llegar al mismo resultado.

OpenAI subraya precisamente que las comparaciones de coste deben tener en cuenta el comportamiento real del modelo, incluyendo tokens generados, herramientas y latencia, porque la tarifa nominal no basta para calcular el coste final de una tarea.

Artificial Analysis utiliza por esa razón métricas de cost per task además del precio por millón de tokens.

Grok 4.3 ya había mostrado una evolución interesante en este sentido. Cuando fue evaluado en abril, Artificial Analysis destacó que ofrecía una puntuación superior a la generación anterior mientras reducía el coste total de ejecutar su suite de benchmarks.

Grok 4.6 parece llevar esa estrategia bastante más lejos.

El enfoque recuerda a lo ocurrido en los procesadores durante años: no basta con comparar rendimiento máximo. Hay que medir rendimiento por vatio, coste por operación y capacidad real de escalar la carga.

En IA, esas métricas empiezan a convertirse en inteligencia por dólar, latencia por tarea y coste por resultado correcto.

SpaceXAI está convirtiendo infraestructura en una ventaja

El precio agresivo tampoco puede analizarse separado de la enorme inversión de SpaceXAI en capacidad informática.

La compañía está construyendo infraestructura a una escala que hace pocos años habría parecido difícil de justificar incluso para un hiperescalares.

Colossus ha sido una de las piezas centrales de esa expansión y la estrategia de la compañía pasa por seguir aumentando rápidamente la capacidad disponible.

Esa infraestructura es importante por dos motivos.

Primero, permite entrenar modelos de mayor tamaño y experimentar con más ciclos de entrenamiento.

Segundo, proporciona a SpaceXAI capacidad propia para servir inferencia sin depender completamente de proveedores externos.

Esto puede traducirse directamente en precios.

Un laboratorio que compra capacidad GPU a terceros tiene que incorporar el margen del proveedor de infraestructura al precio de su API. Una compañía que controla una parte cada vez mayor de su propia infraestructura tiene otras posibilidades para decidir cuánto margen sacrifica con el objetivo de ganar volumen.

La integración cada vez mayor entre SpaceX y su negocio de IA refuerza precisamente ese modelo.

Grok 4.6 llega además apenas un mes después de Grok 4.5, lo que muestra un ritmo de actualización especialmente rápido. MarketWatch señala que la nueva generación está orientada, entre otros objetivos, a agentes de larga duración y tareas complejas, dos áreas en las que los modelos frontera están concentrando buena parte de su competencia.

Fable 5 sigue mostrando una ventaja en tareas agentic y de código

El empate en el índice agregado tampoco debería ocultar las diferencias entre modelos.

Fable 5 continúa obteniendo resultados superiores en varias pruebas especialmente relevantes para programación y agentes.

En CursorBench v3.2 alcanza 70,5 %, en FrontierCode Extended 64,9 % y en APEX-Agents 59,2 %.

Anthropic presenta Fable 5 precisamente como un modelo diseñado para proyectos largos, programación compleja y agentes capaces de trabajar durante días, delegar en subagentes y verificar su propio trabajo. Su contexto llega a un millón de tokens y está disponible mediante API y plataformas cloud.

Eso ayuda a entender su precio mucho mayor.

Anthropic no está intentando competir con Fable 5 como modelo económico para cualquier llamada API. Lo posiciona como una herramienta de máxima capacidad para problemas donde el coste del modelo puede ser secundario frente al coste del trabajo humano que sustituye o acelera.

Grok 4.6 introduce una presión distinta: ¿qué ocurre si un modelo cinco u ocho veces más barato empieza a resolver una parte suficientemente grande de esas mismas tareas?

Para aplicaciones de gran volumen, incluso una pequeña diferencia de calidad puede compensarse si el coste por inferencia cae drásticamente.

GPT-5.6 Sol mantiene una ventaja clara en algunas tareas de ingeniería

GPT-5.6 Sol presenta otro perfil.

OpenAI lo define como su modelo frontera para trabajo profesional complejo, programación, investigación, ciencia, ciberseguridad y uso de herramientas. Dispone de una ventana de contexto de 1,05 millones de tokens y hasta 128.000 tokens de salida.

En la comparación mostrada, su mayor ventaja aparece en DeepSWE v1.1 con un 73 % y Terminal-Bench v3.0 con un 34,6 %.

Eso sugiere que el empate de 61 puntos en el Intelligence Index no representa capacidades idénticas.

Un desarrollador que construya un agente para operar terminales puede obtener resultados diferentes que otro que utilice el modelo para documentos legales o tareas profesionales generalistas.

Es una de las razones por las que los benchmarks agregados son útiles para situar modelos, pero insuficientes para elegir uno.

El test relevante es el que más se parece a la carga real.

La guerra de los modelos frontera empieza a convertirse en una guerra de costes

Hasta hace poco, los laboratorios podían justificar precios elevados simplemente porque solo unos pocos modelos ofrecían capacidades realmente avanzadas.

Eso empieza a cambiar.

OpenAI, Anthropic, Google, SpaceXAI y desarrolladores chinos están acercándose mucho en determinados benchmarks, mientras la competencia en precios aumenta.

El propio DeepSeek sigue jugando en otra liga de costes. Su reciente V4-Pro ha sido anunciado con tarifas inferiores incluso a las de Grok, aunque comparar modelos únicamente por precio resulta todavía menos útil cuando existen diferencias significativas de rendimiento.

Grok 4.6 ocupa una posición particularmente interesante porque intenta combinar ambos extremos: precio cercano a modelos mucho más económicos y rendimiento próximo a los modelos frontera más caros.

Si los resultados se mantienen a medida que Artificial Analysis y otras entidades amplíen las pruebas independientes, la consecuencia será importante para el mercado.

Las compañías que integran IA mediante API tendrán más capacidad para utilizar diferentes modelos según la tarea.

Fable 5 podría reservarse para problemas especialmente difíciles. GPT-5.6 Sol para determinadas cargas de programación, agentes o conocimiento. Grok 4.6 para tareas donde proporcione un resultado suficientemente cercano por una fracción del coste.

Ese escenario favorece arquitecturas de model routing, donde una aplicación decide dinámicamente qué modelo utilizar en función de dificultad, latencia y presupuesto.

Y probablemente ahí está la parte más importante del lanzamiento.

Grok 4.6 no necesita superar a Fable 5 en cada benchmark para convertirse en un problema para Anthropic u OpenAI.

Le basta con acercarse lo suficiente y ser mucho más barato.

Preguntas frecuentes

¿Qué puntuación obtiene Grok 4.6 en Artificial Analysis?

La configuración Grok 4.6 High obtiene 61 puntos en el Intelligence Index mostrado, frente a 56 de Grok 4.5 High. GPT-5.6 Sol Max aparece también con 61 y Fable 5 Max con 62.

¿Cuánto cuesta utilizar Grok 4.6 mediante API?

La tarifa anunciada es de 2 dólares por millón de tokens de entrada y 6 dólares por millón de tokens de salida.

¿Es Grok 4.6 más barato que GPT-5.6 Sol y Fable 5?

Sí en sus tarifas base. GPT-5.6 Sol cuesta 5/30 dólares por millón de tokens de entrada/salida, mientras Fable 5 cuesta 10/50 dólares.

¿Grok 4.6 es mejor que Fable 5?

No puede afirmarse de forma general. Fable 5 obtiene un punto más en el índice agregado y lidera varias pruebas de código y agentes, mientras Grok 4.6 gana otras como GDPVal-AA v2, AA-Briefcase y Harvey LAB en la comparación facilitada. La elección depende de la tarea y del coste aceptable.

Scroll al inicio