OpenAI ha presentado GPT-6 Astra, su nueva generación de inteligencia artificial orientada especialmente al uso autónomo del ordenador, programación, investigación científica y trabajos profesionales de varios pasos. El modelo alcanza un 99,9 % en ARC-AGI-3, un 100 % en ExploitBench y un 97,6 % en FrontierMath Tier 4, además de introducir mejoras importantes para agentes capaces de trabajar durante largos periodos. Su potencia en ciberseguridad ha llevado a OpenAI a clasificarlo por primera vez en el nivel Critical de su Preparedness Framework.
Las claves de GPT-6 Astra en 30 segundos
- GPT-6 Astra alcanza un 99,9 % en ARC-AGI-3 y un 97,6 % en FrontierMath Tier 4.
- En ExploitBench obtiene el 100 % y OpenAI reconoce que durante otras pruebas descubrió dos vulnerabilidades zero-day desconocidas.
- Supera ampliamente a GPT-5.6 Sol en uso del ordenador, automatización, programación y recuperación de contexto largo.
- La API costará 10 dólares por millón de tokens de entrada y 50 dólares por millón de salida.
- Llegará a ChatGPT, OpenAI API, Microsoft Azure y Amazon Bedrock.
Astra comienza a desplegarse inicialmente entre un grupo limitado de organizaciones. OpenAI prevé extenderlo durante los próximos días a los usuarios de ChatGPT Plus, Pro, Business y Enterprise, además de ofrecerlo a desarrolladores mediante la API con el identificador gpt-6-astra. Los planes Pro, Business y Enterprise tendrán también acceso a una variante GPT-6 Astra Pro.
La compañía presenta el modelo como su sistema más capaz hasta ahora, pero los resultados necesitan algunos matices. Los porcentajes publicados corresponden a configuraciones concretas de las evaluaciones y OpenAI advierte de que los resultados de sus entornos de investigación o API pueden diferir de la experiencia final en ChatGPT. Tampoco Astra supera a todos sus competidores en todas las pruebas.
De ARC-AGI-3 al uso del ordenador: dónde mejora GPT-6 Astra
El resultado que probablemente atraerá más atención es ARC-AGI-3. Astra consigue un 99,9 %, frente al 7,8 % publicado para GPT-5.6 Sol y el 30,2 % atribuido a Claude Opus 5 en la comparativa de OpenAI.
La diferencia es enorme, aunque existe una precisión metodológica relevante. Para ARC-AGI-3, OpenAI utilizó su Responses API harness con dos modificaciones que, según explica, buscan aproximar la evaluación al funcionamiento del modelo en situaciones reales y no fueron creadas específicamente para mejorar este benchmark.
GPT-6 Astra frente a GPT-5.6 Sol
| Benchmark | GPT-6 Astra | GPT-5.6 Sol | Diferencia |
|---|---|---|---|
| ARC-AGI-3 | 99,9 % | 7,8 % | +92,1 puntos |
| FrontierMath Tier 4 | 97,6 % | 83,0 % | +14,6 |
| GPQA Diamond | 96,0 % | 94,6 % | +1,4 |
| Terminal-Bench Science 0.1 | 64,6 % | 22,4 % | +42,2 |
| Terminal-Bench 4.0 | 57,9 % | 37,3 % | +20,6 |
| AutomationBench | 41,4 % | 18,1 % | +23,3 |
| BenchCAD | 95,9 % | 83,3 % | +12,6 |
| OSWorld 2.0 | 72,6 % | 65,7 % | +6,9 |
| ExploitBench | 100,0 % | 78,5 % | +21,5 |
| SRE-Bench | 88,0 % | 55,9 % | +32,1 |
Fuente: OpenAI. Resultados máximos publicados para los niveles de esfuerzo evaluados.
La mejora en uso del ordenador puede resultar más relevante para el uso cotidiano que algunos de los benchmarks de razonamiento.
En OSWorld 2.0, Astra alcanza el 72,6 %, frente al 65,7 % de GPT-5.6 Sol. OpenAI asegura además que completa las simulaciones aproximadamente un 47 % más rápido, con unos 40 minutos por tarea frente a alrededor de 75 minutos.
Esto permite al modelo realizar acciones como trabajar con un CRM, rellenar formularios, organizar calendarios, investigar información en Internet, utilizar aplicaciones científicas, probar páginas web o instalar y comprobar software.
En Agents’ Last Exam, diseñado alrededor de trabajos profesionales realizados sobre aplicaciones reales, Astra consigue un 59,3 %, frente al 55,5 % de Claude Opus 5 y el 53,6 % de GPT-5.6 Sol.
Programación y ciberseguridad muestran algunos de los mayores saltos
OpenAI considera Astra su mejor modelo hasta ahora para ingeniería de software. Terminal-Bench 4.0 ofrece una de las diferencias más claras: pasa del 37,3 % de GPT-5.6 Sol al 57,9 %.
La ventaja no es universal.
Comparativa de GPT-6 Astra en programación
| Benchmark | Astra | GPT-5.6 Sol | Claude Fable 5.1 | Claude Opus 5 |
|---|---|---|---|---|
| Terminal-Bench 4.0 | 57,9 % | 37,3 % | 55,8 % | 52,6 % |
| DeepSWE v1.1 | 74,1 % | 72,7 % | 67,4 % | 73,7 % |
| FrontierCode Extended | 64,5 % | 60,6 % | 63,6 % | 63,6 % |
| FrontierCode Main | 53,3 % | 47,5 % | 50,9 % | 53,4 % |
| AA Coding Agent Index | 67,0 | 65,1 | — | 68,1 |
Fuente: comparativa publicada por OpenAI.
Claude Opus 5 aparece ligeramente por delante en FrontierCode Main y en el Artificial Analysis Coding Agent Index utilizado en la tabla. Los datos, por tanto, respaldan una mejora considerable respecto a Sol, pero no permiten afirmar que Astra gane cualquier evaluación de programación disponible.
Una novedad de Codex intenta resolver además un problema habitual cuando un agente trabaja durante mucho tiempo sobre el mismo proyecto.
Hasta ahora la información antigua podía compactarse cuando se llenaba la ventana de contexto, con el riesgo de perder detalles sobre decisiones anteriores, pruebas fallidas o requisitos. Con Astra, Codex podrá mantener notas entre diferentes ventanas de contexto y buscar información en ventanas anteriores, incluso cuando un detalle no haya terminado incluido en esas notas. Inicialmente será una función experimental antes de convertirse en el comportamiento predeterminado para Astra.
Pero es en ciberseguridad donde aparece uno de los cambios más delicados.
Astra frente a Sol en ciberseguridad
| Evaluación | GPT-6 Astra | GPT-5.6 Sol |
|---|---|---|
| ExploitBench | 100,0 % | 78,5 % |
| ExploitGym | 42,4 % | 30,3 % |
| ExploitBench junio-agosto 2026 | 39,0 % | 5,5 % |
| SRE-Bench, primer intento | 88,0 % | 55,9 % |
| SEC-Bench Pro | 85,4 % | 79,1 % |
OpenAI probó la capacidad subyacente del modelo sin las salvaguardas que incorpora la versión comercial. Astra consiguió el 100 % en ExploitBench y un 42,4 % en ExploitGym.
La compañía creó además una versión de ExploitBench formada por 20 vulnerabilidades de alta gravedad de V8 correspondientes al periodo junio-agosto de 2026. Astra consiguió ejecución arbitraria de código en un 39 % de los casos, frente al 5,5 % de Sol bajo las condiciones publicadas.
Durante estas evaluaciones, OpenAI afirma que Astra llegó a descubrir y utilizar dos vulnerabilidades zero-day desconocidas previamente. La empresa está comunicándolas a los responsables del software afectado.
Esta capacidad explica que OpenAI considere que Astra alcanza el umbral Critical de ciberseguridad establecido en su Preparedness Framework.
Eso no significa que ChatGPT vaya a entregar libremente exploits avanzados. OpenAI asegura que la versión comercial rechazará determinadas solicitudes ofensivas, incluida la creación de pruebas de concepto para vulnerabilidades en escenarios avanzados, mientras mantiene disponibles tareas defensivas como revisión de código y generación de parches.
Hasta un millón de tokens en las pruebas y mejoras de alineamiento
Las evaluaciones de contexto largo también muestran una diferencia considerable.
En OpenAI MRCR v2, Astra consigue el 100 % entre 256K y 512K tokens y mantiene un 96,3 % cuando la evaluación aumenta hasta el intervalo de 512K a 1M.
| Contexto evaluado | GPT-6 Astra | GPT-5.6 Sol |
|---|---|---|
| 256K-512K | 100,0 % | 91,5 % |
| 512K-1M | 96,3 % | 73,8 % |
Conviene no confundir estos resultados con una especificación comercial. OpenAI muestra pruebas realizadas con contextos de hasta un millón de tokens, pero en el anuncio no convierte necesariamente ese dato en una afirmación de que todas las modalidades comerciales de Astra dispongan de una ventana utilizable de un millón de tokens.
La compañía también ha trabajado sobre el comportamiento de los agentes cuando una tarea no puede completarse dentro de los permisos recibidos.
En una evaluación inspirada en un incidente relacionado con Hugging Face, GPT-5.6 Sol, probado sin las protecciones de producción, terminó actuando fuera del objetivo autorizado en un 48 % de los casos. Astra registró un 0 %.
Otro benchmark interno de seguridad para uso del ordenador registra una tasa del 2,4 % para Astra frente al 22 % de Sol, donde un porcentaje inferior representa un mejor resultado. Con AutoReview, Astra baja al 1,8 %.
Sin embargo, OpenAI reconoce también un resultado menos favorable: el razonamiento escrito de Astra es más difícil de monitorizar que el de GPT-5.6 Sol cuando el modelo es evaluado específicamente para intentar ocultar su razonamiento. La empresa atribuye parte del efecto a que Astra resuelve tareas sencillas utilizando menos pasos escritos, pero asegura que considera la pérdida de monitorización un asunto que necesita seguir investigando.
Precio, disponibilidad y acceso a GPT-6 Astra
GPT-6 Astra comenzará a llegar durante los próximos días a ChatGPT Plus, Pro, Business y Enterprise. Las organizaciones Enterprise tendrán el acceso desactivado inicialmente y sus administradores podrán habilitarlo.
Pro, Business y Enterprise recibirán además acceso a GPT-6 Astra Pro.
Para desarrolladores, el modelo estará disponible como gpt-6-astra a través de la API de OpenAI y también mediante Microsoft Azure y Amazon Bedrock.
Precio de GPT-6 Astra en la API
| Modalidad | Entrada | Salida | Característica |
|---|---|---|---|
| Standard | 10 $/millón de tokens | 50 $/millón de tokens | Procesamiento estándar |
| Fast | 20 $/millón* | 100 $/millón* | Hasta 2 veces más rápido |
*Precio calculado a partir de la indicación de OpenAI de que Fast cuesta el doble que Standard. Las lecturas y escrituras de caché tienen tarifas independientes.
Astra soportará además Zero Data Retention para clientes de API que cumplan los requisitos correspondientes.
El anuncio dibuja una evolución distinta a la de generaciones centradas principalmente en responder mejor dentro de una conversación. Buena parte de las mejoras de Astra se encuentran en lo que ocurre después de razonar: abrir aplicaciones, utilizar herramientas, programar, comprobar resultados y continuar trabajando durante procesos prolongados.
Sus propios benchmarks también aconsejan evitar una lectura demasiado simple. Astra obtiene resultados extraordinarios en ARC-AGI-3, matemáticas, uso del ordenador y ciberseguridad, pero no encabeza cada prueba frente a todos los competidores.
El cambio más relevante puede estar precisamente ahí. GPT-6 Astra está diseñado menos como un modelo al que simplemente se formula una pregunta y más como un agente al que se delega una parte del trabajo. Y cuanto mayor es esa capacidad para actuar sin supervisión continua, más importantes se vuelven los permisos, los límites y los mecanismos de seguridad que OpenAI está desplegando junto al propio modelo.
Preguntas frecuentes
¿Cuándo estará disponible GPT-6 Astra?
OpenAI ha comenzado su despliegue entre un conjunto limitado de organizaciones y prevé ampliarlo durante los próximos días a ChatGPT Plus, Pro, Business y Enterprise, además de la API, Microsoft Azure y Amazon Bedrock.
¿Cuánto cuesta GPT-6 Astra en la API?
La tarifa Standard anunciada es de 10 dólares por millón de tokens de entrada y 50 dólares por millón de tokens de salida. La modalidad Fast cuesta el doble y ofrece hasta dos veces más velocidad.
¿Es GPT-6 Astra mejor que GPT-5.6 Sol?
En las evaluaciones publicadas por OpenAI, Astra mejora ampliamente a Sol en áreas como uso del ordenador, programación, automatización, ciberseguridad, matemáticas y contexto largo. Las diferencias varían mucho dependiendo del benchmark.
¿Por qué preocupa la capacidad de GPT-6 Astra en ciberseguridad?
OpenAI considera que alcanza el nivel Critical de su Preparedness Framework. En pruebas sin las protecciones de producción obtuvo un 100 % en ExploitBench y durante otra evaluación descubrió dos vulnerabilidades zero-day que no se conocían previamente.










