Anthropic lanza Claude Opus 5.5 con más rendimiento y un 40 % menos de coste

Anthropic ha presentado Claude Opus 5.5, el primer modelo de la nueva familia Claude 5.5, con mejoras en programación, uso de ordenadores, trabajo profesional y comunicación. La compañía asegura que el modelo ofrece un rendimiento superior al de Claude Opus 5 con un coste de ejecución un 40 % inferior en cargas de trabajo habituales, además de incorporar nuevas medidas de seguridad para tareas autónomas y ámbitos como la ciberseguridad y la biología.

Las claves de Claude Opus 5.5 en 20 segundos

  • Anthropic estrena Claude Opus 5.5 como primer modelo de la familia Claude 5.5.
  • La compañía sitúa su coste un 40 % por debajo de Opus 5 en cargas habituales.
  • El precio baja a 4 dólares por millón de tokens de entrada y 20 dólares de salida.
  • Mejora especialmente en programación agéntica, trabajo profesional y uso de ordenadores.
  • Claude Sonnet 5.5 y Haiku 5.5 llegarán en las próximas semanas.

Claude Opus 5.5 ya está disponible en las plataformas de Anthropic y también a través de Amazon Web Services, Google Cloud y Microsoft Azure. Los desarrolladores pueden utilizar el modelo mediante la identificación claude-opus-5-5 en Claude Platform.

La compañía presenta este lanzamiento como una evolución centrada no solo en aumentar las capacidades del modelo, sino también en reducir los recursos necesarios para utilizarlas. Según sus pruebas, Opus 5.5 genera respuestas más de un 30 % más rápido que Opus 5 y utiliza menos tokens para completar determinadas tareas.

Introducing Claude Opus 5.5

Un modelo pensado para trabajos largos de programación

Uno de los ámbitos en los que Anthropic destaca mayores avances es la programación agéntica. Opus 5.5 está orientado a tareas que requieren modificar grandes cantidades de código, realizar auditorías o completar procesos de varios pasos con poca intervención humana.

La empresa cita el caso de un evaluador que utilizó el modelo para completar una migración de 680.000 líneas de código en menos de un día, un trabajo que, según su estimación, habría requerido semanas para un equipo de ingeniería. También menciona otra prueba en la que Opus 5.5 auditó y corrigió una base de código de 200.000 líneas en menos de tres horas, frente a las más de 20 horas empleadas por Opus 5.

En una prueba interna con HAProxy, un software utilizado para distribuir tráfico web entre servidores, Anthropic enfrentó Opus 5.5 y Claude Fable 5.1 a la traducción del proyecto desde C a Rust. Ambos resultados superaron casi todas las pruebas de regresión del propio HAProxy, pero Opus 5.5 terminó el trabajo en 9,5 horas frente a las 12 horas de Fable 5.1 y, según Anthropic, con un coste un 51 % inferior.

Los resultados publicados por la compañía también muestran diferencias en varias pruebas de programación. En Terminal-Bench 4.0, Opus 5.5 obtuvo un 66,4 %, frente al 55,8 % de Fable 5.1 y el 52,3 % de Opus 5. En FrontierCode v1.1 alcanzó un 54,4 %, mientras que Fable 5.1 registró un 50,3 % y Opus 5 un 48 %.

Anthropic advierte, no obstante, que las diferencias entre modelos con capacidades elevadas no siempre quedan bien reflejadas por los benchmarks. La propia compañía señala que la distancia entre Opus 5.5 y Fable 5.1 en el uso real es más reducida de lo que sugieren algunas de estas puntuaciones.

La eficiencia económica es uno de los argumentos centrales del lanzamiento. El precio de entrada de Opus 5.5 queda en 4 dólares por millón de tokens, frente a 5 dólares en Opus 5. La salida cuesta 20 dólares por millón, frente a 25 dólares. Las lecturas de caché pasan de 0,50 a 0,20 dólares por millón de tokens.

Anthropic también ofrece un modo rápido para Opus 5.5 en Claude Code y Claude Platform, con una velocidad de hasta 2,5 veces superior. En este caso, el precio asciende a 8 dólares por millón de tokens de entrada y 40 dólares por millón de salida.

Más capacidad para trabajo profesional y agentes

El modelo también ha sido evaluado en tareas de conocimiento y procesos empresariales. En GDPval-AA v2.1, una prueba que evalúa trabajo profesional en 44 ocupaciones, Opus 5.5 alcanzó 1.846 puntos Elo en las condiciones indicadas por Anthropic, frente a 1.735 de Fable 5.1 y 1.708 de Opus 5.

En AutomationBench, una evaluación ejecutada y publicada por Zapier, Opus 5.5 consiguió un 40 %, frente al 31,4 % de Fable 5.1 y el 26,9 % de Opus 5. Anthropic especifica que estas pruebas se realizaron sin modelos de respaldo, por lo que las intervenciones de los sistemas de seguridad se contabilizaron como fallos.

La compañía también destaca el comportamiento del modelo en tareas de investigación. En una prueba interna, Opus 5.5 tuvo que elaborar informes sobre los resultados trimestrales de una empresa utilizando información disponible en una copia de la web en la que era difícil localizar el comunicado de resultados. Un sistema automático comprobó las cifras y las citas utilizadas.

Según Anthropic, 16 de los 18 informes de Opus 5.5 superaron su criterio de calidad en distintas configuraciones de esfuerzo. La empresa afirma que ni Fable 5.1 ni Opus 5 consiguieron superar ese mismo criterio en ninguno de sus intentos.

Otro cambio afecta a la forma de comunicarse del modelo. Anthropic asegura que Opus 5.5 presenta primero la información más importante, utiliza menos jerga y sigue mejor las instrucciones de estilo. La compañía considera que esta mejora puede facilitar tanto las sesiones de trabajo prolongadas como la revisión de resultados generados por el sistema.

Seguridad y límites para tareas sensibles

El lanzamiento llega acompañado de una evaluación de seguridad más amplia. Anthropic afirma que Opus 5.5 obtuvo los mejores resultados hasta la fecha de la compañía en su auditoría conductual automatizada, que analiza cerca de 2.000 escenarios simulados.

Según la empresa, el modelo intentó saltarse límites de contención alrededor de un 85 % menos que Opus 5 o Claude Mythos 5.1 en una nueva evaluación. Anthropic añade que los intentos observados fueron de baja gravedad y que el propio modelo los comunicó.

La compañía también reconoce límites en estas evaluaciones. Entre ellos está la posibilidad de que el modelo detecte que está siendo evaluado, lo que dificulta extrapolar su comportamiento a todos los entornos reales en los que puede utilizarse.

En ciberseguridad, Opus 5.5 incorpora salvaguardas similares a las de Claude Fable 5.1. Anthropic señala que las tareas habituales de desarrollo y corrección de software siguen disponibles, mientras que la mayor parte de las tareas de ciberseguridad se redirigirán a Opus 4.8.

Para investigación biológica, Opus 5.5 también aplica medidas específicas. Las organizaciones que necesiten trabajar con tareas limitadas por estas salvaguardas pueden solicitar acceso al Life Sciences Verification Program, dirigido a entidades verificadas como laboratorios académicos, empresas emergentes y compañías farmacéuticas.

El modelo incorpora además medidas contra la extracción masiva de capacidades mediante cuentas falsas. Anthropic denomina a esta técnica distillation y señala que Opus 5.5 utiliza preserved thinking, un mecanismo que impide a determinados usuarios de API modificar el contexto previo de Claude con el objetivo de extraer su razonamiento.

El modelo también está disponible con retención cero de datos. Anthropic afirma que incluye medidas de marcado relacionadas con el cumplimiento del Reglamento de Inteligencia Artificial de la Unión Europea y que el modo de pensamiento ya no puede desactivarse.

La compañía sitúa estas decisiones dentro de su estrategia anunciada recientemente para acompasar el desarrollo de modelos avanzados con las medidas de seguridad. En el caso de Opus 5.5, Anthropic afirma que ha combinado evaluaciones internas y externas, con organizaciones como METR y Frontier Design antes del lanzamiento.

La nueva familia no termina con este modelo. Anthropic ha confirmado que Claude Sonnet 5.5 y Claude Haiku 5.5 llegarán durante las próximas semanas y que compartirán parte de las mejoras introducidas en rendimiento, eficiencia y seguridad.

Preguntas frecuentes

¿Qué es Claude Opus 5.5?

Claude Opus 5.5 es el primer modelo de la nueva familia Claude 5.5 de Anthropic. Está orientado a programación, uso de ordenadores, investigación y otras tareas profesionales.

¿Cuánto cuesta Claude Opus 5.5?

El precio estándar es de 4 dólares por millón de tokens de entrada y 20 dólares por millón de tokens de salida. Las lecturas de caché cuestan 0,20 dólares por millón de tokens.

¿Dónde está disponible Claude Opus 5.5?

Anthropic indica que está disponible en sus plataformas, así como mediante Amazon Web Services, Google Cloud y Microsoft Azure.

¿Qué modelos llegarán después de Claude Opus 5.5?

Anthropic ha anunciado que Claude Sonnet 5.5 y Claude Haiku 5.5 llegarán en las próximas semanas.

Scroll al inicio