Anthropic dispara el rendimiento de Claude Fable 5.1 en tareas científicas largas

Anthropic ha dado un salto llamativo con Claude Fable 5.1, pero no está principalmente donde suele concentrarse la competición entre grandes modelos: escribir mejor código en una prueba corta. El cambio más pronunciado aparece en la investigación científica agéntica y en los trabajos que obligan al modelo a mantener procesos largos, utilizar herramientas, corregir errores y continuar trabajando con poca supervisión humana. En Terminal-Bench-Science 0.1 pasa del 24,7 % de Fable 5 al 52,6 %.

Las claves de Claude Fable 5.1 en 30 segundos

  • Fable 5.1 alcanza un 52,6 % en Terminal-Bench-Science 0.1, frente al 24,7 % de Fable 5 y el 29,0 % de Opus 5.
  • En programación las mejoras son más moderadas: obtiene un 55,8 % en Terminal-Bench 4.0 y un 73,4 % en CursorBench 3.2.0.
  • AutomationBench sube del 17,1 % al 31,4 %, reforzando su orientación hacia procesos empresariales largos.
  • Anthropic realizó las evaluaciones con las salvaguardas de producción activadas.
  • El precio base no cambia, pero las lecturas de caché son un 75 % más baratas.

Los resultados ayudan también a entender hacia dónde está desplazándose la siguiente fase de los agentes de inteligencia artificial. La diferencia empieza a estar menos en responder brillantemente a una petición aislada y más en mantenerse trabajando durante horas sin desviarse del objetivo.

Anthropic describe Fable 5.1 precisamente como un modelo pensado para proyectos prolongados. Puede planificar tareas, utilizar diferentes herramientas, recuperarse cuando algún paso falla y continuar ejecutando trabajo de manera desatendida.

El dato que destaca está en investigación científica

La cifra más llamativa de la tabla publicada por Anthropic es la correspondiente a Terminal-Bench-Science 0.1.

Claude Fable 5 conseguía un 24,7 %. Claude Opus 5 alcanza el 29,0 %. Fable 5.1 sube hasta el 52,6 %.

Es más del doble que su predecesor y supone una diferencia de 23,6 puntos porcentuales respecto a Opus 5 bajo la configuración utilizada por Anthropic.

Hay que introducir una precaución estadística. La propia compañía señala que Terminal-Bench-Science 0.1 presenta un error estándar de aproximadamente ±3,5 a ±4,5 puntos por modelo. También explica que sus resultados para Fable 5 y Opus 5 difieren ligeramente del leaderboard público, aunque permanecen dentro de ese margen.

Aun teniendo en cuenta esa variabilidad, la distancia de Fable 5.1 es suficientemente amplia como para convertirse en uno de los datos más interesantes del lanzamiento.

Y es importante por lo que mide la prueba.

No consiste simplemente en solicitar al modelo que escriba una función, resuelva una pregunta científica o genere unas líneas de código.

Evalúa investigación científica agéntica realizada mediante terminal, lo que exige encadenar diferentes operaciones hasta alcanzar un resultado.

Es precisamente el tipo de tarea en el que empiezan a aparecer las diferencias entre un modelo que responde bien y un agente capaz de trabajar.

En programación mejora, pero el salto es mucho menor

Si se observan los benchmarks específicamente relacionados con programación, la evolución es más contenida.

En Terminal-Bench 4.0, Fable 5.1 obtiene un 55,8 %, frente al 42,0 % de Fable 5 y el 52,3 % de Opus 5.

Claude Mythos 5.1, que comparte el mismo modelo subyacente pero dispone de salvaguardas diferentes para determinadas áreas sensibles, alcanza un 60,9 %.

CursorBench 3.2.0 muestra una diferencia todavía menor.

Fable 5.1 obtiene un 73,4 %, Fable 5 alcanza el 70,5 % y Opus 5 se queda en el 70,0 %.

Son mejoras medibles, pero no existe nada parecido a la duplicación observada en investigación científica.

La lectura interesante del lanzamiento está precisamente en esa diferencia.

Anthropic no parece haber concentrado todo el progreso en conseguir que el modelo escriba mejor una función o resuelva un problema aislado. Una parte considerable de la mejora aparece cuando el trabajo exige persistencia, planificación y utilización repetida de herramientas.

Otro benchmark refuerza esta interpretación.

AutomationBench, centrado en flujos empresariales, pasa del 17,1 % de Fable 5 al 31,4 % de Fable 5.1. Opus 5 obtiene un 26,9 %.

De nuevo, la diferencia aumenta cuando el problema exige encadenar acciones.

El objetivo empieza a ser trabajar durante horas

Anthropic describe Fable 5.1 como un modelo diseñado para tareas que pueden durar horas y extenderse entre diferentes aplicaciones.

La compañía pone ejemplos como trabajar sobre una cola de tareas, atender peticiones procedentes de Slack, utilizar un navegador o funcionar de forma desatendida como agente gestionado.

El cambio conceptual resulta importante.

Durante buena parte de la evolución reciente de los grandes modelos, las comparaciones se han centrado en la calidad de una respuesta: programación, matemáticas, razonamiento o conocimiento.

Los agentes añaden otra dimensión.

Un modelo puede ser extraordinariamente bueno resolviendo cada paso individual y, sin embargo, resultar poco fiable cuando necesita realizar cien pasos consecutivos.

Puede perder el objetivo, repetir operaciones, utilizar incorrectamente una herramienta o ser incapaz de recuperarse después de un error.

Por eso empiezan a adquirir más peso los benchmarks que evalúan procesos prolongados.

En OSWorld 2.0, relacionado con utilización de ordenadores, Fable 5.1 obtiene un 77,9 % con evaluación parcial y un 41,7 % bajo el criterio estricto. Fable 5 consigue respectivamente un 72,9 % y un 36,1 %, mientras Opus 5 alcanza un 75,4 % y un 39,6 %.

Humanity’s Last Exam también muestra mejoras más contenidas: Fable 5.1 alcanza un 60,9 % sin herramientas y un 65,0 % utilizándolas.

La fotografía conjunta es más interesante que cualquier resultado aislado: la mayor diferencia aparece cuando aumenta la duración y complejidad operativa del trabajo.

Las salvaguardas estaban activadas durante los benchmarks

Existe además un detalle metodológico poco habitual y relevante para interpretar los resultados.

Anthropic afirma haber evaluado Fable 5.1 con sus salvaguardas de producción activadas.

Cuando esas protecciones intervinieron en determinadas tareas de OSWorld 2.0, los modelos Fable recibieron una puntuación de cero. En otros casos relacionados con ciberseguridad o biología, las peticiones fueron derivadas hacia modelos Opus.

Eso significa que los números publicados intentan representar el comportamiento del producto que realmente recibe el usuario, incluidas las restricciones que pueden limitarlo.

Pero conviene matizar la interpretación de que Anthropic esté mostrando simplemente «el suelo» del modelo.

Las salvaguardas pueden reducir algunas puntuaciones, pero no es posible calcular a partir de estos datos cuál sería exactamente el rendimiento de Fable 5.1 sin ellas. Además, Mythos 5.1 permite observar parcialmente esa diferencia en algunos ámbitos: en Terminal-Bench 4.0 alcanza un 60,9 %, frente al 55,8 % de Fable 5.1.

Fable 5.1 y Mythos 5.1 comparten, según Anthropic, el mismo modelo subyacente. La diferencia está en las protecciones aplicadas a ámbitos como ciberseguridad y biología. Mythos mantiene por ello un acceso limitado a organizaciones verificadas.

El otro cambio importante está en el coste de mantener un agente trabajando

El rendimiento es solamente una parte de la historia.

Fable 5.1 mantiene el precio principal de Fable 5: 10 dólares por millón de tokens de entrada y 50 dólares por millón de tokens de salida.

Lo que cambia radicalmente es la caché.

Las lecturas de contexto almacenado pasan de 1 dólar a 0,25 dólares por millón de tokens, una reducción del 75 %.

Esto tiene bastante más importancia para un agente que para una conversación convencional.

Un agente de programación puede consultar repetidamente el mismo repositorio, sus instrucciones, las definiciones de herramientas y todo el contexto acumulado durante una sesión.

Si cada nueva operación obliga a volver a procesar enormes cantidades de información, mantener el agente funcionando durante horas puede resultar caro aunque el precio nominal del modelo no cambie.

Anthropic estima que la nueva estructura puede reducir alrededor de un 25 % el coste de cargas típicas y hasta aproximadamente un 45 % en trabajos muy agénticos, donde la reutilización del contexto representa una proporción mayor del consumo.

Ese «hasta un 45 %» tampoco significa que cualquier ejecución de Fable 5.1 vaya a ser un 45 % más barata. El ahorro real dependerá de qué proporción de la factura corresponda a lecturas de caché.

Para los agentes que trabajan durante largos periodos, sin embargo, la economía de reutilizar contexto empieza a ser tan importante como el precio convencional del token.

La competición se desplaza hacia el agente que puede quedarse solo

Los benchmarks de Fable 5.1 permiten observar una evolución que probablemente será más importante que conseguir algunos puntos adicionales en pruebas tradicionales de programación.

Los modelos ya escriben código con bastante solvencia.

El siguiente problema es conseguir que puedan recibir un objetivo complejo, dividirlo en tareas, utilizar herramientas durante horas, detectar cuándo algo ha salido mal, volver atrás y continuar hasta entregar un resultado que pueda revisar una persona.

Eso cambia también la forma de medirlos.

La pregunta deja de ser únicamente qué modelo produce el mejor código en una respuesta.

Empiezan a importar el número de intervenciones humanas necesarias, la capacidad de recuperación, los intentos fallidos, el consumo acumulado de tokens, el coste de las herramientas y, finalmente, el precio de completar correctamente una tarea.

Fable 5.1 todavía está lejos de resolver todos esos problemas. Un 31,4 % en AutomationBench muestra claramente que existe mucho margen de mejora.

Pero la dirección del lanzamiento resulta reveladora.

Anthropic no está optimizando únicamente un modelo capaz de escribir una función mejor.

Está intentando construir un agente al que pueda encargársele un trabajo por la mañana y preguntarle varias horas después cómo ha terminado.

Preguntas frecuentes

¿Cuánto mejora Claude Fable 5.1 en investigación científica?

Obtiene un 52,6 % en Terminal-Bench-Science 0.1, frente al 24,7 % de Fable 5 y el 29,0 % de Opus 5 bajo la evaluación realizada por Anthropic. La compañía advierte de un error estándar de ±3,5 a ±4,5 puntos.

¿Fable 5.1 también mejora mucho programando?

Mejora, aunque las diferencias son menores. Alcanza un 55,8 % en Terminal-Bench 4.0 y un 73,4 % en CursorBench 3.2.0, frente al 52,3 % y 70,0 % de Opus 5, respectivamente.

¿Claude Fable 5.1 es más barato que Fable 5?

Mantiene el precio de entrada y salida, pero las lecturas de caché cuestan un 75 % menos. Anthropic estima ahorros de alrededor del 25 % para cargas típicas y de hasta aproximadamente el 45 % en determinados trabajos intensivos en agentes.

¿Qué diferencia existe entre Fable 5.1 y Mythos 5.1?

Anthropic afirma que comparten el mismo modelo subyacente. Fable 5.1 incorpora salvaguardas más restrictivas para áreas sensibles, mientras Mythos 5.1 ofrece mayores capacidades en ciberseguridad y biología y está limitado a organizaciones verificadas.

Scroll al inicio