Un salto de benchmark que no se explica solo con ajuste fino

Anthropic publicó el 1 de septiembre de 2026 Claude Fable 5.1 y Claude Mythos 5.1 -- dos variantes del mismo modelo, diferenciadas únicamente por el nivel de salvaguardas activo. La cifra que más llama la atención es la de Terminal-Bench-Science: 52,6%, más del doble del 24,7% que obtenía Fable 5. En CursorBench 3.2, el benchmark de codificación agéntica, la 5.1 alcanza un 73,4%, la mejor cifra que cita Anthropic hasta la fecha para uno de sus modelos.

Lo que hace que este lanzamiento sea más que una actualización de rutina no es solo el salto de rendimiento -- es que llega acompañado de una rebaja de precio real, hasta un 45% menos en trabajo muy agéntico gracias a la reducción del coste de lectura de caché. Es poco habitual que un fabricante de modelos de frontera mejore rendimiento y precio a la vez con esta magnitud en la misma actualización, en vez de cobrar el salto de capacidad como una prima nueva.

Mythos 5.1: el mismo modelo, con la correa distinta

La decisión de separar Fable 5.1 (disponibilidad general) de Mythos 5.1 (mismo modelo, menos salvaguardas, acceso solo vía programas de confianza para ciberseguridad y ciencias de la vida) es una forma de gestión de riesgo más matizada que aplicar un único nivel de restricción a todo el mundo por igual. Tiene sentido: un investigador de seguridad legítimo trabajando en detección de malware necesita que el modelo coopere con contenido que, para el usuario medio, tendría todo el sentido bloquear por defecto. El matiz real es que, a fecha de esta review, ese acceso sigue siendo vía programa de confianza, no autoservicio -- así que para el público concreto que más se beneficiaría de Mythos 5.1, el anuncio es una promesa de acceso futuro más que una disponibilidad inmediata.

La letra pequeña de cualquier benchmark que publica el propio fabricante

Como con cualquier cifra que llega directamente de quien fabrica el producto, conviene tratar el 52,6% de Terminal-Bench-Science y el 73,4% de CursorBench como un punto de partida, no como una verdad cerrada. Los benchmarks propios tienden a estar seleccionados, consciente o inconscientemente, para mostrar el modelo bajo su mejor luz -- lo interesante llegará en las próximas semanas, cuando terceros independientes contrasten estas cifras contra sus propios conjuntos de pruebas y flujos de trabajo reales.

¿Para quién es esto?

Para cualquiera que ya use Claude en flujos de trabajo agénticos -- automatización, agentes de codificación, análisis científico asistido -- esta actualización combina mejor rendimiento con menor coste de una forma que rara vez se da junta, y justifica revisar la integración existente en vez de dejarla en la versión anterior por inercia. Para quien necesite las salvaguardas reducidas de Mythos 5.1 para trabajo legítimo de ciberseguridad, el acceso vía programa de confianza sigue siendo la barrera real a superar antes de poder aprovechar el anuncio.