Zendoric
← Volver al día · 26 de julio de 2026

Opus 5: Anthropic abarata su inteligencia de frontera y blinda el riesgo dual tras Mythos 5

🕒 Publicado en Zendoric: 26 de julio de 2026 · 00:23

Anthropic lanza Claude Opus 5: roza la inteligencia de su modelo insignia, Fable 5, a mitad de precio, y bate sus propias marcas en programación, uso de ordenador y automatización de negocio. Pero lo mantiene a propósito por detrás de Mythos 5 en ciberseguridad y biología, las capacidades que más vigila.

Por Zendoric · 26 de julio de 2026. Anthropic presentó ayer Claude Opus 5, el nuevo modelo de su familia de uso general, con un mensaje central: rendimiento cercano al de su buque insignia, Claude Fable 5, al mismo precio que pagaba su predecesor. Según los propios datos de Anthropic, Opus 5 cuesta 5 dólares por millón de tokens de entrada y 25 dólares por millón de salida —igual que Opus 4.8— y ya es el modelo por defecto en Claude Max y el más potente disponible en Claude Pro.

En las pruebas de programación y trabajo de conocimiento —Frontier-Bench y GDPval-AA—, Opus 5 marca el mejor resultado histórico entre los modelos de Anthropic. En Frontier-Bench v0.1 supera a todos los demás modelos del mercado y más que duplica el resultado de Opus 4.8 con un coste por tarea menor, según la compañía. En CursorBench 3.2 a máximo esfuerzo queda a apenas un 0,5% del pico de Fable 5, pagando la mitad por tarea. En ARC-AGI 3 —una prueba de resolución de problemas inéditos, sin patrones previos— triplica al segundo mejor modelo, y en AutomationBench de Zapier, que mide la finalización completa de tareas de negocio de principio a fin, su tasa de éxito es en torno a un 50% superior a la del siguiente mejor modelo al mismo coste. En OSWorld 2.0, el benchmark de referencia para uso de ordenador (manejar interfaces, navegar, ejecutar aplicaciones como lo haría una persona), Opus 5 supera a cualquier otro modelo a cualquier coste y bate el mejor resultado de Fable 5 pagando poco más de un tercio de su precio. De hecho, según recoge también PCMag sobre el mismo lanzamiento, Opus 5 llega a superar a Fable 5 en tareas de búsqueda agéntica —la orquestación de búsquedas y recuperación de información en varios pasos—, uno de los pocos terrenos donde el modelo barato no solo iguala sino que supera a la frontera de pago.

La mejora también alcanza a la investigación científica: Anthropic reporta avances relevantes en biología estructural, química orgánica y bioinformática, con los mayores saltos en inferir estructuras moleculares a partir de datos de espectroscopia y en predecir cómo las variaciones de una secuencia proteica afectan a su función.

En su auditoría interna de comportamiento, Anthropic sitúa a Opus 5 como su modelo mejor alineado hasta la fecha: una puntuación de 2.3 en comportamiento desalineado global, la más baja de sus modelos recientes, con las tasas más bajas de conducta engañosa y la menor susceptibilidad a ser manipulado para usos indebidos. Son datos de la propia empresa, conviene recordarlo, pero apuntan en una dirección consistente con lo que Anthropic viene documentando en sus últimos lanzamientos.

El dato más interesante de este lanzamiento, sin embargo, no es de rendimiento sino de arquitectura de riesgo. Anthropic mantiene a Opus 5 deliberadamente por detrás de Mythos 5 —el modelo que, según la compañía, conserva la delantera en esas áreas— en ciberseguridad ofensiva e investigación biológica. Opus 5 no se entrenó a propósito en tareas cibernéticas, pero ha mejorado por el simple arrastre de sus capacidades generales: en el benchmark OSS-Fuzz se acerca a Mythos 5 identificando vulnerabilidades de software, aunque queda muy por detrás a la hora de convertir esas vulnerabilidades en exploits funcionales. Sus clasificadores de seguridad son proporcionalmente menos restrictivos que los de Fable 5 —Anthropic espera que intervengan en torno a un 85% menos—, y dejan pasar la búsqueda de vulnerabilidades en código fuente mientras bloquean el escaneo de binarios, las pruebas de penetración y la generación de exploits; las peticiones marcadas caen por defecto a Opus 4.8 en Claude.ai, Claude Code y Claude Cowork. Solo los miembros del Cyber Verification Program de Anthropic —su programa de acceso verificado— pueden usar una versión de Opus 5 con menos restricciones.

Esto es, en el fondo, un experimento de gobernanza tan relevante como el propio modelo. Anthropic ya no lanza un modelo único con un nivel de riesgo uniforme: construye una jerarquía de capacidad —Fable 5 como frontera general, Opus 5 como frontera accesible y barata, Mythos 5 como el modelo que conserva la delantera en las capacidades de doble uso más sensibles— y gestiona el acceso a cada nivel con clasificadores y programas de verificación distintos. Es la respuesta más seria que hemos visto a un problema real: cómo seguir subiendo el techo de capacidad general sin regalar, de paso, un manual de explotación de vulnerabilidades a cualquiera. La segmentación no elimina el riesgo, lo redistribuye: quien necesite investigación biológica autónoma de largo recorrido o desarrollo de exploits seguirá dependiendo de Mythos 5. A corto plazo, eso significa que el acceso a las capacidades más potentes —y potencialmente más peligrosas— sigue concentrado en quien tenga relación directa con Anthropic; es el mismo patrón de concentración de poder que venimos señalando en otros lanzamientos de modelos de doble uso.

Para el resto del mercado, el mensaje es más simple: lo que era frontera hoy cuesta la mitad y es el modelo por defecto en Claude Max y el más potente disponible en Claude Pro. Ese abaratamiento de la inteligencia de frontera —visible también en OSWorld 2.0 y AutomationBench, dos benchmarks que miden directamente la automatización de tareas de oficina y de negocio— es la mecánica concreta detrás de la abundancia que defendemos a largo plazo en Zendoric: cuanto más barato y capaz es el software que ejecuta tareas administrativas completas, más cerca está el punto en que ese trabajo deja de requerir intervención humana rutinaria y libera a las personas para tareas de mayor criterio. El corto plazo, sin embargo, sigue siendo duro: cada salto de estos —en concreto el de AutomationBench, que mide tareas de negocio de principio a fin— es, en la práctica, un salto en qué perfiles administrativos dejan de ser necesarios.

Anthropic acompaña el lanzamiento con dos funciones en beta que hablan de fricción real detectada en producción: el cambio de herramientas a mitad de conversación sin invalidar la caché de prompts (para que los desarrolladores no paguen de nuevo por reprocesar el contexto cada vez que cambian las herramientas disponibles) y los fallbacks automáticos, que redirigen a otro modelo las peticiones bloqueadas por los clasificadores de seguridad en lugar de simplemente rechazarlas. Es un detalle menor comparado con los benchmarks, pero revela hacia dónde mira Anthropic: no solo hacer modelos más listos, sino hacer que el filtro de seguridad estorbe lo menos posible al desarrollador que construye encima. Ese equilibrio —capacidad creciente, riesgo acotado, fricción decreciente— es, en última instancia, la apuesta de toda la industria para los próximos años.

🔗 Relacionadas en Zendoric

Fuentes y referencias