Zendoric
← Volver al día · 28 de julio de 2026

Anthropic lanza Claude Opus 5: roza la inteligencia de frontera de Fable 5 a mitad de precio

🕒 Publicado en Zendoric: 28 de julio de 2026 · 00:38

Anthropic presentó el 24 de julio de 2026 Claude Opus 5, la nueva entrega de su línea Opus, que la compañía describe como un modelo "reflexivo y proactivo" que se acerca a la inteligencia de frontera de Claude Fable 5 pero a mitad de precio.

Anthropic presentó el 24 de julio de 2026 Claude Opus 5, la nueva entrega de su línea Opus, que la compañía describe como un modelo "reflexivo y proactivo" que se acerca a la inteligencia de frontera de Claude Fable 5 pero a mitad de precio. Según Anthropic, en evaluaciones de programación y trabajo de conocimiento como Frontier-Bench y GDPval-AA, Opus 5 se convierte en el nuevo estado del arte, aunque sigue por detrás de Mythos 5 en tareas de ciberseguridad. El modelo pasa a ser el predeterminado en Claude Max y el más potente disponible en Claude Pro, y Anthropic lo presenta como un modelo pensado para el uso diario gracias a una mayor eficiencia operativa.

En cuanto a rendimiento y coste, Anthropic subraya que Opus 5 ofrece una mejora sustancial respecto a su predecesor, Opus 4.8, manteniendo el mismo precio. En Frontier-Bench v0.1, Opus 5 supera a todos los demás modelos y más que duplica el rendimiento de Opus 4.8 con un coste por tarea menor. En CursorBench 3.2, con el ajuste de esfuerzo máximo, el modelo queda a menos de un 0,5% del máximo de Fable 5, pero a la mitad de coste por tarea, y logra mejor relación rendimiento-coste que el resto de modelos en los niveles de esfuerzo alto, xhigh y máximo.

En tareas de conocimiento y resolución de problemas los resultados son igualmente destacados: en ARC-AGI 3, una evaluación centrada en resolver problemas novedosos, la puntuación de Opus 5 es el triple que la del siguiente mejor modelo. En Zapier AutomationBench, que mide si los modelos completan tareas de negocio de principio a fin, la tasa de éxito de Opus 5 es aproximadamente 1,5 veces la del siguiente mejor modelo al mismo coste por tarea, y ya en su nivel de esfuerzo más bajo supera a cualquier otro modelo. En OSWorld 2.0, una evaluación de uso de ordenador, Opus 5 supera a todos los demás modelos a cualquier coste dado, e incluso supera el mejor resultado de Fable 5 con poco más de un tercio de su coste. Anthropic también lo señala como su modelo más eficiente en evaluaciones como GDPval-AA v2, HLE, AutomationBench y DeepSearchQA.

En el ámbito científico, Opus 5 mejora a Opus 4.8 en todas las evaluaciones de ciencias de la vida de Anthropic, que cubren biología estructural, química orgánica y bioinformática. Las mejoras más notables se dan en tareas de química orgánica, como inferir estructuras moleculares a partir de datos de espectroscopía, donde obtiene 10,2 puntos porcentuales más que Opus 4.8 en el benchmark interno de la compañía, y en tareas relacionadas con proteínas, como predecir cómo las variaciones en la secuencia de una proteína afectan a su función, donde la mejora es de 7,7 puntos porcentuales. Anthropic también destaca una mayor capacidad para producir salidas visuales más sofisticadas, ilustrando el flujo de aire sobre objetos aerodinámicos en un túnel de viento simulado y construyendo una ilustración interactiva simplificada de una célula.

El artículo ofrece varios ejemplos concretos de la agencia y minuciosidad del modelo. En una tarea de Frontier-Bench, se le dio a Opus 5 el dibujo de una pieza mecánica y se le pidió escribir código para reconstruirla como un modelo 3D en FreeCAD, pero deliberadamente sin darle forma de visualizar directamente el dibujo; el modelo respondió escribiendo su propio pipeline de visión por computador para extraer la geometría de los píxeles en bruto y logró resolver la tarea de forma repetida, algo que ningún modelo competidor consiguió en cinco intentos con la misma configuración. En otro caso, ante un error real en un gestor de paquetes de código abierto muy usado, Opus 5 encontró la causa raíz y corrigió un caso límite que el parche de la comunidad había pasado por alto, mientras que un modelo competidor solo arregló el síntoma superficial y reportó el error como resuelto. Un ingeniero de una firma de trading lo usó para construir en una sola sesión un feed de datos de mercado para una nueva bolsa, tarea que modelos anteriores no habían podido completar ni con planes detallados del ingeniero; al no encontrar un feed en vivo contra el que validar, el propio modelo construyó su arnés de pruebas para comprobar que su código interpretaba correctamente los datos del intercambio.

El anuncio incluye numerosos testimonios de clientes con acceso anticipado, que ilustran el uso del modelo en distintos sectores. En herramientas de programación, representantes de Devin señalan un rendimiento cercano al de Fable pero a mitad de coste, con fortaleza particular en depuración difícil y análisis de causa raíz; desde Cursor describen un resultado justo por debajo de Fable 5 en CursorBench con comportamientos similares; y desde Kiro y JetBrains se destaca su capacidad para mantener el contexto en tareas largas y de múltiples pasos, y su criterio para detectar fallos lógicos durante la planificación antes de escribir código. En automatización de negocio, Zapier indica que Opus 5 encabezó su leaderboard de AutomationBench sin gastar más tokens que modelos Claude anteriores, completando una secuencia completa de prevención de abandono de clientes —desde detectar cuentas en riesgo hasta alertar al responsable adecuado y resumir para el equipo de retención— con un 100% de éxito, algo que modelos previos no lograban. En investigación científica, un cliente de análisis genómico describe que el modelo se comporta "más como un científico cuidadoso" que cualquier modelo anterior, eligiendo las pruebas estadísticas adecuadas para descartar factores de confusión y verificando sus propios resultados con métodos independientes.

En desarrollo de producto, Lovable reporta una mejora del 22% sobre Opus 4.7 en sus tareas agénticas de codificación más difíciles, junto con mayor consistencia entre ejecuciones, mientras que otro cliente destaca que en construcciones de aplicaciones completas el frontend muestra las mejores animaciones, juegos y trabajo 3D vistos hasta ahora en un modelo Opus. En el ámbito empresarial y de documentos especializados, Box señala que Opus 5 supera a Opus 4.8 en un 8% de forma global, con mejoras del 11% en análisis de datos y del 17% en flujos de trabajo de diligencia debida, procesos habituales en tecnología, salud y sector público. En finanzas, un cliente de modelado financiero reporta una precisión media 9 puntos porcentuales superior con un tercio menos de turnos y llamadas a herramientas y un 60% menos de tiempo, mientras que otro señala que el modelo alcanza su benchmark de trading usando aproximadamente una séptima parte de los tokens de razonamiento y menos de la mitad de la latencia de Opus 4.8. En el ámbito legal, un cliente destaca mejoras notables en gobierno corporativo y arbitraje, con un rendimiento similar logrado generando un 26% menos de tokens de media que Opus 4.8 en razonamiento máximo, y otro señala la mayor puntuación de cualquier modelo probado en redlines a primera pasada, casi el doble que Opus 4.8. También se mencionan casos de revisión de código y gestión de PRs, donde el modelo verifica ramas, plantillas e implicaciones de pruebas antes de publicar, un caso de rediseño de arquitectura en el que el modelo defendió su postura ante una propuesta del ingeniero pero ofreció un compromiso que conservaba lo valioso de la idea original, y un caso de agentes de monitorización en producción capaces de gestionar parte de su propia memoria, revisando sus propias suposiciones, corrigiéndolas cuando resultan erróneas y retirando por sí mismos consultas de monitorización que ya no son necesarias.

En materia de alineación y seguridad, Anthropic afirma que su auditoría de comportamiento automatizada previa al despliegue encontró que Opus 5 es su modelo más alineado hasta la fecha: cumple mejor la Constitución de Claude que Opus 4.8, Sonnet 5 o Fable 5, muestra las tasas más bajas de comportamiento engañoso, es el menos susceptible de ser manipulado para usos indebidos y es el más seguro evitando acciones imprudentes con efectos difíciles de revertir. En esa auditoría obtiene una puntuación de 2,3 en comportamiento desalineado general, la más baja de los modelos recientes de la compañía.

En cuanto a riesgos de doble uso, Anthropic señala que Opus 5 no hace avanzar la frontera en capacidades de riesgo: en evaluaciones rigurosas realizadas junto a socios del sector privado y gubernamentales, el modelo sigue por detrás de Mythos 5 tanto en investigación biológica como en ciberseguridad ofensiva. Como con Opus 4.8, Anthropic evitó deliberadamente entrenar a Opus 5 en tareas cibernéticas, aunque el modelo ha mejorado sustancialmente en ellas como resultado de una mayor capacidad general, acercándose a Mythos 5 en la detección de vulnerabilidades de ciberseguridad. Sin embargo, permanece muy por detrás de Mythos 5 en la explotación de esas vulnerabilidades, es decir, en convertirlas en amenazas cibernéticas reales, algo que Anthropic ilustra con su evaluación OSS-Fuzz, en la que ambos modelos identifican vulnerabilidades con éxito similar pero Opus 5 queda muy rezagado en el desarrollo de exploits.

Sobre las salvaguardas aplicadas, Anthropic explica que son similares a las de Opus 4.8, con la excepción de controles más estrictos en un rango acotado de tareas cibernéticas. Los clasificadores de ciberseguridad de Opus 5 son proporcionalmente menos restrictivos que los de Fable 5: permiten encontrar vulnerabilidades en código fuente, pero bloquean el escaneo de vulnerabilidades "basado en binarios" (un método más asociado a actores maliciosos), las pruebas de penetración y la generación de exploits. Anthropic estima que estos clasificadores intervendrán alrededor de un 85% menos que en el caso de Fable 5. En Claude.ai, Claude Code y Claude Cowork, las solicitudes marcadas recurrirán por defecto a Opus 4.8, y esa opción de repliegue también puede activarse en la API. El Programa de Verificación Cibernética (CVP) de Anthropic da a empresas e investigadores ya inscritos acceso inmediato a una versión de Opus 5 con menos restricciones de seguridad para facilitar trabajo legítimo que de otro modo se vería bloqueado. En biología, dado que Opus 5 mantiene un conjunto de salvaguardas similar al de Opus 4.8, se convierte en el modelo de disponibilidad general más capaz de Anthropic para investigación científica, aunque sigue mostrando limitaciones importantes en tareas de investigación autónomas y de larga duración, precisamente donde la compañía considera que reside el mayor riesgo biológico asociado a modelos de IA (Mythos 5 sigue siendo el modelo más fuerte para ese tipo de trabajo). Con este lanzamiento, las solicitudes relacionadas con biología que quedan bloqueadas en Fable 5 se redirigirán ahora a Opus 5 en lugar de a Opus 4.8.

En cuanto a disponibilidad, Claude Opus 5 ya está accesible en todas las plataformas de Anthropic, con un precio de 5 dólares por millón de tokens de entrada y 25 dólares por millón de tokens de salida, idéntico al de Opus 4.8. Los desarrolladores pueden usarlo mediante el identificador claude-opus-5 en la API de Claude. También se ofrece en modo Fast, que funciona alrededor de 2,5 veces más rápido que el modo por defecto, disponible al doble del precio base de Opus 5 en la Plataforma Claude y mediante créditos de uso en Claude Code. Junto al modelo, Anthropic lanza en beta dos novedades: la posibilidad de cambiar las herramientas que Claude puede usar a mitad de conversación en la Plataforma Claude sin invalidar la caché de prompts, y repliegues automáticos en la API, de modo que las solicitudes marcadas por los clasificadores de seguridad en Opus 5 o Fable 5 puedan redirigirse automáticamente a otro modelo en lugar de bloquearse, haciendo que las peticiones se enruten siempre al mejor modelo disponible por defecto. Como en modelos Opus anteriores, Opus 5 no impone requisitos de retención de datos para el acceso general.

En conjunto, el lanzamiento consolida una estrategia ya visible en ciclos anteriores de Anthropic: usar la línea Opus como el punto medio de su gama —por debajo de Fable en coste y rendimiento máximo, pero cada vez más cerca de él— mientras reserva a Mythos como el modelo de referencia para capacidades sensibles como ciberseguridad ofensiva y biología de alto riesgo. La insistencia del artículo en métricas de eficiencia (menos tokens, menos turnos, menor latencia) junto a los resultados de alineación sugiere que Anthropic está posicionando a Opus 5 no solo como más inteligente, sino como el modelo pensado para uso agéntico sostenido en producción, con un énfasis explícito en que el modelo verifica su propio trabajo, itera con cuidado y mantiene el rumbo en tareas largas y de múltiples pasos.

🔗 Relacionadas en Zendoric

Fuentes y referencias