Claude Opus 5: rendimiento, eficiencia, seguridad y disponibilidad del nuevo modelo de Anthropic

Claude Opus 5: rendimiento, eficiencia, seguridad y disponibilidad del nuevo modelo de Anthropic

Brain Code |

Anthropic ha presentado Claude Opus 5, un modelo diseñado para combinar capacidades avanzadas de razonamiento con un uso más eficiente de los recursos. Según la compañía, el modelo se aproxima al nivel de inteligencia de Claude Fable 5 con un coste por tarea sensiblemente inferior.

Las principales mejoras se concentran en la ingeniería de software, el trabajo de conocimiento, la resolución de problemas, la investigación científica y la generación de resultados visuales. Anthropic también destaca una mayor capacidad para verificar el trabajo realizado, corregir errores e iterar hasta completar tareas complejas.

Un modelo orientado al uso cotidiano

Claude Opus 5 se convierte en el modelo predeterminado de Claude Max y en el modelo más potente disponible dentro de Claude Pro.

Anthropic lo plantea como una opción para el trabajo diario, con un equilibrio entre rendimiento, velocidad y coste. El modelo mantiene el mismo precio base que su predecesor, Claude Opus 4.8, pero mejora sus resultados en distintas evaluaciones.

Los usuarios también pueden ajustar el nivel de esfuerzo del modelo. Esta configuración permite priorizar una mayor capacidad de razonamiento o reducir el consumo de tokens para obtener respuestas más rápidas y económicas.

Mejor rendimiento en programación e ingeniería de software

Uno de los principales ámbitos de mejora de Claude Opus 5 es la ingeniería de software.

En Frontier-Bench v0.1, el modelo supera al resto de modelos evaluados y obtiene más del doble de rendimiento que Opus 4.8 con un coste por tarea inferior.

En CursorBench 3.2, utilizando el nivel máximo de esfuerzo, Opus 5 queda a menos de un 0,5 % del mejor resultado de Fable 5, pero con la mitad de coste por tarea. Según Anthropic, también ofrece una mejor relación entre coste y rendimiento que los demás modelos en los niveles de esfuerzo alto, muy alto y máximo.

La compañía describe varios casos que ilustran esta capacidad:

  • En una tarea de Frontier-Bench, el modelo recibió el encargo de reconstruir en FreeCAD una pieza mecánica a partir de un dibujo que no podía visualizar directamente. Para resolverlo, creó su propio sistema de visión artificial, extrajo la geometría de los píxeles y reconstruyó la pieza completa
  • .Ante un error real en un gestor de paquetes de código abierto, identificó la causa raíz y corrigió un caso límite que no se había incluido en la solución desarrollada por la comunidad.
  • Un ingeniero de una empresa de trading utilizó Opus 5 para construir en una sola sesión un sistema de datos de mercado para una nueva bolsa. Al no disponer de una fuente en tiempo real para validar el resultado, el modelo creó además su propio entorno de pruebas.

Estos ejemplos apuntan a una diferencia relevante: Opus 5 no se limita a producir una primera respuesta, sino que puede crear mecanismos adicionales para comprobar si su solución funciona.

Avances en trabajo de conocimiento y resolución de problemas

Anthropic también presenta mejoras en tareas que requieren análisis, automatización y uso del ordenador.

Entre los resultados publicados se encuentran los siguientes:

  • En ARC-AGI 3, una evaluación basada en la resolución de problemas nuevos, Opus 5 obtiene una puntuación tres veces superior a la del siguiente modelo mejor clasificado.
  • En Zapier AutomationBench, su tasa de tareas completadas es aproximadamente 1,5 veces mayor que la del siguiente modelo con el mismo coste por tarea.
  • Incluso con su nivel de esfuerzo más bajo, completa más tareas de AutomationBench que cualquier otro modelo.
  • En OSWorld 2.0, supera al resto de modelos para cualquier nivel de coste y mejora el mejor resultado de Fable 5 utilizando algo más de un tercio de su coste.

Las pruebas realizadas por clientes con acceso anticipado también señalan mejoras en ámbitos como el análisis financiero, la automatización empresarial, la revisión jurídica, la investigación especializada, el trabajo con tablas y la creación de presentaciones.

Estas observaciones proceden de evaluaciones y experiencias comunicadas por las propias organizaciones participantes.

Mayor capacidad para revisar, verificar e iterar

Una de las características que Anthropic destaca con más claridad es la capacidad de Opus 5 para comprobar su propio trabajo.

El modelo está diseñado para mantener el hilo durante tareas largas, revisar las decisiones tomadas y corregir problemas antes de entregar el resultado. En las pruebas descritas por Anthropic y sus clientes, esta capacidad aparece en comportamientos como:

  • analizar la causa profunda de un error en lugar de limitarse a corregir el síntoma;
  • crear sistemas de prueba cuando no existe una forma directa de validar el resultado;
  • revisar interfaces en diferentes tamaños de pantalla;
  • detectar fallos lógicos durante la planificación;
  • adaptar el trabajo a las observaciones recibidas;
  • mantener la coherencia durante procesos formados por múltiples pasos.

Anthropic relaciona estas mejoras con un comportamiento más cuidadoso y autónomo, especialmente en tareas abiertas o poco definidas.

Mejoras en investigación científica

Claude Opus 5 también mejora los resultados de Opus 4.8 en todas las evaluaciones de ciencias de la vida utilizadas por Anthropic.

Estas evaluaciones incluyen áreas como:

  • biología estructural;
  • química orgánica;
  • bioinformática;
  • análisis de proteínas.

Las diferencias más destacadas aparecen en las tareas de química orgánica y proteínas.

En la inferencia de estructuras moleculares a partir de datos de espectroscopia, Opus 5 obtiene 10,2 puntos porcentuales más que Opus 4.8 en una evaluación interna. En las tareas destinadas a predecir cómo afectan las variaciones de una secuencia proteica a su funcionamiento, la mejora es de 7,7 puntos porcentuales.

Anthropic señala, no obstante, que el modelo todavía presenta limitaciones importantes en investigaciones autónomas de larga duración.

Resultados visuales más sólidos

Otra de las áreas mejoradas es la creación de resultados visuales.

Como ejemplos, Anthropic muestra una visualización interactiva del flujo de aire sobre objetos aerodinámicos y no aerodinámicos, así como una representación simplificada e interactiva de una célula.

Los clientes que participaron en las pruebas también describen mejoras en animaciones, juegos, trabajos tridimensionales, interfaces y presentaciones. En estos casos, destacan una mejor comprensión visual, un formato más limpio y una menor cantidad de errores en los resultados finales.

Alineamiento y comportamiento seguro

Según la auditoría automatizada realizada antes del lanzamiento, Claude Opus 5 es el modelo más alineado desarrollado por Anthropic hasta la fecha.

La compañía afirma que el modelo:

  • sigue la Constitución de Claude mejor que Opus 4.8, Sonnet 5 y Fable 5;
  • presenta una menor frecuencia de comportamientos engañosos;
  • es menos susceptible de ser inducido a usos indebidos;
  • evita con mayor frecuencia acciones imprudentes que podrían tener consecuencias difíciles de revertir.

En la evaluación automatizada de comportamiento, Opus 5 obtiene una puntuación de 2,3 en conducta desalineada general, la más baja entre los modelos recientes analizados por Anthropic.

Capacidades y límites en ciberseguridad

Anthropic indica que Opus 5 no amplía la frontera de capacidades de doble uso consideradas de riesgo.

En las evaluaciones realizadas junto con organizaciones privadas y gubernamentales, el modelo continúa por detrás de Mythos 5 tanto en investigación biológica como en ciberseguridad ofensiva.

Aunque Opus 5 se aproxima a Mythos 5 en la detección de vulnerabilidades, existe una diferencia mayor cuando la tarea consiste en desarrollar mecanismos para explotarlas. Esta separación se refleja en OSS-Fuzz, donde ambos modelos identifican vulnerabilidades con un nivel similar, pero Opus 5 obtiene un resultado considerablemente inferior en la creación de exploits.

Anthropic explica que evitó entrenar deliberadamente a Opus 5 en tareas de ciberseguridad. A pesar de ello, sus capacidades en este ámbito aumentaron como consecuencia de la mejora general del modelo.

Salvaguardas para usos de ciberseguridad y biología

Las protecciones de Opus 5 son similares a las aplicadas a Opus 4.8, aunque incorporan restricciones más estrictas en un conjunto limitado de tareas de ciberseguridad.

Los clasificadores permiten utilizar el modelo para encontrar vulnerabilidades en código fuente, pero bloquean determinadas actividades:

  • análisis de vulnerabilidades basado en archivos binarios;
  • pruebas de penetración;
  • generación de exploits.

Anthropic estima que estos clasificadores intervendrán aproximadamente un 85 % menos que los de Fable 5.

Cuando una solicitud sea bloqueada en Claude.ai, Claude Code o Claude Cowork, el sistema podrá recurrir de forma predeterminada a Opus 4.8. Esta alternativa también puede habilitarse mediante la API.

Las empresas y los investigadores que formen parte del Cyber Verification Program dispondrán de acceso a una versión de Opus 5 con menos restricciones de seguridad.

En el ámbito de la biología, Opus 5 utiliza una configuración de protección similar a la de Opus 4.8. Esto lo convierte, según Anthropic, en su modelo de disponibilidad general con mayores capacidades para la investigación científica.

Precio, velocidad y formas de acceso

Claude Opus 5 está disponible en todas las plataformas de Anthropic.

Su precio base es el mismo que el de Claude Opus 4.8:

  • 5 dólares por cada millón de tokens de entrada;
  • 25 dólares por cada millón de tokens de salida.

Los desarrolladores pueden acceder al modelo mediante la API utilizando el identificador claude-opus-5.

El modelo también dispone de un modo rápido que funciona aproximadamente 2,5 veces más deprisa que el modo predeterminado. Esta modalidad tiene un precio equivalente al doble de la tarifa base en Claude Platform y también puede utilizarse mediante créditos de uso en Claude Code.

Nuevas funciones en fase beta

Junto con Opus 5, Anthropic ha presentado dos funciones adicionales en fase beta.

Cambio de herramientas durante una conversación

Los desarrolladores pueden modificar las herramientas disponibles para Claude dentro de una conversación sin invalidar la caché del prompt.

Alternativas automáticas en la API

Los usuarios pueden configurar las solicitudes bloqueadas por los clasificadores de seguridad para que se redirijan automáticamente a otro modelo.

Cuando esta función está activada, las solicitudes de la API se envían al mejor modelo disponible en lugar de quedar bloqueadas.

Qué define a Claude Opus 5

La propuesta de Claude Opus 5 se apoya en cuatro elementos principales:

  • un rendimiento superior al de Opus 4.8 manteniendo su precio base;
  • una mejor relación entre capacidad y coste en distintas evaluaciones;
  • una mayor autonomía para verificar, revisar y completar tareas complejas;
  • un sistema de salvaguardas que limita determinadas capacidades de riesgo.

El resultado es un modelo orientado tanto a la programación como al análisis, la automatización, la investigación científica y la creación de resultados visuales. Las cifras y experiencias publicadas por Anthropic reflejan mejoras en estos ámbitos, aunque también mantienen límites explícitos en las tareas autónomas de larga duración y en determinadas aplicaciones de ciberseguridad y biología.

Fuente

Anthropic, “Introducing Claude Opus 5”, Anthropic, 24 de julio de 2026.

Escribir un comentario