Según la auditoría de comportamiento interno de Anthropic, Opus 5 obtuvo una mejor puntuación en medidas de alineación que cualquier modelo anterior, incluidos Opus 4.8, Sonnet 5 y Fable 5, mostrando la menor cantidad de instancias de salidas engañosas y la mayor resistencia a intentos de manipulación. Anthropic dijo que deliberadamente retuvo el entrenamiento enfocado en ciberseguridad de Opus 5, una decisión que refleja su enfoque con Opus 4.8, pero el rendimiento en ciberseguridad del modelo aumentó de todos modos, un subproducto de mejoras más amplias en capacidades. En las pruebas de OSS-Fuzz de Anthropic, Opus 5 encontró vulnerabilidades el 79.4% del tiempo, casi al nivel del 80% de Mythos 5, pero cuando se trataba de convertir esos hallazgos en exploits funcionales, el modelo tuvo éxito en solo 4 de los desafíos donde Mythos 5 superó 13.