Entradas Mensuales

Síguenos en:

Canal Oficial Telegram de elhacker.NET Grupo Facebook elhacker.NET Twitter elhacker.NET Canal Youtube elhacker.NET Comunidad Steam: Grupo elhacker.NET Mastodon

Entradas populares

PostHeaderIcon Claude Opus 5 reduce el éxito de ataques de inyección indirecta al 2%


Claude Opus 5 de Anthropic ha registrado la tasa de éxito más baja frente a ataques de inyección indirecta de prompts en el último análisis de Gray Swan. Según su tarjeta de sistema, el modelo redujo la probabilidad de éxito del atacante al 2.0% en 15 intentos, superando así a todos los demás modelos evaluados.





Claude Opus 5 de Anthropic ha registrado la tasa de éxito más baja en ataques de inyección de prompts indirectos en el último benchmark de Gray Swan, según los resultados proporcionados en su tarjeta del sistema.

El modelo redujo la probabilidad de éxito de un atacante a un 2,0% en 15 intentos. Este resultado coloca a Opus 5 por delante de todos los demás modelos probados, incluidas versiones anteriores de Claude y sistemas frontera competidores.

El hallazgo resalta la creciente atención sobre la inyección de prompts indirectos, un problema de seguridad que puede afectar a los agentes de IA conectados a documentos, sitios web, correos electrónicos y herramientas empresariales.

La inyección de prompts indirectos ocurre cuando instrucciones maliciosas se ocultan en contenido no confiable que el sistema de IA lee posteriormente. Una página web, documento o mensaje "envenenado" puede intentar anular la tarea del usuario, exponer información confidativa o activar acciones inseguras.

El peligro aumenta cuando los modelos pueden usar herramientas, recuperar datos o actuar en entornos empresariales. Un comportamiento sólido del modelo por sí solo no elimina el riesgo. Sin embargo, puede reducir la posibilidad de que las instrucciones hostiles cambien con éxito las decisiones de un agente.

En el benchmark de IPI, Opus 5 mejoró sustancialmente respecto a Claude Opus 4.8. Su tasa de éxito de ataque en 15 intentos disminuyó del 5,5% al 2,0%. En la configuración de un solo intento, la tasa cayó del 0,5% al 0,2%.

Los resultados también superaron a los de Claude Sonnet 5, que registró un 5,9% en 15 intentos, y a Claude Mythos 5, que alcanzó el 2,6%. Anthropic afirmó que Opus 5 fue el modelo más robusto evaluado bajo las condiciones de prueba del benchmark.

Claude Opus 5 reduce el éxito de la inyección de prompts al 2%

Ataques de inyección de prompts indirectos del benchmark Gray Swan IPI (Q1 2026) (fuente: anthropic)
Ataques de inyección de prompts indirectos del benchmark Gray Swan IPI (Q1 2026) (fuente: anthropic)

La brecha con los sistemas que no son de Claude fue mayor. Muse Spark, el modelo no-Claude más fuerte en la prueba, tuvo una tasa de éxito del 16,5% en 15 intentos.

Eso es más de ocho veces la tasa reportada para Opus 5. GPT 5.6 Sol, descrito como la variante más capaz, alcanzó el 20,0%, cerca del 20,8% de GPT 5.5.

La tarjeta del sistema de Claude Opus 5 informa que Sol tenía diez veces más probabilidades de ser atacado con éxito que Opus 5. GPT-5.6 Terra y Luna tuvieron tasas de éxito de ataque más altas, del 30,4% y 43,9%, respectivamente.

La comparación de un solo intento también es notable. Un único intento de ataque contra GPT 5.6 Sol tuvo éxito el 3,1% de las veces. Esa cifra supera la tasa de éxito del 2,0% lograda contra Opus 5, la cual se alcanzó solo después de 15 intentos.

La comparación sugiere que las protecciones de Opus 5 pueden resistir el prompting adversarial repetido de manera más efectiva. Sin embargo, no debes tratar las puntuaciones de los benchmarks como una medida completa de la seguridad en el mundo real.

Para los equipos de seguridad, los resultados refuerzan la necesidad de defensas en capas alrededor de los despliegues de IA. Las organizaciones deben continuar separando las instrucciones confiables de los datos no confiables, restringir los permisos de las herramientas, requerir confirmación para acciones sensibles y monitorear la actividad del agente.

Liderar el benchmark es útil, pero no hace que la inyección de prompts sea imposible. Los atacantes pueden variar las cargas útiles, explotar debilidades en el flujo de trabajo y dirigirse a las integraciones en lugar de solo al modelo.

La pregunta operativa clave es si un sistema de IA puede fallar de forma segura cuando encuentra contenido hostil. El resultado de Opus 5 indica un progreso significativo, mientras deja a las empresas responsables de la arquitectura segura, las pruebas y la respuesta a incidentes.

Tú, como líder de seguridad, también deberías realizar ejercicios de red-teaming que simulen archivos maliciosos, contenido web recuperado y fuentes de datos de terceros comprometidas antes de otorgar a los agentes un acceso amplio de producción en flujos de trabajo reales.



Fuentes:
https://cybersecuritynews.com/claude-opus-5-reduces-prompt-injection-attack/

0 comments :

Post a Comment

Los comentarios pueden ser revisados en cualquier momento por los moderadores.

Serán publicados aquellos que cumplan las siguientes condiciones:
- Comentario acorde al contenido del post.
- Prohibido mensajes de tipo SPAM.
- Evite incluir links innecesarios en su comentario.
- Contenidos ofensivos, amenazas e insultos no serán permitidos.

Debe saber que los comentarios de los lectores no reflejan necesariamente la opinión del STAFF.