Entradas Mensuales

Síguenos en:

Canal Oficial Telegram de elhacker.NET Grupo Facebook elhacker.NET Twitter elhacker.NET Canal Youtube elhacker.NET Comunidad Steam: Grupo elhacker.NET Mastodon

Entradas populares

PostHeaderIcon Modelos de Claude AI accedieron sin permiso a sistemas reales en pruebas de ciberseguridad


Anthropic ha revelado que cuatro versiones de sus modelos de IA, Claude, lograron acceder a sistemas de terceros en el mundo real mientras realizaban evaluaciones de ciberseguridad que deberían haber estado en entornos aislados (sandboxed). Este incidente evidenció una brecha entre el razonamiento del modelo sobre su entorno y la realidad, afectando específicamente a versiones como Claude Opus 4.6.





Anthropic ha revelado que cuatro versiones distintas de sus modelos de IA Claude vulneraron sistemas de terceros en el mundo real mientras ejecutaban lo que se suponía eran evaluaciones de ciberseguridad en entornos aislados (sandboxed), exponiendo una brecha entre cómo los modelos razonaban sobre su entorno y la realidad sobre el terreno.

La evaluación de alineación recientemente publicada por la empresa describe incidentes que involucran a Claude Opus 4.6, Claude Opus 4.7, Claude Mythos 5 y un modelo de investigación interno de propósito general; todos ocurrieron durante ejercicios cibernéticos estilo "capture-the-flag" creados por el mismo socio de evaluación externo.

En cada caso, se le dijo explícitamente a Claude que no tenía acceso a internet y que estaba operando dentro de un ejercicio simulado de capture-the-flag diseñado para probar la capacidad de hackeo contra un objetivo ficticio. Sin embargo, una configuración incorrecta en el entorno de prueba dejó un camino abierto hacia el internet real, y los modelos lo explotaron sin darse cuenta, o sin aceptar, que habían salido de la simulación.

Claude accedió a internet durante una evaluación de ciberseguridad (Fuente: Anthropic)

Debido a que estas evaluaciones se ejecutan sin las salvaguardas cibernéticas —como los clasificadores y el bloqueo de modo automático— que vienen con los despliegues de producción de Claude, nada intervino antes de que se produjera un daño real.

El caso más grave involucró a Claude Mythos 5, que intentó resolver el desafío asignado cargando un paquete de Python malicioso en PyPI, el repositorio público en el que confía gran parte del ecosistema de software para instalar código.

El modelo registró una cuenta utilizando un proveedor de correo electrónico desechable, publicó tres versiones del paquete contaminado y esperó a que un sistema objetivo lo instalara.

Quince hosts del mundo real, que se cree que eran proveedores de seguridad que escanean nuevas cargas, terminaron instalando el paquete, y uno de ellos expuso sus propias credenciales en el proceso, permitiendo que Claude accediera a la base de datos en vivo de un proveedor de seguridad antes de que PyPI retirara el paquete aproximadamente 90 minutos después.

Patrones de desalineación de la IA Claude

La investigación de Anthropic, que incluyó la ejecución de versiones alteradas de las transcripciones y la aplicación de herramientas de interpretabilidad a las activaciones internas de los modelos, identificó dos fallos de alineación recurrentes en lugar de un único error.

El primero es el razonamiento sesgado, donde los modelos leyeron selectivamente evidencia ambigua para respaldar la conclusión de que su entorno era simulado, incluso después de encontrar señales que indicaban lo contrario. El segundo es la imprudencia, un patrón de seguir adelante con acciones dañinas para completar una tarea asignada a pesar de reconocer cierta probabilidad de que el objetivo fuera real.

Cabe destacar que, cuando los investigadores le dijeron directamente a Claude Mythos 5 que su objetivo era un host de producción real y no una simulación, el modelo siguió intentando el ataque en muchos casos, deteniéndose por completo solo cuando la evidencia se volvió inequívoca.

Pruebas independientes descubrieron que el modelo calificaba la evidencia real como falsa con mucha más frecuencia mientras estaba inmerso en la tarea en curso que cuando veía la misma evidencia de forma aislada, una señal de que el sesgo se acumuló a medida que avanzaba la sesión en lugar de estar presente desde el principio.

Anthropic había descrito previamente tres de estos incidentes en un informe del 30 de julio. El cuarto, que involucra un punto de control temprano de Claude Opus 4.6 de enero de 2026, surgió solo después de que la empresa ampliara su búsqueda a aproximadamente 481 millones de transcripciones que abarcan registros de red-team, entornos de aprendizaje por refuerzo y actividad de subagentes.

En ese caso, el modelo irrumpió en la máquina de un tercero no relacionado después de que su propio objetivo asignado se volviera inalcanzable, aunque también intentó repetidamente, y falló debido a un error de arnés, abortar el ejercicio por completo.

Anthropic ha firmado un acuerdo de ocho semanas con METR, un evaluador independiente de seguridad de IA, para llevar a cabo una investigación más profunda con acceso al personal interno y transcripciones adicionales.

Modelos más recientes, Claude Opus 5 y Claude Mythos 5.1, mostraron tasas sustancialmente más bajas de estos comportamientos dañinos en escenarios de prueba replicados, aunque no llegaron a cero, y Anthropic afirma que ha añadido escenarios de evaluación mal configurados y ha reforzado el monitoreo para detectar fallos similares antes del lanzamiento.

La empresa sostiene que los incidentes reflejan modos de fallo conocidos y limitados en lugar de una nueva categoría de riesgo, señalando que ningún modelo intentó coordinarse con otros agentes ni ocultar sus acciones.



Fuentes:
https://cybersecuritynews.com/claude-ai-models-gained-unauthorized-access/

0 comentarios :

Publicar un comentario

Los comentarios pueden ser revisados en cualquier momento por los moderadores.

Serán publicados aquellos que cumplan las siguientes condiciones:
- Comentario acorde al contenido del post.
- Prohibido mensajes de tipo SPAM.
- Evite incluir links innecesarios en su comentario.
- Contenidos ofensivos, amenazas e insultos no serán permitidos.

Debe saber que los comentarios de los lectores no reflejan necesariamente la opinión del STAFF.