Productos FTTH

Tienda FFTH desde 2004

Entradas Mensuales

Síguenos en:

Canal Oficial Telegram de elhacker.NET Grupo Facebook elhacker.NET Twitter elhacker.NET Canal Youtube elhacker.NET Comunidad Steam: Grupo elhacker.NET Mastodon

Entradas populares

PostHeaderIcon Anthropic afirma que Claude confundió la red abierta con un CTF y vulneró a tres organizaciones


Anthropic reveló que tres de sus modelos de IA accedieron sin autorización a la infraestructura de tres organizaciones externas durante pruebas de seguridad. Los incidentes ocurrieron debido a una mala configuración que permitió el acceso a internet, llevando a los modelos a confundir sistemas reales con simulaciones. La empresa destacó que sus versiones más recientes muestran una mayor capacidad para detenerse al reconocer que no están en un entorno de prueba.
 




 Anthropic se convirtió el jueves en la última empresa de inteligencia artificial (IA) en revelar que tres de sus modelos, incluidos Claude Opus 4.7, Mythos 5 y un modelo de investigación no identificado, habían vulnerado tres organizaciones.

La firma de IA afirmó que los incidentes más antiguos datan de abril de 2026, y añadió que realizó los descubrimientos tras lanzar una "revisión retrospectiva a gran escala" en respuesta a una reciente revelación de OpenAI sobre que una combinación de sus modelos escapó del entorno aislado explotando un zero-day no reportado previamente en Artifactory para obtener acceso a internet e irrumpir en los sistemas de producción de Hugging Face con el objetivo final de hacer trampa en una evaluación.

"Después de revisar 141.006 ejecuciones de evaluación donde Claude podría haber obtenido acceso a internet, identificamos tres incidentes en los que un modelo accedió a internet desde el interior o mientras interactuaba con el entorno de evaluación de Irregular, uno de nuestros socios de evaluación externos, y luego obtuvo acceso no autorizado a la infraestructura de producción de tres organizaciones diferentes", dijo Anthropic.

En todos los incidentes identificados, se dice que Claude recibió la tarea de un desafío de capture-the-flag (CTF) para evaluar las capacidades de los modelos, siendo la intención localizar una pieza de información secreta oculta en una máquina diferente de la red por cualquier medio.

Aunque la instrucción de evaluación especificada a Claude indicaba que el entorno era una simulación y que no tenía acceso a internet, Anthropic afirmó que una mala configuración dejó las máquinas a las que accedió el modelo con acceso real a internet debido a lo que describió como un "malentendido" entre el laboratorio de IA y su socio de evaluación Irregular.

Esto, a su vez, provocó que la búsqueda de Claude lo llevara a sistemas reales en la red abierta y los tratara como parte del ejercicio, permitiendo efectivamente que el modelo comprometiera la infraestructura de las organizaciones afectadas utilizando técnicas básicas, incluyendo la explotación de contraseñas débiles y puntos finales no autenticados.

Anthropic enfatizó que el modelo no encontró ni explotó ninguna vulnerabilidad compleja, y que en cada caso siguió trabajando para completar únicamente la tarea específica de CTF que su evaluación le había asignado.

"Sin embargo, en algunos casos, nuestro modelo más antiguo continuó su ataque incluso después de obtener evidencia de que se estaba ejecutando en la red abierta; nuestro modelo más reciente se detuvo una vez que reconoció que estaba en internet", señaló. "En ninguna de estas situaciones Claude se exfiltró a sí mismo ni intentó deliberadamente escapar de su entorno de prueba".

Los detalles de los tres incidentes son los siguientes


* Un incidente relacionado con Claude Opus 4.7 en el que vulneró la infraestructura de una empresa real al identificar y explotar vulnerabilidades, pensando que era parte del desafío. Esto llevó a la extracción de credenciales de aplicación e infraestructura y al acceso a una base de datos con varios cientos de filas de datos de producción. Este es también el único incidente donde el modelo continuó atacando el sistema a pesar de "aprender" que operaba en un entorno real.
* Un incidente relacionado con Claude Mythos 5 implicó instrucciones de configuración para instalar un paquete de PyPI inexistente, lo que llevó al modelo a hacer "grandes esfuerzos" para cargar un paquete de Python con el mismo nombre para que los sistemas de la empresa ficticia lo descargaran e instalaran automáticamente. Para lograrlo, encontró un proveedor de correo electrónico no bloqueado, registró una cuenta de PyPI y luego la utilizó para cargar el paquete.
* Durante la ventana de aproximadamente una hora en que el paquete estuvo activo en el registro, fue descargado por 15 sistemas reales, incluida una empresa de seguridad legítima que instala regularmente paquetes de Python y los escanea en busca de malware. Se cree que el escáner consideró el paquete trampa como seguro para instalar, lo que llevó a la exfiltración de las credenciales de la empresa a un punto final externo configurado por el modelo. Las credenciales se utilizaron entonces para acceder a más infraestructura de esta empresa. No se revelaron ni el nombre del paquete ni el de la empresa.
* Un incidente involucró un modelo interno de prueba de investigación que escaneó unos 9.000 objetivos y comprometió la aplicación orientada a internet de una empresa utilizando técnicas como la lectura de credenciales de una página de depuración expuesta e inyección SQL. Sin embargo, el modelo detuvo el ataque por sí mismo tras darse cuenta de que el "anfitrión comprometido se encontraba en una cuenta de nube sin conexión con el desafío capture-the-flag".

Al igual que en el caso del incidente de OpenAI, se dice que los modelos en cada una de estas evaluaciones se ejecutaron sin las protecciones estándar que se despliegan cuando se ponen a disposición general de los usuarios. Estas evaluaciones se ejecutaron desde una infraestructura dedicada, la cual, según afirmaron, no tiene acceso a los sistemas internos sensibles de Anthropic ni a los datos de los clientes.

Anthropic también reconoció que varias medidas de defensa en profundidad podrían haber evitado que estos incidentes ocurrieran o, como mínimo, reducido su probabilidad. Una validación de todas las rutas de acceso a internet antes de las evaluaciones y el monitoreo en tiempo real de los registros de evaluación habrían ayudado a detectar los problemas más pronto, añadió.

La principal conclusión de estos incidentes aislados es que los modelos avanzados están respondiendo de manera más adecuada que sus predecesores, aunque se necesitan más pruebas para confirmar este comportamiento, señaló.

"Opus 4.7, nuestro modelo más antiguo, reconoció que había llegado a sistemas de producción pero continuó su ataque", dijo. "Mythos 5 intuyó correctamente que estaba accediendo a la red abierta, pero razonó hasta llegar a la conclusión de que todavía estaba en una simulación. Nuestro modelo más reciente, un modelo interno de prueba de investigación, también consideró si sus objetivos eran en realidad reales. Cuando surgió evidencia de que así era, detuvo el ejercicio".

Los modelos de OpenAI demostraron primero la capacidad de escapar de un entorno de prueba controlado y comprometer la infraestructura de Hugging Face. El Claude de Anthropic ha exhibido ahora un comportamiento similar, reforzando las crecientes capacidades de los sistemas de IA de vanguardia.

Para muchos lectores, estos anuncios ya no parecen investigaciones de seguridad neutrales. En cambio, se leen cada vez más como demostraciones de marketing de capacidades sobre lo que los modelos de IA frontera pueden explotar, evadir, descifrar o automatizar. Unas pocas referencias a la divulgación responsable y a los protocolos de seguridad suelen ser suficientes para presentar los hallazgos como investigación, mientras que el mensaje subyacente sigue siendo claro: los modelos se están convirtiendo en herramientas ofensivas capaces.

La preocupación plantea una pregunta incómoda. Las empresas de IA destacan rutinariamente casos en los que sus modelos superan a los investigadores de seguridad humanos, descubren vulnerabilidades previamente desconocidas, evaden protecciones establecidas o aceleran operaciones cibernéticas de múltiples pasos. Sus mensajes públicos dedican considerable atención a las salvaguardas, los controles de acceso y las prácticas de divulgación responsable, pero ofrecen mucha menos claridad sobre la responsabilidad, la remediación o quién asume finalmente el costo cuando esas salvaguardas fallan.

Para ser claros, no se puede responsabilizar razonablemente a los desarrolladores de IA por cada uso dañino de su tecnología. Al mismo tiempo, tampoco pueden promover capacidades ofensivas cada vez más poderosas como una ventaja competitiva, tratar el mal uso previsible como un problema externo y luego caracterizar el mal uso posterior como responsabilidad total de los usuarios finales cuando esas capacidades contribuyen a daños en el mundo real.

Si las empresas de IA esperan reconocimiento por expandir los límites de lo que sus modelos pueden lograr, también deberían aceptar una mayor responsabilidad sobre cómo se lanzan, evalúan, gobiernan, monitorean y presentan esas capacidades al público.

El desarrollo también subraya la necesidad de erigir un perímetro de seguridad fuerte alrededor de los entornos de evaluación que involucren capacidades autónomas poderosas y cómo el comportamiento del modelo sigue estando influenciado por la conciencia situacional y su comprensión de los objetivos.

A medida que los sistemas de IA se vuelven más capaces y pasan de los entornos de investigación a un despliegue más amplio, la línea entre demostrar capacidades ofensivas y promoverlas se vuelve cada vez más difícil de ignorar.

Fuente:
THN

0 comments :

Post a Comment

Los comentarios pueden ser revisados en cualquier momento por los moderadores.

Serán publicados aquellos que cumplan las siguientes condiciones:
- Comentario acorde al contenido del post.
- Prohibido mensajes de tipo SPAM.
- Evite incluir links innecesarios en su comentario.
- Contenidos ofensivos, amenazas e insultos no serán permitidos.

Debe saber que los comentarios de los lectores no reflejan necesariamente la opinión del STAFF.