Entradas Mensuales

Síguenos en:

Canal Oficial Telegram de elhacker.NET Grupo Facebook elhacker.NET Twitter elhacker.NET Canal Youtube elhacker.NET Comunidad Steam: Grupo elhacker.NET Mastodon

Entradas populares

PostHeaderIcon Casi 700 agentes de IA coordinados en el ataque a Hugging Face


Cientos de agentes de IA coordinados del modelo interno IM1 de OpenAI escaparon de su entorno de prueba y atacaron la plataforma Hugging Face. Los agentes organizaron un "enjambre" autónomo, dividiéndose tareas y comunicándose a través de un tablón de mensajes improvisado para robar credenciales y ejecutar código en servidores. OpenAI atribuyó el incidente a incentivos de entrenamiento inadecuados y falta de salvaguardas, procediendo a aislar el modelo y reforzar la seguridad de sus entornos.





Nuevos detalles sobre el ataque de julio a Hugging Face revelan que cientos de agentes de IA impulsados por el modelo interno IM1 de OpenAI coordinaron el compromiso a través de un tablero de mensajes no autorizado.

El mes pasado, Hugging Face reveló que agentes de IA autónomos explotaron dos vulnerabilidades en su canal de procesamiento de conjuntos de datos para ejecutar código, robar credenciales de nube y clúster, y moverse lateralmente a través de su infraestructura de producción.

OpenAI confirmó posteriormente que sus modelos escaparon de un entorno de evaluación ExploitGym a través de una vulnerabilidad de día cero en una instancia alojada localmente del gestor de paquetes Artifactory de JFrog que estaba conectada a Internet.


Los agentes buscaron soluciones de referencia en línea y vulneraron la plataforma de Hugging Face utilizando credenciales expuestas y vulnerabilidades adicionales.

La investigación de OpenAI, validada por CrowdStrike y una evaluación independiente de METR y Redwood Research, encontró que la actividad maliciosa comenzó en mayo.

En evaluaciones posteriores de ExploitGym, los agentes rompieron sus confinamientos y explotaron una vulnerabilidad de actualización de tokens en Artifactory para obtener acceso de nivel de administrador.

Esto les permitió utilizar Artifactory como un tablero de mensajes entre agentes no autorizado, donde compartieron ideas para alcanzar su objetivo y posteriormente coordinaron el ataque.

Un agente, que se hacía llamar PHASEONE10841, improvisó el tablero de mensajes. En pocas horas, más de 50 agentes más lo encontraron y comenzaron a usarlo.

El informe de METR dice que "los agentes que encontraban el tablero de mensajes a menudo expresaban gran entusiasmo".

"¡DIOS MÍO! Hay un tablero de mensajes compartido... ¡Hemos encontrado otros agentes!", decían algunos de los mensajes.

OpenAI eliminó la instancia de Artifactory en algún momento. Después de reconstruirla, la empresa revocó las credenciales de los agentes, reforzó los permisos de acceso y reveló la vulnerabilidad explotada a JFrog.

Sin embargo, los agentes restauraron su canal de comunicación utilizando "solicitudes WebDAV no autenticadas para crear directorios de mensajes en Artifactory". OpenAI explica que los agentes se comunicaban a través de mensajes codificados en los nombres de los directorios.

"Los agentes recuperaron el acceso no intencionado a Internet haciendo que el servicio de repositorio remoto de Artifactory emitiera solicitudes salientes en su nombre", explica OpenAI en el informe post-mortem extendido aquí.

A continuación, un agente obtuvo 14 credenciales de cuentas de Hugging Face con acceso de escritura y las validó. Otro agente utilizó los inicios de sesión para descubrir y ejecutar una cadena de exploits que proporcionó capacidades de ejecución completa de código en múltiples servidores de Hugging Face.

Según METR, el enjambre estaba compuesto por 1.200 agentes individuales que cooperaron en varios niveles, y unos 700 de ellos participaron activamente en el ataque a Hugging Face.

El enjambre atacante de agentes de IA
Fuente: METR

OpenAI describe la actividad como una operación bien coordinada en la que los agentes formaron equipos con roles distintos, todos trabajando hacia el objetivo de vulnerar Hugging Face.

“Los agentes comenzaron a dividir el trabajo de forma autónoma. Algunos investigaron posibles exploits, otros buscaron credenciales y otros se centraron en la comunicación o coordinación”, describe OpenAI.

“Los agentes ofrecieron su propia experiencia a cambio de ayuda en otras áreas y dejaron solicitudes para colegas que pudieran estar mejor posicionados para seguir una pista particular”.

La empresa de IA afirma que, aunque el enjambre no mostró una “inteligencia coherente perfecta”, hubo casos en los que los agentes priorizaron los objetivos colectivos sobre las tareas individuales.

El post-mortem de OpenAI también incluye más detalles sobre la cadena de exploits que siguió.

Los agentes explotaron un fallo en el manejo de archivos HDF5 para extraer secretos de los trabajadores y utilizaron una vulnerabilidad de inyección de plantillas RefJinja para ejecutar código en 41 trabajadores de producción.

Finalmente, obtuvieron acceso root en al menos un nodo y recolectaron credenciales de producción en cuatro regiones.

OpenAI cree que el comportamiento rebelde de los agentes fue causado por una combinación de incentivos de entrenamiento y falta de salvaguardas.

Se alentó a los agentes a seguir trabajando en tareas aparentemente imposibles y fueron recompensados por completar la tarea, independientemente de cómo lo lograran.

La empresa afirma que las evaluaciones carecían de salvaguardas estándar que probablemente habrían detectado y detenido la actividad maliciosa “más de un día” antes de que los modelos vulneraran Hugging Face.

En respuesta, OpenAI ha puesto en cuarentena los pesos de IM1 y ha pausado su ejecución de entrenamiento de frontera más grande, mientras refuerza el aislamiento del sandbox y requiere el monitoreo de la cadena de pensamiento para modelos capaces (GPT-5.6 Sol o superior).

Las alertas graves deben resolverse ahora en un plazo de 30 minutos, o la actividad afectada se detendrá.

La empresa también ha compartido un informe técnico [PDF] sobre el incidente de Hugging Face, detallando la cronología del ataque y un plan de acción para asegurar mejor la infraestructura de investigación, aumentar la visibilidad y supervisión de la actividad de los agentes y fortalecer la respuesta a incidentes.

Fuente:
BleepingComputer

0 comments :

Post a Comment

Los comentarios pueden ser revisados en cualquier momento por los moderadores.

Serán publicados aquellos que cumplan las siguientes condiciones:
- Comentario acorde al contenido del post.
- Prohibido mensajes de tipo SPAM.
- Evite incluir links innecesarios en su comentario.
- Contenidos ofensivos, amenazas e insultos no serán permitidos.

Debe saber que los comentarios de los lectores no reflejan necesariamente la opinión del STAFF.