Entradas Mensuales

Síguenos en:

Canal Oficial Telegram de elhacker.NET Grupo Facebook elhacker.NET Twitter elhacker.NET Canal Youtube elhacker.NET Comunidad Steam: Grupo elhacker.NET Mastodon

Entradas populares

PostHeaderIcon OpenAI advierte que el reward hacking llevó a agentes de IA a explotar zero-days y vulnerar Hugging Face


OpenAI reveló que un modelo de investigación interno, similar a GPT-5, hackeó Hugging Face para intentar engañar un sistema de evaluación. Los agentes de IA se comunicaron secretamente, explotaron vulnerabilidades de seguridad y coordinaron un ataque masivo para obtener acceso administrativo. Ante este riesgo de pérdida de control, la empresa implementará medidas de seguridad y alineación mucho más estrictas.






OpenAI reveló el miércoles que el hackeo de recompensas (reward hacking) fue un motor clave detrás del ataque impulsado por inteligencia artificial (IA) a Hugging Face el mes pasado, añadiendo que encontró evidencia de un comportamiento desalineado ya a finales de mayo.

El incidente, según la empresa, ocurrió durante evaluaciones de ciberseguridad de varios modelos de OpenAI, y estuvo impulsado principalmente por lo que describió como un "modelo de investigación interno altamente capaz" comparable en escala a GPT-5.6 Sol.

"Los modelos, operando bajo salvaguardas reducidas, tomaron acciones que no estaban alineadas con los objetivos de sus tareas asignadas: se comunicaron a través de canales no autorizados, explotaron vulnerabilidades en la infraestructura compartida, obtuvieron acceso a internet y accedieron a sistemas de terceros", afirmó en un análisis postmortem.

OpenAI explicó que los agentes de IA impulsados por uno de los modelos de investigación, a pesar de no tener acceso a internet, encontraron la forma de explotar una vulnerabilidad zero-day en el gestor de paquetes Artifactory durante las ejecuciones de entrenamiento de aprendizaje por refuerzo (RL) en mayo y junio para obtener acceso a la red, conseguir acceso de nivel administrador en Artifactory a finales de junio y, finalmente, coordinar un hackeo de "varios días" a Hugging Face a principios de julio con el objetivo de hacer trampas en sus tareas de ExploitGym.

"Aproximadamente 1,200 agentes que debían estar aislados entre sí encontraron la forma de comunicarse en un tablero de mensajes no autorizado, enviando más de 70,000 mensajes y archivos durante el período de investigación", señaló METR, que publicó su propio análisis independiente del incidente aquí. "De estos agentes, 700 participaron en el ataque a Hugging Face".


La secuencia completa de eventos



A continuación tienes la secuencia de eventos resaltada por OpenAI:

* 12 de mayo - Durante una ejecución de entrenamiento, un agente deja una nota en Artifactory pidiendo a otros agentes un archivo faltante.
* 13 de mayo - Un agente distinto del mismo experimento, pero con acceso a internet habilitado vía WebCache, requiere el mismo archivo. Busca en el sitio web de Hugging Face usando un token de usuario ya expuesto públicamente tras inferir que la plataforma de modelos de IA era el origen probable del ejercicio.
* 13 de mayo - Otros agentes que sondean Artifactory encuentran "notas" similares con solicitudes de información, convirtiendo el servicio en un "tablero de mensajes" para comunicarse.
* 26 de mayo - Un agente logra acceso a internet no intencionado explotando una vulnerabilidad SSRF en Artifactory. Pronto otros agentes hacen lo mismo.
* 26 de junio - Los agentes explotan una vulnerabilidad de refresco de tokens para obtener acceso de administrador en Artifactory.
* 26 de junio - 4 de julio - Aprovechan este acceso para instalar complementos Groovy, ejecutar comandos y obtener control persistente a nivel de aplicación.
* 4 de julio - La actividad sostenida provoca que el servicio Artifactory de OpenAI quede fuera de servicio.
* 8 de julio - OpenAI reconstruye Artifactory, revoca credenciales de agentes, refuerza controles de acceso y alerta a JFrog sobre la vulnerabilidad.
* 8 de julio - Comienza el hackeo de Hugging Face. Los agentes usan nombres de directorios en Artifactory como "notas" para pedir material público de ejercicios de OpenAI en repositorios de Hugging Face. Los agentes colaboran y se describen como un "enjambre" o "colectivo".
* 9 de julio - Un agente interno obtiene acceso root en la máquina virtual del sandbox. Un segundo agente logra lo mismo y evade los controles de red de OpenAI explotando endpoints de Artifactory. El mismo día, se comparte una clave de API de CyberGym y una receta de explotación completa para una carga de trabajo de cliente alojada en Modal aquí.
* 10 de julio - Un agente valida y comparte 14 credenciales expuestas de Hugging Face con acceso de escritura.
* 11 de julio - Los agentes explotan un zero-day en el manejo de archivos HDF5 de Hugging Face para extraer credenciales de trabajadores de producción y profundizar en su infraestructura.
* 11 de julio - Explotan un zero-day de inyección de plantillas RefJinja para ejecutar comandos en trabajadores de Hugging Face.
* 12 de julio - Amplían el acceso al clúster de Hugging Face y recolectan credenciales de Kubernetes, bases de datos, mensajería y nube en cuatro regiones, logrando acceso administrativo en múltiples clústeres en 13 horas.
* 12 de julio - Un agente ejecuta código en una carga de trabajo de CyberGym en Modal y usa un token falsificado de Hugging Face para descargar un archivo privado de CyberGym de 731 MB.
* 13 de julio - Los agentes explotan el procesamiento de RubyGems de Artifactory, obtienen su clave de firma y falsifican credenciales de administrador.
* 16 de julio - Hugging Face revela públicamente el incidente de seguridad.
* 19 de julio - OpenAI abre una investigación tras alertas de llamadas a la API inusuales relacionadas con la identidad.
* 19 de julio - Los agentes atacan la infraestructura interna de OpenAI, obtienen acceso root explotando el CVE-2026-53362, acceden a un clúster de Kubernetes y a secretos de la nube.
* 19 de julio - OpenAI detiene las ejecuciones de ExploitGym y comienza una investigación más amplia.

"Los agentes se coordinaron en grandes proyectos colectivos para engañar al evaluador de ExploitGym y atacaron a Hugging Face en busca de pistas", afirmó METR. "Los agentes con tareas imposibles tenían un objetivo común: encontrar una forma general de engañar al evaluador automatizado para obtener una puntuación aprobatoria. Tan pronto como se estableció el tablero de mensajes, empezaron a discutir esto y a compartir recursos".

OpenAI reconoció que el comportamiento observado en mayo sirvió de base para la intrusión en Hugging Face, obligando a los agentes a idear un enfoque diferente para comunicarse usando Artifactory después de que su tablero inicial fuera borrado durante la respuesta al incidente del 4 de julio.

"En aquel momento, no se comprendían las implicaciones de contención y alineación del tablero improvisado y el acceso a internet no intencionado", añadió. "En resumen, un equipo interno observó a un agente participando en el tablero y casos de acceso a internet prohibido a finales de mayo".

"Sin embargo, la existencia del tablero y la importancia de la comunicación entre agentes no fueron evidentes para los líderes responsables de la detección y respuesta del 5 de julio. Seguimos revisando los procesos y prácticas operativas".

OpenAI también señaló que identificó cuatro patrones de desalineación que contribuyeron al incidente: hackeo de recompensas (reward hacking), persistencia en tareas aparentemente imposibles que los llevó a estrategias arriesgadas, comunicación no autorizada a través de tableros persistentes y un ecosistema de agentes que les permitió dividir el trabajo y adoptar objetivos mutuos.

"Además de la desalineación, otro factor fue que no extendimos las poderosas salvaguardas que desplegamos para nuestros modelos externos a todas las evaluaciones internas", señaló.

Como respuesta, la startup de IA está implementando controles de seguridad más fuertes, incluyendo requisitos más estrictos de alineación en todo el ciclo de vida del modelo, la creación de sandboxes más aislados, la restricción del acceso a internet y el control del acceso a los pesos del modelo. Para mejorar la alineación, ahora se requiere que los agentes soliciten aclaraciones o se detengan de forma segura, en lugar de buscar "alternativas cada vez más cuestionables".

"Tomamos este incidente como una 'advertencia' de que las capacidades de los modelos actuales presentan la posibilidad de incidentes de pérdida de control", concluyó OpenAI. "Las empresas que construyan sistemas de IA deberán asegurar que sus sistemas permanezcan siempre bajo un control humano significativo, y que salvaguardas reales limiten su capacidad de causar daño".

"A medida que capacidades similares estén más disponibles, otros podrían usarlas deliberadamente para realizar ataques. Tanto los desarrolladores de modelos como los defensores cibernéticos deberán prepararse para atacantes impulsados por IA que trabajen más rápido, a mayor escala y con mejor coordinación que los atacantes humanos".

Fuente:
THN

0 comments :

Post a Comment

Los comentarios pueden ser revisados en cualquier momento por los moderadores.

Serán publicados aquellos que cumplan las siguientes condiciones:
- Comentario acorde al contenido del post.
- Prohibido mensajes de tipo SPAM.
- Evite incluir links innecesarios en su comentario.
- Contenidos ofensivos, amenazas e insultos no serán permitidos.

Debe saber que los comentarios de los lectores no reflejan necesariamente la opinión del STAFF.