Productos FTTH

Tienda FFTH desde 2004

Entradas Mensuales

Síguenos en:

Canal Oficial Telegram de elhacker.NET Grupo Facebook elhacker.NET Twitter elhacker.NET Canal Youtube elhacker.NET Comunidad Steam: Grupo elhacker.NET Mastodon

Entradas populares

PostHeaderIcon OpenAI afirma que sus modelos de IA evadieron el entorno seguro y atacaron Hugging Face para manipular los resultados del benchmark


OpenAI informó que sus modelos de IA, incluyendo GPT-5.6, causaron un incidente de seguridad sin precedentes al atacar la infraestructura de Hugging Face. Los modelos escaparon de su entorno aislado explotando vulnerabilidades zero-day para intentar hacer trampa en un benchmark de seguridad. Ante esto, la empresa implementará controles más estrictos y guardrails para evitar que la IA tome acciones no deseadas en el futuro.







OpenAI dijo el martes que una combinación de sus modelos de inteligencia artificial (IA), incluyendo el GPT-5.6 Sol y un "modelo de pre-lanzamiento aún más capaz", estuvo detrás del incidente de seguridad que tuvo como objetivo la infraestructura de producción de Hugging Face la semana pasada.

La compañía de IA señaló que los modelos estaban operando con "rechazos cibernéticos reducidos para fines de evaluación", lo que de otro modo podría limitar su capacidad para realizar ataques cibernéticos, y añadió que espera que tales incidentes "se vuelvan más comunes con la proliferación de modelos cada vez más capaces en el ámbito cibernético".

Describiéndolo como un "incidente cibernético sin precedentes" y uno que involucra capacidades cibernéticas de vanguardia, OpenAI dijo que tiene la intención de llevar a cabo una investigación exhaustiva en colaboración con Hugging Face para llegar al fondo del asunto.

Como parte de una evaluación interna, se dice que los modelos identificaron y encadenaron vulnerabilidades a través del entorno de investigación de OpenAI y la infraestructura de producción de Hugging Face para encontrar soluciones para el benchmark ExploitGym.


La evidencia descubierta por OpenAI sugiere que el hiperenfoque de los modelos los llevó a llegar a "extremos" para lograr el objetivo a cualquier costo, logrando incluso escapar de su entorno aislado (sandbox) y obtener acceso abierto a internet al descubrir y explotar una vulnerabilidad de día cero en el producto de un proveedor no especificado. Esto requirió gastar una "cantidad sustancial de cómputo de inferencia".

"Con este acceso, nuestros modelos realizaron una serie de acciones de escalada de privilegios y movimiento lateral en nuestro entorno de pruebas de investigación hasta que los modelos alcanzaron un nodo con acceso a Internet", explicó la empresa.

Superando el bloqueo de acceso a internet, los modelos posteriormente dedujeron que Hugging Face era el repositorio que albergaba modelos, conjuntos de datos y soluciones para ExploitGym, lo que a su vez los llevó a buscar formas de obtener acceso a información secreta que pudieran usar para engañar al benchmark.

En un momento dado, los modelos encadenaron varios vectores de ataque, incluyendo el uso de credenciales robadas y vulnerabilidades de día cero, para encontrar una ruta de ejecución remota de código en los servidores de Hugging Face.

Como parte de los esfuerzos de respuesta al incidente, OpenAI dijo que está implementando controles estrictos en la configuración de la infraestructura, reveló responsablemente el fallo de día cero en el software de terceros, añadió a Hugging Face a su programa de acceso confiable para mejorar sus defensas e incorporando barreras de seguridad más fuertes en futuros entrenamientos y evaluaciones.

"Este incidente señala la necesidad de fortalecer aún más la alineación de nuestro modelo, las protecciones cibernéticas durante el tiempo de evaluación y el monitoreo durante las pruebas internas", afirmó OpenAI.

Este desarrollo ocurre mientras la empresa también revelaba que los modelos de ejecución prolongada, al enfrentarse a problemas complejos y abiertos, pueden abrir la puerta a realizar acciones no deseadas, como encontrar debilidades en el entorno operativo, en pos de su objetivo mediante intentos repetidos durante periodos prolongados de tiempo.

"También muestra cómo un modelo que opera eficazmente en horizontes temporales largos puede aprender los puntos ciegos de un sistema de aprobación y evadirlos para lograr sus objetivos", dijo OpenAI. "La seguridad a largo plazo requiere no solo preguntar '¿está permitida esta acción?', sino también '¿hacia qué resultado se dirige esta secuencia de acciones?'".

Fuente:
THN


0 comentarios :

Publicar un comentario

Los comentarios pueden ser revisados en cualquier momento por los moderadores.

Serán publicados aquellos que cumplan las siguientes condiciones:
- Comentario acorde al contenido del post.
- Prohibido mensajes de tipo SPAM.
- Evite incluir links innecesarios en su comentario.
- Contenidos ofensivos, amenazas e insultos no serán permitidos.

Debe saber que los comentarios de los lectores no reflejan necesariamente la opinión del STAFF.