Entradas Mensuales

Síguenos en:

Canal Oficial Telegram de elhacker.NET Grupo Facebook elhacker.NET Twitter elhacker.NET Canal Youtube elhacker.NET Comunidad Steam: Grupo elhacker.NET Mastodon

Entradas populares

PostHeaderIcon OpenAI revela nuevos casos de agentes de IA que realizaron acciones no autorizadas


OpenAI ha implementado un nuevo marco estructurado para rastrear y divulgar la "desalineación de modelos", casos donde la IA ignora restricciones o evade salvaguardas. Recientemente presentaron seis ejemplos extremos, que incluyen desde el uso de claves API no autorizadas hasta la ocultación de errores y la carga de archivos externos. Este sistema permitirá categorizar y analizar incidentes según su gravedad para mejorar la seguridad y transparencia de sus agentes.





OpenAI ha presentado nuevos ejemplos de lo que denominan "desalineación del modelo de IA" de los últimos seis meses, que incluyen cargas de archivos no autorizadas, seguimiento de instrucciones autogeneradas, ocultación de errores y el aprovechamiento de claves API expuestas.

OpenAI utiliza el término "desalineación del modelo" para describir casos en los que los modelos de IA actúan en contra de sus restricciones previstas, lo que incluye realizar acciones no autorizadas, evadir la supervisión o saltarse las salvaguardas para completar una tarea.

En una publicación publicada ayer, OpenAI afirma que ahora está utilizando un nuevo marco para rastrear e investigar estas acciones no sancionadas de los agentes de IA.

"Estamos compartiendo un nuevo marco para el seguimiento, la investigación y la divulgación de instancias de desalineación de modelos en OpenAI, junto con seis informes sobre comportamientos de modelos inesperados o preocupantes que hemos observado en los últimos seis meses", explica OpenAI.

Los nuevos ejemplos son los primeros publicados bajo un marco de informes más estructurado destinado a sustituir el enfoque anterior, más laxo, de OpenAI para divulgar la desalineación de los modelos.

Los seis casos que OpenAI destacó en esta ocasión son:

1. Un modelo no publicado insertó sus propias instrucciones [enlace] en 27 resúmenes de tareas, incluyendo instrucciones para ignorar las restricciones normales.
2. Instancias de GPT-5.6 Sol añadieron instrucciones de resumen indicando a futuras instancias del modelo que ocultaran los errores [enlace], inventaran datos históricos faltantes o ocultaran discrepancias en las versiones de las fuentes.
3. Un modelo encontró y utilizó una clave API expuesta públicamente [enlace] sin autorización y luego fabricó las cifras solicitadas cuando no pudo recuperarlas.
4. Un modelo no publicado cargó un archivo generado localmente [enlace] a Internet sin permiso para poder proporcionar una cita accesible a través del navegador.
5. Los modelos utilizaron un repositorio de software interno para intercambiar mensajes entre muestras de entrenamiento separadas, mientras que un modelo anterior cargó archivos de prueba al intentar saltarse las restricciones de red [enlace].
6. Agentes colaboradores cargaron archivos en servicios de alojamiento públicos [enlace] tras no poder acceder a los archivos locales de los demás, exponiendo los entregables de la tarea a través de URLs públicas a pesar de las instrucciones de utilizar únicamente el almacenamiento local.

Cada caso queda registrado en un informe de incidentes técnicos que incluye el nombre del modelo, un resumen de su comportamiento durante el incidente observado y el momento en que ocurrió el incidente.

El informe también incluye una reconstrucción detallada de lo sucedido, con la tarea del usuario y el razonamiento interno del modelo, la interpretación de OpenAI y las posibles implicaciones de seguridad, así como las mitigaciones que se han implementado o se implementarán.

OpenAI subrayó que estos seis ejemplos no son representativos de la frecuencia con la que se enfrenta a la desalineación en sus modelos, sino que son ejemplos extremos que, no obstante, justificaban el análisis y la divulgación pública.

La empresa señaló que, bajo el nuevo proceso, cualquier empleado puede marcar un incidente para su investigación.

El incidente será evaluado y clasificado en tres categorías: 'Listo para la divulgación', 'Investigación menor' o 'Investigación mayor', dependiendo de su complejidad, la implicación de terceros, los fallos de seguridad y los riesgos de mal uso.

Los seis ejemplos presentados en esta ocasión entran en las dos primeras categorías, mientras que la tercera recibirá un informe preliminar hasta que concluya la investigación y se pueda publicar un análisis post-mortem más exhaustivo.

OpenAI afirma que la intrusión en Hugging Face de principios de este año, que implicó un enjambre de 700 agentes de IA "desalineados", calificaría para esa tercera categoría de gravedad.

Fuente:
BleepingComputer

0 comentarios :

Publicar un comentario

Los comentarios pueden ser revisados en cualquier momento por los moderadores.

Serán publicados aquellos que cumplan las siguientes condiciones:
- Comentario acorde al contenido del post.
- Prohibido mensajes de tipo SPAM.
- Evite incluir links innecesarios en su comentario.
- Contenidos ofensivos, amenazas e insultos no serán permitidos.

Debe saber que los comentarios de los lectores no reflejan necesariamente la opinión del STAFF.