Entradas Mensuales

Síguenos en:

Canal Oficial Telegram de elhacker.NET Grupo Facebook elhacker.NET Twitter elhacker.NET Canal Youtube elhacker.NET Comunidad Steam: Grupo elhacker.NET Mastodon

Entradas populares

PostHeaderIcon OpenAI bloquea campaña de 15.000 usuarios para extraer el razonamiento de su IA


OpenAI ha desmantelado una campaña coordinada de más de 15,000 usuarios que intentaban extraer el razonamiento protegido de sus modelos de IA mediante una técnica llamada destilación adversarial. Este razonamiento protegido es el proceso interno que utiliza la IA para analizar y planificar una tarea antes de entregar la respuesta final.






OpenAI ha desbaratado una campaña coordinada en la que participaron más de 15.000 usuarios que intentaron extraer el razonamiento protegido de sus modelos de IA mediante la destilación adversaria.

El razonamiento protegido se refiere al proceso interno que utiliza un modelo para resolver una tarea antes de producir su respuesta final. Este razonamiento oculto puede incluir análisis intermedios, pasos de planificación e información omitida intencionadamente para los usuarios finales.

Si los atacantes logran obtenerlo a gran escala, podrían conseguir un atajo para reproducir capacidades de modelos avanzados sin realizar inversiones equivalentes en desarrollo, pruebas de seguridad e infraestructura.

OpenAI afirmó que la campaña no implicó una brecha en sus sistemas de cifrado, bases de datos o conversaciones de usuarios almacenadas. En su lugar, los operadores presuntamente manipularon las interacciones normales del modelo para hacer visible el razonamiento oculto a través de prompts coordinados y técnicas de conversación cruzada.

Un método observado consistía en copiar el razonamiento cifrado de una conversación y enviarlo a otra conversación con instrucciones para descifrar y transcribir el contenido.

OpenAI bloquea campaña de 15.000 usuarios

La actividad sospechosa comenzó el 1 de julio con un volumen bajo. Más tarde, OpenAI registró picos importantes el 24 y 25 de julio, cuando detectó 16.000 solicitudes que coincidían con un patrón de extracción de más de 4.000 usuarios.

La investigación se amplió a partir de esas solicitudes y descubrió actividad de prompts relacionada en un grupo más grande de más de 15.000 usuarios.

OpenAI afirmó que desbarató completamente la operación para el 28 de julio. La empresa atribuyó una parte central de la actividad a personas asociadas con Moonshot AI, el desarrollador del modelo Kimi AI.

Sin embargo, OpenAI señaló que no pudo confirmar que cada cuenta u operador implicado en la campaña más amplia perteneciera a un único actor.

Por lo tanto, la divulgación pública vincula un grupo central con asociados de Moonshot AI, en lugar de atribuir definitivamente toda la red de 15.000 usuarios a la empresa. OpenAI describió la actividad como un problema de seguridad de la IA más general, en lugar de una debilidad limitada a sus propios servicios.

Investigadores independientes también habían informado sobre rutas de ataque relacionadas con modelos cruzados y compactación de conversaciones a través de la divulgación responsable, ayudando a la empresa a investigar la clase más amplia de técnicas de extracción de razonamiento.

En respuesta, OpenAI prohibió o restringió cuentas fraudulentas, reforzó los controles de registro e infraestructura, y aumentó el monitoreo de las redes de cuentas asociadas.

También cerró una vía de reproducción que podría permitir que alguien con el razonamiento cifrado de otro usuario recuperara su contenido. La empresa añadió salvaguardas para detectar y retener la salida transmitida que pudiera exponer el razonamiento oculto.

La compañía también compartió información relevante con socios de la industria a través del Frontier Model Forum y con canales gubernamentales de intercambio de información. Esto es significativo porque los artefactos de razonamiento portátiles o reproducibles pueden crear riesgos comparables para otros desarrolladores de IA de vanguardia.

El incidente resalta un problema de ciberseguridad creciente para los proveedores de IA generativa. A medida que los modelos se vuelven más capaces en programación, ciencia, herramientas autónomas y otras áreas de doble uso, el razonamiento oculto puede convertirse en un objetivo de alto valor para competidores y actores de amenazas.

OpenAI afirmó que espera que los intentos de destilación adversaria se vuelvan más sofisticados y que continuará mejorando la detección, la aplicación de normas, los rechazos del modelo, las defensas de las herramientas y las protecciones en los despliegues de nube alojados por socios.



Fuentes:
https://cybersecuritynews.com/openai-blocks-ai-reasoning-extraction/

0 comments :

Publicar un comentario

Los comentarios pueden ser revisados en cualquier momento por los moderadores.

Serán publicados aquellos que cumplan las siguientes condiciones:
- Comentario acorde al contenido del post.
- Prohibido mensajes de tipo SPAM.
- Evite incluir links innecesarios en su comentario.
- Contenidos ofensivos, amenazas e insultos no serán permitidos.

Debe saber que los comentarios de los lectores no reflejan necesariamente la opinión del STAFF.