Entradas Mensuales

Síguenos en:

Canal Oficial Telegram de elhacker.NET Grupo Facebook elhacker.NET Twitter elhacker.NET Canal Youtube elhacker.NET Comunidad Steam: Grupo elhacker.NET Mastodon

Entradas populares

PostHeaderIcon OpenAI desarticula campaña de extracción de razonamiento vinculada a colaboradores de Moonshot AI


OpenAI detuvo una campaña de destilación adversaria coordinada, presuntamente vinculada a la empresa china Moonshot AI, para extraer razonamientos protegidos de sus modelos. Los atacantes manipularon las interacciones del sistema para reproducir procesos internos y entrenar otros modelos sin respetar las medidas de seguridad originales. OpenAI ya bloqueó las cuentas implicadas y desplegó nuevas mitigaciones para cerrar las vulnerabilidades arquitectónicas explotadas.





Moonshot AI

OpenAI afirmó el miércoles que identificó e interrumpió una campaña coordinada de destilación diseñada para extraer ilícitamente el razonamiento protegido de sus modelos de inteligencia artificial (IA).

Un "núcleo central de la actividad", que se remonta a la primera semana de julio, ha sido atribuido a personas asociadas con Moonshot AI, una empresa de IA china con sede en Pekín. La compañía no citó ninguna evidencia técnica para respaldar esta evaluación, probablemente por razones de seguridad.

"Los operadores no rompieron nuestro cifrado, no comprometieron una base de datos ni obtuvieron acceso directo a las conversaciones almacenadas de los usuarios", dijo OpenAI aquí. "En cambio, manipularon las interacciones del modelo para que el razonamiento protegido pudiera reproducirse en formas visibles para el solicitante de manera coordinada y a escala, violando nuestros términos de servicio".

Se dice que la actividad comenzó el 1 de julio de 2026, inicialmente con un volumen bajo antes de dispararse el 24 y 25 de julio de 2026, con 16,000 solicitudes intentadas utilizando un patrón de extracción relevante de más de 4,000 usuarios. Tras una investigación más profunda, la empresa dijo que identificó una "actividad de patrones de prompts" relacionada en más de 15,000 usuarios. La campaña fue totalmente interrumpida el 28 de julio de 2026.

La startup de IA caracterizó la actividad como destilación adversarial, la cual implica el uso sistemático y no autorizado de las salidas de un modelo para ayudar a entrenar, reproducir o mejorar otro modelo. OpenAI dijo que desde entonces ha implementado mitigaciones adicionales para combatir este ataque y ha prohibido las cuentas fraudulentas involucradas en la actividad.

Además, OpenAI dijo que cerró una "vía" que permitía que algunos que ya poseían el razonamiento cifrado de otro usuario pudieran reproducirlo y recuperar su contenido, además de añadir comprobaciones para detectar y retener la salida transmitida que pudiera exponer el razonamiento.

En un estudio publicado en agosto de 2026, un grupo de investigadores encontró una vulnerabilidad arquitectónica que hacía que los rastros de razonamiento cifrados fueran "totalmente compatibles e intercambiables entre diferentes sesiones, usuarios y modelos dentro del ecosistema de un proveedor", lo que un atacante podría explotar para desarrollar un jailbreak de descifrado escalable y eludir los mecanismos antidestilación.

"Al inyectar un rastro de razonamiento cifrado de un modelo determinado en un modelo más débil y menos protegido del mismo proveedor, lo obligamos a decodificar y emitir el rastro textualmente en texto plano, sin necesidad de hacer un jailbreak directamente al modelo más capaz", dijeron investigadores de MATS Research, ELLIS Institute Tübingen y Synk aquí.

Además, esto permite la extracción de datos privados a gran escala, abre la puerta a inyecciones de prompts invisibles al incrustar cargas maliciosas enteramente dentro de bloques cifrados, y revela inadvertidamente información peligrosa oculta dentro del proceso de razonamiento, incluso si la salida final y visible del modelo rechaza una solicitud dañina.

Dado que el razonamiento protegido ofrece información sobre cómo un modelo resuelve una tarea, extraer esta información puede revelar datos sensibles y ayudar a otros a reproducir las capacidades del modelo, añadió OpenAI.

"La destilación adversarial plantea riesgos para la seguridad y la seguridad nacional", dijo la empresa. "El razonamiento extraído podría usarse para entrenar otro modelo sin preservar las salvaguardas aplicadas a las salidas orientadas al usuario del modelo original".

"A escala, la destilación también puede acelerar la transferencia de capacidades avanzadas sin requerir la misma inversión en seguridad. Estas preocupaciones aumentan a medida que los modelos adquieren capacidades en dominios de doble uso".

Esta no es la primera vez que Moonshot AI enfrenta acusaciones de destilación. El mes pasado, su rival Anthropic acusó a Moonshot AI de retransmitir sigilosamente las solicitudes de los clientes a Claude en lugar de procesarlas usando Kimi, y luego mostrar las respuestas de Claude a los usuarios.

También se alega que la empresa conservó un subconjunto de estos intercambios para entrenar su modelo de cadena de pensamiento (CoT). La actividad ha sido rastreada bajo el apodo GTG-16002.

Fuente:
THN

0 comments :

Post a Comment

Los comentarios pueden ser revisados en cualquier momento por los moderadores.

Serán publicados aquellos que cumplan las siguientes condiciones:
- Comentario acorde al contenido del post.
- Prohibido mensajes de tipo SPAM.
- Evite incluir links innecesarios en su comentario.
- Contenidos ofensivos, amenazas e insultos no serán permitidos.

Debe saber que los comentarios de los lectores no reflejan necesariamente la opinión del STAFF.