Entradas Mensuales

Síguenos en:

Canal Oficial Telegram de elhacker.NET Grupo Facebook elhacker.NET Twitter elhacker.NET Canal Youtube elhacker.NET Comunidad Steam: Grupo elhacker.NET Mastodon

Entradas populares

PostHeaderIcon Vulnerabilidad en APIs de OpenAI, Anthropic y Google expone razonamientos ocultos


Se ha descubierto un fallo arquitectónico significativo en la forma en que proveedores de IA como OpenAI, Anthropic y Google protegen el razonamiento interno (chain-of-thought) de sus modelos principales. La investigación revela que es posible extraer estos rastros de razonamiento privados en texto plano al replicar los sobres de razonamiento cifrados de las APIs en modelos hermanos más débiles y menos protegidos.





Un fallo arquitectónico significativo en la forma en que los principales proveedores de IA, incluidos OpenAI, Anthropic y Google, protegen el razonamiento interno de "cadena de pensamiento" generado por sus modelos de lenguaje extensos (LLM) insignia.

La investigación revela que los sobres de razonamiento cifrados devueltos por las API de los proveedores pueden ser replicados en modelos hermanos más débiles y menos protegidos para extraer trazas de razonamiento privado en texto plano.

Detallado por un equipo de investigación colaborativo del Instituto ELLIS de Tubinga, el Instituto Max Planck, MATS Research y Snyk, el ataque afecta a los ecosistemas de modelos Claude, GPT y Gemini, y requiere únicamente un acceso estándar y no privilegiado a la API.

El fallo de las API expone trazas de razonamiento ocultas

Las arquitecturas de razonamiento modernas, como GPT-5.6, Claude Opus 4.8 y Gemini 3, construyen trazas de procesamiento de cadena de pensamiento ocultas antes de devolver una respuesta final.

Debido a que estos pensamientos internos contienen propiedad intelectual comercial y controles de seguridad, los proveedores no los entregan en texto plano.

En su lugar, las API transmiten la traza de razonamiento como un sobre cifrado y codificado en base64 que la aplicación cliente devuelve en llamadas posteriores para mantener el contexto conversacional de múltiples turnos sin requerir el almacenamiento de estado en el servidor.

Sin embargo, los investigadores descubrieron que estas cargas útiles cifradas se autentican utilizando una clave global de todo el proveedor, en lugar de estar vinculadas criptográficamente a una cuenta de usuario, ID de sesión o nivel de modelo específico.

Debido a que las firmas criptográficas carecen de una vinculación específica al modelo, un sobre cifrado creado por un modelo insignia fuertemente protegido puede pasarse legalmente a cualquier otro modelo alojado bajo la infraestructura del mismo proveedor.

Explotar tales brechas de implementación tan generalizadas demuestra cómo las vulnerabilidades de seguridad de API no mitigadas pueden comprometer servicios en la nube sensibles. La cadena de ataque opera utilizando modelos más ligeros y económicos como oráculos de descifrado.

Un adversario captura un bloque de razonamiento cifrado emitido por un modelo de vanguardia (como Claude Opus 4.8) y lo inyecta en la llamada a la API de un modelo más pequeño (como Claude Haiku 4.5), instruyendo al modelo más pequeño para que transcriba el pensamiento interno palabra por palabra dentro de etiquetas de texto personalizadas.

Top AI Models APIs Flaw Exposes Hidden Reasoning
Decodificando trazas de razonamiento en las API de Anthropic, OpenAI y Google (Fuente de la imagen: Arxiv.org)

Debido a que los modelos más ligeros carecen de la agresiva alineación anti-destilación y las barreras de seguridad impuestas en los niveles insignia, estos cumplen con la instrucción y muestran el razonamiento oculto en texto plano.

Como se detalla en el artículo de investigación publicado en ArXiv, el equipo confirmó una compatibilidad cross-modelo idéntica en la familia GPT-5.6 de OpenAI y la línea Gemini 3 de Google.

Los investigadores validaron la precisión matemática de las trazas recuperadas comparando la longitud de los tokens decodificados con los recuentos de tokens de pensamiento facturables reportados por las API de los proveedores.

Las implicaciones de seguridad en el mundo real van mucho más allá de la destilación de modelos o el robo de propiedad intelectual. Al analizar 6,708 transcripciones de agentes públicos extraídas de GitHub y Hugging Face, los investigadores decodificaron 315,320 bloques de razonamiento integrados, recuperando:

  • 367 artefactos de Información de Identificación Personal (PII)
  • 182 credenciales hardcodeadas (incluyendo 62 claves de API, 33 contraseñas y 30 direcciones de correo electrónico personales)

Crucialmente, gran parte de estos datos sensibles residían únicamente dentro de los bloques de razonamiento internos y nunca se renderizaron en las respuestas visibles del asistente, dejando a los desarrolladores sin saber que sus registros de sesión compartidos contenían secretos expuestos.

Top AI Models APIs Flaw Exposes Hidden Reasoning
Esquemas de inyección que explotan la compatibilidad dentro y entre sesiones (Fuente de la imagen: Arxiv.org)

Además, la vulnerabilidad permite ataques invisibles de inyección indirecta de prompts contra agentes de IA autónomos. Un adversario puede diseñar instrucciones maliciosas dentro de un bloque de razonamiento cifrado.

Cuando un agente las procesa, las herramientas de monitoreo que inspeccionan solo el historial de conversación visible no logran detectar la carga útil oculta, permitiendo que las instrucciones inyectadas comprometan los flujos de trabajo agenticos posteriores sin ser detectadas.

ProveedorModelo Insignia de OrigenOráculo de Descifrado ObjetivoActivo Extraído / Riesgo
AnthropicClaude Opus 4.8 / Sonnet 5Claude Haiku 4.5Cadena de pensamiento no alineada, prompts del sistema, claves de API
OpenAIGPT-5.6 / GPT-5GPT-5-mini / o4-miniEvaluación de seguridad interna, credenciales, razonamiento bruto
GoogleGemini 3 / Gemini 3.1 ProGemini 3.1 Flash Lite / FlashSecretos hardcodeados, instrucciones ocultas, PII

Tras una divulgación responsable, OpenAI, Anthropic y Google reconocieron los hallazgos de la investigación. Los tres proveedores implementaron mitigaciones en el lado del servidor, haciendo que las pruebas de concepto (PoCs) originales de replicación cross-modelo ya no sean reproducibles en las versiones actuales de la API.

Para establecer controles integrales de seguridad de IA Generativa en las tuberías de LLM, los proveedores y desarrolladores empresariales deberían implementar las siguientes protecciones:

  • Vinculación Criptográfica: Vincular los sobres de razonamiento al modelo de origen específico, al ID de sesión y a la identidad del usuario en la capa de la puerta de enlace de la API.
  • Aislamiento Estricto de Modelos: Rechazar bloques de pensamiento enviados a un nivel de modelo diferente al que generó la carga útil.
  • Rotación de Claves: Rotar las claves de firma heredadas para invalidar los bloques de texto cifrado históricos expuestos en repositorios de código públicos.
  • Saneamiento de Registros: Los equipos de desarrolladores que construyan agentes de IA deben tratar los bloques de pensamiento cifrados como datos sensibles y limpiar los campos de firma bruta antes de hacer públicos los registros del agente.


Fuentes:
https://cybersecuritynews.com/top-ai-models-apis-flaw-exposes-hidden-reasoning/

0 comments :

Post a Comment

Los comentarios pueden ser revisados en cualquier momento por los moderadores.

Serán publicados aquellos que cumplan las siguientes condiciones:
- Comentario acorde al contenido del post.
- Prohibido mensajes de tipo SPAM.
- Evite incluir links innecesarios en su comentario.
- Contenidos ofensivos, amenazas e insultos no serán permitidos.

Debe saber que los comentarios de los lectores no reflejan necesariamente la opinión del STAFF.