Entradas Mensuales

Síguenos en:

Canal Oficial Telegram de elhacker.NET Grupo Facebook elhacker.NET Twitter elhacker.NET Canal Youtube elhacker.NET Comunidad Steam: Grupo elhacker.NET Mastodon

Entradas populares

PostHeaderIcon Engañan a Grok para que ejecute instrucciones inyectadas


Investigadores de Adversa AI descubrieron una vulnerabilidad en Grok llamada inyección de contexto criptográfico, que permite evadir filtros de seguridad mediante instrucciones maliciosas cifradas. El modelo descifra el texto usando su propio entorno de ejecución, lo que puede permitir el robo de datos del usuario o la generación de contenido prohibido. Aunque se notificó a xAI, el ataque seguía siendo efectivo en agosto, afectando también a Gemini en menor medida.





El agente de chat web Grok de xAI es actualmente vulnerable a una nueva forma de inyección de prompts, según investigadores de seguridad de Adversa AI.

La técnica permite que un atacante cree una página web "envenenada" con instrucciones maliciosas que inducen a un modelo de IA que resume la página a llevar a cabo acciones dañinas.

Esto describe un ataque bien conocido llamado inyección de prompts indirecta. Los modelos de IA de vanguardia han mejorado en el manejo de tales intentos a través de las protecciones existentes, aunque el problema está lejos de resolverse.

El enfoque de Adversa tiene un giro: se basa en instrucciones maliciosas cifradas, que los atacantes colocan en una página web junto con una clave de cifrado. El escáner de protección del modelo (un filtro de entrada) no puede leer el texto cifrado a pesar de la presencia de la clave. Por lo tanto, el escáner lo pasa al modelo, que puede utilizar la clave para descifrar las instrucciones.

El modelo luego ejecuta las instrucciones del texto descifrado, como ocurriría en cualquier otro ataque de inyección de prompts indirecta.

Adversa llama a su método "inyección de contexto criptográfico".

"Un atacante envía el texto cifrado junto con el material de la clave y una instrucción para descifrarlo, y el modelo ejecuta ese descifrado dentro de su propio entorno de ejecución de código", escribió Rony Utevsky, investigador principal de Adversa AI, en una publicación de blog (https://adversa.ai/blog/cryptographic-context-injection-grok-data-theft). "Todo lo que el escáner de protección necesitaría está ahí mismo en la página, pero recuperar el texto plano significa ejecutar PBKDF2 y AES-256-GCM, algo que ningún clasificador de contenido hace en el momento de la inspección".

Otros ataques a modelos de IA se han basado en la evasión basada en cifrados, como la codificación base64. Pero debido a que estos son mecanismos de cifrado débiles y reversibles, los modelos pueden decodificarlos nativamente a partir de sus propios datos de entrenamiento, dijo Utevsky.

Eso no funciona para el cifrado fuerte, por lo que el descifrado debe realizarse a través del tiempo de ejecución de código. El tiempo de ejecución se convierte así en un mecanismo de "lavado de confianza": el modelo confía en su propia salida, concretamente en las instrucciones maliciosas que ha descifrado.

En una demostración de prueba de concepto (https://www.youtube.com/watch?v=FBcHUjnyyY0), Adversa muestra cómo la técnica puede usarse para exfiltrar el historial de chat de la víctima con Grok.com. El ataque transmite el nombre del usuario, la ubicación aproximada, el nivel de suscripción y el conjunto completo de los prompts del usuario en la conversación, añadiéndolos a una URL como parámetros.

Otros modelos pueden ser vulnerables en diversos grados. Con la interfaz de chat pública de Gemini de Google (gemini.google.com), Utevsky dijo que el escenario de Grok no funciona porque Gemini no proporciona a Python acceso a sitios web externos.

"Por lo tanto, solo es útil para colar preguntas y respuestas maliciosas pasando por alto las protecciones", explicó.

Cuando Adversa probó la inyección de contexto criptográfico en Gemini, lograron que el modelo produjera contenido que normalmente sería bloqueado por los filtros de seguridad: instrucciones sobre cómo construir un arma incendiaria.

xAI, según Utevsky, fue informada sobre el ataque el 3 de junio de 2026, directamente y a través de su programa de recompensas por errores HackerOne. Se nos informó que xAI reconoció el informe pero no proporcionó un cronograma de mitigación. Se dice que ocurrieron intentos adicionales de plantear el problema el 4 y el 10 de agosto. Hasta el 19 de agosto, nos informan, la técnica seguía funcionando en Grok.com.

SpaceX, que adquirió xAI a principios de este año, no respondió a una solicitud de comentarios.

Google no fue informada del ataque, según Utevsky, porque considera que los "jailbreaks" (evadir las protecciones para que los modelos emitan contenido dañino) están fuera del alcance de su programa de divulgación de vulnerabilidades. No obstante, la tasa de éxito del ataque contra Gemini disminuyó significativamente para agosto, lo que Utevsky sugiere que podría deberse a actualizaciones de filtros, cambios en la versión del modelo, o ambos.

Al preguntarle si la inyección de contexto criptográfico puede compararse con la programación orientada al retorno (https://dl.acm.org/doi/abs/10.1145/2133375.2133377) (ROP) en términos de la forma en que ensambla "gadgets" de ataque a partir de partes almacenadas en memoria que por separado son inofensivas, Utevsky dijo: "La analogía con ROP es cercana, aunque ROP funciona así por necesidad: el atacante no puede inyectar código en absoluto, por lo que se ve obligado a reutilizar gadgets que ya están en la memoria.

"En lo demás, tiene la misma forma. Una protección estática lee el texto un artefacto a la vez. Si ningún artefacto individual es dañino, todos pasan, y el significado malicioso aparece solo una vez que el tiempo de ejecución los ensambla. Y las protecciones no pueden ver dentro del tiempo de ejecución".

Pero Utevsky añadió que la inyección de contexto criptográfico es más abierta que ROP.

"El tiempo de ejecución del agente es un intérprete de propósito general, por lo que las piezas son arbitrarias", explicó. "Se podría dividir una instrucción en varios fragmentos cifrados, páginas obtenidas o salidas de herramientas, ninguno significativo por sí solo, y dejar que el tiempo de ejecución los concatene. No lo hemos demostrado, pero nada lo descarta.

"Así que sí, la inyección de contexto criptográfico es un tipo de eslabón, no necesariamente la cadena completa.

"En el momento en que los agentes obtuvieron código y herramientas, la unidad de inspección de la protección (una cadena de texto) dejó de ser la unidad de acción (un programa compuesto y ejecutado). Este es un campo de juego muy amplio. Nuestro ataque SymJack anterior (https://adversa.ai/blog/the-approval-prompt-is-lying-to-you-symlink-rce-in-five-ai-coding-agents-claude-code-cursor-antigravity-copilot-grok-build/) llegó al mismo lugar a través de enlaces simbólicos y el comportamiento de la shell. El cifrado añade otro truco al juego".

Fuente:
TheRegister

0 comments :

Post a Comment

Los comentarios pueden ser revisados en cualquier momento por los moderadores.

Serán publicados aquellos que cumplan las siguientes condiciones:
- Comentario acorde al contenido del post.
- Prohibido mensajes de tipo SPAM.
- Evite incluir links innecesarios en su comentario.
- Contenidos ofensivos, amenazas e insultos no serán permitidos.

Debe saber que los comentarios de los lectores no reflejan necesariamente la opinión del STAFF.