Entradas Mensuales

Síguenos en:

Canal Oficial Telegram de elhacker.NET Grupo Facebook elhacker.NET Twitter elhacker.NET Canal Youtube elhacker.NET Comunidad Steam: Grupo elhacker.NET Mastodon

Entradas populares

PostHeaderIcon Investigador demuestra que Claude Code puede ser engañado pidiéndole que resuma un sitio web


El texto presenta noticias breves sobre seguridad, legalidad y tecnología, destacando una vulnerabilidad grave en Claude Code de Anthropic. Un experto demostró que el modelo puede ser engañado mediante inyección de prompts para ejecutar código malicioso al resumir sitios web. Se recomienda ejecutar estos agentes de IA en entornos aislados o sandboxes para evitar riesgos de seguridad.







Claude Code de Anthropic, ejecutando Opus 5 en Modo Auto, puede ser engañado para ejecutar código controlado por un atacante simplemente pidiendo al agente de programación que resuma un sitio web. El ataque funciona hasta en el 80 por ciento de las veces, según el experto en inyección de prompts Johann Rehberger, también conocido como wunderwuzzi.

En un blog y una demostración en vídeo, detalló cómo secuestrar Opus 5 en Modo Auto, que es la configuración predeterminada de Claude desde mediados de agosto.

Comienza pidiendo al modelo de programación agentivo que resuma un sitio web malicioso que se presenta como un archivo de registros de cuadernos, y luego engañando a Claude para que use curl en lugar de su herramienta WebFetch para recuperar el contenido de la página, pero sin decirle directamente al modelo que use curl.

La solicitud WebFetch falla, devolviendo una respuesta 415 de tipo de medio no soportado, por lo que el modelo decide acceder al sitio web directamente mediante una llamada a la herramienta Bash con curl.

El sitio web devuelve una respuesta 303 y redirige a un archivo ZIP malicioso, que Claude descarga a continuación. Este archivo contiene archivos aparentemente inofensivos, incluyendo metadatos de catálogo, un archivo README, siete registros de cuadernos JSON codificados en Base85/zlib, un binario decoder-darwin de macOS, además de un archivo Python envenenado llamado struct.py.

Claude, siguiendo sus barandillas de seguridad, se niega a ejecutar el decodificador: “Esto está previsto y es lo que el atacante quiere”, escribió Rehberger. En lugar de utilizar el binario suministrado, la IA decide escribir su propio decodificador. “Irónicamente, esa decisión de seguridad es la vía de explotación”, explicó Rehberger.

El nuevo decodificador importa base64, y a partir de aquí el ataque se basa en el sombreo de módulos de Python (module shadowing) para engañar al modelo y que ejecute el código malicioso de struct.py.

El sombreo de módulos ocurre cuando un archivo local comparte el mismo nombre que un módulo de la biblioteca estándar de Python. El archivo local oculta el módulo oficial, haciendo que Python lo cargue a él en su lugar.

En este caso, el módulo base64 de la biblioteca estándar importa el módulo struct legítimo, y el ZIP malicioso contiene un archivo malicioso con el mismo nombre.

Rehberger afirma que utilizó ChatGPT para ofuscar el código malicioso de struct.py para evadir los controles de seguridad de Claude, y esto lanza con éxito un proceso de Python independiente para descargar y ejecutar un payload remoto; en este caso, una llamada de mando y control que, a su vez, abre la Calculadora. Asumimos que los atacantes reales ejecutarían algo un poco más nefasto.

En otro escenario de ataque, struct.py lanza un segundo Claude Code sin interfaz a través de claude -p, lo que significa que esta inyección de prompts puede usarse no solo para ejecutar código remotamente, sino para crear un agente completamente nuevo.

“El Claude anidado obtiene su propio acceso a herramientas y contexto”, escribió Rehberger. “En estas ejecuciones, el hijo realizó un reconocimiento básico (whoami, uname, id), abrió la Calculadora y escribió en archivos locales de la carpeta personal”.

A través de tres variantes probadas cinco veces cada una, que Rehberger señaló como muestras pequeñas, informó de tasas de éxito entre el 60 y el 80 por ciento. “Diría que estos resultados son representativos para un ataque motivado, pero no exhaustivos”.

Anthropic no respondió a la solicitud de comentarios, pero según se informa, dijo a Rehberger que el “comportamiento del modelo funciona según lo diseñado”.

“El Modo Auto es una función de conveniencia respaldada por un clasificador de mejor esfuerzo, no una garantía de seguridad”, escribió Rehberger, parafraseando la respuesta de Anthropic a su informe de seguridad.

Según Rehberger, el clasificador no está diseñado para detener cadenas de inyección de prompts determinadas compuestas por pasos que individualmente parecen benignos, y el límite real es el aislamiento del sistema operativo y el control de salida de la red.

La conclusión clave, según Rehberger, es ejecutar este y otros agentes de programación en un sandbox.

“La solución es algo de lo que hemos hablado durante muchos años”, escribió. “No confíe en la salida del modelo”.

Fuente:
TheRegister

0 comentarios :

Publicar un comentario

Los comentarios pueden ser revisados en cualquier momento por los moderadores.

Serán publicados aquellos que cumplan las siguientes condiciones:
- Comentario acorde al contenido del post.
- Prohibido mensajes de tipo SPAM.
- Evite incluir links innecesarios en su comentario.
- Contenidos ofensivos, amenazas e insultos no serán permitidos.

Debe saber que los comentarios de los lectores no reflejan necesariamente la opinión del STAFF.