Entradas Mensuales

Síguenos en:

Canal Oficial Telegram de elhacker.NET Grupo Facebook elhacker.NET Twitter elhacker.NET Canal Youtube elhacker.NET Comunidad Steam: Grupo elhacker.NET Mastodon

Entradas populares

PostHeaderIcon Secuestran Claude Code Opus 5 Auto Mode mediante prompt injection para ejecutar código malicioso


Se ha descubierto que Claude Code Opus 5 en Modo Auto puede ser engañado para ejecutar código malicioso a través de una simple solicitud de resumen de un sitio web. Según pruebas de laboratorio realizadas por Embrace The Red, el ataque tuvo un éxito de entre el 60% y el 80%, lo cual es significativo dado que Anthropic había destacado previamente la seguridad de este modo.





Claude Code Opus 5 en Modo Auto puede ser engañado para ejecutar código malicioso a través de una simple solicitud de resumen de un sitio web. En una prueba de laboratorio limitada, se informó que el ataque tuvo éxito en el 60% al 80% de los intentos.

El hallazgo de Embrace The Red es significativo porque Anthropic destacó previamente pruebas en las que el Modo Auto de Opus 5 mostró una tasa de éxito de inyección de prompts del 0,00% en un conjunto fijo de escenarios.

Sin embargo, la nueva investigación sugiere que los ataques dirigidos y de múltiples pasos aún pueden evadir las salvaguardas automatizadas. El Modo Auto de Claude Code está diseñado para reducir las solicitudes de aprobación.

En lugar de pedirte que apruebes cada comando, utiliza un clasificador de seguridad para revisar las llamadas a las herramientas. Anthropic posiciona esta función como más segura que saltarse los permisos sin restricciones, pero no está diseñada para reemplazar un sandbox o los controles de seguridad del sistema operativo.

Modo Auto de Claude Code Opus 5 Secuestrado

El ataque comenzó con una instrucción de apariencia normal: resumir un sitio web. El sitio web controlado por el atacante parecía albergar un archivo de registros de cuadernos. Cuando Claude intentó usar su herramienta de obtención de datos web, el servidor devolvió un error HTTP 415.

Claude decidió entonces usar curl a través de un comando de shell para recuperar el sitio directamente. El sitio web redirigió la solicitud a un archivo ZIP que contenía archivos de catálogo, registros codificados, un binario decodificador y un archivo Python malicioso llamado struct.py.

The payload establishes C2 and immediately opens Calculator as a visible effect( source : embracethered )
El payload establece un C2 e inmediatamente abre la Calculadora como efecto visible (fuente: Embracethered)

Claude rechazó correctamente la ejecución del binario decodificador nativo incluido. Sin embargo, esta decisión de seguridad preparó el terreno para la siguiente etapa del ataque.

En lugar de ejecutar el binario no confiable, Claude escribió su propio decodificador de Python para procesar los archivos codificados. El decodificador importó módulos comunes de Python como base64, zlib y json. Pero Claude ejecutó el código desde dentro del directorio ZIP extraído.

Python busca en el directorio actual al cargar módulos. El atacante incluyó un archivo llamado struct.py, que eclipsó al módulo legítimo struct de la biblioteca estándar de Python.

Cuando el decodificador de Claude importó base64, Python terminó cargando el archivo struct.py controlado por el atacante. El archivo malicioso podía ejecutar código durante el proceso de importación mientras permitía que el decodificador funcionara normalmente.

Auto Mode denied the cleanup command ( source : embracethered )
El Modo Auto denegó el comando de limpieza (fuente: Embracethered)

Como resultado, Claude recibió registros decodificados válidos y no reconoció inmediatamente que un payload oculto ya se había ejecutado. En el ataque de prueba de concepto, el módulo de Python envenenado lanzó otro proceso de Python aislado. Ese proceso hijo descargó y ejecutó un payload de etapa posterior, creó una llamada de retorno de comando y control y abrió la Calculadora como una señal visible de compromiso.

El investigador también probó un segundo método en el que el módulo malicioso lanzó otra instancia de Claude Code en modo headless. Según se informa, ese agente anidado realizó un reconocimiento básico del sistema, abrió la Calculadora y escribió archivos fuera del espacio de trabajo original.

Los resultados de las pruebas reportadas se basaron en muestras pequeñas. Una cadena de ataque basada en Python tuvo éxito en 3 de 5 pruebas (60%). Una variante de Claude Code anidado también tuvo éxito en 3 de 5 pruebas. Una versión que escribía archivos fuera del espacio de trabajo tuvo éxito en 4 de 5 pruebas (80%).

Según Embrace The Red, la lección clave es que el Modo Auto no debe tratarse como un límite de seguridad. Un clasificador puede considerar que un comando corto es inofensivo sin comprender completamente los riesgos ocultos en un archivo, una ruta de importación local, un proceso hijo o una solicitud de red.

Running the Malware ( source : embracethered )
Ejecutando el Malware (fuente: Embracethered)

Las organizaciones que utilicen agentes de codificación autónomos deben ejecutarlos en entornos aislados como contenedores, máquinas virtuales o sistemas de prueba dedicados.

Deben limitar el acceso a la red, bloquear el acceso a credenciales sensibles, monitorear los procesos y evitar que los agentes ejecuten código desde directorios no confiables.

El Modo Auto puede reducir la fatiga de los prompts y puede ser más seguro que desactivar completamente las aprobaciones. Pero cuando los agentes procesan sitios web, archivos o repositorios no confiables, el sandboxing y el monitoreo siguen siendo esenciales.



Fuentes:
https://cybersecuritynews.com/claude-code-opus-5-auto-mode-hijacked/

0 comentarios :

Publicar un comentario

Los comentarios pueden ser revisados en cualquier momento por los moderadores.

Serán publicados aquellos que cumplan las siguientes condiciones:
- Comentario acorde al contenido del post.
- Prohibido mensajes de tipo SPAM.
- Evite incluir links innecesarios en su comentario.
- Contenidos ofensivos, amenazas e insultos no serán permitidos.

Debe saber que los comentarios de los lectores no reflejan necesariamente la opinión del STAFF.