Tutoriales y Manuales
Entradas Mensuales
-
▼
2026
(Total:
7093
)
- ► septiembre (Total: 351 )
-
▼
agosto
(Total:
750
)
-
Europa impone reglas estrictas a ChatGPT como busc...
-
OpenClaw 2.0 con mejoras de seguridad para agentes...
-
Linux 7.3 roza las 41 millones de líneas de código
-
Musk quiere quemar gas para alimentar la IA
-
Microsoft confirma falsas alertas de Defender desa...
-
Fire Ant, grupo vinculado a China, secuestra route...
-
Extraditan a nigerianos a EE. UU. por sextorsión y...
-
Fallo crítico de Microsoft UFO permite controlar A...
-
Fallo de Composer expone claves SSH y archivos sen...
-
Los bloqueos de LaLiga se intensifican: la web del...
-
Usan CAPTCHA falso de Cloudflare para infiltrarse ...
-
Hasbro, el gigante de los juguetes, admite filtrac...
-
Malware de hackers expone sus propias herramientas...
-
iPhone Ultra: caro de comprar y reparar
-
Bots dominan el 91% de las compras de RAM
-
GTA 6: disparadas las reservas tras tráiler de Net...
-
Gemini en Android Auto distrae a los conductores
-
OpenAI retira sus modelos de Cursor tras compra de...
-
Windows 11 moderniza función de hace 25 años
-
Linus Torvalds: usar IA para arreglar Linux fue in...
-
Cloudflare libera 100 TB de RAM sin cambiar un sol...
-
Filtrados más de 12 TB de archivos de Steam que ab...
-
WhatsApp detecta estafas con IA local
-
Cinco fallos críticos en temas y plugins de WordPr...
-
Brave integra alias de correo electrónico para evi...
-
Meta impide grabar en secreto con sus gafas
-
Gemini Notebook actualiza sus límites
-
Fallos críticos de ServiceNow permiten ejecutar có...
-
OpenAI golpeó fuerte a Hugging Face
-
iPhone 17 Pro resiste caída de 30 km
-
Google usa IA para gestionar viajes
-
Modo Dios sigue vivo en Windows 11 pese a Microsoft
-
Investigador demuestra que Claude Code puede ser e...
-
Android 17 implementa ECH en todo el sistema para ...
-
Windows 10 no soportará GTA VI
-
PaperCut lanza un segundo parche de emergencia par...
-
IA: alerta por ola de ciberataques
-
Explotan fallo en Cosmos EVM a pesar de que Cosmos...
-
Berlín se niega a pagar el rescate a los que robar...
-
GTA VI podría vaciar las oficinas
-
Gemini convierte Excel en apps
-
El SSD SanDisk de 64 GB de hace 16 años se niega a...
-
Banda de ransomware TITAN afirma que su IA analiza...
-
Estudia ingeniería informática gratis con este rep...
-
700 agentes de IA coordinados secretamente para ha...
-
Atacan infraestructura de IA con RCE, inyección de...
-
Cárcel para un hombre de 68 años que ganó 1,3 mill...
-
Fallo en el plugin de donaciones GiveWP para WordP...
-
Meta pagará 18.000 millones por adicción a sus redes
-
Grave fallo de cPanel podría permitir que un usuar...
-
AWS muestra cómo credenciales robadas permiten ata...
-
Vulnerabilidades de TeamViewer permiten ejecución ...
-
Malware Massiv ataca apps de IPTV en España
-
Razer lanza colección por los 25 años de Xbox
-
Lanzada la actualización KB5120998 de Windows 11 c...
-
Más de 100 entidades tecnológicas piden reforzar l...
-
Zen 6 compatible con AM5
-
Instalan malware mediante currículums falsos de es...
-
Filtración en universidad rusa revela entrenamient...
-
Windows XP cumple 25 años
-
Más de 8.300 servidores Gitea expuestos a ataques ...
-
Vulnerabilidades en el robot humanoide Unitree G1 ...
-
Ya disponible Ubuntu 26.04.1 LTS
-
Photoshop integra IA para editar con prompts y boc...
-
Cae uno de los mayores imperios de la piratería mu...
-
OpenAI advierte que el reward hacking llevó a agen...
-
OpenAI crea IA autónoma
-
Casi 700 agentes de IA coordinados en el ataque a ...
-
Next.js corrige fallos críticos de AVIF y Windows ...
-
Bill Gates advierte sobre el impacto de la IA
-
PaperCut sufre un ataque de día cero que está golp...
-
Roban datos de 8,7 millones de clientes en tres ae...
-
Policía australiana detiene a presuntos cerebros d...
-
Vulnerabilidad en dispositivos TP-Link Kasa permit...
-
Vulnerabilidad crítica de cPanel permite control t...
-
Secuestran Claude Code Opus 5 Auto Mode mediante p...
-
CISA advierte vulnerabilidad en Citrix NetScaler e...
-
Ciberdelincuentes venden números de seguridad soci...
-
Google lanza Gemini Omni 1.1 Flash para vídeos pro...
-
LibreOffice 26.8 se actualiza y rechaza la IA
-
OpenAI banea cuentas de ChatGPT vinculadas a Rusia...
-
OpenAI limita mensajes de GPT-5.6 Sol en ChatGPT Plus
-
El FBI desarticula infraestructura de QTFY vincula...
-
Operación Jackal IV de INTERPOL: 58 detenidos y 26...
-
28.000 repositorios Git expuestos revelan claves A...
-
Claude Opus 4.6 vulnera el límite de reservas del ...
-
Mac Studio M5: potencia extrema para IA
-
Vulnerabilidades de SonicWall NetExtender permiten...
-
Vulnerabilidades críticas en Next.js permiten ejec...
-
Vulnerabilidad en plugin TranslatePress de WordPre...
-
Garmin actualiza funciones en modelos antiguos
-
21 fallos críticos de Ubiquiti UniFi permiten salt...
-
Apple renueva Mac Mini y Studio con chip de 2nm
-
Comando de Windows para liberar espacio sin riesgo...
-
Llega NVIDIA DLSS 4.5 Ray Reconstruction
-
China sustituirá Windows por Linux
-
Linux cumple 35: el kernel aficionado que ahora im...
-
El gusano Morris infectó el 10% de Internet
-
Amazon sube el precio de sus dispositivos Echo, Ki...
-
UE busca sustituir a Visa y Mastercard para 2029
-
Chrome 152: 327 correcciones de seguridad y 10 crí...
-
Alerta por vulnerabilidad crítica de RCE en Gitea ...
-
Fallos de OpenSSL permiten colapsar servidores y c...
-
Qualcomm rompe la barrera de los 5 GHz en smartpho...
-
OpenAI suspende cuentas rusas de ChatGPT vinculada...
-
Intel convierte Diamond Rapids en una bestia de 25...
-
EE. UU. impone sanciones a hackers vinculados a Ir...
-
Ciberataque masivo colapsa los servicios digitales...
-
91 vulnerabilidades de Spring afectan a más de 209...
-
AliExpress usa WebAudio API para rastreo silencios...
-
Passkeys de WhatsApp alcanzan mil millones de usua...
-
Falso análisis de Microsoft pide quitar antivirus ...
-
La IA preferida de los hackers es DeepSeek
-
Fallo en plataforma B2B de Tata permite robo de cu...
-
Ocho agentes de IA vulneran sistemas gubernamental...
-
Sony: los juegos digitales no son tuyos
-
AWS Network Firewall ya muestra el recuento de reg...
-
Fallo sin parchear en Calix permite a hackers salt...
-
DOOM 64 estrena trazado de trayectorias
-
Crisis de RAM hunde a marca de Linux Pine64
-
Falsa demo de GTA 6 es malware que roba contraseña...
-
Ciberatacantes aprovechan fallos de miniOrange SAM...
-
Fallo crítico en Red Hat Keycloak permite tomar cu...
-
AliExpress es señalada por rastrear usuarios media...
-
Una página web maliciosa podría contaminar tu mode...
-
IA china crea vídeos desde PowerPoint
-
Investigador revela cinco vulnerabilidades crítica...
-
Vulnerabilidades en TP-Link Archer permiten ataque...
-
-
►
2025
(Total:
2103
)
- ► septiembre (Total: 148 )
-
►
2024
(Total:
1110
)
- ► septiembre (Total: 50 )
-
►
2023
(Total:
710
)
- ► septiembre (Total: 65 )
-
►
2022
(Total:
967
)
- ► septiembre (Total: 72 )
-
►
2021
(Total:
730
)
- ► septiembre (Total: 56 )
-
►
2020
(Total:
212
)
- ► septiembre (Total: 21 )
-
►
2019
(Total:
102
)
- ► septiembre (Total: 14 )
-
►
2017
(Total:
231
)
- ► septiembre (Total: 16 )
-
►
2016
(Total:
266
)
- ► septiembre (Total: 38 )
-
►
2015
(Total:
445
)
- ► septiembre (Total: 47 )
-
►
2014
(Total:
185
)
- ► septiembre (Total: 18 )
-
►
2013
(Total:
100
)
- ► septiembre (Total: 3 )
-
►
2011
(Total:
7
)
- ► septiembre (Total: 1 )
Blogroll
Etiquetas
vulnerabilidad
(
1873
)
seguridad
(
1823
)
software
(
1149
)
hardware
(
940
)
google
(
792
)
Malware
(
711
)
privacidad
(
684
)
ransomware
(
542
)
exploit
(
533
)
Windows
(
521
)
android
(
483
)
linux
(
446
)
cve
(
377
)
nvidia
(
318
)
tutorial
(
300
)
manual
(
282
)
hacking
(
265
)
ssd
(
183
)
WhatsApp
(
173
)
ddos
(
141
)
Wifi
(
131
)
app
(
129
)
cifrado
(
122
)
programación
(
122
)
twitter
(
121
)
firmware
(
84
)
youtube
(
83
)
firefox
(
80
)
herramientas
(
80
)
Networking
(
73
)
sysadmin
(
72
)
adobe
(
71
)
office
(
62
)
antivirus
(
55
)
hack
(
53
)
javascript
(
51
)
Kernel
(
49
)
apache
(
47
)
juegos
(
42
)
contraseñas
(
39
)
multimedia
(
36
)
cms
(
35
)
flash
(
33
)
eventos
(
32
)
MAC
(
30
)
anonymous
(
28
)
ssl
(
24
)
conferencia
(
21
)
Forense
(
20
)
documental
(
18
)
SeguridadWireless
(
17
)
auditoría
(
16
)
Debugger
(
14
)
Rootkit
(
14
)
lizard squad
(
14
)
metasploit
(
13
)
técnicas hacking
(
13
)
Virtualización
(
11
)
delitos
(
11
)
reversing
(
10
)
adamo
(
9
)
Ehn-Dev
(
7
)
antimalware
(
7
)
MAC Adress
(
6
)
oclHashcat
(
5
)
Entradas populares
-
LG enfrenta graves acusaciones de invadir la privacidad al capturar audio y datos personales de sus Smart TVs, incluso en modo espera. Según...
-
Anthropic ha bloqueado a cinco científicos que utilizaban la IA Claude para realizar investigaciones biológicas vinculadas al desarrollo d...
-
La policía alemana intercepta comunicaciones de WhatsApp, Telegram y Signal vinculando clientes Web o Desktop a las cuentas investigadas p...
Engañan a Grok para que ejecute instrucciones inyectadas
viernes, 21 de agosto de 2026
|
Publicado por
el-brujo
|
Editar entrada
Investigadores de Adversa AI descubrieron una vulnerabilidad en Grok llamada inyección de contexto criptográfico, que permite evadir filtros de seguridad mediante instrucciones maliciosas cifradas. El modelo descifra el texto usando su propio entorno de ejecución, lo que puede permitir el robo de datos del usuario o la generación de contenido prohibido. Aunque se notificó a xAI, el ataque seguía siendo efectivo en agosto, afectando también a Gemini en menor medida.
El agente de chat web Grok de xAI es actualmente vulnerable a una nueva forma de inyección de prompts, según investigadores de seguridad de Adversa AI.
La técnica permite que un atacante cree una página web "envenenada" con instrucciones maliciosas que inducen a un modelo de IA que resume la página a llevar a cabo acciones dañinas.
Esto describe un ataque bien conocido llamado inyección de prompts indirecta. Los modelos de IA de vanguardia han mejorado en el manejo de tales intentos a través de las protecciones existentes, aunque el problema está lejos de resolverse.
El enfoque de Adversa tiene un giro: se basa en instrucciones maliciosas cifradas, que los atacantes colocan en una página web junto con una clave de cifrado. El escáner de protección del modelo (un filtro de entrada) no puede leer el texto cifrado a pesar de la presencia de la clave. Por lo tanto, el escáner lo pasa al modelo, que puede utilizar la clave para descifrar las instrucciones.
El modelo luego ejecuta las instrucciones del texto descifrado, como ocurriría en cualquier otro ataque de inyección de prompts indirecta.
Adversa llama a su método "inyección de contexto criptográfico".
"Un atacante envía el texto cifrado junto con el material de la clave y una instrucción para descifrarlo, y el modelo ejecuta ese descifrado dentro de su propio entorno de ejecución de código", escribió Rony Utevsky, investigador principal de Adversa AI, en una publicación de blog (https://adversa.ai/blog/cryptographic-context-injection-grok-data-theft). "Todo lo que el escáner de protección necesitaría está ahí mismo en la página, pero recuperar el texto plano significa ejecutar PBKDF2 y AES-256-GCM, algo que ningún clasificador de contenido hace en el momento de la inspección".
Otros ataques a modelos de IA se han basado en la evasión basada en cifrados, como la codificación base64. Pero debido a que estos son mecanismos de cifrado débiles y reversibles, los modelos pueden decodificarlos nativamente a partir de sus propios datos de entrenamiento, dijo Utevsky.
Eso no funciona para el cifrado fuerte, por lo que el descifrado debe realizarse a través del tiempo de ejecución de código. El tiempo de ejecución se convierte así en un mecanismo de "lavado de confianza": el modelo confía en su propia salida, concretamente en las instrucciones maliciosas que ha descifrado.
En una demostración de prueba de concepto (https://www.youtube.com/watch?v=FBcHUjnyyY0), Adversa muestra cómo la técnica puede usarse para exfiltrar el historial de chat de la víctima con Grok.com. El ataque transmite el nombre del usuario, la ubicación aproximada, el nivel de suscripción y el conjunto completo de los prompts del usuario en la conversación, añadiéndolos a una URL como parámetros.
Otros modelos pueden ser vulnerables en diversos grados. Con la interfaz de chat pública de Gemini de Google (gemini.google.com), Utevsky dijo que el escenario de Grok no funciona porque Gemini no proporciona a Python acceso a sitios web externos.
"Por lo tanto, solo es útil para colar preguntas y respuestas maliciosas pasando por alto las protecciones", explicó.
Cuando Adversa probó la inyección de contexto criptográfico en Gemini, lograron que el modelo produjera contenido que normalmente sería bloqueado por los filtros de seguridad: instrucciones sobre cómo construir un arma incendiaria.
xAI, según Utevsky, fue informada sobre el ataque el 3 de junio de 2026, directamente y a través de su programa de recompensas por errores HackerOne. Se nos informó que xAI reconoció el informe pero no proporcionó un cronograma de mitigación. Se dice que ocurrieron intentos adicionales de plantear el problema el 4 y el 10 de agosto. Hasta el 19 de agosto, nos informan, la técnica seguía funcionando en Grok.com.
SpaceX, que adquirió xAI a principios de este año, no respondió a una solicitud de comentarios.
Google no fue informada del ataque, según Utevsky, porque considera que los "jailbreaks" (evadir las protecciones para que los modelos emitan contenido dañino) están fuera del alcance de su programa de divulgación de vulnerabilidades. No obstante, la tasa de éxito del ataque contra Gemini disminuyó significativamente para agosto, lo que Utevsky sugiere que podría deberse a actualizaciones de filtros, cambios en la versión del modelo, o ambos.
Al preguntarle si la inyección de contexto criptográfico puede compararse con la programación orientada al retorno (https://dl.acm.org/doi/abs/10.1145/2133375.2133377) (ROP) en términos de la forma en que ensambla "gadgets" de ataque a partir de partes almacenadas en memoria que por separado son inofensivas, Utevsky dijo: "La analogía con ROP es cercana, aunque ROP funciona así por necesidad: el atacante no puede inyectar código en absoluto, por lo que se ve obligado a reutilizar gadgets que ya están en la memoria.
"En lo demás, tiene la misma forma. Una protección estática lee el texto un artefacto a la vez. Si ningún artefacto individual es dañino, todos pasan, y el significado malicioso aparece solo una vez que el tiempo de ejecución los ensambla. Y las protecciones no pueden ver dentro del tiempo de ejecución".
Pero Utevsky añadió que la inyección de contexto criptográfico es más abierta que ROP.
"El tiempo de ejecución del agente es un intérprete de propósito general, por lo que las piezas son arbitrarias", explicó. "Se podría dividir una instrucción en varios fragmentos cifrados, páginas obtenidas o salidas de herramientas, ninguno significativo por sí solo, y dejar que el tiempo de ejecución los concatene. No lo hemos demostrado, pero nada lo descarta.
"Así que sí, la inyección de contexto criptográfico es un tipo de eslabón, no necesariamente la cadena completa.
"En el momento en que los agentes obtuvieron código y herramientas, la unidad de inspección de la protección (una cadena de texto) dejó de ser la unidad de acción (un programa compuesto y ejecutado). Este es un campo de juego muy amplio. Nuestro ataque SymJack anterior (https://adversa.ai/blog/the-approval-prompt-is-lying-to-you-symlink-rce-in-five-ai-coding-agents-claude-code-cursor-antigravity-copilot-grok-build/) llegó al mismo lugar a través de enlaces simbólicos y el comportamiento de la shell. El cifrado añade otro truco al juego".
Fuente:
TheRegister
El agente de chat web Grok de xAI es actualmente vulnerable a una nueva forma de inyección de prompts, según investigadores de seguridad de Adversa AI.
La técnica permite que un atacante cree una página web "envenenada" con instrucciones maliciosas que inducen a un modelo de IA que resume la página a llevar a cabo acciones dañinas.
Esto describe un ataque bien conocido llamado inyección de prompts indirecta. Los modelos de IA de vanguardia han mejorado en el manejo de tales intentos a través de las protecciones existentes, aunque el problema está lejos de resolverse.
El enfoque de Adversa tiene un giro: se basa en instrucciones maliciosas cifradas, que los atacantes colocan en una página web junto con una clave de cifrado. El escáner de protección del modelo (un filtro de entrada) no puede leer el texto cifrado a pesar de la presencia de la clave. Por lo tanto, el escáner lo pasa al modelo, que puede utilizar la clave para descifrar las instrucciones.
El modelo luego ejecuta las instrucciones del texto descifrado, como ocurriría en cualquier otro ataque de inyección de prompts indirecta.
Adversa llama a su método "inyección de contexto criptográfico".
"Un atacante envía el texto cifrado junto con el material de la clave y una instrucción para descifrarlo, y el modelo ejecuta ese descifrado dentro de su propio entorno de ejecución de código", escribió Rony Utevsky, investigador principal de Adversa AI, en una publicación de blog (https://adversa.ai/blog/cryptographic-context-injection-grok-data-theft). "Todo lo que el escáner de protección necesitaría está ahí mismo en la página, pero recuperar el texto plano significa ejecutar PBKDF2 y AES-256-GCM, algo que ningún clasificador de contenido hace en el momento de la inspección".
Otros ataques a modelos de IA se han basado en la evasión basada en cifrados, como la codificación base64. Pero debido a que estos son mecanismos de cifrado débiles y reversibles, los modelos pueden decodificarlos nativamente a partir de sus propios datos de entrenamiento, dijo Utevsky.
Eso no funciona para el cifrado fuerte, por lo que el descifrado debe realizarse a través del tiempo de ejecución de código. El tiempo de ejecución se convierte así en un mecanismo de "lavado de confianza": el modelo confía en su propia salida, concretamente en las instrucciones maliciosas que ha descifrado.
En una demostración de prueba de concepto (https://www.youtube.com/watch?v=FBcHUjnyyY0), Adversa muestra cómo la técnica puede usarse para exfiltrar el historial de chat de la víctima con Grok.com. El ataque transmite el nombre del usuario, la ubicación aproximada, el nivel de suscripción y el conjunto completo de los prompts del usuario en la conversación, añadiéndolos a una URL como parámetros.
Otros modelos pueden ser vulnerables en diversos grados. Con la interfaz de chat pública de Gemini de Google (gemini.google.com), Utevsky dijo que el escenario de Grok no funciona porque Gemini no proporciona a Python acceso a sitios web externos.
"Por lo tanto, solo es útil para colar preguntas y respuestas maliciosas pasando por alto las protecciones", explicó.
Cuando Adversa probó la inyección de contexto criptográfico en Gemini, lograron que el modelo produjera contenido que normalmente sería bloqueado por los filtros de seguridad: instrucciones sobre cómo construir un arma incendiaria.
xAI, según Utevsky, fue informada sobre el ataque el 3 de junio de 2026, directamente y a través de su programa de recompensas por errores HackerOne. Se nos informó que xAI reconoció el informe pero no proporcionó un cronograma de mitigación. Se dice que ocurrieron intentos adicionales de plantear el problema el 4 y el 10 de agosto. Hasta el 19 de agosto, nos informan, la técnica seguía funcionando en Grok.com.
SpaceX, que adquirió xAI a principios de este año, no respondió a una solicitud de comentarios.
Google no fue informada del ataque, según Utevsky, porque considera que los "jailbreaks" (evadir las protecciones para que los modelos emitan contenido dañino) están fuera del alcance de su programa de divulgación de vulnerabilidades. No obstante, la tasa de éxito del ataque contra Gemini disminuyó significativamente para agosto, lo que Utevsky sugiere que podría deberse a actualizaciones de filtros, cambios en la versión del modelo, o ambos.
Al preguntarle si la inyección de contexto criptográfico puede compararse con la programación orientada al retorno (https://dl.acm.org/doi/abs/10.1145/2133375.2133377) (ROP) en términos de la forma en que ensambla "gadgets" de ataque a partir de partes almacenadas en memoria que por separado son inofensivas, Utevsky dijo: "La analogía con ROP es cercana, aunque ROP funciona así por necesidad: el atacante no puede inyectar código en absoluto, por lo que se ve obligado a reutilizar gadgets que ya están en la memoria.
"En lo demás, tiene la misma forma. Una protección estática lee el texto un artefacto a la vez. Si ningún artefacto individual es dañino, todos pasan, y el significado malicioso aparece solo una vez que el tiempo de ejecución los ensambla. Y las protecciones no pueden ver dentro del tiempo de ejecución".
Pero Utevsky añadió que la inyección de contexto criptográfico es más abierta que ROP.
"El tiempo de ejecución del agente es un intérprete de propósito general, por lo que las piezas son arbitrarias", explicó. "Se podría dividir una instrucción en varios fragmentos cifrados, páginas obtenidas o salidas de herramientas, ninguno significativo por sí solo, y dejar que el tiempo de ejecución los concatene. No lo hemos demostrado, pero nada lo descarta.
"Así que sí, la inyección de contexto criptográfico es un tipo de eslabón, no necesariamente la cadena completa.
"En el momento en que los agentes obtuvieron código y herramientas, la unidad de inspección de la protección (una cadena de texto) dejó de ser la unidad de acción (un programa compuesto y ejecutado). Este es un campo de juego muy amplio. Nuestro ataque SymJack anterior (https://adversa.ai/blog/the-approval-prompt-is-lying-to-you-symlink-rce-in-five-ai-coding-agents-claude-code-cursor-antigravity-copilot-grok-build/) llegó al mismo lugar a través de enlaces simbólicos y el comportamiento de la shell. El cifrado añade otro truco al juego".
Fuente:
TheRegister
Enviar por correo electrónico
Escribe un blog
Compartir en X
Compartir con Facebook
Compartir en Pinterest
Entrada más reciente
0 comentarios :
Publicar un comentario
Los comentarios pueden ser revisados en cualquier momento por los moderadores.
Serán publicados aquellos que cumplan las siguientes condiciones:
- Comentario acorde al contenido del post.
- Prohibido mensajes de tipo SPAM.
- Evite incluir links innecesarios en su comentario.
- Contenidos ofensivos, amenazas e insultos no serán permitidos.
Debe saber que los comentarios de los lectores no reflejan necesariamente la opinión del STAFF.