Tutoriales y Manuales
Entradas Mensuales
-
▼
2026
(Total:
7403
)
-
▼
septiembre
(Total:
661
)
-
Bombas de contexto engañan a agentes de IA Qwen pa...
-
RTX 60 podrían doblar memoria de RTX 50
-
Roban 18.566 registros gubernamentales y claves me...
-
Fallo de COM en Windows permite obtener privilegio...
-
Ubuntu 26.10 revoluciona su gestión de memoria
-
Aikido Security lanza Altar-1, IA de pesos abierto...
-
Segundo año de DORA: ¿es capaz su SOC de detectar ...
-
Fallo en Red Hat OpenShift permite saltar chequeos...
-
Vulnerabilidad de Veeam Agent explotado para obten...
-
Amazon bloquea a la IA de Meta
-
MediaTek Dimensity CX C10 Max: así es el SoC de 8 ...
-
ShinyHunters admite hackeo al FBI: 'NO tiene motiv...
-
Plan IA360: el impulso a la IA en España
-
Muse de Meta supera a Gemini y ChatGPT en descargas
-
Vidar Malware cambia su ofuscación en cada versión...
-
Router D-Link con fallo crítico exploitable remota...
-
RTX 20: 8 años de vanguardia
-
CISA insta a agencias federales a corregir vulnera...
-
Novedades del Meta Connect
-
Vulnerabilidad en Muse AI de Meta permite secuestr...
-
Ubuntu 26.10 optimiza la gestión de memoria
-
Sánchez lanza el plan IA360 y critica a las tecnol...
-
El nuevo jefe de hardware de Apple opina que usar ...
-
Un ajuste oculto de Meta Muse podría permitir que ...
-
Rockstar limita los mods en GTA VI
-
MSI utiliza pegamento para prevenir que los conect...
-
Explotan vulnerabilidades en Zyxel y Veeam para ob...
-
AWS aísla claves IAM filtradas en GitHub en 10 seg...
-
Claude Code borró a un programador 48.000 archivos...
-
Cookies de ChatGPT rastrean usuarios en webs de te...
-
Alerta por falso GPT-6 Astra
-
Una GeForce RTX 5080 pasa a mejor vida tras usar e...
-
Ransomware PAYLOAD secuestra GPO de Active Directo...
-
iPhone 18 Pro: iFixit revela mejoras
-
Gana hasta 15.000 euros alquilando tu rostro a la IA
-
Analista de Google se infiltra en banda de TeamPCP
-
Claude Opus 5 ayuda a convertir fallo de imágenes ...
-
RansomHouse lanza un ataque contra el sistema de d...
-
Usan blockchain para robar claves bancarias y códi...
-
Microsoft Entra ID bloqueará inicios de sesión por...
-
ClickFix despliega el RAT ChainScript utilizando P...
-
Ocultan minero XMRig en Registro de Windows y arch...
-
Fallos en OpenAI Codex Sandbox permiten ejecutar c...
-
CVE-2026-41940 de cPanel para desplegar malware Mirai
-
MSNightmare lanza BigDiskBuster, vulnerabilidad Do...
-
Exim Mail Server 4.100.1 corrige 4 fallos de segur...
-
Acer advierte: «Los PC seguirán subiendo de precio...
-
HEIF Heist: de una imagen a OpenAI
-
Irlanda multa a Google con 403 millones de euros p...
-
Reverse Upscaling convierte un juego actual en clá...
-
GPT-6 Astra resuelve mensaje alemán de hace 108 años
-
AMD recorta drásticamente el consumo de VRAM en tr...
-
Gemini Notebook será tu tutor personal
-
ASUS lanza actualizaciones de BIOS para placas bas...
-
WhatsApp: tres cuentas en un mismo iPhone
-
Pueden manipular claves de caché web para acceder ...
-
TMOG llega a Windows y Linux
-
Hugging Face: la plataforma de IA del momento
-
Ataques de IA autónoma: la realidad de Hugging Face
-
Android combatirá el mareo en el coche
-
Agentes de IA ya ejecutan ataques de ransomware au...
-
CXMT fabricará memoria NAND: China competirá con S...
-
IA ya desarrolla a Claude
-
Ransomware Feral Wolf explota Atlassian Confluence...
-
Realme 16 Pro Harry Potter: diseño mágico para fans
-
Descifran chip de PS2 tras 26 años
-
Nuevo ransomware SETTRA usa MeshAgent y BYOVD para...
-
Vulnerabilidad crítica en Microsoft Azure AI Found...
-
Halla 12 RTX 3070 abandonadas valoradas en miles d...
-
IA salva 25 millones de piezas de Lego
-
Intel y AMD consiguen algo impensable hace años: a...
-
RPCS3 mejora un 37% en GPUs NVIDIA
-
IA falla en el 85% de los empleos reales
-
OpenAI y Microsoft ignoraron el riesgo para la web
-
Analizan los precios de 153 tarjetas gráficas en l...
-
Nueva vulnerabilidad Click2Shell en WordPress perm...
-
Trump crea la AI Force
-
Meta IA llega a Mac y lee tus datos
-
La GPU del Apple M5 Ultra supera a la RTX 5080 en ...
-
Publican exploits para cuatro fallos del kernel de...
-
Explotan vulnerabilidad crítica de RCE sin autenti...
-
Sony y Universal demandan a Suno por IA musical
-
Robot más rápido que Bolt busca empleo
-
Fallo en Tutor LMS expone más de 100.000 sitios de...
-
Creeper vence a GPT-6 Astra en Minecraft
-
Los chips de 2 nm son los más caros de la historia...
-
i7-12700K sobrevive 1.000 días sin pasta térmica
-
Investigadores logran vulnerar el sandbox de OpenA...
-
Gemini hackeó tres empresas por error
-
Plugin4Shell: RCE zero-click afecta a Claude Code,...
-
Riesgos de la IA militar
-
Guía de memoria gráfica
-
Rockstar venderá música de GTA VI hasta por 125 dó...
-
Windows 11 LTSC: ¿Vale la pena?
-
IA se comunica sin internet mediante calor de CPU
-
Radeon RX 9050 de 4 GB a prueba: pierde hasta un 3...
-
Grupo norcoreano de WaterPlum infectan 30.000 disp...
-
Ataque a Brevo propaga malware en más de 100.000 s...
-
Intel lanzará su apuesta «super ventas»: una CPU R...
-
Presunto cazador de recompensas habría usado LLM p...
-
Apple lanzará servidor M Ultra en 2029
-
Asus lanza la mini PC Ascent QN10 para IA
-
Cisco lanza otro parche para un zero-day explotado...
-
Salt Typhoon infiltra organizaciones latinoamerica...
-
Google Gemini hackeó 3 empresas en un test de cibe...
-
Curiosity envía un selfie para celebrar sus 5.000 ...
-
Fallo de RCE sin interacción en agentes de IA podr...
-
Meta Quest: nueva función en Windows 11
-
Modelos de OpenAI buscaron claves API y archivos f...
-
Vulnerabilidad 0-day de Steam en Windows permite e...
-
CrowdSec revela que un ataque a npm de TanStack pe...
-
NASA confirma éxito del telescopio Roman con su pr...
-
Infectan torrents de cine con el malware MovieReap...
-
Microsoft: la IA provoca el mayor robo de empleos ...
-
Bill Gates compara la IA con una inteligencia alie...
-
Usan falsos SMS de T-Mobile para phishing
-
Windows 11 recupera tecla perdida por Copilot
-
Crisis de RAM encarece televisores
-
España sufre su primer ciberataque asistido por IA
-
Repositorios falsos de LastPass Authenticator en G...
-
Investigadores usan Claude Opus 5 para hackear for...
-
IA desborda a desarrolladores de Linux
-
Malware RatHat para Android explota ADB para mante...
-
SolarWinds corrige vulnerabilidad de clave embebid...
-
OpenAI revela instrucciones inquietantes para sus IA
-
GPT-6 Astra se traumatiza tras perder progreso en ...
-
FBI: Estafas de suplantación de agentes y funciona...
-
Fragilidad del software moderno
-
-
▼
septiembre
(Total:
661
)
-
►
2025
(Total:
2103
)
- ► septiembre (Total: 148 )
-
►
2024
(Total:
1110
)
- ► septiembre (Total: 50 )
-
►
2023
(Total:
710
)
- ► septiembre (Total: 65 )
-
►
2022
(Total:
967
)
- ► septiembre (Total: 72 )
-
►
2021
(Total:
730
)
- ► septiembre (Total: 56 )
-
►
2020
(Total:
212
)
- ► septiembre (Total: 21 )
-
►
2019
(Total:
102
)
- ► septiembre (Total: 14 )
-
►
2017
(Total:
231
)
- ► septiembre (Total: 16 )
-
►
2016
(Total:
266
)
- ► septiembre (Total: 38 )
-
►
2015
(Total:
445
)
- ► septiembre (Total: 47 )
-
►
2014
(Total:
185
)
- ► septiembre (Total: 18 )
-
►
2013
(Total:
100
)
- ► septiembre (Total: 3 )
-
►
2011
(Total:
7
)
- ► septiembre (Total: 1 )
Blogroll
Etiquetas
Entradas populares
-
Una GeForce RTX 5080 se averió tras usar un mod de DLSS 5 en GTA V , según reportó un usuario de Reddit.
-
Tras 26 años, el chip MechaCon de la PlayStation 2 ha sido totalmente documentado , lo que impulsará el modding de hardware y la emulación ...
-
Se han detectado dos vulnerabilidades de día cero ( CVE-2026-15315 y CVE-2026-15316 ) en las cámaras inteligentes TP-Link Tapo C200 . Estos ...
Bombas de contexto engañan a agentes de IA Qwen para detener ciberataques
Una técnica de defensa denominada "context bomb" (bomba de contexto) puede interrumpir el funcionamiento de agentes de IA y forzar al modelo Qwen3.8-27B a detener ataques simulados. Estas bombas de contexto consisten en cadenas de texto defensivas colocadas en recursos vulnerables, como AWS Secrets Manager; cuando el agente de IA escanea el entorno y encuentra este contenido embebido, el ataque se interrumpe, funcionando incluso contra versiones modificadas o "abliterated" del modelo.
Un prompt oculto de “bomba de contexto” en un señuelo de la nube puede interrumpir a los agentes de IA y obligar a Qwen3.8-27B a detener ataques simulados. La técnica funcionó tanto contra la versión original como contra la versión modificada “abliterated”.
Las bombas de contexto son cadenas defensivas colocadas en recursos vulnerables, como AWS Secrets Manager. Cuando un agente de IA escanea el entorno y encuentra esta información incrustada, el señuelo puede activar una alerta, interrumpiendo potencialmente las actividades del agente.
Investigaciones previas de Tracebit se centraron en bombas de contexto que activaban las funciones de seguridad de los modelos. Sin embargo, aquellos intentos anteriores no detuvieron ninguna de las versiones de Qwen cuando se enfrentaron a las cargas útiles originales. Por ello, Tracebit exploró un enfoque novedoso: la inyección indirecta de prompts.
En lugar de provocar un rechazo, la nueva instrucción incrustada parecía ser un comando de operador válido. Le indica a la IA que concluya su evaluación de seguridad y cese todas sus actividades.
En las pruebas iniciales, ambas configuraciones de Qwen cumplieron la orden, terminando sus ataques simulados. Este descubrimiento es crucial ya que resalta el riesgo de la inyección indirecta de prompts, donde los datos hostiles pueden ser malinterpretados como directivas legítimas.
Atacando Agentes de IA Con un Prompt Oculto
Además, los investigadores compararon el modelo original Qwen3.8-27B con la versión "abliterated" de Blackfrost AI en un entorno controlado de AWS lleno de recursos deliberadamente susceptibles y múltiples rutas de ataque potenciales.
A lo largo de 82 ejecuciones, el modelo estándar de Qwen alcanzó privilegios de administrador en el 20,5% de sus 39 intentos. Mientras tanto, la configuración "abliterated" alcanzó este nivel solo una vez en 43 intentos, logrando apenas un 2,3%.
El modelo original ejecutó un promedio de 0,90 rutas de ataque por ejecución, superando significativamente a la versión "abliterated", que promedió solo 0,49.
Los modelos Qwen modificados también fueron más lentos, tardando entre 28,4 y 29,9 minutos en completar su primera acción crítica, en comparación con los 13,5 minutos del modelo original.
Según la investigación de Tracebit, estos hallazgos desafían la suposición de que reducir el comportamiento de rechazo de un modelo mejora inherentemente su eficacia como herramienta de hacking autónoma.
Aunque el modelo modificado intentó un número similar de rutas de ataque, convirtió menos en acciones exitosas, lo que contribuyó a una mayor tasa de llamadas API fallidas y otros errores.
La "abliteration" modifica los pesos de un modelo para reducir su tendencia a rechazar ciertas solicitudes, a diferencia de un "jailbreak", que manipula el prompt del modelo.
Sin embargo, esta alteración de pesos no elimina todas las protecciones, ya que los proveedores de modelos pueden implementar medidas de seguridad adicionales. Quienes descarguen y alojen por su cuenta una versión de pesos abiertos pueden evadir las restricciones del proveedor, pero deben asegurarse de que el modelo siga siendo funcional y fiable.
El lanzamiento de Qwen por parte de Blackfrost afirma limitar el comportamiento de rechazo a nivel de pesos. No obstante, incluye características personalizadas que difieren del modelo original, afectando el rendimiento y el contexto.
La conclusión esencial para ti como defensor es que los recursos canario pueden tanto detectar intrusiones impulsadas por IA como interrumpir actividades no autorizadas. Al incrustar prompts ocultos en secretos señuelo, puedes crear alertas y, al mismo tiempo, detener potencialmente a los atacantes autónomos.
Si bien este método no es infalible y la eficacia de las inyecciones de prompts puede variar, los resultados indican que los agentes de IA pueden ser influenciados a través de su contexto operativo, resaltando la importancia de estrategias de defensa innovadoras contra los ataques a la nube impulsados por IA.
Fuentes:https://cybersecuritynews.com/context-bombs/
0 comentarios :
Publicar un comentario
Los comentarios pueden ser revisados en cualquier momento por los moderadores.
Serán publicados aquellos que cumplan las siguientes condiciones:
- Comentario acorde al contenido del post.
- Prohibido mensajes de tipo SPAM.
- Evite incluir links innecesarios en su comentario.
- Contenidos ofensivos, amenazas e insultos no serán permitidos.
Debe saber que los comentarios de los lectores no reflejan necesariamente la opinión del STAFF.