Tutoriales y Manuales
Entradas Mensuales
-
▼
2026
(Total:
5969
)
-
▼
julio
(Total:
687
)
-
ChatGPT llega a Linux
-
IA engaña y traiciona al gestionar un negocio sola
-
TA488 pudo explotar fallo 0-day de Outlook antes d...
-
Pixel 11 Pro: teaser de Pixel Glow
-
Nuevo ransomware GenieLocker ataca Windows, ESXi y...
-
Logitech lanza ratones con batería reemplazable en...
-
Chrome 151 corrige 370 fallos de seguridad, siete ...
-
Firefox añade función vídeos HDR para Windows 11
-
Fallo en Ruflo MCP permite a atacantes no autentic...
-
EEUU prohíbe robots extranjeros
-
Paquetes npm de Joyfill hackeados despliegan RAT y...
-
vBulletin soluciona vulnerabilidad crítica de RCE ...
-
Anthropic admite que Claude puede vulnerar el cifr...
-
Vulnerabilidad Zero-Day en Cisco FMC explotada act...
-
Grave fallo en Rails permitiría a atacantes leer a...
-
Fallo crítico en Rails permite leer archivos y eje...
-
Caída global de Claude afecta a usuarios con error...
-
1Password limita la IA
-
Gusano informático se infiltra en Copilot y desata...
-
Sospechan que CyberAv3ngers, vinculados a Irán, es...
-
Rusos roban claves de Signal para secuestrar cuent...
-
GOG Galaxy llega a Linux
-
eBay pagará 56 millones por acosar a periodistas
-
Phishing con IA ya no requiere malware: roba sesio...
-
Mejores lectores de eBooks para Linux
-
WhatsApp añade cifrado de extremo a extremo a llam...
-
Vulnerabilidad de 20 años permite controlar miles ...
-
Apple creará un iPad sumergible
-
Los primeros dispositivos de OpenAI: altavoz, smar...
-
Publican PoC para el bypass de autenticación explo...
-
Rusia acusa al CEO de Telegram, Pavel Durov, de ay...
-
Aparece un Intel Core i9-14901KE con únicamente 8 ...
-
Presunta brecha de datos en Revolut: dicen acceder...
-
Paquetes maliciosos de npm despliegan RAT contra d...
-
NVIDIA impulsa la Alianza Segura Open Source para ...
-
Filtración de datos en Bank of Baroda: accedieron ...
-
DEF CON prohíbe las gafas perversas al estilo de Meta
-
Botnet Tengu reinicia dispositivos Linux infectado...
-
Primer ciberataque de agente de IA autónomo infilt...
-
OpenAI libera Codex Security CLI para hallar y cor...
-
Vulnerabilidad crítica en Gitea permite ejecución ...
-
Puerta trasera en plugin Advanced Responsive Video...
-
Nuevo fallo de RCE en Gitea permite a redactores d...
-
Filtran cientos de chats de Claude por falta de in...
-
Fabricantes chinos lanzan portátiles con GPUs GeFo...
-
IA descubre zero-day en kernel de Linux para escal...
-
Radeon RX 9050: especificaciones
-
JFrog confirma que los modelos de OpenAI aprovecha...
-
Kimi K3: la IA china que desafía a OpenAI y Anthropic
-
PortSwigger lanza Burp AT Agentic AI para pruebas ...
-
Claude AI descifra esquema de prueba post-cuántica...
-
Estafadores fingen ser ShinyHunters para chantajea...
-
Investigadores: empresa fantasma china creó la red...
-
Nueva botnet Tengu Mirai reinicia tu IoT si intent...
-
Amodei niega querer prohibir la IA de código abierto
-
App del Vaticano expone a 700.000 usuarios por fal...
-
Filtración de datos en la firma de facturación méd...
-
Múltiples vulnerabilidades de FFmpeg permiten corr...
-
Botnet DDoS Dysphoria se extiende a 200.000 dispos...
-
Profesor atrapa a 32 alumnos copiando con IA media...
-
Microsoft afirma que su nuevo modelo de IA para ci...
-
Claude Opus 5 de Anthropic llega a AWS con mejoras...
-
Backups a tu NAS QNAP en 3 pasos: guía con HDP PC ...
-
Phineas Fisher, el hacker más famoso del mundo, si...
-
Fuga de Sandbox en n8n permite a editores de flujo...
-
Ubuntu 26.04 LTS impulsa la computación confidencial
-
Coca-Cola confirma robo de datos tras ataque de ra...
-
La botnet de IoT Dysphoria implementa C2 de blockc...
-
GitHub combate el malware
-
Alianza contra ciberataques de IA
-
El Explorador de Windows 11 borra archivos grandes...
-
Investigadores inician iOS 27 con jailbreak en iPh...
-
Fallo crítico de vBulletin permite ejecución remot...
-
Guía básica del SoC y su importancia
-
Bandas de ransomware atacan VPN de Palo Alto, Fort...
-
GitHub implementa periodo de espera de 3 días en D...
-
Movistar y Orange activan Starlink en zonas incend...
-
Zen 7 cerrará AM5 y Zen 8 ya se desarrolla
-
ChatGPT quiere que vincules tus datos de salud a s...
-
Fuga de datos en app del Papa
-
Fallo de AgentForger en ChatGPT permitiría despleg...
-
Ocho fallos de NodeBB permiten leer chats privados...
-
El precio de las tarjetas gráficas continúa subien...
-
Chats compartidos de Claude AI expuestos en Google
-
Ataques aprovechan vulnerabilidad RCE de Fastjson ...
-
OpenAI tardó diez días en informar a Hugging Face ...
-
AMD confirma que sus CPU EPYC «Florence» basadas e...
-
Europol identifica 4.340 URLs para su eliminación ...
-
SourTrade crea malware en navegadores para evadir ...
-
Hombre condenado a seis años de prisión por hackea...
-
Cómo los logs de infostealers impulsan filtracione...
-
Google lanza actualización urgente de Chrome por c...
-
Fallos de seguridad en cada script de ChatGPT, Cop...
-
Apache Syncope parchea vulnerabilidades de RCE e i...
-
Guías online para tus vacaciones
-
YouTube crea IA para miniaturas
-
CXMT ya se permite el lujo de cobrar más que Samsu...
-
PentesterFlow: IA para automatizar flujos de pente...
-
Qualcomm aumentará el precio de todos sus chips: l...
-
Microsoft eliminará dos funciones de Copilot el pr...
-
Cuatro novedades de WhatsApp
-
Vulnerabilidades de GitLab permiten ejecución remo...
-
Claude Code optimiza el desarrollo para iPhone
-
Se cumplen 20 años desde la compra de ATI Technolo...
-
Afiliados de Cl0p explotan vulnerabilidades de RCE...
-
Facebook sustituye el muro por vídeos
-
Facebook ofrece verificación gratuita a cambio de ...
-
OpenAI dividida por la regulación
-
Chrome permitirá guardar fotogramas de vídeos con ...
-
Los ladrones de memoria RAM desvalijan los ordenad...
-
Vulnerabilidad en juego Age of Empires II
-
Fallo en ChatGPT AgentForger permitiría desplegar ...
-
Exploit Certighost permite que usuarios de Active ...
-
Vulnerabilidad en Bing Images permite ejecutar cód...
-
Despliega agente de IA Hermes de forma autónoma pa...
-
Un gateway Wi-Fi comprometido puede redirigir a to...
-
Nueva vulnerabilidad HTTP/2 permite colapsar servi...
-
Las CPU AMD EPYC 9006 (Venice) son muy potentes: h...
-
Más de un tercio de las víctimas de ransomware vue...
-
Ciberdelincuentes aprovechan fallo en Windmill par...
-
Royal Ransomware usa Qbot y Cobalt Strike para com...
-
KDE refuerza su infraestructura PIM
-
Guía rápida de HDR en juegos y vídeos
-
Google lanza CodeMender para hallar y corregir vul...
-
Claude Opus 5: potente y más barato que Fable 5
-
TrickBot usa tráfico DNS como canal oculto para co...
-
GitHub reduce los pagos de su programa de recompen...
-
Nuevo malware Dolphin X roba credenciales de más d...
-
-
▼
julio
(Total:
687
)
-
►
2025
(Total:
2103
)
- ► septiembre (Total: 148 )
-
►
2024
(Total:
1110
)
- ► septiembre (Total: 50 )
-
►
2023
(Total:
710
)
- ► septiembre (Total: 65 )
-
►
2022
(Total:
967
)
- ► septiembre (Total: 72 )
-
►
2021
(Total:
730
)
- ► septiembre (Total: 56 )
-
►
2020
(Total:
212
)
- ► septiembre (Total: 21 )
-
►
2019
(Total:
102
)
- ► septiembre (Total: 14 )
-
►
2017
(Total:
231
)
- ► septiembre (Total: 16 )
-
►
2016
(Total:
266
)
- ► septiembre (Total: 38 )
-
►
2015
(Total:
445
)
- ► septiembre (Total: 47 )
-
►
2014
(Total:
185
)
- ► septiembre (Total: 18 )
-
►
2013
(Total:
100
)
- ► septiembre (Total: 3 )
-
►
2011
(Total:
7
)
- ► septiembre (Total: 1 )
Blogroll
Etiquetas
Entradas populares
-
Revolut está siendo investigada luego de que unos hackers afirmaran estar vendiendo una base de datos con registros de más de 75 millones de...
-
Un profesor detectó que 32 de 35 alumnos copiaron usando IA al ocultar un prompt invisible en el examen .
-
ZedAxis ha creado un bloqueador de anuncios por hardware de 5 euros que filtra más de medio millón de dominios consumiendo solo 4 MB de m...
Expertos en seguridad engañaron a LLMs para obtener recetas de cocaína mediante la manipulación de roles en inyecciones de prompts
Los investigadores afirman que los modelos de aprendizaje automático no pueden distinguir de manera fiable entre las entradas autorizadas y las no autorizadas, lo que garantiza que la inyección de prompts seguirá representando una amenaza hasta que los desarrolladores encuentren nuevas formas de procesar las entradas.
Los modelos de IA proporcionan respuestas a los prompts suministrados por el usuario. El problema es que los modelos de IA pueden recibir prompts adversarios —ya sea directamente de un usuario o indirectamente a través de un documento ingerido— que indican al modelo que tome acciones contrarias a su prompt de sistema integrado.
Diversas técnicas mitigan la inyección de prompts, pero los defensores no han encontrado formas de prevenir tales ataques.
Según los investigadores independientes Charles Ye y Jasmine Cui, y el profesor asociado del MIT Dylan Hadfield-Menell, es probable que nadie lo logre bajo el actual y frágil modelo de seguridad de los LLM.
Como observan en un artículo https://arxiv.org/abs/2603.12277 titulado "Prompt Injection as Role Confusion" en las actas de la conferencia ICML 2026 de la próxima semana, los LLM han pasado a depender de un sistema de etiquetado de texto que define "roles" para separar el texto del sistema del texto del usuario. Y argumentan que los roles no garantizan la seguridad.
"Las etiquetas de rol fueron un truco de formato que se convirtió en la arquitectura de seguridad y el andamiaje cognitivo de los LLM modernos", explican los autores en una publicación de blog https://role-confusion.github.io/. "Hemos demostrado que esta arquitectura no sobrevive en las representaciones reales del modelo, y que tal confusión de roles está vinculada a la inyección de prompts".
Cuando el ChatGPT de OpenAI llegó en 2022, implementó el concepto de roles —descrito por Anthropic https://arxiv.org/abs/2112.00861 un año antes— como una forma de decirle al modelo subyacente que se comportara de cierta manera. El rol de usuario haría una solicitud y el modelo, actuando en el rol de un asistente útil, respondería a esa solicitud.
"Un truco de formato se había convertido en el mecanismo que transformó el autocompletado en un asistente", observan los autores.
Los desarrolladores introdujeron otros roles con el tiempo. Además de <user> y <assistant>, existen <tool>, <system> y <think>. Estos roles sirvieron para trazar una línea entre diferentes objetivos para que pudieran optimizarse individualmente durante el proceso de entrenamiento. Los creadores de modelos quieren equilibrar objetivos conflictivos, como ser útiles y evitar daños, y esto implica distinciones de roles.
Pero los roles, dicen los investigadores, se han visto sobrecargados con responsabilidades que no pueden llevar a cabo de manera fiable. Se han convertido en una versión más imprecisa de los niveles de permisos, determinando cómo se confía en los prompts y cómo se tratan.
El problema, sostienen los autores, es que los roles se determinan de una manera fundamentalmente insegura: el estilo de escritura.
"Los LLM identifican los roles a partir de una característica insegura (el estilo)", explican. "Esto es como identificar la profesión de un extraño por cómo habla y viste en lugar de comprobar su identificación. Normalmente todo coincide, por lo que funciona bien. Pero cuando los atacantes crean intencionadamente un desajuste, el LLM utiliza el método inseguro (estilo de escritura) para identificar su rol en lugar del método seguro (etiquetas)".
Los autores desarrollaron un ataque llamado CoT (Chain of Thought) Forgery que consiste en utilizar un LLM para suplantar el estilo conciso del modo <think> de OpenAI y añadirlo al prompt de <user>. La técnica ganó el concurso de red-teaming de OpenAI Kaggle 2025 https://www.kaggle.com/competitions/openai-gpt-oss-20b-red-teaming.
"Preguntamos a varios LLM cómo sintetizar cocaína, insertando razonamientos falsos que decían que estaba bien porque llevábamos una camiseta verde", explican los autores. "Los LLM acceden. El razonamiento es transparentemente tonto, pero los modelos no lo evalúan como una afirmación externa que deba ser escrutada. Lo tratan como una conclusión ya alcanzada y simplemente actúan en consecuencia. Hemos robado la confianza otorgada al rol <think>".
En un benchmark estándar de jailbreaking, afirman que el CoT Forgery elevó la tasa de éxito del ataque de casi cero a aproximadamente el 60 por ciento en los modelos probados. Y mientras que la mayoría de los jailbreaks son frágiles y funcionan solo para ciertos modelos, este se transfirió porque explota un fallo estructural. No intenta persuadir al modelo, sino engañarlo para que trate la solicitud como algo que ya ha sido resuelto.
Los autores también señalan que, aunque muchos modelos reportan puntuaciones de seguridad casi perfectas en los benchmarks de inyección de prompts, los red-teamers humanos logran tasas de éxito de ataque cercanas al 100 por ciento https://arxiv.org/abs/2510.09023.
"La discrepancia es sencilla: los humanos capacitados prueban y adaptan los ataques hasta que funcionan; los benchmarks no", afirman. "Los benchmarks estáticos miden ataques que los modelos ya han aprendido a detectar".
Los roles, argumentan los autores, merecen más atención de la comunidad de investigación porque se han convertido en una de las abstracciones más importantes en el stack de la IA.
"A menos que los LLM logren una percepción de rol genuina, creemos que la defensa contra la inyección seguirá siendo un juego perpetuo de golpear al topo", concluyen. "Y la naturaleza continua de los límites de los roles abre la amenaza de inyecciones diseñadas para cambiar sutilmente los estados de los LLM mediante texto aparentemente inocuo, de forma legal y a escala".
Fuente:
TheRegister







Entrada más reciente
0 comentarios :
Publicar un comentario
Los comentarios pueden ser revisados en cualquier momento por los moderadores.
Serán publicados aquellos que cumplan las siguientes condiciones:
- Comentario acorde al contenido del post.
- Prohibido mensajes de tipo SPAM.
- Evite incluir links innecesarios en su comentario.
- Contenidos ofensivos, amenazas e insultos no serán permitidos.
Debe saber que los comentarios de los lectores no reflejan necesariamente la opinión del STAFF.