Tutoriales y Manuales
Entradas Mensuales
-
▼
2026
(Total:
5792
)
-
▼
julio
(Total:
510
)
-
Actualización de Chrome corrige 12 vulnerabilidades
-
Instagram permitirá cambiar el audio de las public...
-
ASUS corrige vulnerabilidad crítica en routers que...
-
Nueva herramienta NULLZEREPTOOL usa Telegram para ...
-
Vulnerabilidad en Microsoft Azure DevOps permite q...
-
Francia prohíbe redes sociales a menores de 15 años
-
LaLiga pierde el juicio: el TJUE dice que el uso d...
-
EE. UU. clausura más de 1.000 webs en ofensiva con...
-
OpenAI reconoce haber originado el ataque de agent...
-
Fallo en Azure DevOps permite que comentarios ocul...
-
Vulnerabilidad de Meta expuso correos, chats y arc...
-
La policía desmantela la plataforma de phishing Kr...
-
La Steam Deck se hunde en ventas tras la subida de...
-
SolarWinds corrige 15 fallos críticos de Serv-U qu...
-
Agencia gubernamental británica detecta trampas co...
-
DLSS 5 optimiza rendimiento y arte
-
La policía desarticula el kit de phishing Kratos d...
-
Gemini 3.5 Flash Cyber detecta y parchea vulnerabi...
-
OpenAI revela que sus modelos de IA lograron vulne...
-
Renuncia el jefe de seguridad de IA de Trump a los...
-
Secuestran más de 20 webs gubernamentales para dis...
-
Investigador anónimo filtra 204 exploits 0-day ant...
-
Google presenta Gemini 3.5 Flash Cyber AI para det...
-
España multa a 23andMe con 2,4 millones de euros p...
-
Los fabricantes de Estados Unidos, Japón y Corea d...
-
Fallo en AWS Kiro permitía que páginas web malicio...
-
Firefox lanza contenedores globales y nuevas funci...
-
FRITZ!OS 8.20: sistema operativo inteligente
-
Trabajos de entrenamiento de IA contra la red eléc...
-
Taiwán obligará a TSMC a generar su propia energía
-
GTX 1060: 10 años de un icono gama media
-
Filtración de datos de Craneware: hackers robaron ...
-
Estafadores se hacen pasar por el FBI en redes soc...
-
Microsoft crea cristal que almacena datos por 10.0...
-
Usan vulnerabilidad de PAN-OS de Palo Alto para de...
-
Ciberatacantes aprovechan vulnerabilidad crítica d...
-
Optimiza la seguridad de Windows desactivando esta...
-
Parches no oficiales y gratuitos para la vulnerabi...
-
Los 10 malware más activos la semana pasada
-
Nuevo ransomware ENCFORGE ataca archivos de modelo...
-
Cómo conectar tu móvil gratis a Starlink: requisit...
-
Trump busca prohibir la IA china Kimi K3
-
Zimbra corrige vulnerabilidades críticas de inyecc...
-
Grave vulnerabilidad en Gitea permite escribir en ...
-
Anthropic pagará a autores por usar sus libros sin...
-
Robots de Xiaomi logran 98% de precisión en fábric...
-
PentDEM: frameworks de pentesting inteligentes
-
Un análisis del SoC Kirin 9030 demuestra que China...
-
Más de 55 millones de cuentas comprometidas en el ...
-
Furtex: kit de Linux para post-explotación y evasi...
-
Rumanía se quedó sin registro de la propiedad porq...
-
OVH desvela un plan semicubierto para solucionar u...
-
Memoria DDR5 alcanza precio récord en julio
-
Detenido por robar 200.000 euros con malware en Steam
-
Punto ciego de Microsoft Defender XDR puede oculta...
-
Un modder hace una PS4 V2 portátil con pantalla OL...
-
Microsoft lanza actualización KB5121767 para corre...
-
Usan bots de Telegram como puertas traseras en sis...
-
Líderes tecnológicos felicitan a España campeona d...
-
UE multa a AliExpress con 550 millones por product...
-
Linux corrige más de 400 vulnerabilidades del kern...
-
Adobe lanza una IA revolucionaria para fotografía
-
Aumentan los ataques de wp2shell en WordPress impu...
-
Robotaxi de Tesla choca siendo conducido remotamente
-
Fallo crítico en la plataforma de IA de ServiceNow...
-
Fallo en Kimai Docker permite robo de cuentas medi...
-
LG instalaría adware en Windows mediante una app
-
Microsoft recreó cabina de avión para probar sonid...
-
Caviar vende un Z Fold 8 de oro con Messi por 11.0...
-
3 herramientas gratuitas para monitorizar tu red d...
-
Nueva vulnerabilidad en 7-Zip permitiría la ejecuc...
-
Publicado PoC para vulnerabilidad crítica de RCE e...
-
Publican datos de Starbucks en foros
-
Siete paquetes maliciosos de Vite en npm emplean C...
-
En España los Hospitales y empresas tendrán su pro...
-
1Password integrará Claude para usar tus credenciales
-
Abuso de Windows Bind Link permite cegar EDR y eva...
-
PentestCode: nuevo agente de IA que automatiza pru...
-
Caos en Amazon Web Services por facturas millonarias
-
Vulnerabilidad crítica RCE wp2shell: cobertura, Po...
-
Servidor expuesto revela kit de phishing basado en...
-
Google crea chip para potenciar su IA
-
Acelera el arranque de Windows sin programas
-
Vulnerabilidad de 15 años en NGINX permite ejecuta...
-
Apple Music sube precios en España
-
NVIDIA lanza los primeros drivers para RTX Spark e...
-
Avances en las pruebas para clasificar a las IAs s...
-
Inteligencia rusa hackea cámaras IP para espiar lo...
-
Grave vulnerabilidad en F5 NGINX podría provocar c...
-
Explotan vulnerabilidades de Microsoft SharePoint ...
-
Agente de IA autónomo vulnera Hugging Face, el rep...
-
EE. UU. acusa a tres rusos por ciberdelitos de 62 ...
-
GoldenEyeDog: roban certificados de DigiCert
-
Jefe de OpenAI advierte sobre el Comunismo de la IA
-
Apple advierte a exemplepados en OpenAI
-
Más controles parentales en ChatGPT
-
Mario Kart Wii llega a PC en 4K y FPS libres: Mari...
-
Están suplantando la identidad de tu banco para ro...
-
Ben Affleck gana 587 millones de Netflix por su IA
-
Hoy se cumplen 50 años de la llegada de la Viking ...
-
Explotan vulnerabilidades de RCE en WordPress Core...
-
Alarma por la IA de Google para menores
-
Novias IA causan caos en China
-
OpenAI notificará a padres sobre infracciones de h...
-
NadMesh usa Shodan para secuestrar infraestructura...
-
Hugging Face confirma brecha por IA: atacantes usa...
-
Tesla lanza bicicleta infantil mediocre
-
BleachBit: la mejor alternativa gratis y abierta a...
-
NVIDIA RTX Spark aparece en Cinebench 2026 rindien...
-
Gemini en Chrome analizará grupos de pestañas
-
Project Perception detectará fallos en Windows
-
Vulnerabilidad en Citrix Secure Access y Endpoint ...
-
Filtran Galaxy Z Fold 8
-
NVIDIA permite grabar partidas a 240 FPS
-
Nuevo ransomware Spirals cifra empresa IT en menos...
-
Claude accede a cuentas sin contraseñas sin llegar...
-
Kimi-K3 supera a IA de EE UU pero se identifica co...
-
X será de código abierto según Musk
-
Nueva botnet NadMesh rastrea servicios de IA expue...
-
FBI detiene hacker de criptomonedas en Steam
-
Fallo HollowByte en OpenSSL podría colapsar la mem...
-
LegacyHive: vulnerabilidad 0-Day de Windows permit...
-
Rectify11 es una herramienta gratuita optimiza Win...
-
Google integra AI Mode con YouTube Music y Canva
-
Nueva vulnerabilidad RCE en wp2shell afecta a mill...
-
Explotan vulnerabilidad 0-day de SonicWall SMA1000
-
Nova Lake-S: nueva marca y fecha de lanzamiento
-
Dos miembros de Scattered Spider condenados a 5,5 ...
-
-
▼
julio
(Total:
510
)
-
►
2025
(Total:
2103
)
- ► septiembre (Total: 148 )
-
►
2024
(Total:
1110
)
- ► septiembre (Total: 50 )
-
►
2023
(Total:
710
)
- ► septiembre (Total: 65 )
-
►
2022
(Total:
967
)
- ► septiembre (Total: 72 )
-
►
2021
(Total:
730
)
- ► septiembre (Total: 56 )
-
►
2020
(Total:
212
)
- ► septiembre (Total: 21 )
-
►
2019
(Total:
102
)
- ► septiembre (Total: 14 )
-
►
2017
(Total:
231
)
- ► septiembre (Total: 16 )
-
►
2016
(Total:
266
)
- ► septiembre (Total: 38 )
-
►
2015
(Total:
445
)
- ► septiembre (Total: 47 )
-
►
2014
(Total:
185
)
- ► septiembre (Total: 18 )
-
►
2013
(Total:
100
)
- ► septiembre (Total: 3 )
-
►
2011
(Total:
7
)
- ► septiembre (Total: 1 )
Blogroll
Etiquetas
Entradas populares
-
Acelerar el arranque de Windows es posible utilizando las herramientas propias del sistema operativo , evitando así el uso de software exte...
-
La GeForce GTX 1060 cumple 10 años , consolidándose como una de las mejores tarjetas gráficas de gama media de la historia debido a su gran...
-
Linux ya es compatible con más versiones de PlayStation 5 , permitiendo instalar el sistema de PC para jugar desde Steam .
Expertos en seguridad engañaron a LLMs para obtener recetas de cocaína mediante la manipulación de roles en inyecciones de prompts
Los investigadores afirman que los modelos de aprendizaje automático no pueden distinguir de manera fiable entre las entradas autorizadas y las no autorizadas, lo que garantiza que la inyección de prompts seguirá representando una amenaza hasta que los desarrolladores encuentren nuevas formas de procesar las entradas.
Los modelos de IA proporcionan respuestas a los prompts suministrados por el usuario. El problema es que los modelos de IA pueden recibir prompts adversarios —ya sea directamente de un usuario o indirectamente a través de un documento ingerido— que indican al modelo que tome acciones contrarias a su prompt de sistema integrado.
Diversas técnicas mitigan la inyección de prompts, pero los defensores no han encontrado formas de prevenir tales ataques.
Según los investigadores independientes Charles Ye y Jasmine Cui, y el profesor asociado del MIT Dylan Hadfield-Menell, es probable que nadie lo logre bajo el actual y frágil modelo de seguridad de los LLM.
Como observan en un artículo https://arxiv.org/abs/2603.12277 titulado "Prompt Injection as Role Confusion" en las actas de la conferencia ICML 2026 de la próxima semana, los LLM han pasado a depender de un sistema de etiquetado de texto que define "roles" para separar el texto del sistema del texto del usuario. Y argumentan que los roles no garantizan la seguridad.
"Las etiquetas de rol fueron un truco de formato que se convirtió en la arquitectura de seguridad y el andamiaje cognitivo de los LLM modernos", explican los autores en una publicación de blog https://role-confusion.github.io/. "Hemos demostrado que esta arquitectura no sobrevive en las representaciones reales del modelo, y que tal confusión de roles está vinculada a la inyección de prompts".
Cuando el ChatGPT de OpenAI llegó en 2022, implementó el concepto de roles —descrito por Anthropic https://arxiv.org/abs/2112.00861 un año antes— como una forma de decirle al modelo subyacente que se comportara de cierta manera. El rol de usuario haría una solicitud y el modelo, actuando en el rol de un asistente útil, respondería a esa solicitud.
"Un truco de formato se había convertido en el mecanismo que transformó el autocompletado en un asistente", observan los autores.
Los desarrolladores introdujeron otros roles con el tiempo. Además de <user> y <assistant>, existen <tool>, <system> y <think>. Estos roles sirvieron para trazar una línea entre diferentes objetivos para que pudieran optimizarse individualmente durante el proceso de entrenamiento. Los creadores de modelos quieren equilibrar objetivos conflictivos, como ser útiles y evitar daños, y esto implica distinciones de roles.
Pero los roles, dicen los investigadores, se han visto sobrecargados con responsabilidades que no pueden llevar a cabo de manera fiable. Se han convertido en una versión más imprecisa de los niveles de permisos, determinando cómo se confía en los prompts y cómo se tratan.
El problema, sostienen los autores, es que los roles se determinan de una manera fundamentalmente insegura: el estilo de escritura.
"Los LLM identifican los roles a partir de una característica insegura (el estilo)", explican. "Esto es como identificar la profesión de un extraño por cómo habla y viste en lugar de comprobar su identificación. Normalmente todo coincide, por lo que funciona bien. Pero cuando los atacantes crean intencionadamente un desajuste, el LLM utiliza el método inseguro (estilo de escritura) para identificar su rol en lugar del método seguro (etiquetas)".
Los autores desarrollaron un ataque llamado CoT (Chain of Thought) Forgery que consiste en utilizar un LLM para suplantar el estilo conciso del modo <think> de OpenAI y añadirlo al prompt de <user>. La técnica ganó el concurso de red-teaming de OpenAI Kaggle 2025 https://www.kaggle.com/competitions/openai-gpt-oss-20b-red-teaming.
"Preguntamos a varios LLM cómo sintetizar cocaína, insertando razonamientos falsos que decían que estaba bien porque llevábamos una camiseta verde", explican los autores. "Los LLM acceden. El razonamiento es transparentemente tonto, pero los modelos no lo evalúan como una afirmación externa que deba ser escrutada. Lo tratan como una conclusión ya alcanzada y simplemente actúan en consecuencia. Hemos robado la confianza otorgada al rol <think>".
En un benchmark estándar de jailbreaking, afirman que el CoT Forgery elevó la tasa de éxito del ataque de casi cero a aproximadamente el 60 por ciento en los modelos probados. Y mientras que la mayoría de los jailbreaks son frágiles y funcionan solo para ciertos modelos, este se transfirió porque explota un fallo estructural. No intenta persuadir al modelo, sino engañarlo para que trate la solicitud como algo que ya ha sido resuelto.
Los autores también señalan que, aunque muchos modelos reportan puntuaciones de seguridad casi perfectas en los benchmarks de inyección de prompts, los red-teamers humanos logran tasas de éxito de ataque cercanas al 100 por ciento https://arxiv.org/abs/2510.09023.
"La discrepancia es sencilla: los humanos capacitados prueban y adaptan los ataques hasta que funcionan; los benchmarks no", afirman. "Los benchmarks estáticos miden ataques que los modelos ya han aprendido a detectar".
Los roles, argumentan los autores, merecen más atención de la comunidad de investigación porque se han convertido en una de las abstracciones más importantes en el stack de la IA.
"A menos que los LLM logren una percepción de rol genuina, creemos que la defensa contra la inyección seguirá siendo un juego perpetuo de golpear al topo", concluyen. "Y la naturaleza continua de los límites de los roles abre la amenaza de inyecciones diseñadas para cambiar sutilmente los estados de los LLM mediante texto aparentemente inocuo, de forma legal y a escala".
Fuente:
TheRegister







Entrada más reciente
0 comentarios :
Publicar un comentario
Los comentarios pueden ser revisados en cualquier momento por los moderadores.
Serán publicados aquellos que cumplan las siguientes condiciones:
- Comentario acorde al contenido del post.
- Prohibido mensajes de tipo SPAM.
- Evite incluir links innecesarios en su comentario.
- Contenidos ofensivos, amenazas e insultos no serán permitidos.
Debe saber que los comentarios de los lectores no reflejan necesariamente la opinión del STAFF.