Tutoriales y Manuales
Entradas Mensuales
-
▼
2026
(Total:
5582
)
-
▼
julio
(Total:
300
)
-
Prueba KDE Linux en máquina virtual
-
Un streamer ruso «destruye» su GPU RTX 5090 tras e...
-
Robo de datos de Salesforce vinculado a ShinyHunte...
-
Empresa alemana se declara en quiebra tras seis se...
-
Ciberataque obliga a cerrar los sistemas del mayor...
-
Google y Microsoft eliminan ModHeader con 1,6 mill...
-
EE. UU. sanciona a primer servicio VPN que ayudó a...
-
Intel invertirá 5.000 millones de euros para ampli...
-
Extensión de Chrome con 1,6 millones de usuarios r...
-
El dominio t.me de Telegram suspendido
-
Samsung borrará tus datos de salud si no entrenas ...
-
Lidl admite filtración de datos en su tienda onlin...
-
Nintendo planea Switch 2 OLED
-
Usan scripts de PowerShell con IA para enumerar cu...
-
Una ZOTAC GeForce RTX 5090 «explota» tras arrancar...
-
Usan materiales académicos reales para infectar in...
-
Progress ordena apagado urgente de servidor ShareF...
-
La UE impone sanciones al GRU ruso por ciberataques
-
Waze integra IA de Gemini
-
Tiny11 25H2 optimiza Windows 11 al mínimo: 8Gb esp...
-
Grave vulnerabilidad en plugin miniOrange de WordP...
-
Vulneran jscrambler para atacar a desarrolladores
-
VEXAIoT: Sistema multiagente automatiza reconocimi...
-
ScummVM rescata a Mortadelo y Filemón
-
RAM de PS1: ventajas y desventajas de ampliarla
-
Servidor Python mal configurado expuso tres campañ...
-
IA en Irlanda consume tanta energía como sus hogares
-
Steam Machine subirá aviso de temperatura a 100ºC
-
Fallo en Enlace Móvil de Windows 11 consume 30 GB ...
-
Cuentas de SpaceX y Starlink hackeadas para promoc...
-
Australia advierte sobre campaña global contra pla...
-
Debian 13.6 ya disponible
-
AMD prepara FSR con generación de 8 fotogramas
-
Huawei construiría su propia fábrica de memoria DRAM
-
Condenado negociador que extorsionaba a víctimas d...
-
El Apple M7 Ultra sería capaz de admitir hasta 1,5...
-
RedWing MaaS presenta el fraude bancario en Androi...
-
Legacy Update revive Windows Update en XP, Vista y 7
-
KittySploit: framework de pentesting con IA y más ...
-
Google Earth Pro para PC desaparecerá pronto
-
Ahorra 70% en programación con IA Claude convirtie...
-
Apple demanda a OpenAI por secretos comerciales
-
Cómo evitar que la IA de Instagram use tus fotos
-
Roost: la red social de palomas virtuales
-
Miembro del ransomware Ryuk se declara culpable en...
-
Apple demanda a OpenAI por robo de datos
-
Steam supera ampliamente a PlayStation en usuarios
-
Claude Code ahora es un hacker automático con T3MP3ST
-
ChatGPT Work: el agente de IA que automatiza tus t...
-
Estafa con SSD de 16 TB: recibió una microSD y pesas
-
Proton 11 optimiza Resident Evil y Dino Crisis
-
281 apps VPN de Google Play filtran datos sensible...
-
Fallo de BIOS de Dell permite recuperar contraseña...
-
Grave fallo en Zimbra permitiría ejecutar código m...
-
Instagram retira función de IA por críticas
-
Xalgorix: herramienta de pentesting con metodologí...
-
Equivalencia gráfica de la Steam Machine
-
Google Drive ya no ofrece copias de seguridad grat...
-
Ha muerto Wally Funk, pionera de la aviación y la ...
-
Seis fallos en U-Boot FIT permiten ejecución de có...
-
Investigador afirma que parche de RoguePlanet para...
-
El Parlamento Europeo prorroga el funcionamiento d...
-
Explotan vulnerabilidad de inyección SQL en Django
-
ChatGPT ya crea presentaciones y Excel solo
-
npm 12 desactiva los scripts de instalación por de...
-
Usó IA para vulnerar AWS en 72 horas
-
WhatsApp recordará los cumpleaños
-
uBlock Origin muere en Chromium: alternativas
-
OpenMandriva Linux denuncia intento de sabotaje po...
-
Lanzan GPT-5.6 y ChatGPT Work
-
Lanzado Wireshark 4.6.7 con correcciones contra pa...
-
Grok 4.5 supera a Claude Opus según Elon Musk
-
Examen confirma uso de ChatGPT en clase
-
GitLab corrige ocho vulnerabilidades de seguridad ...
-
Oregón sube 30% luz a centros de datos de IA
-
Claude, Cursor y Codex activan reglas de seguridad...
-
Meta lanza herramienta de IA que utiliza fotos púb...
-
Vulnerabilidad en PAN-OS de Palo Alto permite ejec...
-
GPU casera con 64.000 chips baratos
-
Monitores de LG, Dell y Alienware instalan bloatwa...
-
Tuxedo OS deja Ubuntu por Debian por falta de tran...
-
Mycelium Framework: primera botnet de IA como serv...
-
Ataque de agente doble de IA hace que Claude Deskt...
-
Nueva herramienta promete humanizar los textos aca...
-
CrowdStrike revela 5 nuevas técnicas de inyección ...
-
Claude Cowork permite gestionar sesiones de IA des...
-
Deepin 25.2 optimiza Wayland y la búsqueda
-
Moonraker: el plan de Amazon para mejorar Alexa
-
Cuidado con el nuevo ataque HalluSquatting: podría...
-
Navegador DuckDuckGo bloquea anuncios de YouTube p...
-
GPT-Live: la IA que escucha y habla en tiempo real
-
Banana RAT usa generador de carga útil para crear ...
-
Nuevo SSD de Samsung alcanza 28.400 MB/s
-
70% de sitios de WordPress con PHP desactualizado ...
-
Usan fallos de Roundcube para robar credenciales e...
-
Víctimas de Predatorgate demandan por 8 millones d...
-
Game Pass pierde cuatro millones de usuarios
-
Claude Cowork llega a iPhone y Android
-
Los servidores europeos dependen en buena parte de...
-
OpenAI obtendría permiso del gobierno EE. UU. para...
-
Meta lanza Muse Image para WhatsApp e Instagram
-
El Mundial pone a prueba la interconexión europea ...
-
Filtración de Accenture: robo de 35 GB de código f...
-
Brave añade contenedores tipo Firefox
-
Vuelve Hannah Montana Linux tras 20 años
-
Vulnerabilidad GitLost engaña a la IA de GitHub pa...
-
Ciberdelincuentes explotan fallo de Docker en Gite...
-
4.982 fallos de seguridad en 2.259 servidores MCP ...
-
Fedora frena la IA por presión de sus usuarios
-
Agencia de ciberdefensa de EE. UU. usaría Mythos d...
-
Peligros del envenenamiento por IA
-
Documento judicial revela que el ID de dispositivo...
-
Nintendo retira Switch de Europa por leyes UE
-
Errores críticos en PHP PDO exponen riesgos de iny...
-
Vietnam detiene a los responsables del servicio de...
-
Ubiquiti revela 25 vulnerabilidades de seguridad e...
-
Carros inteligentes en España: comodidad y riesgo ...
-
España detiene a un presunto integrante de grupos ...
-
Vulnerabilidad de 16 años en Linux KVM permite cor...
-
Microsoft prueba Cloud Rebuild en Windows 11
-
PS5: crece el interés por el jailbreak
-
Demanda contra centro de IA en Wisconsin por ruido...
-
Mando con PS1 integrada y pilas
-
Japón desplegará 10 millones de robots para 2040
-
Tuxedo OS cambia Ubuntu por Debian
-
Error de Windows 11 roba 500 GB de disco
-
Transforman una RTX 4080 Laptop en una GPU de sobr...
-
El ID de Windows permite arrestar a miembro de Sca...
-
-
▼
julio
(Total:
300
)
-
►
2025
(Total:
2103
)
- ► septiembre (Total: 148 )
-
►
2024
(Total:
1110
)
- ► septiembre (Total: 50 )
-
►
2023
(Total:
710
)
- ► septiembre (Total: 65 )
-
►
2022
(Total:
967
)
- ► septiembre (Total: 72 )
-
►
2021
(Total:
730
)
- ► septiembre (Total: 56 )
-
►
2020
(Total:
212
)
- ► septiembre (Total: 21 )
-
►
2019
(Total:
102
)
- ► septiembre (Total: 14 )
-
►
2017
(Total:
231
)
- ► septiembre (Total: 16 )
-
►
2016
(Total:
266
)
- ► septiembre (Total: 38 )
-
►
2015
(Total:
445
)
- ► septiembre (Total: 47 )
-
►
2014
(Total:
185
)
- ► septiembre (Total: 18 )
-
►
2013
(Total:
100
)
- ► septiembre (Total: 3 )
-
►
2011
(Total:
7
)
- ► septiembre (Total: 1 )
Blogroll
Etiquetas
Entradas populares
-
Un actor de amenazas bajo el alias "888" ha publicado en un foro de cibercrimen que está vendiendo datos presuntamente robados a ...
-
Tiny11 25H2 es una versión optimizada de Windows 11 que reduce el bloatware para funcionar con solo 8 GB de espacio y 2 GB de RAM , permiti...
-
Los centros de datos de IA en Irlanda consumieron 7.663 GWh en 2025 , cifra equivalente al consumo energético de todas las viviendas del paí...
Expertos en seguridad engañaron a LLMs para obtener recetas de cocaína mediante la manipulación de roles en inyecciones de prompts
Los investigadores afirman que los modelos de aprendizaje automático no pueden distinguir de manera fiable entre las entradas autorizadas y las no autorizadas, lo que garantiza que la inyección de prompts seguirá representando una amenaza hasta que los desarrolladores encuentren nuevas formas de procesar las entradas.
Los modelos de IA proporcionan respuestas a los prompts suministrados por el usuario. El problema es que los modelos de IA pueden recibir prompts adversarios —ya sea directamente de un usuario o indirectamente a través de un documento ingerido— que indican al modelo que tome acciones contrarias a su prompt de sistema integrado.
Diversas técnicas mitigan la inyección de prompts, pero los defensores no han encontrado formas de prevenir tales ataques.
Según los investigadores independientes Charles Ye y Jasmine Cui, y el profesor asociado del MIT Dylan Hadfield-Menell, es probable que nadie lo logre bajo el actual y frágil modelo de seguridad de los LLM.
Como observan en un artículo https://arxiv.org/abs/2603.12277 titulado "Prompt Injection as Role Confusion" en las actas de la conferencia ICML 2026 de la próxima semana, los LLM han pasado a depender de un sistema de etiquetado de texto que define "roles" para separar el texto del sistema del texto del usuario. Y argumentan que los roles no garantizan la seguridad.
"Las etiquetas de rol fueron un truco de formato que se convirtió en la arquitectura de seguridad y el andamiaje cognitivo de los LLM modernos", explican los autores en una publicación de blog https://role-confusion.github.io/. "Hemos demostrado que esta arquitectura no sobrevive en las representaciones reales del modelo, y que tal confusión de roles está vinculada a la inyección de prompts".
Cuando el ChatGPT de OpenAI llegó en 2022, implementó el concepto de roles —descrito por Anthropic https://arxiv.org/abs/2112.00861 un año antes— como una forma de decirle al modelo subyacente que se comportara de cierta manera. El rol de usuario haría una solicitud y el modelo, actuando en el rol de un asistente útil, respondería a esa solicitud.
"Un truco de formato se había convertido en el mecanismo que transformó el autocompletado en un asistente", observan los autores.
Los desarrolladores introdujeron otros roles con el tiempo. Además de <user> y <assistant>, existen <tool>, <system> y <think>. Estos roles sirvieron para trazar una línea entre diferentes objetivos para que pudieran optimizarse individualmente durante el proceso de entrenamiento. Los creadores de modelos quieren equilibrar objetivos conflictivos, como ser útiles y evitar daños, y esto implica distinciones de roles.
Pero los roles, dicen los investigadores, se han visto sobrecargados con responsabilidades que no pueden llevar a cabo de manera fiable. Se han convertido en una versión más imprecisa de los niveles de permisos, determinando cómo se confía en los prompts y cómo se tratan.
El problema, sostienen los autores, es que los roles se determinan de una manera fundamentalmente insegura: el estilo de escritura.
"Los LLM identifican los roles a partir de una característica insegura (el estilo)", explican. "Esto es como identificar la profesión de un extraño por cómo habla y viste en lugar de comprobar su identificación. Normalmente todo coincide, por lo que funciona bien. Pero cuando los atacantes crean intencionadamente un desajuste, el LLM utiliza el método inseguro (estilo de escritura) para identificar su rol en lugar del método seguro (etiquetas)".
Los autores desarrollaron un ataque llamado CoT (Chain of Thought) Forgery que consiste en utilizar un LLM para suplantar el estilo conciso del modo <think> de OpenAI y añadirlo al prompt de <user>. La técnica ganó el concurso de red-teaming de OpenAI Kaggle 2025 https://www.kaggle.com/competitions/openai-gpt-oss-20b-red-teaming.
"Preguntamos a varios LLM cómo sintetizar cocaína, insertando razonamientos falsos que decían que estaba bien porque llevábamos una camiseta verde", explican los autores. "Los LLM acceden. El razonamiento es transparentemente tonto, pero los modelos no lo evalúan como una afirmación externa que deba ser escrutada. Lo tratan como una conclusión ya alcanzada y simplemente actúan en consecuencia. Hemos robado la confianza otorgada al rol <think>".
En un benchmark estándar de jailbreaking, afirman que el CoT Forgery elevó la tasa de éxito del ataque de casi cero a aproximadamente el 60 por ciento en los modelos probados. Y mientras que la mayoría de los jailbreaks son frágiles y funcionan solo para ciertos modelos, este se transfirió porque explota un fallo estructural. No intenta persuadir al modelo, sino engañarlo para que trate la solicitud como algo que ya ha sido resuelto.
Los autores también señalan que, aunque muchos modelos reportan puntuaciones de seguridad casi perfectas en los benchmarks de inyección de prompts, los red-teamers humanos logran tasas de éxito de ataque cercanas al 100 por ciento https://arxiv.org/abs/2510.09023.
"La discrepancia es sencilla: los humanos capacitados prueban y adaptan los ataques hasta que funcionan; los benchmarks no", afirman. "Los benchmarks estáticos miden ataques que los modelos ya han aprendido a detectar".
Los roles, argumentan los autores, merecen más atención de la comunidad de investigación porque se han convertido en una de las abstracciones más importantes en el stack de la IA.
"A menos que los LLM logren una percepción de rol genuina, creemos que la defensa contra la inyección seguirá siendo un juego perpetuo de golpear al topo", concluyen. "Y la naturaleza continua de los límites de los roles abre la amenaza de inyecciones diseñadas para cambiar sutilmente los estados de los LLM mediante texto aparentemente inocuo, de forma legal y a escala".
Fuente:
TheRegister







Entrada más reciente
0 comentarios :
Publicar un comentario
Los comentarios pueden ser revisados en cualquier momento por los moderadores.
Serán publicados aquellos que cumplan las siguientes condiciones:
- Comentario acorde al contenido del post.
- Prohibido mensajes de tipo SPAM.
- Evite incluir links innecesarios en su comentario.
- Contenidos ofensivos, amenazas e insultos no serán permitidos.
Debe saber que los comentarios de los lectores no reflejan necesariamente la opinión del STAFF.