Tutoriales y Manuales
Entradas Mensuales
-
▼
2026
(Total:
5843
)
-
▼
julio
(Total:
561
)
-
GitHub reduce los pagos de su programa de recompen...
-
Nuevo malware Dolphin X roba credenciales de más d...
-
EEUU propone botón de apagado para la IA
-
Google añade videos selfie para recuperar cuentas ...
-
Fallo en Claude Cowork permite leer claves SSH y c...
-
Microsoft detecta 7.600 millones de phishing y el ...
-
Thermaltake AX 3200W: fuente de alimentación 80 PL...
-
Hackers usan GitHub Actions para atacar servidores...
-
Tuxedo OS y la seguridad en Debian
-
Microsoft ha liberado el código fuente de Comic Chat
-
Usan plugins de Notepad++ para comprometer sistema...
-
Filtran 160 millones de datos de clientes de Decat...
-
Rusos roban 90 días de correos vía Zimbra Zero-Day
-
NodeBB corrige ocho fallos detectados por IA que c...
-
Origin, proveedora energética australiana, informa...
-
Vulnerabilidad grave en el sistema de archivos de ...
-
Vulnerabilidad de Exim permite escalada de privile...
-
Next.js corrige nueve fallos de seguridad de SSRF,...
-
Musk creará película de La Odisea con Grok
-
Intel y AMD hacen caja con China: desde enero las ...
-
Google implementa recuperación mediante video self...
-
Fallos preocupantes en ChatGPT
-
Apple bloqueará dispositivos por impagos en iOS 27
-
Bloqueador de anuncios ultra eficiente por 5 euros
-
Una línea oculta de texto web convierte AWS Kiro e...
-
Hackean la Academia Diplomática de Corea del Sur y...
-
CISA: Grupos de Irán atacan PLCs de Rockwell en in...
-
EEUU probará drones contra incendios
-
Multa récord a Google en Europa
-
Publicado PoC de vulnerabilidad de escalada de pri...
-
Anthropic lanza plugin de seguridad de Claude para...
-
Chick-fil-A pide cambiar contraseñas por acceso no...
-
Fallo en extensión de Adobe Acrobat permite robar ...
-
EE UU acusa a IA china Kimi K3 de plagio
-
Check Point corrige vulnerabilidad en SmartConsole...
-
Webs consideran abandonar Google por el impacto de...
-
Fallo en la extensión de Adobe Acrobat permitía a ...
-
Vulnerabilidad crítica de ejecución remota de códi...
-
Un empleado del Ayuntamiento se libra de la cárcel...
-
xMEMS XMC-1200, el micro ventilador más pequeño de...
-
China evalúa restringir exportaciones de IA y el u...
-
El equipo del kernel de Linux lanza 432 CVE en sol...
-
OpenAI afirma que sus modelos de IA evadieron el e...
-
Datos de Cloudflare revelan qué selecciones del Mu...
-
Roban sesiones de Microsoft 365 tras el MFA
-
Atacantes de Qilin Ransomware aprovechan vulnerabi...
-
Usan GitHub Actions para insertar RAT Miasma en pa...
-
El gigante ferroviario suizo Stadler rechaza pagar...
-
Usan juegos falsos para robar contraseñas y cripto...
-
Ransomware Qilin: récord de 1.358 víctimas globales
-
FluentCleaner Classic: Windows ligero y open source
-
Actualización de Chrome corrige 12 vulnerabilidades
-
Instagram permitirá cambiar el audio de las public...
-
ASUS corrige vulnerabilidad crítica en routers que...
-
Nueva herramienta NULLZEREPTOOL usa Telegram para ...
-
Vulnerabilidad en Microsoft Azure DevOps permite q...
-
Francia prohíbe redes sociales a menores de 15 años
-
LaLiga pierde el juicio: el TJUE dice que el uso d...
-
EE. UU. clausura más de 1.000 webs en ofensiva con...
-
OpenAI reconoce haber originado el ataque de agent...
-
Fallo en Azure DevOps permite que comentarios ocul...
-
Vulnerabilidad de Meta expuso correos, chats y arc...
-
La policía desmantela la plataforma de phishing Kr...
-
La Steam Deck se hunde en ventas tras la subida de...
-
SolarWinds corrige 15 fallos críticos de Serv-U qu...
-
Agencia gubernamental británica detecta trampas co...
-
DLSS 5 optimiza rendimiento y arte
-
La policía desarticula el kit de phishing Kratos d...
-
Gemini 3.5 Flash Cyber detecta y parchea vulnerabi...
-
OpenAI revela que sus modelos de IA lograron vulne...
-
Renuncia el jefe de seguridad de IA de Trump a los...
-
Secuestran más de 20 webs gubernamentales para dis...
-
Investigador anónimo filtra 204 exploits 0-day ant...
-
Google presenta Gemini 3.5 Flash Cyber AI para det...
-
España multa a 23andMe con 2,4 millones de euros p...
-
Los fabricantes de Estados Unidos, Japón y Corea d...
-
Fallo en AWS Kiro permitía que páginas web malicio...
-
Firefox lanza contenedores globales y nuevas funci...
-
FRITZ!OS 8.20: sistema operativo inteligente
-
Trabajos de entrenamiento de IA contra la red eléc...
-
Taiwán obligará a TSMC a generar su propia energía
-
GTX 1060: 10 años de un icono gama media
-
Filtración de datos de Craneware: hackers robaron ...
-
Estafadores se hacen pasar por el FBI en redes soc...
-
Microsoft crea cristal que almacena datos por 10.0...
-
Usan vulnerabilidad de PAN-OS de Palo Alto para de...
-
Ciberatacantes aprovechan vulnerabilidad crítica d...
-
Optimiza la seguridad de Windows desactivando esta...
-
Parches no oficiales y gratuitos para la vulnerabi...
-
Los 10 malware más activos la semana pasada
-
Nuevo ransomware ENCFORGE ataca archivos de modelo...
-
Cómo conectar tu móvil gratis a Starlink: requisit...
-
Trump busca prohibir la IA china Kimi K3
-
Zimbra corrige vulnerabilidades críticas de inyecc...
-
Grave vulnerabilidad en Gitea permite escribir en ...
-
Anthropic pagará a autores por usar sus libros sin...
-
Robots de Xiaomi logran 98% de precisión en fábric...
-
PentDEM: frameworks de pentesting inteligentes
-
Un análisis del SoC Kirin 9030 demuestra que China...
-
Más de 55 millones de cuentas comprometidas en el ...
-
Furtex: kit de Linux para post-explotación y evasi...
-
Rumanía se quedó sin registro de la propiedad porq...
-
OVH desvela un plan semicubierto para solucionar u...
-
Memoria DDR5 alcanza precio récord en julio
-
Detenido por robar 200.000 euros con malware en Steam
-
Punto ciego de Microsoft Defender XDR puede oculta...
-
Un modder hace una PS4 V2 portátil con pantalla OL...
-
Microsoft lanza actualización KB5121767 para corre...
-
Usan bots de Telegram como puertas traseras en sis...
-
Líderes tecnológicos felicitan a España campeona d...
-
UE multa a AliExpress con 550 millones por product...
-
Linux corrige más de 400 vulnerabilidades del kern...
-
Adobe lanza una IA revolucionaria para fotografía
-
Aumentan los ataques de wp2shell en WordPress impu...
-
Robotaxi de Tesla choca siendo conducido remotamente
-
Fallo crítico en la plataforma de IA de ServiceNow...
-
Fallo en Kimai Docker permite robo de cuentas medi...
-
LG instalaría adware en Windows mediante una app
-
Microsoft recreó cabina de avión para probar sonid...
-
Caviar vende un Z Fold 8 de oro con Messi por 11.0...
-
3 herramientas gratuitas para monitorizar tu red d...
-
Nueva vulnerabilidad en 7-Zip permitiría la ejecuc...
-
Publicado PoC para vulnerabilidad crítica de RCE e...
-
Publican datos de Starbucks en foros
-
Siete paquetes maliciosos de Vite en npm emplean C...
-
En España los Hospitales y empresas tendrán su pro...
-
1Password integrará Claude para usar tus credenciales
-
Abuso de Windows Bind Link permite cegar EDR y eva...
-
-
▼
julio
(Total:
561
)
-
►
2025
(Total:
2103
)
- ► septiembre (Total: 148 )
-
►
2024
(Total:
1110
)
- ► septiembre (Total: 50 )
-
►
2023
(Total:
710
)
- ► septiembre (Total: 65 )
-
►
2022
(Total:
967
)
- ► septiembre (Total: 72 )
-
►
2021
(Total:
730
)
- ► septiembre (Total: 56 )
-
►
2020
(Total:
212
)
- ► septiembre (Total: 21 )
-
►
2019
(Total:
102
)
- ► septiembre (Total: 14 )
-
►
2017
(Total:
231
)
- ► septiembre (Total: 16 )
-
►
2016
(Total:
266
)
- ► septiembre (Total: 38 )
-
►
2015
(Total:
445
)
- ► septiembre (Total: 47 )
-
►
2014
(Total:
185
)
- ► septiembre (Total: 18 )
-
►
2013
(Total:
100
)
- ► septiembre (Total: 3 )
-
►
2011
(Total:
7
)
- ► septiembre (Total: 1 )
Blogroll
Etiquetas
seguridad
(
1570
)
vulnerabilidad
(
1502
)
software
(
852
)
hardware
(
825
)
google
(
730
)
Malware
(
708
)
privacidad
(
638
)
Windows
(
521
)
ransomware
(
510
)
android
(
448
)
exploit
(
376
)
linux
(
371
)
cve
(
370
)
tutorial
(
299
)
nvidia
(
284
)
manual
(
281
)
hacking
(
242
)
WhatsApp
(
173
)
ssd
(
172
)
Wifi
(
131
)
ddos
(
131
)
app
(
125
)
twitter
(
121
)
cifrado
(
120
)
programación
(
105
)
youtube
(
81
)
herramientas
(
80
)
firefox
(
74
)
Networking
(
73
)
sysadmin
(
72
)
firmware
(
70
)
adobe
(
64
)
office
(
62
)
Kernel
(
49
)
antivirus
(
49
)
hack
(
49
)
javascript
(
48
)
apache
(
45
)
juegos
(
42
)
contraseñas
(
39
)
cms
(
35
)
multimedia
(
35
)
eventos
(
32
)
flash
(
32
)
MAC
(
30
)
anonymous
(
28
)
ssl
(
24
)
Forense
(
20
)
conferencia
(
20
)
SeguridadWireless
(
17
)
documental
(
17
)
auditoría
(
15
)
Debugger
(
14
)
Rootkit
(
14
)
lizard squad
(
14
)
metasploit
(
13
)
técnicas hacking
(
13
)
Virtualización
(
11
)
delitos
(
11
)
reversing
(
10
)
adamo
(
9
)
Ehn-Dev
(
7
)
MAC Adress
(
6
)
antimalware
(
6
)
oclHashcat
(
5
)
Entradas populares
-
ZedAxis ha creado un bloqueador de anuncios por hardware de 5 euros que filtra más de medio millón de dominios consumiendo solo 4 MB de m...
-
Se publicaron 432 CVE del kernel de Linux en solo dos días, generando preocupación entre los administradores de sistemas por la dificultad d...
-
FluentCleaner Classic es una herramienta gratuita, portátil y de código abierto diseñada para eliminar el software basura de Windows , per...
OpenAI usa GPT-Red para automatizar pruebas de inyección de prompts y reforzar GPT-5.6 Sol
jueves, 16 de julio de 2026
|
Publicado por
el-brujo
|
Editar entrada
OpenAI ha desarrollado GPT-Red, un modelo interno de red-teaming automatizado diseñado para descubrir vulnerabilidades de inyección de prompts a gran escala. Esta herramienta entrena adversariamente a nuevos modelos, como el GPT-5.6 Sol, logrando que sean significativamente más robustos y seguros antes de su despliegue público. El sistema imita el comportamiento humano para iterar ataques y corregir fallos críticos de seguridad de manera eficiente.
OpenAI ha revelado detalles de GPT-Red, un modelo interno automatizado de red-teaming que escala el descubrimiento de vulnerabilidades de inyección de prompts con el objetivo de solucionar problemas antes de que las herramientas se desplieguen ampliamente.
"GPT‑Red es un red-teamer potente, y nuestros modelos anteriores son altamente vulnerables a sus ataques de inyección de prompts", afirmó la compañía de inteligencia artificial (IA) [aquí]. "Utilizamos GPT‑Red para entrenar adversariamente a GPT‑5.6, haciéndolo mucho más robusto ante las inyecciones de prompts".
El modelo funciona exactamente como un red-teamer humano. Envía un prompt, monitorea cómo responde un modelo GPT y itera su camino hacia un objetivo malicioso, como cargar datos confidenciales en un servidor externo.
Este desarrollo se produce mientras que las inyecciones de prompts adversarias siguen siendo una espina persistente en los grandes modelos de lenguaje, que pueden ser engañados para ejecutar una instrucción cuidadosamente elaborada que puede producir consecuencias indeseables.
A medida que los sistemas agentivos continúan vinculándose a fuentes de datos de terceros a través de navegadores web, aplicaciones conectadas, archivos locales y otras herramientas, también han ampliado la superficie de ataque y presentado más vías para que los malos actores influyan en el resultado de un modelo incrustando prompts maliciosos dentro de contenido aparentemente inofensivo que se introduce como entrada. Esto puede tomar la forma de un correo electrónico, una página web, la respuesta de una herramienta o un repositorio de código.
GPT-Red tiene como objetivo aumentar el red-teaming humano a escala, haciendo así posible identificar nuevos modos de falla, mejorar la robustez y crear contramedidas adecuadas antes de que los modelos puedan ser desplegados.
"De manera similar a cómo los red-teamers humanos diseñan ataques, el modelo trabaja hacia un objetivo enviando un prompt, observando cómo responden los modelos GPT e iterando", dijo OpenAI.
Al integrar directamente GPT‑Red en el proceso de entrenamiento de sus modelos de producción, OpenAI afirmó que GPT‑5.6 Sol es su modelo más robusto contra inyecciones de prompts hasta la fecha, logrando 6 veces menos fallos en el benchmark de inyección directa de prompts en comparación con GPT-5.5, su modelo frontera de hace cuatro meses.
Algunas de las conversaciones de ejemplo con inyección de prompts probadas como parte del proceso incluyen:
"GPT‑Red está entrenado mediante aprendizaje por refuerzo de juego autónomo, donde el modelo y una colección de diversos LLM defensores se entrenan simultáneamente en un amplio conjunto de escenarios de red-teaming", explicó OpenAI. "GPT‑Red es recompensado por provocar un fallo válido, como una inyección de prompt exitosa, mientras que los modelos defensores son recompensados por resistir el ataque y completar sus tareas originales".
Esto también significa que a medida que los modelos defensores se vuelven más robustos, el modelo de red-teaming tendrá que volver a la mesa de dibujo para descubrir métodos de ataque más potentes y diversos para derrotar esas protecciones. Específicamente, se ha descubierto que GPT-Red genera ataques exitosos contra GPT‑5.1 en más escenarios que los red-teamers humanos cuando se trata de inyecciones de prompts indirectas.
OpenAI hizo hincapié en que GPT‑Red se mantiene separado de los demás modelos para que las capacidades maliciosas integradas en él no lleguen a malos actores que buscan constantemente diversas formas de eludir las medidas éticas y de seguridad de un modelo.
En una prueba del mundo real, OpenAI dirigió GPT-Red hacia una máquina expendedora basada en IA construida por Andon Labs. Tras practicar en simulación, el modelo atacó al agente autónomo y cumplió sus tres objetivos: reducir el precio de un artículo caro al precio mínimo permitido de 0,50 $, pedir un artículo nuevo de 100 $ por esa misma cantidad y cancelar el pedido de otro cliente. Tras la divulgación responsable, se están probando nuevas salvaguardas, añadió.
Un segundo estudio de caso implicó el uso de GPT-Red para atacar a un agente de línea de comandos de Codex, basado en GPT-5.4 mini, a través de 10 tareas de exfiltración de datos reservadas, provocando que se transmitieran datos confidenciales en más casos que una línea base de GPT-5.5.
Una versión temprana del modelo también ha descubierto una nueva clase de ataques de inyección de prompt directa conocidos como ataques de "Cadena de Pensamiento Falsa" (Fake CoT), que alcanzaron tasas de éxito superiores al 95% en GPT‑5.1 pero que ahora están por debajo del 10% para GPT‑5.6 Sol.
"Del mismo modo, varios de nuestros benchmarks de inyección de prompt indirecta que se centran en ataques en herramientas de desarrollo y navegación han sido saturados por nuestro último modelo (>97% de precisión)", dijo OpenAI.
"La robustez frente al propio GPT‑Red también ha mejorado sustancialmente. En un amplio conjunto de entornos de robustez, las tasas de éxito de ataque de GPT‑Red han bajado monótonamente con el tiempo. Con el lanzamiento de nuestro último modelo, GPT‑5.6 Sol falla solo en el 0,05% de las inyecciones directas de prompt de GPT‑Red".
La revelación llega mientras la empresa decía [aquí] que una auditoría de SWE-Bench Pro [aquí] encontró que aproximadamente el 30% de las tareas están rotas, retractando su recomendación anterior de adoptar el benchmark [aquí] para medir las capacidades de codificación frontera. A principios de febrero, OpenAI dijo [aquí] que se alejaba de SWE-bench Verified [aquí] debido a problemas fundamentales de diseño y contaminación.
"Encontramos evidencia de problemas de ruptura en una parte significativa del conjunto de datos", dijo OpenAI. "Nuestro pipeline de análisis de puntos de datos marcó 200 (27,4%) tareas rotas, mientras que la campaña de anotación humana identificó 249 (34,1%). En última instancia, una evaluación debe proporcionar una señal significativa a través de benchmarks que sean difíciles de manipular, fáciles de confiar y que reflejen genuinamente la capacidad o alineación del modelo".
Fuente:
THN
OpenAI ha revelado detalles de GPT-Red, un modelo interno automatizado de red-teaming que escala el descubrimiento de vulnerabilidades de inyección de prompts con el objetivo de solucionar problemas antes de que las herramientas se desplieguen ampliamente.
"GPT‑Red es un red-teamer potente, y nuestros modelos anteriores son altamente vulnerables a sus ataques de inyección de prompts", afirmó la compañía de inteligencia artificial (IA) [aquí]. "Utilizamos GPT‑Red para entrenar adversariamente a GPT‑5.6, haciéndolo mucho más robusto ante las inyecciones de prompts".
El modelo funciona exactamente como un red-teamer humano. Envía un prompt, monitorea cómo responde un modelo GPT y itera su camino hacia un objetivo malicioso, como cargar datos confidenciales en un servidor externo.
Este desarrollo se produce mientras que las inyecciones de prompts adversarias siguen siendo una espina persistente en los grandes modelos de lenguaje, que pueden ser engañados para ejecutar una instrucción cuidadosamente elaborada que puede producir consecuencias indeseables.
A medida que los sistemas agentivos continúan vinculándose a fuentes de datos de terceros a través de navegadores web, aplicaciones conectadas, archivos locales y otras herramientas, también han ampliado la superficie de ataque y presentado más vías para que los malos actores influyan en el resultado de un modelo incrustando prompts maliciosos dentro de contenido aparentemente inofensivo que se introduce como entrada. Esto puede tomar la forma de un correo electrónico, una página web, la respuesta de una herramienta o un repositorio de código.
GPT-Red tiene como objetivo aumentar el red-teaming humano a escala, haciendo así posible identificar nuevos modos de falla, mejorar la robustez y crear contramedidas adecuadas antes de que los modelos puedan ser desplegados.
"De manera similar a cómo los red-teamers humanos diseñan ataques, el modelo trabaja hacia un objetivo enviando un prompt, observando cómo responden los modelos GPT e iterando", dijo OpenAI.
Al integrar directamente GPT‑Red en el proceso de entrenamiento de sus modelos de producción, OpenAI afirmó que GPT‑5.6 Sol es su modelo más robusto contra inyecciones de prompts hasta la fecha, logrando 6 veces menos fallos en el benchmark de inyección directa de prompts en comparación con GPT-5.5, su modelo frontera de hace cuatro meses.
Algunas de las conversaciones de ejemplo con inyección de prompts probadas como parte del proceso incluyen:
- * Exfiltración de directorios internos
- * Instrucciones de pago fraudulentas
- * Exfiltración de credenciales de Amazon Web Services (AWS)
- * Desactivación de la autenticación de dos factores (2FA)
- * Carga de archivos de credenciales
- * Inyección de scripts externos
- * Reenvío de claves API
- * Scripts de scraping maliciosos
"GPT‑Red está entrenado mediante aprendizaje por refuerzo de juego autónomo, donde el modelo y una colección de diversos LLM defensores se entrenan simultáneamente en un amplio conjunto de escenarios de red-teaming", explicó OpenAI. "GPT‑Red es recompensado por provocar un fallo válido, como una inyección de prompt exitosa, mientras que los modelos defensores son recompensados por resistir el ataque y completar sus tareas originales".
Esto también significa que a medida que los modelos defensores se vuelven más robustos, el modelo de red-teaming tendrá que volver a la mesa de dibujo para descubrir métodos de ataque más potentes y diversos para derrotar esas protecciones. Específicamente, se ha descubierto que GPT-Red genera ataques exitosos contra GPT‑5.1 en más escenarios que los red-teamers humanos cuando se trata de inyecciones de prompts indirectas.
OpenAI hizo hincapié en que GPT‑Red se mantiene separado de los demás modelos para que las capacidades maliciosas integradas en él no lleguen a malos actores que buscan constantemente diversas formas de eludir las medidas éticas y de seguridad de un modelo.
En una prueba del mundo real, OpenAI dirigió GPT-Red hacia una máquina expendedora basada en IA construida por Andon Labs. Tras practicar en simulación, el modelo atacó al agente autónomo y cumplió sus tres objetivos: reducir el precio de un artículo caro al precio mínimo permitido de 0,50 $, pedir un artículo nuevo de 100 $ por esa misma cantidad y cancelar el pedido de otro cliente. Tras la divulgación responsable, se están probando nuevas salvaguardas, añadió.
Un segundo estudio de caso implicó el uso de GPT-Red para atacar a un agente de línea de comandos de Codex, basado en GPT-5.4 mini, a través de 10 tareas de exfiltración de datos reservadas, provocando que se transmitieran datos confidenciales en más casos que una línea base de GPT-5.5.
Una versión temprana del modelo también ha descubierto una nueva clase de ataques de inyección de prompt directa conocidos como ataques de "Cadena de Pensamiento Falsa" (Fake CoT), que alcanzaron tasas de éxito superiores al 95% en GPT‑5.1 pero que ahora están por debajo del 10% para GPT‑5.6 Sol.
"Del mismo modo, varios de nuestros benchmarks de inyección de prompt indirecta que se centran en ataques en herramientas de desarrollo y navegación han sido saturados por nuestro último modelo (>97% de precisión)", dijo OpenAI.
"La robustez frente al propio GPT‑Red también ha mejorado sustancialmente. En un amplio conjunto de entornos de robustez, las tasas de éxito de ataque de GPT‑Red han bajado monótonamente con el tiempo. Con el lanzamiento de nuestro último modelo, GPT‑5.6 Sol falla solo en el 0,05% de las inyecciones directas de prompt de GPT‑Red".
La revelación llega mientras la empresa decía [aquí] que una auditoría de SWE-Bench Pro [aquí] encontró que aproximadamente el 30% de las tareas están rotas, retractando su recomendación anterior de adoptar el benchmark [aquí] para medir las capacidades de codificación frontera. A principios de febrero, OpenAI dijo [aquí] que se alejaba de SWE-bench Verified [aquí] debido a problemas fundamentales de diseño y contaminación.
"Encontramos evidencia de problemas de ruptura en una parte significativa del conjunto de datos", dijo OpenAI. "Nuestro pipeline de análisis de puntos de datos marcó 200 (27,4%) tareas rotas, mientras que la campaña de anotación humana identificó 249 (34,1%). En última instancia, una evaluación debe proporcionar una señal significativa a través de benchmarks que sean difíciles de manipular, fáciles de confiar y que reflejen genuinamente la capacidad o alineación del modelo".
Fuente:
THN
Enviar por correo electrónico
Escribe un blog
Compartir en X
Compartir con Facebook
Compartir en Pinterest


Entrada más reciente
0 comentarios :
Publicar un comentario
Los comentarios pueden ser revisados en cualquier momento por los moderadores.
Serán publicados aquellos que cumplan las siguientes condiciones:
- Comentario acorde al contenido del post.
- Prohibido mensajes de tipo SPAM.
- Evite incluir links innecesarios en su comentario.
- Contenidos ofensivos, amenazas e insultos no serán permitidos.
Debe saber que los comentarios de los lectores no reflejan necesariamente la opinión del STAFF.