Tutoriales y Manuales
Entradas Mensuales
-
▼
2026
(Total:
6052
)
-
▼
julio
(Total:
710
)
-
Microsoft pierde dinero con Xbox Series X-S
-
iPhone 20: lo último
-
Vulnerabilidad en NVIDIA BlueField permite ejecuci...
-
Apple apuesta por las suscripciones
-
BlueNoroff lanza kit de phishing de Zoom que anali...
-
Gemini para Mac se renueva con una función impresc...
-
Intel logra fabricar chips gigantes
-
Samsung multiplicó sus beneficios x19 en el Q2 202...
-
Falso instalador de Flash Player usa certificado d...
-
Seagate planea lanzar discos duros Mozaic 5 de 50 ...
-
Las Radeon RX 9070 XT más baratas son más propensa...
-
GitLab corrige 13 fallos de seguridad que filtran ...
-
Campaña de minería en Linux usa PAM para ocultar b...
-
Llamada de Teams de dos minutos podría cifrar tu r...
-
Estafa de nueve años clona webs de empresas rusas ...
-
Explotan vulnerabilidad 0-day de Cisco FMC para ro...
-
Desarrollador afirma que Claude Opus 5 borró una b...
-
Node.js corrige 11 fallos de seguridad que pueden ...
-
Ciberplataforma que convierte llamadas de soporte ...
-
Raspberry Pi revela datos ocultos del operador DNS
-
SK Hynix consigue aumentar sus ganancias en un 557...
-
Vulnerabilidad en Copilot de Word convierte prompt...
-
Rusos aprovechan fallo de Microsoft OWA para mante...
-
ChatGPT llega a Linux
-
IA engaña y traiciona al gestionar un negocio sola
-
TA488 pudo explotar fallo 0-day de Outlook antes d...
-
Pixel 11 Pro: teaser de Pixel Glow
-
Nuevo ransomware GenieLocker ataca Windows, ESXi y...
-
Logitech lanza ratones con batería reemplazable en...
-
Chrome 151 corrige 370 fallos de seguridad, siete ...
-
Firefox añade función vídeos HDR para Windows 11
-
Fallo en Ruflo MCP permite a atacantes no autentic...
-
EEUU prohíbe robots extranjeros
-
Paquetes npm de Joyfill hackeados despliegan RAT y...
-
vBulletin soluciona vulnerabilidad crítica de RCE ...
-
Anthropic admite que Claude puede vulnerar el cifr...
-
Vulnerabilidad Zero-Day en Cisco FMC explotada act...
-
Grave fallo en Rails permitiría a atacantes leer a...
-
Fallo crítico en Rails permite leer archivos y eje...
-
Caída global de Claude afecta a usuarios con error...
-
1Password limita la IA
-
Gusano informático se infiltra en Copilot y desata...
-
Sospechan que CyberAv3ngers, vinculados a Irán, es...
-
Rusos roban claves de Signal para secuestrar cuent...
-
GOG Galaxy llega a Linux
-
eBay pagará 56 millones por acosar a periodistas
-
Phishing con IA ya no requiere malware: roba sesio...
-
Mejores lectores de eBooks para Linux
-
WhatsApp añade cifrado de extremo a extremo a llam...
-
Vulnerabilidad de 20 años permite controlar miles ...
-
Apple creará un iPad sumergible
-
Los primeros dispositivos de OpenAI: altavoz, smar...
-
Publican PoC para el bypass de autenticación explo...
-
Rusia acusa al CEO de Telegram, Pavel Durov, de ay...
-
Aparece un Intel Core i9-14901KE con únicamente 8 ...
-
Presunta brecha de datos en Revolut: dicen acceder...
-
Paquetes maliciosos de npm despliegan RAT contra d...
-
NVIDIA impulsa la Alianza Segura Open Source para ...
-
Filtración de datos en Bank of Baroda: accedieron ...
-
DEF CON prohíbe las gafas perversas al estilo de Meta
-
Botnet Tengu reinicia dispositivos Linux infectado...
-
Primer ciberataque de agente de IA autónomo infilt...
-
OpenAI libera Codex Security CLI para hallar y cor...
-
Vulnerabilidad crítica en Gitea permite ejecución ...
-
Puerta trasera en plugin Advanced Responsive Video...
-
Nuevo fallo de RCE en Gitea permite a redactores d...
-
Filtran cientos de chats de Claude por falta de in...
-
Fabricantes chinos lanzan portátiles con GPUs GeFo...
-
IA descubre zero-day en kernel de Linux para escal...
-
Radeon RX 9050: especificaciones
-
JFrog confirma que los modelos de OpenAI aprovecha...
-
Kimi K3: la IA china que desafía a OpenAI y Anthropic
-
PortSwigger lanza Burp AT Agentic AI para pruebas ...
-
Claude AI descifra esquema de prueba post-cuántica...
-
Estafadores fingen ser ShinyHunters para chantajea...
-
Investigadores: empresa fantasma china creó la red...
-
Nueva botnet Tengu Mirai reinicia tu IoT si intent...
-
Amodei niega querer prohibir la IA de código abierto
-
App del Vaticano expone a 700.000 usuarios por fal...
-
Filtración de datos en la firma de facturación méd...
-
Múltiples vulnerabilidades de FFmpeg permiten corr...
-
Botnet DDoS Dysphoria se extiende a 200.000 dispos...
-
Profesor atrapa a 32 alumnos copiando con IA media...
-
Microsoft afirma que su nuevo modelo de IA para ci...
-
Claude Opus 5 de Anthropic llega a AWS con mejoras...
-
Backups a tu NAS QNAP en 3 pasos: guía con HDP PC ...
-
Phineas Fisher, el hacker más famoso del mundo, si...
-
Fuga de Sandbox en n8n permite a editores de flujo...
-
Ubuntu 26.04 LTS impulsa la computación confidencial
-
Coca-Cola confirma robo de datos tras ataque de ra...
-
La botnet de IoT Dysphoria implementa C2 de blockc...
-
GitHub combate el malware
-
Alianza contra ciberataques de IA
-
El Explorador de Windows 11 borra archivos grandes...
-
Investigadores inician iOS 27 con jailbreak en iPh...
-
Fallo crítico de vBulletin permite ejecución remot...
-
Guía básica del SoC y su importancia
-
Bandas de ransomware atacan VPN de Palo Alto, Fort...
-
GitHub implementa periodo de espera de 3 días en D...
-
Movistar y Orange activan Starlink en zonas incend...
-
Zen 7 cerrará AM5 y Zen 8 ya se desarrolla
-
ChatGPT quiere que vincules tus datos de salud a s...
-
Fuga de datos en app del Papa
-
Fallo de AgentForger en ChatGPT permitiría despleg...
-
Ocho fallos de NodeBB permiten leer chats privados...
-
El precio de las tarjetas gráficas continúa subien...
-
Chats compartidos de Claude AI expuestos en Google
-
Ataques aprovechan vulnerabilidad RCE de Fastjson ...
-
OpenAI tardó diez días en informar a Hugging Face ...
-
AMD confirma que sus CPU EPYC «Florence» basadas e...
-
Europol identifica 4.340 URLs para su eliminación ...
-
SourTrade crea malware en navegadores para evadir ...
-
Hombre condenado a seis años de prisión por hackea...
-
Cómo los logs de infostealers impulsan filtracione...
-
Google lanza actualización urgente de Chrome por c...
-
Fallos de seguridad en cada script de ChatGPT, Cop...
-
Apache Syncope parchea vulnerabilidades de RCE e i...
-
Guías online para tus vacaciones
-
YouTube crea IA para miniaturas
-
CXMT ya se permite el lujo de cobrar más que Samsu...
-
PentesterFlow: IA para automatizar flujos de pente...
-
Qualcomm aumentará el precio de todos sus chips: l...
-
Microsoft eliminará dos funciones de Copilot el pr...
-
Cuatro novedades de WhatsApp
-
Vulnerabilidades de GitLab permiten ejecución remo...
-
Claude Code optimiza el desarrollo para iPhone
-
Se cumplen 20 años desde la compra de ATI Technolo...
-
Afiliados de Cl0p explotan vulnerabilidades de RCE...
-
-
▼
julio
(Total:
710
)
-
►
2025
(Total:
2103
)
- ► septiembre (Total: 148 )
-
►
2024
(Total:
1110
)
- ► septiembre (Total: 50 )
-
►
2023
(Total:
710
)
- ► septiembre (Total: 65 )
-
►
2022
(Total:
967
)
- ► septiembre (Total: 72 )
-
►
2021
(Total:
730
)
- ► septiembre (Total: 56 )
-
►
2020
(Total:
212
)
- ► septiembre (Total: 21 )
-
►
2019
(Total:
102
)
- ► septiembre (Total: 14 )
-
►
2017
(Total:
231
)
- ► septiembre (Total: 16 )
-
►
2016
(Total:
266
)
- ► septiembre (Total: 38 )
-
►
2015
(Total:
445
)
- ► septiembre (Total: 47 )
-
►
2014
(Total:
185
)
- ► septiembre (Total: 18 )
-
►
2013
(Total:
100
)
- ► septiembre (Total: 3 )
-
►
2011
(Total:
7
)
- ► septiembre (Total: 1 )
Blogroll
Etiquetas
seguridad
(
1616
)
vulnerabilidad
(
1565
)
software
(
896
)
hardware
(
842
)
google
(
742
)
Malware
(
708
)
privacidad
(
646
)
Windows
(
521
)
ransomware
(
518
)
android
(
453
)
exploit
(
403
)
linux
(
383
)
cve
(
371
)
tutorial
(
299
)
nvidia
(
288
)
manual
(
282
)
hacking
(
244
)
WhatsApp
(
173
)
ssd
(
173
)
ddos
(
134
)
Wifi
(
131
)
app
(
126
)
cifrado
(
121
)
twitter
(
121
)
programación
(
105
)
youtube
(
82
)
herramientas
(
80
)
firefox
(
76
)
Networking
(
73
)
sysadmin
(
72
)
firmware
(
71
)
adobe
(
65
)
office
(
62
)
hack
(
50
)
Kernel
(
49
)
antivirus
(
49
)
javascript
(
48
)
apache
(
46
)
juegos
(
42
)
contraseñas
(
39
)
multimedia
(
36
)
cms
(
35
)
eventos
(
32
)
flash
(
32
)
MAC
(
30
)
anonymous
(
28
)
ssl
(
24
)
Forense
(
20
)
conferencia
(
20
)
SeguridadWireless
(
17
)
documental
(
17
)
auditoría
(
15
)
Debugger
(
14
)
Rootkit
(
14
)
lizard squad
(
14
)
metasploit
(
13
)
técnicas hacking
(
13
)
Virtualización
(
11
)
delitos
(
11
)
reversing
(
10
)
adamo
(
9
)
Ehn-Dev
(
7
)
MAC Adress
(
6
)
antimalware
(
6
)
oclHashcat
(
5
)
Entradas populares
-
Google prepara el lanzamiento de Pixel Tag , un localizador de objetos similar al AirTag para llenar el hueco de hardware en su ecosistema A...
-
Revolut está siendo investigada luego de que unos hackers afirmaran estar vendiendo una base de datos con registros de más de 75 millones de...
-
El protocolo de finanzas descentralizadas. Poly Network, ha ofrecido a la persona responsable de un hackeo de USD 611 millones un puesto...
OpenAI usa GPT-Red para automatizar pruebas de inyección de prompts y reforzar GPT-5.6 Sol
jueves, 16 de julio de 2026
|
Publicado por
el-brujo
|
Editar entrada
OpenAI ha desarrollado GPT-Red, un modelo interno de red-teaming automatizado diseñado para descubrir vulnerabilidades de inyección de prompts a gran escala. Esta herramienta entrena adversariamente a nuevos modelos, como el GPT-5.6 Sol, logrando que sean significativamente más robustos y seguros antes de su despliegue público. El sistema imita el comportamiento humano para iterar ataques y corregir fallos críticos de seguridad de manera eficiente.
OpenAI ha revelado detalles de GPT-Red, un modelo interno automatizado de red-teaming que escala el descubrimiento de vulnerabilidades de inyección de prompts con el objetivo de solucionar problemas antes de que las herramientas se desplieguen ampliamente.
"GPT‑Red es un red-teamer potente, y nuestros modelos anteriores son altamente vulnerables a sus ataques de inyección de prompts", afirmó la compañía de inteligencia artificial (IA) [aquí]. "Utilizamos GPT‑Red para entrenar adversariamente a GPT‑5.6, haciéndolo mucho más robusto ante las inyecciones de prompts".
El modelo funciona exactamente como un red-teamer humano. Envía un prompt, monitorea cómo responde un modelo GPT y itera su camino hacia un objetivo malicioso, como cargar datos confidenciales en un servidor externo.
Este desarrollo se produce mientras que las inyecciones de prompts adversarias siguen siendo una espina persistente en los grandes modelos de lenguaje, que pueden ser engañados para ejecutar una instrucción cuidadosamente elaborada que puede producir consecuencias indeseables.
A medida que los sistemas agentivos continúan vinculándose a fuentes de datos de terceros a través de navegadores web, aplicaciones conectadas, archivos locales y otras herramientas, también han ampliado la superficie de ataque y presentado más vías para que los malos actores influyan en el resultado de un modelo incrustando prompts maliciosos dentro de contenido aparentemente inofensivo que se introduce como entrada. Esto puede tomar la forma de un correo electrónico, una página web, la respuesta de una herramienta o un repositorio de código.
GPT-Red tiene como objetivo aumentar el red-teaming humano a escala, haciendo así posible identificar nuevos modos de falla, mejorar la robustez y crear contramedidas adecuadas antes de que los modelos puedan ser desplegados.
"De manera similar a cómo los red-teamers humanos diseñan ataques, el modelo trabaja hacia un objetivo enviando un prompt, observando cómo responden los modelos GPT e iterando", dijo OpenAI.
Al integrar directamente GPT‑Red en el proceso de entrenamiento de sus modelos de producción, OpenAI afirmó que GPT‑5.6 Sol es su modelo más robusto contra inyecciones de prompts hasta la fecha, logrando 6 veces menos fallos en el benchmark de inyección directa de prompts en comparación con GPT-5.5, su modelo frontera de hace cuatro meses.
Algunas de las conversaciones de ejemplo con inyección de prompts probadas como parte del proceso incluyen:
"GPT‑Red está entrenado mediante aprendizaje por refuerzo de juego autónomo, donde el modelo y una colección de diversos LLM defensores se entrenan simultáneamente en un amplio conjunto de escenarios de red-teaming", explicó OpenAI. "GPT‑Red es recompensado por provocar un fallo válido, como una inyección de prompt exitosa, mientras que los modelos defensores son recompensados por resistir el ataque y completar sus tareas originales".
Esto también significa que a medida que los modelos defensores se vuelven más robustos, el modelo de red-teaming tendrá que volver a la mesa de dibujo para descubrir métodos de ataque más potentes y diversos para derrotar esas protecciones. Específicamente, se ha descubierto que GPT-Red genera ataques exitosos contra GPT‑5.1 en más escenarios que los red-teamers humanos cuando se trata de inyecciones de prompts indirectas.
OpenAI hizo hincapié en que GPT‑Red se mantiene separado de los demás modelos para que las capacidades maliciosas integradas en él no lleguen a malos actores que buscan constantemente diversas formas de eludir las medidas éticas y de seguridad de un modelo.
En una prueba del mundo real, OpenAI dirigió GPT-Red hacia una máquina expendedora basada en IA construida por Andon Labs. Tras practicar en simulación, el modelo atacó al agente autónomo y cumplió sus tres objetivos: reducir el precio de un artículo caro al precio mínimo permitido de 0,50 $, pedir un artículo nuevo de 100 $ por esa misma cantidad y cancelar el pedido de otro cliente. Tras la divulgación responsable, se están probando nuevas salvaguardas, añadió.
Un segundo estudio de caso implicó el uso de GPT-Red para atacar a un agente de línea de comandos de Codex, basado en GPT-5.4 mini, a través de 10 tareas de exfiltración de datos reservadas, provocando que se transmitieran datos confidenciales en más casos que una línea base de GPT-5.5.
Una versión temprana del modelo también ha descubierto una nueva clase de ataques de inyección de prompt directa conocidos como ataques de "Cadena de Pensamiento Falsa" (Fake CoT), que alcanzaron tasas de éxito superiores al 95% en GPT‑5.1 pero que ahora están por debajo del 10% para GPT‑5.6 Sol.
"Del mismo modo, varios de nuestros benchmarks de inyección de prompt indirecta que se centran en ataques en herramientas de desarrollo y navegación han sido saturados por nuestro último modelo (>97% de precisión)", dijo OpenAI.
"La robustez frente al propio GPT‑Red también ha mejorado sustancialmente. En un amplio conjunto de entornos de robustez, las tasas de éxito de ataque de GPT‑Red han bajado monótonamente con el tiempo. Con el lanzamiento de nuestro último modelo, GPT‑5.6 Sol falla solo en el 0,05% de las inyecciones directas de prompt de GPT‑Red".
La revelación llega mientras la empresa decía [aquí] que una auditoría de SWE-Bench Pro [aquí] encontró que aproximadamente el 30% de las tareas están rotas, retractando su recomendación anterior de adoptar el benchmark [aquí] para medir las capacidades de codificación frontera. A principios de febrero, OpenAI dijo [aquí] que se alejaba de SWE-bench Verified [aquí] debido a problemas fundamentales de diseño y contaminación.
"Encontramos evidencia de problemas de ruptura en una parte significativa del conjunto de datos", dijo OpenAI. "Nuestro pipeline de análisis de puntos de datos marcó 200 (27,4%) tareas rotas, mientras que la campaña de anotación humana identificó 249 (34,1%). En última instancia, una evaluación debe proporcionar una señal significativa a través de benchmarks que sean difíciles de manipular, fáciles de confiar y que reflejen genuinamente la capacidad o alineación del modelo".
Fuente:
THN
OpenAI ha revelado detalles de GPT-Red, un modelo interno automatizado de red-teaming que escala el descubrimiento de vulnerabilidades de inyección de prompts con el objetivo de solucionar problemas antes de que las herramientas se desplieguen ampliamente.
"GPT‑Red es un red-teamer potente, y nuestros modelos anteriores son altamente vulnerables a sus ataques de inyección de prompts", afirmó la compañía de inteligencia artificial (IA) [aquí]. "Utilizamos GPT‑Red para entrenar adversariamente a GPT‑5.6, haciéndolo mucho más robusto ante las inyecciones de prompts".
El modelo funciona exactamente como un red-teamer humano. Envía un prompt, monitorea cómo responde un modelo GPT y itera su camino hacia un objetivo malicioso, como cargar datos confidenciales en un servidor externo.
Este desarrollo se produce mientras que las inyecciones de prompts adversarias siguen siendo una espina persistente en los grandes modelos de lenguaje, que pueden ser engañados para ejecutar una instrucción cuidadosamente elaborada que puede producir consecuencias indeseables.
A medida que los sistemas agentivos continúan vinculándose a fuentes de datos de terceros a través de navegadores web, aplicaciones conectadas, archivos locales y otras herramientas, también han ampliado la superficie de ataque y presentado más vías para que los malos actores influyan en el resultado de un modelo incrustando prompts maliciosos dentro de contenido aparentemente inofensivo que se introduce como entrada. Esto puede tomar la forma de un correo electrónico, una página web, la respuesta de una herramienta o un repositorio de código.
GPT-Red tiene como objetivo aumentar el red-teaming humano a escala, haciendo así posible identificar nuevos modos de falla, mejorar la robustez y crear contramedidas adecuadas antes de que los modelos puedan ser desplegados.
"De manera similar a cómo los red-teamers humanos diseñan ataques, el modelo trabaja hacia un objetivo enviando un prompt, observando cómo responden los modelos GPT e iterando", dijo OpenAI.
Al integrar directamente GPT‑Red en el proceso de entrenamiento de sus modelos de producción, OpenAI afirmó que GPT‑5.6 Sol es su modelo más robusto contra inyecciones de prompts hasta la fecha, logrando 6 veces menos fallos en el benchmark de inyección directa de prompts en comparación con GPT-5.5, su modelo frontera de hace cuatro meses.
Algunas de las conversaciones de ejemplo con inyección de prompts probadas como parte del proceso incluyen:
- * Exfiltración de directorios internos
- * Instrucciones de pago fraudulentas
- * Exfiltración de credenciales de Amazon Web Services (AWS)
- * Desactivación de la autenticación de dos factores (2FA)
- * Carga de archivos de credenciales
- * Inyección de scripts externos
- * Reenvío de claves API
- * Scripts de scraping maliciosos
"GPT‑Red está entrenado mediante aprendizaje por refuerzo de juego autónomo, donde el modelo y una colección de diversos LLM defensores se entrenan simultáneamente en un amplio conjunto de escenarios de red-teaming", explicó OpenAI. "GPT‑Red es recompensado por provocar un fallo válido, como una inyección de prompt exitosa, mientras que los modelos defensores son recompensados por resistir el ataque y completar sus tareas originales".
Esto también significa que a medida que los modelos defensores se vuelven más robustos, el modelo de red-teaming tendrá que volver a la mesa de dibujo para descubrir métodos de ataque más potentes y diversos para derrotar esas protecciones. Específicamente, se ha descubierto que GPT-Red genera ataques exitosos contra GPT‑5.1 en más escenarios que los red-teamers humanos cuando se trata de inyecciones de prompts indirectas.
OpenAI hizo hincapié en que GPT‑Red se mantiene separado de los demás modelos para que las capacidades maliciosas integradas en él no lleguen a malos actores que buscan constantemente diversas formas de eludir las medidas éticas y de seguridad de un modelo.
En una prueba del mundo real, OpenAI dirigió GPT-Red hacia una máquina expendedora basada en IA construida por Andon Labs. Tras practicar en simulación, el modelo atacó al agente autónomo y cumplió sus tres objetivos: reducir el precio de un artículo caro al precio mínimo permitido de 0,50 $, pedir un artículo nuevo de 100 $ por esa misma cantidad y cancelar el pedido de otro cliente. Tras la divulgación responsable, se están probando nuevas salvaguardas, añadió.
Un segundo estudio de caso implicó el uso de GPT-Red para atacar a un agente de línea de comandos de Codex, basado en GPT-5.4 mini, a través de 10 tareas de exfiltración de datos reservadas, provocando que se transmitieran datos confidenciales en más casos que una línea base de GPT-5.5.
Una versión temprana del modelo también ha descubierto una nueva clase de ataques de inyección de prompt directa conocidos como ataques de "Cadena de Pensamiento Falsa" (Fake CoT), que alcanzaron tasas de éxito superiores al 95% en GPT‑5.1 pero que ahora están por debajo del 10% para GPT‑5.6 Sol.
"Del mismo modo, varios de nuestros benchmarks de inyección de prompt indirecta que se centran en ataques en herramientas de desarrollo y navegación han sido saturados por nuestro último modelo (>97% de precisión)", dijo OpenAI.
"La robustez frente al propio GPT‑Red también ha mejorado sustancialmente. En un amplio conjunto de entornos de robustez, las tasas de éxito de ataque de GPT‑Red han bajado monótonamente con el tiempo. Con el lanzamiento de nuestro último modelo, GPT‑5.6 Sol falla solo en el 0,05% de las inyecciones directas de prompt de GPT‑Red".
La revelación llega mientras la empresa decía [aquí] que una auditoría de SWE-Bench Pro [aquí] encontró que aproximadamente el 30% de las tareas están rotas, retractando su recomendación anterior de adoptar el benchmark [aquí] para medir las capacidades de codificación frontera. A principios de febrero, OpenAI dijo [aquí] que se alejaba de SWE-bench Verified [aquí] debido a problemas fundamentales de diseño y contaminación.
"Encontramos evidencia de problemas de ruptura en una parte significativa del conjunto de datos", dijo OpenAI. "Nuestro pipeline de análisis de puntos de datos marcó 200 (27,4%) tareas rotas, mientras que la campaña de anotación humana identificó 249 (34,1%). En última instancia, una evaluación debe proporcionar una señal significativa a través de benchmarks que sean difíciles de manipular, fáciles de confiar y que reflejen genuinamente la capacidad o alineación del modelo".
Fuente:
THN
Enviar por correo electrónico
Escribe un blog
Compartir en X
Compartir con Facebook
Compartir en Pinterest


Entrada más reciente
0 comentarios :
Publicar un comentario
Los comentarios pueden ser revisados en cualquier momento por los moderadores.
Serán publicados aquellos que cumplan las siguientes condiciones:
- Comentario acorde al contenido del post.
- Prohibido mensajes de tipo SPAM.
- Evite incluir links innecesarios en su comentario.
- Contenidos ofensivos, amenazas e insultos no serán permitidos.
Debe saber que los comentarios de los lectores no reflejan necesariamente la opinión del STAFF.