Tutoriales y Manuales
Entradas Mensuales
-
▼
2026
(Total:
6060
)
-
▼
agosto
(Total:
68
)
-
Puppy Linux revive portátiles antiguos
-
Nueva app Fotos de Windows 11: cambios polémicos
-
GTX 1050 Ti funcional por 2 euros
-
AMD Zen 6 usará CPPC Performance Priority y EPP Bo...
-
GPT-Red: el modelo hacker de OpenAI
-
Microsoft actualiza apps de Windows 11
-
Explotan casi una de cada cuatro vulnerabilidades ...
-
Pixel 11: más caros y con menos RAM
-
Google elimina app de AI Studio
-
El manual original del Legend of Zelda de Nintendo...
-
¿Ves esta GeForce RTX 5060 Ti completamente doblad...
-
Memoria DDR5 de 500 euros al precio de una hamburg...
-
Microsoft creará una superapp de Copilot
-
Irán sospechoso de ciberataques a proveedores de a...
-
WhatsApp permite responder fotos sin salir de la i...
-
Europa obliga a etiquetar deepfakes
-
IA inventa mapa de África en foro de EE UU
-
Estafa con RTX 5070 Ti: recibió agua en vez de tar...
-
Windows 11 optimiza el menú contextual
-
Gemini Robotics ER 2: cerebro robótico avanzado
-
Anthropic afirma que Claude confundió la red abier...
-
Spotify transforma playlists en historias
-
Aumento de los ciberataques dirigidos a los contro...
-
Amazon gasta 1,8 millones por error con IA
-
Agente Hermes de DeepSeek lanza ciberataques autón...
-
ShutterGap expone millones de recursos de AWS entr...
-
Nike lanza zapatillas de recuperación inteligente
-
Comparativa mejores WAF
-
Estados Unidos prohíbe la importación de robots po...
-
Samsung prevé escasez de RAM el próximo año
-
Meta invierte 8.000 millones en IA
-
Bot de SSH analiza CPU, GPU y RAM de Linux antes d...
-
OpenAI abarata sus modelos pequeños para captar fo...
-
Google Earth + Nano Banana: una interesante idea q...
-
Google usa IA para corregir 1.072 fallos de Chrome
-
Vulnerabilidad en FFmpeg de Home Assistant permite...
-
Fallo crítico de JetBrains permite ejecutar código...
-
Nuevas puertas traseras permiten espiar y controla...
-
Tras la intrusión: qué hacen los atacantes una vez...
-
Apple lanza importantes actualizaciones y corrige ...
-
Red Hat impulsa Flatpak con Firefox y Thunderbird
-
Compra un MacBook Pro M3 con una pantalla defectuo...
-
Los kits de phishing más usados
-
UE obliga a etiquetar todo contenido IA
-
Arch Linux pausa adopción de paquetes en AUR
-
CyberStrike: Plataforma de IA para pruebas de pene...
-
Cargador HollowFrame despliega el backdoor Matryos...
-
IA: vecinos denuncian ruido de centro de datos
-
Origin confirma filtración de datos de 900.000 cli...
-
Google lanza Pixel Tag
-
Administrador de tareas llega a Mac
-
Snapdragon sube precios
-
IA de Anthropic hackea tres organizaciones
-
HackerOne exige verificación de identidad para rep...
-
Gemini Spark automatiza tareas en Chrome
-
Grave vulnerabilidad en Adobe Campaign Classic per...
-
Centro de compras universitarias de Escocia confir...
-
Apple iOS 26.6 corrige fallos de ejecución de códi...
-
ASUS lanza beta de Zenni Claw
-
Google crea IA para robots que piensan y actúan
-
Vivaldi: alternativas a uBlock Origin
-
Vulnerabilidad de Keycloak expone nombres y correo...
-
Usan 0-day de FastJson para atacar organizaciones ...
-
SK hynix ya prepara el salto a la memoria DRAM LPD...
-
Telegram lanza editor enriquecido, comunidades y m...
-
WhatsApp permitirá editar estados
-
Modelos de OpenAI explotan Zero-Day de JFrog Artif...
-
VulnGym usa IA para evaluar estrategias de parcheo...
-
-
▼
agosto
(Total:
68
)
-
►
2025
(Total:
2103
)
- ► septiembre (Total: 148 )
-
►
2024
(Total:
1110
)
- ► septiembre (Total: 50 )
-
►
2023
(Total:
710
)
- ► septiembre (Total: 65 )
-
►
2022
(Total:
967
)
- ► septiembre (Total: 72 )
-
►
2021
(Total:
730
)
- ► septiembre (Total: 56 )
-
►
2020
(Total:
212
)
- ► septiembre (Total: 21 )
-
►
2019
(Total:
102
)
- ► septiembre (Total: 14 )
-
►
2017
(Total:
231
)
- ► septiembre (Total: 16 )
-
►
2016
(Total:
266
)
- ► septiembre (Total: 38 )
-
►
2015
(Total:
445
)
- ► septiembre (Total: 47 )
-
►
2014
(Total:
185
)
- ► septiembre (Total: 18 )
-
►
2013
(Total:
100
)
- ► septiembre (Total: 3 )
-
►
2011
(Total:
7
)
- ► septiembre (Total: 1 )
Blogroll
Etiquetas
Entradas populares
-
Google prepara el lanzamiento de Pixel Tag , un localizador de objetos similar al AirTag para llenar el hueco de hardware en su ecosistema A...
-
Revolut está siendo investigada luego de que unos hackers afirmaran estar vendiendo una base de datos con registros de más de 75 millones de...
-
Un usuario de Reddit adquirió una memoria DDR5 de 32 GB valorada en 500 euros por solo 12,50 euros en una tienda de segunda mano.
GPT-Red: el modelo hacker de OpenAI
- GPT-Red es una herramienta confidencial desarrollada por OpenAI con el objetivo de actuar como un modelo "superhacker".
- La finalidad de este sistema es detectar fallos y vulnerabilidades de forma preventiva, adelantándose a los errores que podrían ser descubiertos por investigadores o atacantes externos una vez que el modelo sea lanzado al público.
Una inteligencia artificial cuyo único objetivo sea intentar hackear a otras inteligencias artificiales. Suena un tanto extraño, pero eso es exactamente lo que ha creado OpenAI con GPT-Red, un modelo que, al menos en un principio, nunca llegará al público y que ha sido creado para encontrar fallos de seguridad antes de que lo hagan los ciberdelincuentes.
A diferencia de ChatGPT o de otros modelos de la compañía, GPT-Red no responde preguntas ni ayuda a programar. Su trabajo consiste en actuar como un superhacker: intenta engañar a otros modelos de IA, saltarse sus restricciones y descubrir vulnerabilidades que podrían ser aprovechadas por un ciberdelincuente.
Solo cuando consigue romper sus defensas, los ingenieros pueden corregir esos fallos antes de lanzar el modelo al público. Puede parecer una idea un tanto rara, pero ciertamente tiene todo el sentido del mundo.
¿Qué es GPT-Red?
GPT-Red es un modelo de lenguaje especializado en red teaming, una técnica utilizada desde hace años en ciberseguridad que consiste en atacar un sistema para descubrir sus puntos débiles antes que un atacante real.
Normalmente, este trabajo lo hacen expertos humanos que intentan romper las defensas de un programa buscando errores, vulnerabilidades o formas raras de hacerlo fallar. El problema es que este proceso requiere mucho tiempo y resulta casi imposible de escalar cuando los propios modelos de IA mejoran tan rápido y se usan para los ataques.
Para resolver ese problema, OpenAI decidió crear un modelo capaz de hacer ese trabajo de forma automática. En lugar de responder preguntas como ChatGPT, GPT-Red tiene un único objetivo: encontrar la manera de engañar a otros modelos.
Su especialidad son los llamados ataques de inyección de prompts (prompt injection). Consisten en dar instrucciones ocultas dentro de documentos, páginas web, correos electrónicos o cualquier otro contenido que una IA pueda leer para conseguir que se salte sus instrucciones y haga algo que nunca debería hacer, como dar información confidencial, modificar datos o realizar acciones que no debería.
¿Cómo aprende a convertirse en un "superhacker"?
GPT-Red no fue entrenado con una lista de ataques escritos por personas. OpenAI utilizó una técnica llamada autojuego (self-play). En lugar de enfrentarlo a hackers humanos, lo puso a competir todo el tiempo contra otros modelos de inteligencia artificial.
Como realmente funciona, recuerda mucho al entrenamiento de programas como AlphaGo o AlphaZero. Un modelo intenta atacar mientras el otro intenta defenderse.
Cada vez que el atacante encuentra una nueva forma de romper las defensas, recibe una recompensa durante el entrenamiento. Al mismo tiempo, el modelo atacado aprende a protegerse frente a ese nuevo método.
Después de miles y miles de enfrentamientos, ambos mejoran todo el tiempo. Además, según las pruebas, GPT-Red demostró ser muy persistente. Cada vez que encontraba un pequeño fallo, lo probaba una y otra vez de formas distintas hasta dar con la mejor forma de romper el sistema de su rival.
Pero esto no es todo y, para realmente ver de qué era capaz, en OpenAI lo pusieron a prueba repitiendo un examen que varios expertos humanos hicieron en 2025 sobre una versión antigua de GPT-5.
El resultado fue que GPT-Red encontró más fallos y más rápido que los profesionales humanos. En concreto, este modelo superhacker consiguió saltarse sus defensas el 90% de las veces.
Sin embargo, al probar esos mismos ataques contra el nuevo GPT-5.6, la tasa de éxito bajó a menos del 23%, demostrando que esto no solo va de encontrar fallos sino de que los modelos también aprendan a protegerse.
También lo probaron contra Vendy, una inteligencia artificial que gestiona máquinas expendedoras de refrescos, y logró hackearla para cambiar los precios de las bebidas y cancelar pedidos de clientes.
¿Podrás algún día utilizar GPT-Red?
Parece que la respuesta es que no. Esta IA ha sido entrenada para algo que poco tiene que ver con el usuario de a pie. OpenAI ha confirmado que permanecerá como una herramienta solo para uso interno.
En su lugar, lo que llegará al público serán los resultados de su trabajo: modelos más resistentes, con menos vulnerabilidades y mejor preparados para soportar intentos de manipulación.
Fuentes:
https://computerhoy.20minutos.es/tecnologia/que-es-gpt-red-modelo-superhacker-secreto-openai_7019539_0.html

Entrada más reciente
0 comentarios :
Publicar un comentario
Los comentarios pueden ser revisados en cualquier momento por los moderadores.
Serán publicados aquellos que cumplan las siguientes condiciones:
- Comentario acorde al contenido del post.
- Prohibido mensajes de tipo SPAM.
- Evite incluir links innecesarios en su comentario.
- Contenidos ofensivos, amenazas e insultos no serán permitidos.
Debe saber que los comentarios de los lectores no reflejan necesariamente la opinión del STAFF.