Productos FTTH

Tienda FFTH desde 2004

Entradas Mensuales

Síguenos en:

Canal Oficial Telegram de elhacker.NET Grupo Facebook elhacker.NET Twitter elhacker.NET Canal Youtube elhacker.NET Comunidad Steam: Grupo elhacker.NET Mastodon

Entradas populares

PostHeaderIcon GPT-Red: el modelo hacker de OpenAI


GPT-Red es un modelo secreto de OpenAI diseñado para actuar como un superhacker que detecta errores de seguridad antes de que los modelos sean publicados.





  • GPT-Red es una herramienta confidencial desarrollada por OpenAI con el objetivo de actuar como un modelo "superhacker".
  • La finalidad de este sistema es detectar fallos y vulnerabilidades de forma preventiva, adelantándose a los errores que podrían ser descubiertos por investigadores o atacantes externos una vez que el modelo sea lanzado al público.



Una inteligencia artificial cuyo único objetivo sea intentar hackear a otras inteligencias artificiales. Suena un tanto extraño, pero eso es exactamente lo que ha creado OpenAI con GPT-Red, un modelo que, al menos en un principio, nunca llegará al público y que ha sido creado para encontrar fallos de seguridad antes de que lo hagan los ciberdelincuentes.

A diferencia de ChatGPT o de otros modelos de la compañía, GPT-Red no responde preguntas ni ayuda a programar. Su trabajo consiste en actuar como un superhacker: intenta engañar a otros modelos de IA, saltarse sus restricciones y descubrir vulnerabilidades que podrían ser aprovechadas por un ciberdelincuente.

Solo cuando consigue romper sus defensas, los ingenieros pueden corregir esos fallos antes de lanzar el modelo al público. Puede parecer una idea un tanto rara, pero ciertamente tiene todo el sentido del mundo.

¿Qué es GPT-Red?

GPT-Red es un modelo de lenguaje especializado en red teaming, una técnica utilizada desde hace años en ciberseguridad que consiste en atacar un sistema para descubrir sus puntos débiles antes que un atacante real.

Normalmente, este trabajo lo hacen expertos humanos que intentan romper las defensas de un programa buscando errores, vulnerabilidades o formas raras de hacerlo fallar. El problema es que este proceso requiere mucho tiempo y resulta casi imposible de escalar cuando los propios modelos de IA mejoran tan rápido y se usan para los ataques.

Para resolver ese problema, OpenAI decidió crear un modelo capaz de hacer ese trabajo de forma automática. En lugar de responder preguntas como ChatGPT, GPT-Red tiene un único objetivo: encontrar la manera de engañar a otros modelos.

Su especialidad son los llamados ataques de inyección de prompts (prompt injection). Consisten en dar instrucciones ocultas dentro de documentos, páginas web, correos electrónicos o cualquier otro contenido que una IA pueda leer para conseguir que se salte sus instrucciones y haga algo que nunca debería hacer, como dar información confidencial, modificar datos o realizar acciones que no debería.

¿Cómo aprende a convertirse en un "superhacker"?

GPT-Red no fue entrenado con una lista de ataques escritos por personas. OpenAI utilizó una técnica llamada autojuego (self-play). En lugar de enfrentarlo a hackers humanos, lo puso a competir todo el tiempo contra otros modelos de inteligencia artificial.

Como realmente funciona, recuerda mucho al entrenamiento de programas como AlphaGo o AlphaZero. Un modelo intenta atacar mientras el otro intenta defenderse.

Cada vez que el atacante encuentra una nueva forma de romper las defensas, recibe una recompensa durante el entrenamiento. Al mismo tiempo, el modelo atacado aprende a protegerse frente a ese nuevo método.

Después de miles y miles de enfrentamientos, ambos mejoran todo el tiempo. Además, según las pruebas, GPT-Red demostró ser muy persistente. Cada vez que encontraba un pequeño fallo, lo probaba una y otra vez de formas distintas hasta dar con la mejor forma de romper el sistema de su rival.

Pero esto no es todo y, para realmente ver de qué era capaz, en OpenAI lo pusieron a prueba repitiendo un examen que varios expertos humanos hicieron en 2025 sobre una versión antigua de GPT-5.

El resultado fue que GPT-Red encontró más fallos y más rápido que los profesionales humanos. En concreto, este modelo superhacker consiguió saltarse sus defensas el 90% de las veces.

Sin embargo, al probar esos mismos ataques contra el nuevo GPT-5.6, la tasa de éxito bajó a menos del 23%, demostrando que esto no solo va de encontrar fallos sino de que los modelos también aprendan a protegerse.

También lo probaron contra Vendy, una inteligencia artificial que gestiona máquinas expendedoras de refrescos, y logró hackearla para cambiar los precios de las bebidas y cancelar pedidos de clientes.

¿Podrás algún día utilizar GPT-Red?

Parece que la respuesta es que no. Esta IA ha sido entrenada para algo que poco tiene que ver con el usuario de a pie. OpenAI ha confirmado que permanecerá como una herramienta solo para uso interno.

En su lugar, lo que llegará al público serán los resultados de su trabajo: modelos más resistentes, con menos vulnerabilidades y mejor preparados para soportar intentos de manipulación.



Fuentes:
https://computerhoy.20minutos.es/tecnologia/que-es-gpt-red-modelo-superhacker-secreto-openai_7019539_0.html

0 comentarios :

Publicar un comentario

Los comentarios pueden ser revisados en cualquier momento por los moderadores.

Serán publicados aquellos que cumplan las siguientes condiciones:
- Comentario acorde al contenido del post.
- Prohibido mensajes de tipo SPAM.
- Evite incluir links innecesarios en su comentario.
- Contenidos ofensivos, amenazas e insultos no serán permitidos.

Debe saber que los comentarios de los lectores no reflejan necesariamente la opinión del STAFF.