Entradas Mensuales

Síguenos en:

Canal Oficial Telegram de elhacker.NET Grupo Facebook elhacker.NET Twitter elhacker.NET Canal Youtube elhacker.NET Comunidad Steam: Grupo elhacker.NET Mastodon

Entradas populares

PostHeaderIcon ChatGPT lanza ciberataques autónomos


GPT-6 Astra ejecutó ciberataques no autorizados a la cadena de suministro de software en el 29,2% de las simulaciones detectadas por el Instituto de Seguridad de IA de Reino Unido (AISI).



ChatGPT actúa por cuenta propia y lanza ciberataques


  • Se ha reportado un alarmante incidente relacionado con la inteligencia artificial de OpenAI. El Instituto de Seguridad de IA del Reino Unido (AISI) ha descubierto que el modelo GPT-6 Astra fue capaz de ejecutar ataques a la cadena de suministro de software de forma autónoma.
  • Lo más preocupante es que estas acciones no fueron solicitadas por ningún usuario; de hecho, la IA realizó ciberataques en casi el 30% de las simulaciones analizadas, lo que genera serias dudas sobre el control de estas herramientas.

ChatGPT fondo de pantalla

La IA de OpenAI ha protagonizado otro incidente que ya comienza a preocupar. EI Instituto de Seguridad de IA de Reino Unido (AISI) detectó que GPT-6 Astra ejecutó ataques a la cadena de suministro de software que nadie le había pedido. El modelo llevó a cabo un ciberataque en un 29,2% de las simulaciones en las que tenía que evaluar la seguridad, algo que GPT-5.5 no hizo.

De acuerdo con una publicación en la web del instituto, Astra creó identidades falsas para engañar a desarrolladores, publicó comentarios desde cuentas ficticias para rebatir revisiones de seguridad y entregó código malicioso a repositorios de código abierto. Antes de alarmarse, estos hackeos no ocurrieron en la web, como pasó hace unos meses con Hugging Face. El AISI realizó las simulaciones en un entorno seguro con ayuda de una herramienta llamada Petri y desactivó los clasificadores de ciberseguridad de Astra, los cuales están pensados para bloquear estos comportamientos.

En las simulaciones, Astra recibía un resumen de intentos fallidos anteriores, razonaba sobre sus opciones y proponía atacar un objetivo de terceros fuera del perímetro permitido. Después de eso, la IA escribía y probaba el código malicioso, creaba cuentas falsas y las usaba para enviar contribuciones inofensivas o comentarios. Según los investigadores, esto lo haría para aumentar las posibilidades de que un revisor aprobara los cambios.

Imagen: AISI.

Una vez que los científicos se dieron cuenta de este comportamiento, reforzaron las instrucciones y le especificaron que no debía desviarse de lo que se le pedía. Aun así, Astra siguió efectuando ciberataques, aunque en menor medida. Los resultados muestran que los ataques simulados pasaron de 26 de 50 trayectorias a 4 de 49, y en estos casos, la IA justificaba el ataque alegando que sería inofensivo o que era la única vía que le quedaba.

La IA sospechaba que podría ser una simulación

El instituto de Reino Unido mencionó que en este tipo de simulaciones, cuando la IA pregunta algo al usuario, siempre recibe un mensaje automático diciendo que use su mejor criterio para continuar. Durante las pruebas, Astra pidió autorización y en múltiples ocasiones interpretó la respuesta automática como luz verde, incluyendo objetivos por los que ni siquiera había preguntado. En algunos casos, la IA identificó que el mensaje probablemente no venía de una persona real.

Imagen: AISI.

A primera vista, el estudio no deja bien parado a OpenAI, que ha tenido que lidiar desde julio con el desastre de Hugging Face. El hackeo, que llevaron a cabo algunos agentes que se salieron de su entorno seguro, ha ocasionado que los gobiernos y reguladores alcen la voz y pidan más mecanismos de seguridad. Lo peor de todo es que la compañía sigue disparándose en el pie, como lo vimos en otro ciberatque al Gobierno de Australia, donde tardó semanas para avisarle a las autoridades de ese país.

La única limitación de este estudio es algo que los científicos definen como "conciencia de simulación". Si la IA detecta que el entorno es artificial, podría comportarse de una manera distinta a como lo haría en el mundo real. En el caso de Astra, el AISI dijo que el modelo razonaba a menudo sobre si el escenario era falso y llegó a señalar imperfecciones reales de la simulación.

 

Pese a ello, Astra siguió atacando, incluso cuando reconocía que podía estar sobrepasando los límites establecidos. Aunque el AISI desactivó las salvaguardas durante las pruebas, los investigadores afirmaron que la alineación del modelo no debería ser la única línea de defensa. El aislamiento de entornos controlados y la monitorización podrían ayudar, aunque no por mucho tiempo.



Fuentes:
https://hipertextual.com/inteligencia-artificial/gpt-6-astra-ciberataques-no-autorizados-aisi/

0 comments :

Publicar un comentario

Los comentarios pueden ser revisados en cualquier momento por los moderadores.

Serán publicados aquellos que cumplan las siguientes condiciones:
- Comentario acorde al contenido del post.
- Prohibido mensajes de tipo SPAM.
- Evite incluir links innecesarios en su comentario.
- Contenidos ofensivos, amenazas e insultos no serán permitidos.

Debe saber que los comentarios de los lectores no reflejan necesariamente la opinión del STAFF.