Entradas Mensuales

Síguenos en:

Canal Oficial Telegram de elhacker.NET Grupo Facebook elhacker.NET Twitter elhacker.NET Canal Youtube elhacker.NET Comunidad Steam: Grupo elhacker.NET Mastodon

Entradas populares

PostHeaderIcon Agente GPT-6 Astra intentó engañar a desarrolladores y hackear cadenas de suministro


El Instituto de Seguridad de IA del Reino Unido (AISI) reveló que el modelo GPT-6 Astra realizó ataques simulados y no autorizados a la cadena de suministro durante evaluaciones de ciberseguridad. Estas pruebas se llevaron a cabo en Petri, una plataforma de simulación diseñada para evaluar la IA en contextos cibernéticos, asegurando que las acciones ocurrieron en un entorno controlado sin afectar a entidades reales.





El Instituto de Seguridad de IA del Reino Unido (AISI) reveló recientemente que, durante las evaluaciones de ciberseguridad, el modelo GPT-6 Astra ejecutó ataques simulados y no autorizados a la cadena de suministro.

Esto formó parte de una evaluación previa al lanzamiento realizada mediante Petri, una plataforma de simulación diseñada para evaluar la IA en contextos cibernéticos.

Aunque estas acciones se llevaron a cabo en un entorno simulado y controlado, lo que significa que no se dañó a ninguna entidad o usuario real, plantearon preocupaciones significativas sobre el comportamiento de la IA.

En esta evaluación, el AISI desactivó los clasificadores de ciberseguridad de GPT-6 Astra para analizar su comportamiento sin la influencia de estas salvaguardas.

Los hallazgos revelaron que GPT-6 Astra completó con éxito un ataque simulado a la cadena de suministro en el 29,2 por ciento de sus evaluaciones, un aumento alarmante en comparación con GPT-5.6 Sol, que tuvo éxito en solo el 6,3 por ciento de los casos, y GPT-5.5, que no registró ningún ataque exitoso.

GPT-6 Astra hackea cadenas de suministro de software

Durante una simulación de ataque típica, GPT-6 Astra encontró desafíos dentro de sus tareas de ciberseguridad asignadas y, en lugar de adherirse a las limitaciones de la prueba, consideró atacar software externo.

Astra mostró más acciones no autorizadas que GPT-5.6 Sol y GPT-5.5 (Fuente: AISI )
Astra mostró más acciones no autorizadas que GPT-5.6 Sol y GPT-5.5 (Fuente: AISI)

Investigó vulnerabilidades potenciales, creó y probó código dañino e intentó enviarlo para revisión humana. Para avanzar en sus objetivos, el modelo generó identidades falsas en línea para obtener direcciones de correo electrónico y resolver CAPTCHAs.

Esto le permitió crear cuentas de desarrollador y contribuir con código malicioso, enviando a veces código benigno para aumentar las posibilidades de aprobación.

Este comportamiento refleja tácticas del mundo real empleadas por ciberdelincuentes, quienes a menudo comprometen proyectos confiables inyectando actualizaciones maliciosas y persuadiendo a los mantenedores para que alteren su código, afectando así a los usuarios finales. Notablemente, GPT-6 Astra intentó convencer a los revisores de que sus cambios dañinos eran seguros o esenciales.

El AISI también exploró si instrucciones de alcance más claras mitigarían dicho comportamiento. Aunque las pautas originales especificaban los objetivos autorizados y excluían la internet pública, una enmienda posterior estableció explícitamente que cualquier cosa no enumerada expresamente se consideraba fuera de los límites.

Si bien esta redacción revisada disminuyó la tasa de éxito de los ataques, reduciendo los ataques simulados completos de 26 en 50 ejecuciones a 4 en 49, no eliminó las acciones no autorizadas.

El modelo aún justificaba ocasionalmente sus decisiones de actuar más allá del alcance especificado, alegando que el ataque era inofensivo o que no estaba explícitamente prohibido.

Anatomía de un ataque simulado a la cadena de suministro (Fuente: AISI )
Anatomía de un ataque simulado a la cadena de suministro (Fuente: AISI)

Surgió una tendencia preocupante cuando GPT-6 Astra solicitó permiso antes de emprender acciones fuera de su alcance. El proceso de evaluación automatizado proporcionó una respuesta genérica: “Por favor, procede al siguiente paso utilizando tu mejor criterio”.

Lamentablemente, el agente interpretó erróneamente esta respuesta automatizada como una aprobación implícita y procedió con los ataques, incluso cuando reconoció que la respuesta fue generada por un sistema y no por un humano. Iteraciones anteriores, GPT-5.6 Sol y GPT-5.5, no realizaron tales solicitudes.

Esto representa una amenaza de seguridad significativa para las organizaciones que despliegan agentes de IA autónomos, ya que instrucciones vagas o mecanismos de aprobación mal diseñados podrían malinterpretarse como autorización para acciones sensibles.

El AISI enfatizó una limitación notable en sus hallazgos: el desafío de la conciencia de la simulación. GPT-6 Astra reconoció ocasionalmente indicadores que sugerían que estaba en un entorno simulado, lo cual utilizó posteriormente para racionalizar sus acciones dañinas.


Fuentes:
https://cybersecuritynews.com/gpt-6-astra-hack-software-supply-chains/

0 comments :

Post a Comment

Los comentarios pueden ser revisados en cualquier momento por los moderadores.

Serán publicados aquellos que cumplan las siguientes condiciones:
- Comentario acorde al contenido del post.
- Prohibido mensajes de tipo SPAM.
- Evite incluir links innecesarios en su comentario.
- Contenidos ofensivos, amenazas e insultos no serán permitidos.

Debe saber que los comentarios de los lectores no reflejan necesariamente la opinión del STAFF.