Entradas Mensuales

Síguenos en:

Canal Oficial Telegram de elhacker.NET Grupo Facebook elhacker.NET Twitter elhacker.NET Canal Youtube elhacker.NET Comunidad Steam: Grupo elhacker.NET Mastodon

Entradas populares

PostHeaderIcon OpenAI suspende el desarrollo de GPT-6.1 Astra tras detectar engaños y acciones no autorizadas


OpenAI canceló el lanzamiento de GPT-6.1 Astra tras fallar auditorías internas de seguridad y alineación. El modelo mostró comportamientos engañosos, realizó ataques simulados no autorizados y no siguió instrucciones de seguridad. Esta decisión refleja una postura cautelosa ante el riesgo de que los sistemas de IA actúen de forma autónoma e insegura.




OpenAI descartó el lunes los planes de lanzar GPT-6.1 Astra, un modelo de inteligencia artificial (IA) de próxima generación que estaba previsto para octubre, después de que fallara las auditorías internas de seguridad y alineación.

Este hecho fue informado primero por The Wall Street Journal. El movimiento "marca un caso raro en el que un desarrollador importante de IA desecha un nuevo lanzamiento debido a preocupaciones de seguridad", afirmó la publicación.

El creador de ChatGPT dijo que tomó la decisión de cancelar el lanzamiento de su modelo GPT-6.1 Astra después de que las pruebas plantearan dudas sobre si puede seguir las instrucciones del usuario sin desviarse del comportamiento esperado.

El Journal informó que el modelo mostró niveles de engaño más altos que su predecesor durante la evaluación y no reveló qué acciones había llevado a cabo. En algunos casos, procedió sin pedir permiso o intentó utilizar herramientas externas en escenarios donde hacerlo podría considerarse inseguro.

"Si bien (GPT-6.1 Astra) mejoró en ejes como la pereza del modelo, no alcanzó el nivel en términos de mantenerse dentro del alcance y la autorización, y en cómo se comunica con el usuario sobre el tipo de trabajo que ha realizado", dijo Saachi Jain, jefa de sistemas de seguridad de OpenAI, en un comunicado.

"Por supuesto, queremos asegurarnos de que el desarrollo de nuestro modelo sea seguro, ya sea dentro de la empresa o cuando lo enviemos a los usuarios. Pero cuando lo lanzamos para ti, tenemos un listón extremadamente alto en términos de seguridad y alineación".

Este acontecimiento ocurre en medio de informes sobre sistemas de IA que se vuelven "rebeldes" en toda la industria, lo que ha llevado a pedir que se ralentice el ritmo de desarrollo de la IA y se apliquen medidas de seguridad más estrictas antes de implementarlas ampliamente.

La semana pasada, OpenAI dijo que estaba pausando el entrenamiento de sus modelos más potentes después de que uno de sus agentes, durante el entrenamiento de aprendizaje por refuerzo (RL), contactara con un chatbot externo explotando un vacío legal en sus restricciones de acceso a internet.



Informe del instituto de seguridad de ia


En un informe publicado el lunes, el AI Security Institute señaló que GPT-6 Astra realizó ataques de cadena de suministro no autorizados en pruebas simuladas con más frecuencia que los modelos anteriores de OpenAI, en algunos casos incluso después de que el alcance fuera aclarado explícitamente.

"En nuestras simulaciones, descubrimos que GPT-6 Astra llevó a cabo una serie de actividades de ataque no autorizadas, y lo hizo a un ritmo más alto que GPT-5.6 Sol y GPT-5.5", dice el informe.

"Las actividades de ataque incluyeron la creación de identidades falsas que GPT-6 Astra utilizó para engañar a los desarrolladores, la publicación de comentarios desde cuentas falsas argumentando contra los resultados de revisiones de seguridad precisas y la entrega de cargas maliciosas en bases de código de código abierto".

Fuente:
THN

0 comments :

Post a Comment

Los comentarios pueden ser revisados en cualquier momento por los moderadores.

Serán publicados aquellos que cumplan las siguientes condiciones:
- Comentario acorde al contenido del post.
- Prohibido mensajes de tipo SPAM.
- Evite incluir links innecesarios en su comentario.
- Contenidos ofensivos, amenazas e insultos no serán permitidos.

Debe saber que los comentarios de los lectores no reflejan necesariamente la opinión del STAFF.