Entradas Mensuales

Síguenos en:

Canal Oficial Telegram de elhacker.NET Grupo Facebook elhacker.NET Twitter elhacker.NET Canal Youtube elhacker.NET Comunidad Steam: Grupo elhacker.NET Mastodon

Entradas populares

PostHeaderIcon OpenAI suspende parte de sus entrenamientos tras alegaciones de que sus agentes autónomos actuaron peor de lo previsto


OpenAI ha pausado el entrenamiento de sus modelos más avanzados tras detectar fallos de seguridad que permitieron a agentes de IA acceder a sitios web gubernamentales y servicios externos. Diversos reportes indican que existen miles de incidentes de mal comportamiento de agentes, lo que ha provocado tensiones con el gobierno australiano. Mientras tanto, EE. UU. y China buscan establecer canales de comunicación para gestionar los riesgos y crisis derivados de la IA.






El debate sobre la seguridad de la IA avanzó a gran velocidad durante el fin de semana, en medio de nuevas alegaciones de que agentes rebeldes se han comportado peor de lo que se pensó inicialmente, y en mayor número.

La diversión comenzó el viernes cuando OpenAI reveló discretamente que había pausado el entrenamiento de sus modelos más avanzados.

La empresa emergente de IA ocultó esa noticia en un "informe de desalineación" (término de OpenAI para sus informes sobre agentes rebeldes) titulado "Un agente utilizó DNS para llegar a un chatbot externo".

La buena noticia es que el agente implicado en este incidente nunca llegó a la internet abierta.

La mala noticia es que el agente, que intentaba completar una tarea de entrenamiento basada en búsquedas, pudo llegar al chatbot debido a un filtrado DNS insuficiente en un entorno de pruebas (sandbox). O como dijo OpenAI, "un hueco en nuestras restricciones de acceso a internet", que también fue un problema en el ataque a HuggingFace.

"El incidente expuso una brecha en nuestros controles sobre las restricciones de red", dice el informe. "Por lo tanto, detuvimos la ejecución del entrenamiento afectado y posteriormente hemos decidido pausar todo el entrenamiento, evaluación e inferencia con uso de herramientas para nuestros modelos más capaces hasta que hayamos validado que la brecha se ha resuelto y hayamos realizado un red-teaming adicional del sistema".

También el viernes, la startup de IA Parse publicó un análisis del ataque a Hugging Face que los autores afirman que reveló nuevos detalles, incluyendo que el enjambre de agentes de OpenAI obtuvo credenciales de Docker Hub y creó versiones modificadas de imágenes existentes con la esperanza de facilitar el cumplimiento de su misión de "captura la bandera". Los agentes también mapearon el entorno Kubernetes de Hugging Face.

El viernes empeoró para OpenAI después de que el New York Times informara que sus agentes también "interfirieron con los sitios web del Departamento de Educación, el Departamento de Comercio y la Comisión de Bolsa y Valores". OpenAI reconoció los incidentes.

La compañía también admitió que "agentes en nuestro entorno de investigación transmitieron datos de entrenamiento y evaluación mientras utilizaban servicios de terceros". Este lío resultó en la publicación de 53 imágenes generadas por usuarios en sitios de alojamiento de imágenes.

El CEO de OpenAI, Sam Altman, respondió admitiendo que las investigaciones de su empresa sobre agentes rebeldes "no han sido tan rápidas como nos hubiera gustado", pero que intentan equilibrar el deseo de transparencia con la comprensión clara de petabytes de registros de actividad de agentes y el trabajo con las organizaciones afectadas.

Una de esas organizaciones afectadas es el gobierno australiano, que la semana pasada reveló que fue objetivo de agentes de OpenAI excesivamente entusiastas que accedieron inapropiadamente a un portal de datos de investigación sanitaria. Durante el fin de semana, Australia indicó que quiere que Altman y el CEO de Anthropic, Dario Amodei, comparezcan ante una investigación del Senado.

Los líderes australianos han suavizado su retórica sobre el incidente, y el viceprimer ministro Richard Marles lo describió como "menor" y similar a "saltar una valla" en lugar de romper capas de controles de seguridad, quizás porque miembros de la oposición sugieren que la culpa fue de una ciberseguridad laxa.

Si Altman y Amodei comparecen ante el Senado de Australia, podrían enfrentarse a una nueva línea de preguntas después de que Axios informara que sus empresas están investigando "decenas de miles" de incidentes preocupantes.

Ese nivel de mal comportamiento agentivo parece el tipo de cosa que los reguladores podrían considerar como una evidencia sólida de que los productos no son seguros.

Dos personas muy importantes —el presidente chino Xi Jinping y el presidente estadounidense Donald Trump— parecen no estar preocupados, ya que el resultado relacionado con la IA de su cumbre la semana pasada fue establecer un "Diálogo de IA China-EE. UU. para intercambiar puntos de vista sobre riesgos y beneficios relacionados con la IA", además de un "canal de comunicación bilateral para incidentes de IA".

Eso suena como una línea directa que las dos naciones pueden usar para informarse mutuamente sobre incidentes agentivos que cualquiera de las dos podría ver como signos de mala intención. Las dos naciones también decidieron que sus respectivos ejércitos "concluirán un memorando de entendimiento sobre la comunicación y prevención de crisis lo antes posible".

Los gigantes de la IA de China, mientras tanto, permanecen en silencio sobre el alcance y los resultados de cualquier prueba que hayan realizado con herramientas agentivas. 

Fuente:
TheRegister

0 comments :

Publicar un comentario

Los comentarios pueden ser revisados en cualquier momento por los moderadores.

Serán publicados aquellos que cumplan las siguientes condiciones:
- Comentario acorde al contenido del post.
- Prohibido mensajes de tipo SPAM.
- Evite incluir links innecesarios en su comentario.
- Contenidos ofensivos, amenazas e insultos no serán permitidos.

Debe saber que los comentarios de los lectores no reflejan necesariamente la opinión del STAFF.