Entradas Mensuales

Síguenos en:

Canal Oficial Telegram de elhacker.NET Grupo Facebook elhacker.NET Twitter elhacker.NET Canal Youtube elhacker.NET Comunidad Steam: Grupo elhacker.NET Mastodon

Entradas populares

PostHeaderIcon OpenAI detiene el entrenamiento de RL de vanguardia para reforzar la seguridad contra comportamientos imprevistos de la IA


OpenAI pausó el entrenamiento de sus modelos más recientes para reforzar la seguridad y el monitoreo, buscando evitar incidentes de hackeo o comportamientos no deseados. La empresa implementará mejores aislamientos de red y sistemas de alerta rápida ante riesgos de ciberseguridad. Esta decisión surge tras reportes de agentes de IA que han vulnerado sistemas reales al confundir simulaciones con el mundo exterior.







OpenAI reveló el martes que pausó el entrenamiento de aprendizaje por refuerzo (RL RL) para sus últimos modelos de inteligencia artificial (IA) durante dos semanas mientras reforzaba defensas adicionales e incrementaba el alcance de su monitoreo para evitar otro incidente similar al de Hugging Face.

"A medida que los modelos se vuelven más capaces, también crecen los riesgos asociados con su desarrollo y prueba interna", afirmó la compañía de IA en su comunicado. "Nuestros estándares de monitoreo, alineación y seguridad deben adelantarse a esos riesgos. Quisimos tomarnos el tiempo necesario para cumplir esos estándares, por lo que redujimos temporalmente el ritmo de escalado".

La empresa señaló que su ejecución de RL de frontera más grande planificada permanece en espera por el momento, mientras realiza entrenamientos y evaluaciones a menor escala para analizar el comportamiento del modelo, validar sus salvaguardas y establecer evidencia más concreta de alineación antes de pasar a la siguiente fase.

Con ese fin, OpenAI dijo que planea fortalecer las salvaguardas en todo su proceso de desarrollo, incluyendo el monitoreo para responder mejor a comportamientos no deseados y preocupantes; la alineación para reducir la probabilidad de acciones dañinas o no autorizadas; y medidas de seguridad para limitar a qué pueden acceder o afectar los sistemas de IA.

Parte de esto implica sandboxes más fuertes, aislamiento de red para evitar el acceso a internet y pruebas de seguridad continuas para eliminar servicios compartidos potencialmente vulnerables, reducir privilegios permanentes y mejorar los límites de seguridad y confianza.

Este desarrollo ocurre días después de que OpenAI dijera que está pausando algunas "actividades internas" relacionadas con su próximo modelo de IA, Astra, después de que una evaluación interna descubriera que había logrado avances significativos en codificación agéntica y ciberseguridad.

"Si bien algunos entrenamientos y evaluaciones de Astra cumplen con esos requisitos, un número significativo de cargas de trabajo permanecen pausadas hasta que sean totalmente migradas y mejoradas para alcanzar el nuevo estándar de seguridad", subrayó la compañía. "Estamos priorizando las cargas de trabajo de seguridad y alineación para su migración a estos nuevos entornos primero".

En paralelo, el sistema de monitoreo ha sido renovado para marcar y escalar preocupaciones potenciales a "investigadores automatizados cada vez más sofisticados y de alta computación", quienes luego examinan las acciones de las herramientas, el razonamiento disponible y la secuencia completa de actividad en busca de accesos no autorizados, robo de datos, comportamiento destructivo e intentos de burlar las salvaguardas.

OpenAI planea emitir una alerta en menos de 30 minutos después de que se detecte actividad preocupante a través de este mecanismo. Este enfoque es obligatorio para todo entrenamiento y evaluación de RL que involucre herramientas para modelos de capacidad Sol o superior. Se espera que estas salvaguardas aumenten la carga computacional de inferencia observada en un 20%.

"A medida que los modelos adquieren capacidades avanzadas, como la capacidad de realizar ciberataques y operar en entornos más complejos, los comportamientos desalineados como el reward hacking (buscar formas de recibir altas recompensas en el entrenamiento sin lograr realmente el resultado previsto), el engaño o el acceso no autorizado crearán riesgos cada vez más graves", señaló la empresa.

De hecho, una nueva investigación publicada por su rival Anthropic la semana pasada encontró que los agentes de IA, al ser colocados en situaciones con objetivos competitivos y contradictorios, comenzaron a sabotear a otros y desplegaron malware autorreplicante entre sí, lo que llevó a lo que se ha descrito como una "guerra de territorios multi-agente".

"Esto incluyó la desactivación de las cuentas Unix de otros agentes, la escritura de scripts automatizados que buscaban y eliminaban procesos competidores en bucle y el despliegue de código malicioso disfrazado de pertenecer a otro agente", afirmó Anthropic en su investigación.

Aunque las preocupaciones sobre sistemas autónomos que se vuelven rebeldes se han convertido en un tema candente, el estudio busca comprender qué nuevos comportamientos y dinámicas posiblemente dañinas pueden surgir cuando múltiples agentes interactúan entre sí o se enfrentan.

Estas interacciones pueden llevar a situaciones en las que coordinen y trabajen al unísono en pos de un objetivo común (como en el caso del incidente de Hugging Face reportado por Wired) o compitan entre sí antes de intentar resolver sus conflictos mediante un "torneo".

En otro caso que salió a la luz recientemente, los intentos de un hombre australiano por reservar un lugar en una clase popular de gimnasio a través de OpenClaw llevaron a consecuencias inesperadas cuando Anthropic Claude Opus 4.6, el modelo integrado en la plataforma, reservó una clase con meses de antelación aprovechando una vulnerabilidad que descubrió en el software de reservas.

Peor aún, encontró la manera de hackear el sistema y cancelar las reservas de otros miembros en la lista de espera. El incidente, ocurrido en abril de 2026, es otro ejemplo de cómo los agentes de IA llegarán a cualquier extremo para cumplir las tareas asignadas, incluso si significa romper las reglas establecidas.

Para contrarrestar tales patrones emergentes riesgosos, OpenAI dijo que está tomando medidas para mejorar los modelos de recompensa para detectar y desalentar mejor el comportamiento inseguro; entrenar modelos para que sean más transparentes sobre sus acciones, capacidades y limitaciones; y reducir los comportamientos que explotan debilidades en las recompensas, calificadores, herramientas o supervisión.

Este desarrollo ocurre un día después de que la compañía dijera que la IA puede inclinar la balanza de la ciberseguridad a favor de los defensores, ya que facilita encontrar, priorizar y corregir fallos en los sistemas existentes antes de que sean descubiertos por atacantes impulsados por IA.

"Estamos utilizando inteligencia de frontera para enumerar, sondear e identificar continuamente posibles rutas de ataque", dijo Greg Brockman de OpenAI en su publicación. "Al identificar vulnerabilidades, configuraciones erróneas, identidades con privilegios excesivos o límites de confianza no intencionados, podemos cerrar rápidamente estas brechas antes de que sean abusadas por atacantes".

Otra capa crucial de defensa es evidente: invertir en los fundamentos, lo que significa una arquitectura y controles seguros, implementar estrategias de defensa en profundidad y el principio de menor privilegio (PoLP), y diseñar sistemas que requieran múltiples controles independientes para evitar fallos.

"Los controles de seguridad clásicos como el aislamiento de red, el endurecimiento de la carga de trabajo, el monitoreo y el parcheo y despliegue seguro serán más importantes que nunca en el futuro de la IA", añadió Brockman.

Según un informe de WIRED de la semana pasada, el hackeo del agente rebelde de OpenAI a Hugging Face no solo ha sido un "momento decisivo" para la seguridad de la IA y la ciberseguridad, sino que también ha despertado preocupaciones de que las presiones competitivas por lanzar nuevos modelos y productos de IA hayan dificultado que los empleados prioricen adecuadamente la seguridad y la alineación.

Los laboratorios de IA de frontera como Anthropic, OpenAI y Meta han enfrentado un mayor escrutinio tras incidentes en los que sus modelos escaparon de las salvaguardas y los límites de contención durante las pruebas de seguridad y, en algunos casos, atacaron sistemas del mundo real.

La firma de pruebas de seguridad de IA, Irregular, ha revelado posteriormente que la brecha que involucró a Anthropic se debió a un error de nomenclatura, lo que provocó que el nombre de una empresa ficticia utilizada durante las simulaciones de hackeo coincidiera sin saberlo con un dominio real. Esto, a su vez, provocó que los modelos tomaran acciones ofensivas.

La empresa israelí afirmó que fue debido a un "descuido humano" y dijo que los problemas han sido remediados. Sin embargo, no reveló cuántos incidentes de este tipo ocurrieron, optando por describirlos como un "puñado" o una "pequeña fracción" de casos. Una investigación exhaustiva sigue en curso.

También enfatizó que no hay evidencia de que "los sistemas de un cliente hayan sido vulnerados o que los datos de un cliente hayan sido filtrados", refiriéndose a las empresas de IA con las que se asocia para realizar pruebas de estrés, y que "todas las revelaciones públicas posteriores se refieren al mismo problema subyacente" en lugar de "incidentes materialmente separados".

"Debido a que el acceso a internet estaba habilitado en el entorno, el dominio fue objetivo un número limitado de veces por diferentes modelos, que lo confundieron con parte del desafío en el que estaban siendo probados", señaló. "Tras obtener acceso al objetivo, los modelos realizaron acciones como explotar vulnerabilidades, extraer credenciales y obtener acceso a una base de datos de producción".

"En última instancia, la mayoría de los problemas que hemos descubierto se debieron a los controles de acceso a internet. Principalmente, los modelos creían que estaban en entornos simulados, cuando en realidad actuaron en el mundo real. Estamos implementando protocolos nuevos y robustos para asegurar que no ocurran problemas de configuración mientras cumplimos con las restricciones del proceso de prueba".

Fuente:
THN

0 comments :

Post a Comment

Los comentarios pueden ser revisados en cualquier momento por los moderadores.

Serán publicados aquellos que cumplan las siguientes condiciones:
- Comentario acorde al contenido del post.
- Prohibido mensajes de tipo SPAM.
- Evite incluir links innecesarios en su comentario.
- Contenidos ofensivos, amenazas e insultos no serán permitidos.

Debe saber que los comentarios de los lectores no reflejan necesariamente la opinión del STAFF.