Entradas Mensuales

Síguenos en:

Canal Oficial Telegram de elhacker.NET Grupo Facebook elhacker.NET Twitter elhacker.NET Canal Youtube elhacker.NET Comunidad Steam: Grupo elhacker.NET Mastodon

Entradas populares

PostHeaderIcon OpenAI pausa entrenamiento de IA por riesgo de hallar fallos 0-day


OpenAI ha pausado temporalmente el entrenamiento de su IA de vanguardia tras detectar que su próximo modelo, Astra, podría alcanzar un umbral crítico de capacidades de ciberseguridad. Esta decisión se tomó debido a un incidente de seguridad con modelos de Hugging Face y a la evidencia de que los sistemas avanzados pueden identificar y explotar vulnerabilidades de software con mínima guía humana.





OpenAI ha ralentizado temporalmente el entrenamiento de su IA de vanguardia después de que las pruebas internas sugirieran que su próximo modelo Astra podría alcanzar un umbral crítico de capacidad en ciberseguridad.

La empresa afirmó que la decisión se tomó tras un incidente de seguridad relacionado con modelos de Hugging Face y la creciente evidencia de que los sistemas avanzados podrían identificar y explotar debilidades de software con una guía humana limitada.

La pausa incluyó la detención durante dos semanas del entrenamiento de aprendizaje por refuerzo para los modelos destinados al despliegue. OpenAI también puso en espera su ejecución de aprendizaje por refuerzo de vanguardia más grande planeada.

Al mismo tiempo, lleva a cabo ejecuciones de entrenamiento más pequeñas, evaluaciones y pruebas de alineación. Este movimiento refleja un cambio importante en la forma en que los desarrolladores de IA están abordando el riesgo cibernético.

Los modelos capaces de escribir código, utilizar herramientas, navegar por sistemas conectados y razonar a través de tareas largas podrían potencialmente descubrir vulnerabilidades de día cero, fallos desconocidos para los proveedores y defensores.

En el entorno equivocado, esas capacidades podrían permitir el acceso no autorizado, el robo de datos, acciones destructivas o intentos de eludir los controles de seguridad.

OpenAI ralentiza el entrenamiento de IA por temores a los "Zero-Day"

OpenAI dijo que Astra puede poseer capacidades cibernéticas críticas, lo que ha motivado la aplicación de salvaguardas más estrictas para todas las cargas de trabajo de Astra y relacionadas con la ciberseguridad. Algunas tareas de entrenamiento y evaluación permanecen pausadas hasta que se trasladen a entornos de investigación reforzados.

La empresa ha reforzado el aislamiento de las cargas de trabajo para los sistemas que ejecutan código generado por el modelo o código no confiable. Estos controles de "sandboxing" están diseñados para contener el software comprometido y reducir la posibilidad de que los resultados del modelo afecten a la infraestructura interna.

OpenAI también ha ampliado el aislamiento de la red. Las cargas de trabajo de mayor riesgo se están separando de la internet pública y de las redes internas para que el compromiso de un solo servicio no otorgue automáticamente a un atacante o a un modelo de IA un acceso más amplio.

Las pruebas continuas son otro foco de atención. OpenAI dijo que ha reducido los privilegios permanentes, eliminado servicios compartidos potencialmente expuestos, mejorado el registro de seguridad y comenzado a utilizar modelos para probar continuamente los límites de la infraestructura contra ataques simulados.

Una parte clave del enfoque actualizado es la expansión de la monitorización de la cadena de pensamiento. El sistema utiliza clasificadores de activación para inspeccionar la actividad del modelo durante los tokens muestreados y señalar comportamientos potencialmente preocupantes.

Los sistemas de investigación automatizados pueden entonces examinar la actividad de las herramientas, el razonamiento disponible y la secuencia de acciones en busca de signos de violaciones de seguridad.

OpenAI tiene como objetivo generar una alerta en los 30 minutos posteriores a la detección de un comportamiento sospechoso. Si los equipos no pueden determinar en otros 30 minutos que el evento es un falso positivo, se espera que pausen la actividad.

El marco de monitorización se aplica ahora al entrenamiento de aprendizaje por refuerzo y a las evaluaciones habilitadas para herramientas que involucren modelos con capacidad Sol o superior, mientras que el uso de la herramienta Astra enfrenta requisitos de monitorización adicionales.

Los controles de seguridad consumen muchos recursos. OpenAI estimó que la monitorización añade actualmente aproximadamente un 20% al cómputo de inferencia utilizado por las cargas de trabajo monitorizadas.

Más allá de la contención técnica, OpenAI está aumentando su investigación de alineación. La empresa trabaja para mejorar los modelos de recompensa, reducir el comportamiento engañoso o de "reward-hacking", y entrenar a los sistemas para que informen sobre sus capacidades y acciones de manera más honesta.

El anuncio muestra que la carrera hacia una IA más capaz está cada vez más ligada a una nueva preocupación de seguridad: los modelos avanzados pronto podrían ayudar a los defensores a escala, pero también podrían acelerar de forma independiente el descubrimiento de vulnerabilidades y las operaciones cibernéticas ofensivas.


Fuentes:
https://cybersecuritynews.com/openai-pauses-ai-training/

0 comments :

Post a Comment

Los comentarios pueden ser revisados en cualquier momento por los moderadores.

Serán publicados aquellos que cumplan las siguientes condiciones:
- Comentario acorde al contenido del post.
- Prohibido mensajes de tipo SPAM.
- Evite incluir links innecesarios en su comentario.
- Contenidos ofensivos, amenazas e insultos no serán permitidos.

Debe saber que los comentarios de los lectores no reflejan necesariamente la opinión del STAFF.