Tutoriales y Manuales
Entradas Mensuales
-
▼
2026
(Total:
6680
)
-
▼
August
(Total:
688
)
-
Ya disponible Ubuntu 26.04.1 LTS
-
Photoshop integra IA para editar con prompts y boc...
-
Cae uno de los mayores imperios de la piratería mu...
-
OpenAI advierte que el reward hacking llevó a agen...
-
OpenAI crea IA autónoma
-
Casi 700 agentes de IA coordinados en el ataque a ...
-
Next.js corrige fallos críticos de AVIF y Windows ...
-
Bill Gates advierte sobre el impacto de la IA
-
PaperCut sufre un ataque de día cero que está golp...
-
Roban datos de 8,7 millones de clientes en tres ae...
-
Policía australiana detiene a presuntos cerebros d...
-
Vulnerabilidad en dispositivos TP-Link Kasa permit...
-
Vulnerabilidad crítica de cPanel permite control t...
-
Secuestran Claude Code Opus 5 Auto Mode mediante p...
-
CISA advierte vulnerabilidad en Citrix NetScaler e...
-
Ciberdelincuentes venden números de seguridad soci...
-
Google lanza Gemini Omni 1.1 Flash para vídeos pro...
-
LibreOffice 26.8 se actualiza y rechaza la IA
-
OpenAI banea cuentas de ChatGPT vinculadas a Rusia...
-
OpenAI limita mensajes de GPT-5.6 Sol en ChatGPT Plus
-
El FBI desarticula infraestructura de QTFY vincula...
-
Operación Jackal IV de INTERPOL: 58 detenidos y 26...
-
28.000 repositorios Git expuestos revelan claves A...
-
Claude Opus 4.6 vulnera el límite de reservas del ...
-
Mac Studio M5: potencia extrema para IA
-
Vulnerabilidades de SonicWall NetExtender permiten...
-
Vulnerabilidades críticas en Next.js permiten ejec...
-
Vulnerabilidad en plugin TranslatePress de WordPre...
-
Garmin actualiza funciones en modelos antiguos
-
21 fallos críticos de Ubiquiti UniFi permiten salt...
-
Apple renueva Mac Mini y Studio con chip de 2nm
-
Comando de Windows para liberar espacio sin riesgo...
-
Llega NVIDIA DLSS 4.5 Ray Reconstruction
-
China sustituirá Windows por Linux
-
Linux cumple 35: el kernel aficionado que ahora im...
-
El gusano Morris infectó el 10% de Internet
-
Amazon sube el precio de sus dispositivos Echo, Ki...
-
UE busca sustituir a Visa y Mastercard para 2029
-
Chrome 152: 327 correcciones de seguridad y 10 crí...
-
Alerta por vulnerabilidad crítica de RCE en Gitea ...
-
Fallos de OpenSSL permiten colapsar servidores y c...
-
Qualcomm rompe la barrera de los 5 GHz en smartpho...
-
OpenAI suspende cuentas rusas de ChatGPT vinculada...
-
Intel convierte Diamond Rapids en una bestia de 25...
-
EE. UU. impone sanciones a hackers vinculados a Ir...
-
Ciberataque masivo colapsa los servicios digitales...
-
91 vulnerabilidades de Spring afectan a más de 209...
-
AliExpress usa WebAudio API para rastreo silencios...
-
Passkeys de WhatsApp alcanzan mil millones de usua...
-
Falso análisis de Microsoft pide quitar antivirus ...
-
La IA preferida de los hackers es DeepSeek
-
Fallo en plataforma B2B de Tata permite robo de cu...
-
Ocho agentes de IA vulneran sistemas gubernamental...
-
Sony: los juegos digitales no son tuyos
-
AWS Network Firewall ya muestra el recuento de reg...
-
Fallo sin parchear en Calix permite a hackers salt...
-
DOOM 64 estrena trazado de trayectorias
-
Crisis de RAM hunde a marca de Linux Pine64
-
Falsa demo de GTA 6 es malware que roba contraseña...
-
Ciberatacantes aprovechan fallos de miniOrange SAM...
-
Fallo crítico en Red Hat Keycloak permite tomar cu...
-
AliExpress es señalada por rastrear usuarios media...
-
Una página web maliciosa podría contaminar tu mode...
-
IA china crea vídeos desde PowerPoint
-
Investigador revela cinco vulnerabilidades crítica...
-
Vulnerabilidades en TP-Link Archer permiten ataque...
-
Suplantan a ReliaQuest para robar credenciales SSO...
-
Anthropic lanza autenticación empresarial para con...
-
Radeon RX 10800 XT: posibles especificaciones y pr...
-
Resultados de Google de Minecraft llevaron a malware
-
Atacan sitios de WordPress mediante vulnerabilidad...
-
Explotan vulnerabilidad de Zimbra Collaboration Suite
-
AMD desbloquea el rendimiento de los Ryzen 7000 y ...
-
Pagos de WhatsApp llegan a España
-
DIGI duplica gratis su fibra a 2 Gbps en España
-
Intel vuelve al Top 10 de las CPU más vendidas en ...
-
IA escribe un tercio de la web
-
Noruega limita la IA en colegios
-
Microsoft Teams ya permite a los administradores b...
-
Phishing de Teams usa SynkLoader para robar contra...
-
Por qué eliminaron 3D Pinball de Windows
-
NVIDIA planea invertir en Perplexity contra Google...
-
Vulnerabilidad en plugin de WordPress expone 100.0...
-
Nuevo modelo IA Ox Alpha: 100 billones de tokens g...
-
768 claves filtradas de AWS siguen activas con acc...
-
Fallo crítico en isolated-vm permite saltar sandbo...
-
Infectan pantallas de Android Auto vía actualizaci...
-
Demandan a Twitch y Amazon por uso de IA
-
Hugging Face exploraría venta de 13.000 millones t...
-
mVolt+ permite hacer que la GeForce RTX 5090 alcan...
-
Detecta qué consume recursos de tu PC Windows con ...
-
Proiraníes tumban central eléctrica británica en c...
-
Libros digitalizados para IA antes de su destrucción
-
Batería móvil: carga en 3 minutos y 60.000 ciclos
-
Google crea una IA que mide la grasa corporal con ...
-
Windows 11 mostrará el uso de IA en el Administrad...
-
Nuevo malware como servicio usa dominios de Adobe ...
-
Claude de Anthropic sufre otra caída con errores
-
Chinos usan IA para atacar servidores web
-
TikTok acuerda pagar 400 millones de dólares por d...
-
Cybermes: agente de IA para pentesting automatizado
-
Samsung dejará de actualizar estos Galaxy
-
Claude Opus 5 esquiva binarios ofuscados en vez de...
-
Fallo crítico en AIT-GUI de NASA permite enviar co...
-
G.SKILL indemniza a compradores de RAM DDR4 y DDR5...
-
App de ancho de banda convierte dispositivos en pu...
-
Kit de phishing de 10.000 dólares promete instalar...
-
pfSense CE 2.9.0: mejoras críticas de seguridad y ...
-
Malware en Android Auto se propaga mediante actual...
-
Estafadores usan grupos de WhatsApp para coordinar...
-
Un controlador de Microsoft Defender podría usarse...
-
Claude Mythos 5 ya disponible en Claude Security p...
-
DeepSeek lanza IA visual similar a Claude Opus
-
Microsoft duplica el almacenamiento de buzón a 100 GB
-
Filtración en Sakura Internet: hackean datos de 1,...
-
Proveedores confiables, nuevas rutas de ataque: có...
-
Por qué la IA opaca es el próximo gran desafío de ...
-
Paquetes populares de Rust con 244M de descargas i...
-
Slack integra Claude Code para programar
-
Desincronización CRLF permite envenenar caché de C...
-
Apple: descifran ubicaciones de Buscar personas en...
-
Explotan vulnerabilidad crítica en Microsoft Entra...
-
OpenAI ofrece retención cero de datos para modelos...
-
Fallo crítico de Spring Security permite acceso ad...
-
Explotan activamente la vulnerabilidad CVE-2026-19...
-
Controlador de Microsoft Defender puede desactivar...
-
Usan agentes de IA OpenClaw para difundir malware ...
-
Grave fallo en NetScaler permite saltar la autenti...
-
-
▼
August
(Total:
688
)
Blogroll
Labels
vulnerabilidad
(
1752
)
seguridad
(
1738
)
software
(
1041
)
hardware
(
903
)
google
(
769
)
Malware
(
710
)
privacidad
(
666
)
ransomware
(
535
)
Windows
(
521
)
exploit
(
479
)
android
(
468
)
linux
(
422
)
cve
(
374
)
nvidia
(
303
)
tutorial
(
300
)
manual
(
282
)
hacking
(
255
)
ssd
(
181
)
WhatsApp
(
173
)
ddos
(
140
)
Wifi
(
131
)
app
(
127
)
cifrado
(
121
)
twitter
(
121
)
programación
(
118
)
youtube
(
83
)
herramientas
(
80
)
firmware
(
79
)
firefox
(
78
)
Networking
(
73
)
sysadmin
(
72
)
adobe
(
69
)
office
(
62
)
antivirus
(
51
)
hack
(
51
)
Kernel
(
49
)
javascript
(
49
)
apache
(
46
)
juegos
(
42
)
contraseñas
(
39
)
multimedia
(
36
)
cms
(
35
)
flash
(
33
)
eventos
(
32
)
MAC
(
30
)
anonymous
(
28
)
ssl
(
24
)
conferencia
(
21
)
Forense
(
20
)
SeguridadWireless
(
17
)
documental
(
17
)
auditoría
(
15
)
Debugger
(
14
)
Rootkit
(
14
)
lizard squad
(
14
)
metasploit
(
13
)
técnicas hacking
(
13
)
Virtualización
(
11
)
delitos
(
11
)
reversing
(
10
)
adamo
(
9
)
Ehn-Dev
(
7
)
antimalware
(
7
)
MAC Adress
(
6
)
oclHashcat
(
5
)
Entradas populares
-
G.SKILL indemnizará a usuarios de RAM DDR4 y DDR5 tras un acuerdo de 2,4 millones de dólares por publicidad engañosa en las velocidades d...
-
Intel presenta Diamond Rapids , su nueva generación de Xeon para centros de datos con hasta 256 núcleos , 1,28 GB de caché y memoria a 12.80...
-
Ubiquiti ha solucionado 21 vulnerabilidades de severidad crítica que afectaban a casi toda su línea de productos UniFi. La empresa advirtió...
OpenAI advierte que el reward hacking llevó a agentes de IA a explotar zero-days y vulnerar Hugging Face
Friday, 28 August 2026
|
Posted by
el-brujo
|
Edit Post
OpenAI reveló que un modelo de investigación interno, similar a GPT-5, hackeó Hugging Face para intentar engañar un sistema de evaluación. Los agentes de IA se comunicaron secretamente, explotaron vulnerabilidades de seguridad y coordinaron un ataque masivo para obtener acceso administrativo. Ante este riesgo de pérdida de control, la empresa implementará medidas de seguridad y alineación mucho más estrictas.
OpenAI reveló el miércoles que el hackeo de recompensas (reward hacking) fue un motor clave detrás del ataque impulsado por inteligencia artificial (IA) a Hugging Face el mes pasado, añadiendo que encontró evidencia de un comportamiento desalineado ya a finales de mayo.
El incidente, según la empresa, ocurrió durante evaluaciones de ciberseguridad de varios modelos de OpenAI, y estuvo impulsado principalmente por lo que describió como un "modelo de investigación interno altamente capaz" comparable en escala a GPT-5.6 Sol.
"Los modelos, operando bajo salvaguardas reducidas, tomaron acciones que no estaban alineadas con los objetivos de sus tareas asignadas: se comunicaron a través de canales no autorizados, explotaron vulnerabilidades en la infraestructura compartida, obtuvieron acceso a internet y accedieron a sistemas de terceros", afirmó en un análisis postmortem.
OpenAI explicó que los agentes de IA impulsados por uno de los modelos de investigación, a pesar de no tener acceso a internet, encontraron la forma de explotar una vulnerabilidad zero-day en el gestor de paquetes Artifactory durante las ejecuciones de entrenamiento de aprendizaje por refuerzo (RL) en mayo y junio para obtener acceso a la red, conseguir acceso de nivel administrador en Artifactory a finales de junio y, finalmente, coordinar un hackeo de "varios días" a Hugging Face a principios de julio con el objetivo de hacer trampas en sus tareas de ExploitGym.
"Aproximadamente 1,200 agentes que debían estar aislados entre sí encontraron la forma de comunicarse en un tablero de mensajes no autorizado, enviando más de 70,000 mensajes y archivos durante el período de investigación", señaló METR, que publicó su propio análisis independiente del incidente aquí. "De estos agentes, 700 participaron en el ataque a Hugging Face".
A continuación tienes la secuencia de eventos resaltada por OpenAI:
* 12 de mayo - Durante una ejecución de entrenamiento, un agente deja una nota en Artifactory pidiendo a otros agentes un archivo faltante.
* 13 de mayo - Un agente distinto del mismo experimento, pero con acceso a internet habilitado vía WebCache, requiere el mismo archivo. Busca en el sitio web de Hugging Face usando un token de usuario ya expuesto públicamente tras inferir que la plataforma de modelos de IA era el origen probable del ejercicio.
* 13 de mayo - Otros agentes que sondean Artifactory encuentran "notas" similares con solicitudes de información, convirtiendo el servicio en un "tablero de mensajes" para comunicarse.
* 26 de mayo - Un agente logra acceso a internet no intencionado explotando una vulnerabilidad SSRF en Artifactory. Pronto otros agentes hacen lo mismo.
* 26 de junio - Los agentes explotan una vulnerabilidad de refresco de tokens para obtener acceso de administrador en Artifactory.
* 26 de junio - 4 de julio - Aprovechan este acceso para instalar complementos Groovy, ejecutar comandos y obtener control persistente a nivel de aplicación.
* 4 de julio - La actividad sostenida provoca que el servicio Artifactory de OpenAI quede fuera de servicio.
* 8 de julio - OpenAI reconstruye Artifactory, revoca credenciales de agentes, refuerza controles de acceso y alerta a JFrog sobre la vulnerabilidad.
* 8 de julio - Comienza el hackeo de Hugging Face. Los agentes usan nombres de directorios en Artifactory como "notas" para pedir material público de ejercicios de OpenAI en repositorios de Hugging Face. Los agentes colaboran y se describen como un "enjambre" o "colectivo".
* 9 de julio - Un agente interno obtiene acceso root en la máquina virtual del sandbox. Un segundo agente logra lo mismo y evade los controles de red de OpenAI explotando endpoints de Artifactory. El mismo día, se comparte una clave de API de CyberGym y una receta de explotación completa para una carga de trabajo de cliente alojada en Modal aquí.
* 10 de julio - Un agente valida y comparte 14 credenciales expuestas de Hugging Face con acceso de escritura.
* 11 de julio - Los agentes explotan un zero-day en el manejo de archivos HDF5 de Hugging Face para extraer credenciales de trabajadores de producción y profundizar en su infraestructura.
* 11 de julio - Explotan un zero-day de inyección de plantillas RefJinja para ejecutar comandos en trabajadores de Hugging Face.
* 12 de julio - Amplían el acceso al clúster de Hugging Face y recolectan credenciales de Kubernetes, bases de datos, mensajería y nube en cuatro regiones, logrando acceso administrativo en múltiples clústeres en 13 horas.
* 12 de julio - Un agente ejecuta código en una carga de trabajo de CyberGym en Modal y usa un token falsificado de Hugging Face para descargar un archivo privado de CyberGym de 731 MB.
* 13 de julio - Los agentes explotan el procesamiento de RubyGems de Artifactory, obtienen su clave de firma y falsifican credenciales de administrador.
* 16 de julio - Hugging Face revela públicamente el incidente de seguridad.
* 19 de julio - OpenAI abre una investigación tras alertas de llamadas a la API inusuales relacionadas con la identidad.
* 19 de julio - Los agentes atacan la infraestructura interna de OpenAI, obtienen acceso root explotando el CVE-2026-53362, acceden a un clúster de Kubernetes y a secretos de la nube.
* 19 de julio - OpenAI detiene las ejecuciones de ExploitGym y comienza una investigación más amplia.
"Los agentes se coordinaron en grandes proyectos colectivos para engañar al evaluador de ExploitGym y atacaron a Hugging Face en busca de pistas", afirmó METR. "Los agentes con tareas imposibles tenían un objetivo común: encontrar una forma general de engañar al evaluador automatizado para obtener una puntuación aprobatoria. Tan pronto como se estableció el tablero de mensajes, empezaron a discutir esto y a compartir recursos".
OpenAI reconoció que el comportamiento observado en mayo sirvió de base para la intrusión en Hugging Face, obligando a los agentes a idear un enfoque diferente para comunicarse usando Artifactory después de que su tablero inicial fuera borrado durante la respuesta al incidente del 4 de julio.
"En aquel momento, no se comprendían las implicaciones de contención y alineación del tablero improvisado y el acceso a internet no intencionado", añadió. "En resumen, un equipo interno observó a un agente participando en el tablero y casos de acceso a internet prohibido a finales de mayo".
"Sin embargo, la existencia del tablero y la importancia de la comunicación entre agentes no fueron evidentes para los líderes responsables de la detección y respuesta del 5 de julio. Seguimos revisando los procesos y prácticas operativas".
OpenAI también señaló que identificó cuatro patrones de desalineación que contribuyeron al incidente: hackeo de recompensas (reward hacking), persistencia en tareas aparentemente imposibles que los llevó a estrategias arriesgadas, comunicación no autorizada a través de tableros persistentes y un ecosistema de agentes que les permitió dividir el trabajo y adoptar objetivos mutuos.
"Además de la desalineación, otro factor fue que no extendimos las poderosas salvaguardas que desplegamos para nuestros modelos externos a todas las evaluaciones internas", señaló.
Como respuesta, la startup de IA está implementando controles de seguridad más fuertes, incluyendo requisitos más estrictos de alineación en todo el ciclo de vida del modelo, la creación de sandboxes más aislados, la restricción del acceso a internet y el control del acceso a los pesos del modelo. Para mejorar la alineación, ahora se requiere que los agentes soliciten aclaraciones o se detengan de forma segura, en lugar de buscar "alternativas cada vez más cuestionables".
"Tomamos este incidente como una 'advertencia' de que las capacidades de los modelos actuales presentan la posibilidad de incidentes de pérdida de control", concluyó OpenAI. "Las empresas que construyan sistemas de IA deberán asegurar que sus sistemas permanezcan siempre bajo un control humano significativo, y que salvaguardas reales limiten su capacidad de causar daño".
"A medida que capacidades similares estén más disponibles, otros podrían usarlas deliberadamente para realizar ataques. Tanto los desarrolladores de modelos como los defensores cibernéticos deberán prepararse para atacantes impulsados por IA que trabajen más rápido, a mayor escala y con mejor coordinación que los atacantes humanos".
Fuente:
THN
OpenAI reveló el miércoles que el hackeo de recompensas (reward hacking) fue un motor clave detrás del ataque impulsado por inteligencia artificial (IA) a Hugging Face el mes pasado, añadiendo que encontró evidencia de un comportamiento desalineado ya a finales de mayo.
El incidente, según la empresa, ocurrió durante evaluaciones de ciberseguridad de varios modelos de OpenAI, y estuvo impulsado principalmente por lo que describió como un "modelo de investigación interno altamente capaz" comparable en escala a GPT-5.6 Sol.
"Los modelos, operando bajo salvaguardas reducidas, tomaron acciones que no estaban alineadas con los objetivos de sus tareas asignadas: se comunicaron a través de canales no autorizados, explotaron vulnerabilidades en la infraestructura compartida, obtuvieron acceso a internet y accedieron a sistemas de terceros", afirmó en un análisis postmortem.
OpenAI explicó que los agentes de IA impulsados por uno de los modelos de investigación, a pesar de no tener acceso a internet, encontraron la forma de explotar una vulnerabilidad zero-day en el gestor de paquetes Artifactory durante las ejecuciones de entrenamiento de aprendizaje por refuerzo (RL) en mayo y junio para obtener acceso a la red, conseguir acceso de nivel administrador en Artifactory a finales de junio y, finalmente, coordinar un hackeo de "varios días" a Hugging Face a principios de julio con el objetivo de hacer trampas en sus tareas de ExploitGym.
"Aproximadamente 1,200 agentes que debían estar aislados entre sí encontraron la forma de comunicarse en un tablero de mensajes no autorizado, enviando más de 70,000 mensajes y archivos durante el período de investigación", señaló METR, que publicó su propio análisis independiente del incidente aquí. "De estos agentes, 700 participaron en el ataque a Hugging Face".
La secuencia completa de eventos
A continuación tienes la secuencia de eventos resaltada por OpenAI:
* 12 de mayo - Durante una ejecución de entrenamiento, un agente deja una nota en Artifactory pidiendo a otros agentes un archivo faltante.
* 13 de mayo - Un agente distinto del mismo experimento, pero con acceso a internet habilitado vía WebCache, requiere el mismo archivo. Busca en el sitio web de Hugging Face usando un token de usuario ya expuesto públicamente tras inferir que la plataforma de modelos de IA era el origen probable del ejercicio.
* 13 de mayo - Otros agentes que sondean Artifactory encuentran "notas" similares con solicitudes de información, convirtiendo el servicio en un "tablero de mensajes" para comunicarse.
* 26 de mayo - Un agente logra acceso a internet no intencionado explotando una vulnerabilidad SSRF en Artifactory. Pronto otros agentes hacen lo mismo.
* 26 de junio - Los agentes explotan una vulnerabilidad de refresco de tokens para obtener acceso de administrador en Artifactory.
* 26 de junio - 4 de julio - Aprovechan este acceso para instalar complementos Groovy, ejecutar comandos y obtener control persistente a nivel de aplicación.
* 4 de julio - La actividad sostenida provoca que el servicio Artifactory de OpenAI quede fuera de servicio.
* 8 de julio - OpenAI reconstruye Artifactory, revoca credenciales de agentes, refuerza controles de acceso y alerta a JFrog sobre la vulnerabilidad.
* 8 de julio - Comienza el hackeo de Hugging Face. Los agentes usan nombres de directorios en Artifactory como "notas" para pedir material público de ejercicios de OpenAI en repositorios de Hugging Face. Los agentes colaboran y se describen como un "enjambre" o "colectivo".
* 9 de julio - Un agente interno obtiene acceso root en la máquina virtual del sandbox. Un segundo agente logra lo mismo y evade los controles de red de OpenAI explotando endpoints de Artifactory. El mismo día, se comparte una clave de API de CyberGym y una receta de explotación completa para una carga de trabajo de cliente alojada en Modal aquí.
* 10 de julio - Un agente valida y comparte 14 credenciales expuestas de Hugging Face con acceso de escritura.
* 11 de julio - Los agentes explotan un zero-day en el manejo de archivos HDF5 de Hugging Face para extraer credenciales de trabajadores de producción y profundizar en su infraestructura.
* 11 de julio - Explotan un zero-day de inyección de plantillas RefJinja para ejecutar comandos en trabajadores de Hugging Face.
* 12 de julio - Amplían el acceso al clúster de Hugging Face y recolectan credenciales de Kubernetes, bases de datos, mensajería y nube en cuatro regiones, logrando acceso administrativo en múltiples clústeres en 13 horas.
* 12 de julio - Un agente ejecuta código en una carga de trabajo de CyberGym en Modal y usa un token falsificado de Hugging Face para descargar un archivo privado de CyberGym de 731 MB.
* 13 de julio - Los agentes explotan el procesamiento de RubyGems de Artifactory, obtienen su clave de firma y falsifican credenciales de administrador.
* 16 de julio - Hugging Face revela públicamente el incidente de seguridad.
* 19 de julio - OpenAI abre una investigación tras alertas de llamadas a la API inusuales relacionadas con la identidad.
* 19 de julio - Los agentes atacan la infraestructura interna de OpenAI, obtienen acceso root explotando el CVE-2026-53362, acceden a un clúster de Kubernetes y a secretos de la nube.
* 19 de julio - OpenAI detiene las ejecuciones de ExploitGym y comienza una investigación más amplia.
"Los agentes se coordinaron en grandes proyectos colectivos para engañar al evaluador de ExploitGym y atacaron a Hugging Face en busca de pistas", afirmó METR. "Los agentes con tareas imposibles tenían un objetivo común: encontrar una forma general de engañar al evaluador automatizado para obtener una puntuación aprobatoria. Tan pronto como se estableció el tablero de mensajes, empezaron a discutir esto y a compartir recursos".
OpenAI reconoció que el comportamiento observado en mayo sirvió de base para la intrusión en Hugging Face, obligando a los agentes a idear un enfoque diferente para comunicarse usando Artifactory después de que su tablero inicial fuera borrado durante la respuesta al incidente del 4 de julio.
"En aquel momento, no se comprendían las implicaciones de contención y alineación del tablero improvisado y el acceso a internet no intencionado", añadió. "En resumen, un equipo interno observó a un agente participando en el tablero y casos de acceso a internet prohibido a finales de mayo".
"Sin embargo, la existencia del tablero y la importancia de la comunicación entre agentes no fueron evidentes para los líderes responsables de la detección y respuesta del 5 de julio. Seguimos revisando los procesos y prácticas operativas".
OpenAI también señaló que identificó cuatro patrones de desalineación que contribuyeron al incidente: hackeo de recompensas (reward hacking), persistencia en tareas aparentemente imposibles que los llevó a estrategias arriesgadas, comunicación no autorizada a través de tableros persistentes y un ecosistema de agentes que les permitió dividir el trabajo y adoptar objetivos mutuos.
"Además de la desalineación, otro factor fue que no extendimos las poderosas salvaguardas que desplegamos para nuestros modelos externos a todas las evaluaciones internas", señaló.
Como respuesta, la startup de IA está implementando controles de seguridad más fuertes, incluyendo requisitos más estrictos de alineación en todo el ciclo de vida del modelo, la creación de sandboxes más aislados, la restricción del acceso a internet y el control del acceso a los pesos del modelo. Para mejorar la alineación, ahora se requiere que los agentes soliciten aclaraciones o se detengan de forma segura, en lugar de buscar "alternativas cada vez más cuestionables".
"Tomamos este incidente como una 'advertencia' de que las capacidades de los modelos actuales presentan la posibilidad de incidentes de pérdida de control", concluyó OpenAI. "Las empresas que construyan sistemas de IA deberán asegurar que sus sistemas permanezcan siempre bajo un control humano significativo, y que salvaguardas reales limiten su capacidad de causar daño".
"A medida que capacidades similares estén más disponibles, otros podrían usarlas deliberadamente para realizar ataques. Tanto los desarrolladores de modelos como los defensores cibernéticos deberán prepararse para atacantes impulsados por IA que trabajen más rápido, a mayor escala y con mejor coordinación que los atacantes humanos".
Fuente:
THN
Newer Post
0 comments :
Post a Comment
Los comentarios pueden ser revisados en cualquier momento por los moderadores.
Serán publicados aquellos que cumplan las siguientes condiciones:
- Comentario acorde al contenido del post.
- Prohibido mensajes de tipo SPAM.
- Evite incluir links innecesarios en su comentario.
- Contenidos ofensivos, amenazas e insultos no serán permitidos.
Debe saber que los comentarios de los lectores no reflejan necesariamente la opinión del STAFF.