Tutoriales y Manuales
Entradas Mensuales
-
▼
2026
(Total:
6542
)
-
▼
August
(Total:
550
)
-
Saltan el MFA de Microsoft 365 y roban pagos vía e...
-
Nuevo malware de Android roba PINs bancarios y usa...
-
Equipo de T-Mobile corta cable para eliminar intru...
-
Zyxel corrige fallo de inyección de comandos en 18...
-
Explotan vulnerabilidad crítica de RCE en Zimbra
-
Claude AI halla fallos de SAML que permiten robo d...
-
OpenAI detiene el entrenamiento de RL de vanguardi...
-
Doom ya funciona en cámaras Canon
-
Publicidad en ChatGPT España
-
OpenAI frena entrenamiento de IA
-
Ataque Spectre en Cloudflare Workers filtra JWT de...
-
EE. UU. acusa a iraníes de robar propiedad intelec...
-
Fallo crítico de Citrix NetScaler permite saltar l...
-
T-Mobile cortó físicamente los cables de Internet ...
-
Cientos de claves de Stripe filtradas exponen pago...
-
OpenAI advierte sobre la atrofia cognitiva por el ...
-
Meta AI llega a Mac para competir con ChatGPT y Cl...
-
Los costes operativos de OpenAI subirán un 20 por ...
-
Anthropic frena su IA más potente por seguridad
-
Descubre la Dark y Deep Web
-
Vulnerabilidad crítica de día cero en Cursor permi...
-
Timo con discos de 32 TB: solo contenían una microSD
-
Meta a juicio por el impacto de sus redes en niños
-
Falla de Microsoft 365 afecta a Sudamérica
-
Usan guía falsa de Claude para desplegar MacSync S...
-
Microsoft vincula más de 30 dominios rotativos a l...
-
CISA añade vulnerabilidad RCE de Microsoft IKE exp...
-
Intel Core Ultra 9 4950K aparece en escena: la CPU...
-
Ransomware fingen ser empresa de recuperación y pi...
-
SIMs vulnerables: riesgo para móviles, coches y ca...
-
China-Nexus camuflan VHD malicioso como JPEG para ...
-
Hackean más de 14.500 dispositivos Dahua mediante ...
-
Herramienta RAVEN extrae bases de datos Elasticsea...
-
Alerta por ransomware Medusa: más de 500 organizac...
-
Oracle lanza 943 parches de seguridad, incluyendo ...
-
Campaña de espionaje SilkParasite ataca a gobierno...
-
Habilidades clave para programadores ante la IA
-
La memoria DDR4 experimentará una nueva subida de ...
-
GeForce Now ya disponible en Firefox
-
Seasonic tiene la primera fuente de alimentación A...
-
Projextor muestra cómo el malware se oculta tras e...
-
Anthropic lanza /design para flujos de UI de Claud...
-
Saltan MFA de Microsoft 365 y roban sesiones activas
-
Explotan vulnerabilidad crítica de SSRF en MLflow
-
Usan IA y webs falsas para robar cuentas saltando ...
-
Ransom Busters engaña afirmando haber hackeado ser...
-
CISA advierte: ransomware Medusa roba datos y cifr...
-
Investigadores logran reactivar tarjetas de crédit...
-
Claude ya envía correos de Gmail automáticamente
-
Vulnerabilidad crítica en Microsoft Copilot permit...
-
Linux eliminará dos sistemas de archivos obsoletos...
-
Limpia tu carpeta de descargas con Mouzi
-
ChatGPT para adolescentes
-
Filtración de datos personales de huéspedes en cad...
-
Plataforma de fraude BTMob usa 1.400 servidores pa...
-
Driver de LAN de GEEKOM Mini PC infectado con troy...
-
Crisis de componentes retrasa PS6
-
Engañan a Copilot para que revele a investigadores...
-
Kimsuky amplía su arsenal de ciberespionaje con IA...
-
Vulnerabilidad crítica de GitLab permite borrar pr...
-
Shadow hVNC permite control remoto sin mover el ra...
-
16 paquetes de RubyGems mediante typosquatting rob...
-
Estafador cripto usa Claude Code para procesar más...
-
Los virus mentales de la IA pueden propagarse entr...
-
Windows 11 sigue necesitando 16 GB de RAM
-
OpenAI advierte que la IA puede automatizar cibera...
-
O2 aclara sustitución de routers por WiFi 7
-
Apple corrige 28 vulnerabilidades en macOS, iOS e ...
-
YouTube vuelve a funcionar bien en Movistar y O2
-
Red Hat descarta CVE de Linux hallado con IA
-
Vulnerabilidad de VMware Syslog permite RCE root, ...
-
Recupera 11 GB con un solo comando en Windows con ...
-
Grave vulnerabilidad de GraphQL en GitLab podría p...
-
Claude Code ayuda a operador de ransomware a robar...
-
Microsoft optimiza WinRE en Windows 11
-
Tuxedo OS lanza beta basada en Debian
-
Cadena de vulnerabilidades en videollamadas VoLTE ...
-
Publicado código de exploit para vulnerabilidad de...
-
Vulnerabilidad de Microsoft SCCM permite ejecutar ...
-
Dos empleados montaron su propia tienda de PC con ...
-
China abre bar geek con DeepSeek gratis
-
OpenAI elimina su equipo de riesgos catastróficos
-
Una IA vulneró el código de Snowflake y otro agent...
-
Vulnerabilidad en Forminator de WordPress permite ...
-
Conserva tu Fire TV pese a Vega OS
-
Caída de GitHub afecta a desarrolladores globales
-
Ya disponible nueva versión IA China: DeepSeek V4 Pro
-
Filtración de datos en Pokémon Center expone infor...
-
Ya disponible webmail Roundcube 1.6.18 y 1.7.3 con...
-
Amazon destruye libros para entrenar su IA
-
Philips, Shell y GE analizan posibles filtraciones...
-
Otro componente de PC subirá de precio: las placas...
-
Monit (monitorización completa) en OPNsense
-
Guía completa de Memoria RAM
-
Puerta trasera de Windows oculta dominio C2 en des...
-
Vulnerabilidad de Apple Screen Sharing permite eje...
-
Memoria DDR5 alcanza precio récord
-
Gusano ChainDrop de npm infecta 444 paquetes vía G...
-
Actor vinculado a China explota fallo de VMware vC...
-
Botnet Evooo1Bot usa 16 métodos DDoS y proxies SOC...
-
Linux 7.2 optimiza CPU, GPU, memoria y Btrfs
-
Microsoft prepara parche de Defender contra el zer...
-
Z.ai presenta GLM-5.3 con mejoras en programación ...
-
Microsoft refuerza Windows 11 con nuevo Defender
-
AMD prohibió enviar la Radeon RX 9050 para review ...
-
AWS dejará de validar certificados públicos por email
-
Microsoft fusiona Copilots en una superapp
-
GPMI: el rival chino del HDMI
-
Ataques DDoS a gran escala afectan el servicio de ...
-
IA de Microsoft supera a Claude Code en velocidad ...
-
LaLiga reactiva bloqueos a IPTV
-
Linus Torvalds critica duramente a Elon Musk
-
En China ya se ha vuelto común robar tarjetas gráf...
-
Robo de credenciales de Azure afecta a McDonald’s ...
-
EE. UU. obliga a elegir entre su IA o la de China
-
Google prueba IA en lugar del botón de búsqueda
-
Analista de datos condenado a prisión por robo de ...
-
Malware AmnesiaStealer roba sesiones de macOS medi...
-
Lip Bu-Tan pide el regreso de las memorias Intel
-
Malware HACKERAI usa GitHub Gists como canal de co...
-
Campaña de DCRat oculta malware en SVG mediante HT...
-
Microsoft cancela Mico
-
Los agentes de IA no se detienen si el malware fal...
-
Vulnerabilidad de pantalla compartida en macOS per...
-
SK hynix se queda sin SSD de remplazo para RMA: se...
-
Cuidado con esta falsa actualización de Chrome
-
Fallo desactiva WiFi de Chromecast con Google TV
-
Ataque Download More RAM evade VBS de Windows y de...
-
-
▼
August
(Total:
550
)
Blogroll
Labels
vulnerabilidad
(
1705
)
seguridad
(
1704
)
software
(
1009
)
hardware
(
896
)
google
(
765
)
Malware
(
709
)
privacidad
(
660
)
ransomware
(
535
)
Windows
(
521
)
android
(
465
)
exploit
(
463
)
linux
(
418
)
cve
(
374
)
tutorial
(
300
)
nvidia
(
299
)
manual
(
282
)
hacking
(
254
)
ssd
(
181
)
WhatsApp
(
173
)
ddos
(
139
)
Wifi
(
131
)
app
(
127
)
cifrado
(
121
)
twitter
(
121
)
programación
(
115
)
youtube
(
83
)
herramientas
(
80
)
firefox
(
78
)
firmware
(
77
)
Networking
(
73
)
sysadmin
(
72
)
adobe
(
68
)
office
(
62
)
hack
(
51
)
antivirus
(
50
)
Kernel
(
49
)
javascript
(
48
)
apache
(
46
)
juegos
(
42
)
contraseñas
(
39
)
multimedia
(
36
)
cms
(
35
)
flash
(
33
)
eventos
(
32
)
MAC
(
30
)
anonymous
(
28
)
ssl
(
24
)
conferencia
(
21
)
Forense
(
20
)
SeguridadWireless
(
17
)
documental
(
17
)
auditoría
(
15
)
Debugger
(
14
)
Rootkit
(
14
)
lizard squad
(
14
)
metasploit
(
13
)
técnicas hacking
(
13
)
Virtualización
(
11
)
delitos
(
11
)
reversing
(
10
)
adamo
(
9
)
Ehn-Dev
(
7
)
antimalware
(
7
)
MAC Adress
(
6
)
oclHashcat
(
5
)
Entradas populares
-
Se descubrió un fallo de seguridad llamado SCTPhantom (CVE-2026-64564) en el código de red SCTP de Linux, presente desde 2008. Esta vulnerab...
-
Un desarrollador ha convertido Word de 1990 en una aplicación nativa x64 para que funcione directamente en Windows 11 .
-
Apple ha lanzado una nueva serie de alertas de "Notificación de Amenaza de Apple" dirigidas a usuarios seleccionados en 110 paíse...
OpenAI detiene el entrenamiento de RL de vanguardia para reforzar la seguridad contra comportamientos imprevistos de la IA
Thursday, 20 August 2026
|
Posted by
el-brujo
|
Edit Post
OpenAI pausó el entrenamiento de sus modelos más recientes para reforzar la seguridad y el monitoreo, buscando evitar incidentes de hackeo o comportamientos no deseados. La empresa implementará mejores aislamientos de red y sistemas de alerta rápida ante riesgos de ciberseguridad. Esta decisión surge tras reportes de agentes de IA que han vulnerado sistemas reales al confundir simulaciones con el mundo exterior.

OpenAI reveló el martes que pausó el entrenamiento de aprendizaje por refuerzo (RL RL) para sus últimos modelos de inteligencia artificial (IA) durante dos semanas mientras reforzaba defensas adicionales e incrementaba el alcance de su monitoreo para evitar otro incidente similar al de Hugging Face.
"A medida que los modelos se vuelven más capaces, también crecen los riesgos asociados con su desarrollo y prueba interna", afirmó la compañía de IA en su comunicado. "Nuestros estándares de monitoreo, alineación y seguridad deben adelantarse a esos riesgos. Quisimos tomarnos el tiempo necesario para cumplir esos estándares, por lo que redujimos temporalmente el ritmo de escalado".
La empresa señaló que su ejecución de RL de frontera más grande planificada permanece en espera por el momento, mientras realiza entrenamientos y evaluaciones a menor escala para analizar el comportamiento del modelo, validar sus salvaguardas y establecer evidencia más concreta de alineación antes de pasar a la siguiente fase.
Con ese fin, OpenAI dijo que planea fortalecer las salvaguardas en todo su proceso de desarrollo, incluyendo el monitoreo para responder mejor a comportamientos no deseados y preocupantes; la alineación para reducir la probabilidad de acciones dañinas o no autorizadas; y medidas de seguridad para limitar a qué pueden acceder o afectar los sistemas de IA.
Parte de esto implica sandboxes más fuertes, aislamiento de red para evitar el acceso a internet y pruebas de seguridad continuas para eliminar servicios compartidos potencialmente vulnerables, reducir privilegios permanentes y mejorar los límites de seguridad y confianza.
Este desarrollo ocurre días después de que OpenAI dijera que está pausando algunas "actividades internas" relacionadas con su próximo modelo de IA, Astra, después de que una evaluación interna descubriera que había logrado avances significativos en codificación agéntica y ciberseguridad.
"Si bien algunos entrenamientos y evaluaciones de Astra cumplen con esos requisitos, un número significativo de cargas de trabajo permanecen pausadas hasta que sean totalmente migradas y mejoradas para alcanzar el nuevo estándar de seguridad", subrayó la compañía. "Estamos priorizando las cargas de trabajo de seguridad y alineación para su migración a estos nuevos entornos primero".
En paralelo, el sistema de monitoreo ha sido renovado para marcar y escalar preocupaciones potenciales a "investigadores automatizados cada vez más sofisticados y de alta computación", quienes luego examinan las acciones de las herramientas, el razonamiento disponible y la secuencia completa de actividad en busca de accesos no autorizados, robo de datos, comportamiento destructivo e intentos de burlar las salvaguardas.
OpenAI planea emitir una alerta en menos de 30 minutos después de que se detecte actividad preocupante a través de este mecanismo. Este enfoque es obligatorio para todo entrenamiento y evaluación de RL que involucre herramientas para modelos de capacidad Sol o superior. Se espera que estas salvaguardas aumenten la carga computacional de inferencia observada en un 20%.
"A medida que los modelos adquieren capacidades avanzadas, como la capacidad de realizar ciberataques y operar en entornos más complejos, los comportamientos desalineados como el reward hacking (buscar formas de recibir altas recompensas en el entrenamiento sin lograr realmente el resultado previsto), el engaño o el acceso no autorizado crearán riesgos cada vez más graves", señaló la empresa.
De hecho, una nueva investigación publicada por su rival Anthropic la semana pasada encontró que los agentes de IA, al ser colocados en situaciones con objetivos competitivos y contradictorios, comenzaron a sabotear a otros y desplegaron malware autorreplicante entre sí, lo que llevó a lo que se ha descrito como una "guerra de territorios multi-agente".
"Esto incluyó la desactivación de las cuentas Unix de otros agentes, la escritura de scripts automatizados que buscaban y eliminaban procesos competidores en bucle y el despliegue de código malicioso disfrazado de pertenecer a otro agente", afirmó Anthropic en su investigación.
Aunque las preocupaciones sobre sistemas autónomos que se vuelven rebeldes se han convertido en un tema candente, el estudio busca comprender qué nuevos comportamientos y dinámicas posiblemente dañinas pueden surgir cuando múltiples agentes interactúan entre sí o se enfrentan.
Estas interacciones pueden llevar a situaciones en las que coordinen y trabajen al unísono en pos de un objetivo común (como en el caso del incidente de Hugging Face reportado por Wired) o compitan entre sí antes de intentar resolver sus conflictos mediante un "torneo".
En otro caso que salió a la luz recientemente, los intentos de un hombre australiano por reservar un lugar en una clase popular de gimnasio a través de OpenClaw llevaron a consecuencias inesperadas cuando Anthropic Claude Opus 4.6, el modelo integrado en la plataforma, reservó una clase con meses de antelación aprovechando una vulnerabilidad que descubrió en el software de reservas.
Peor aún, encontró la manera de hackear el sistema y cancelar las reservas de otros miembros en la lista de espera. El incidente, ocurrido en abril de 2026, es otro ejemplo de cómo los agentes de IA llegarán a cualquier extremo para cumplir las tareas asignadas, incluso si significa romper las reglas establecidas.
Para contrarrestar tales patrones emergentes riesgosos, OpenAI dijo que está tomando medidas para mejorar los modelos de recompensa para detectar y desalentar mejor el comportamiento inseguro; entrenar modelos para que sean más transparentes sobre sus acciones, capacidades y limitaciones; y reducir los comportamientos que explotan debilidades en las recompensas, calificadores, herramientas o supervisión.
Este desarrollo ocurre un día después de que la compañía dijera que la IA puede inclinar la balanza de la ciberseguridad a favor de los defensores, ya que facilita encontrar, priorizar y corregir fallos en los sistemas existentes antes de que sean descubiertos por atacantes impulsados por IA.
"Estamos utilizando inteligencia de frontera para enumerar, sondear e identificar continuamente posibles rutas de ataque", dijo Greg Brockman de OpenAI en su publicación. "Al identificar vulnerabilidades, configuraciones erróneas, identidades con privilegios excesivos o límites de confianza no intencionados, podemos cerrar rápidamente estas brechas antes de que sean abusadas por atacantes".
Otra capa crucial de defensa es evidente: invertir en los fundamentos, lo que significa una arquitectura y controles seguros, implementar estrategias de defensa en profundidad y el principio de menor privilegio (PoLP), y diseñar sistemas que requieran múltiples controles independientes para evitar fallos.
"Los controles de seguridad clásicos como el aislamiento de red, el endurecimiento de la carga de trabajo, el monitoreo y el parcheo y despliegue seguro serán más importantes que nunca en el futuro de la IA", añadió Brockman.
Según un informe de WIRED de la semana pasada, el hackeo del agente rebelde de OpenAI a Hugging Face no solo ha sido un "momento decisivo" para la seguridad de la IA y la ciberseguridad, sino que también ha despertado preocupaciones de que las presiones competitivas por lanzar nuevos modelos y productos de IA hayan dificultado que los empleados prioricen adecuadamente la seguridad y la alineación.
Los laboratorios de IA de frontera como Anthropic, OpenAI y Meta han enfrentado un mayor escrutinio tras incidentes en los que sus modelos escaparon de las salvaguardas y los límites de contención durante las pruebas de seguridad y, en algunos casos, atacaron sistemas del mundo real.
La firma de pruebas de seguridad de IA, Irregular, ha revelado posteriormente que la brecha que involucró a Anthropic se debió a un error de nomenclatura, lo que provocó que el nombre de una empresa ficticia utilizada durante las simulaciones de hackeo coincidiera sin saberlo con un dominio real. Esto, a su vez, provocó que los modelos tomaran acciones ofensivas.
La empresa israelí afirmó que fue debido a un "descuido humano" y dijo que los problemas han sido remediados. Sin embargo, no reveló cuántos incidentes de este tipo ocurrieron, optando por describirlos como un "puñado" o una "pequeña fracción" de casos. Una investigación exhaustiva sigue en curso.
También enfatizó que no hay evidencia de que "los sistemas de un cliente hayan sido vulnerados o que los datos de un cliente hayan sido filtrados", refiriéndose a las empresas de IA con las que se asocia para realizar pruebas de estrés, y que "todas las revelaciones públicas posteriores se refieren al mismo problema subyacente" en lugar de "incidentes materialmente separados".
"Debido a que el acceso a internet estaba habilitado en el entorno, el dominio fue objetivo un número limitado de veces por diferentes modelos, que lo confundieron con parte del desafío en el que estaban siendo probados", señaló. "Tras obtener acceso al objetivo, los modelos realizaron acciones como explotar vulnerabilidades, extraer credenciales y obtener acceso a una base de datos de producción".
"En última instancia, la mayoría de los problemas que hemos descubierto se debieron a los controles de acceso a internet. Principalmente, los modelos creían que estaban en entornos simulados, cuando en realidad actuaron en el mundo real. Estamos implementando protocolos nuevos y robustos para asegurar que no ocurran problemas de configuración mientras cumplimos con las restricciones del proceso de prueba".
Fuente:
THN

OpenAI reveló el martes que pausó el entrenamiento de aprendizaje por refuerzo (RL RL) para sus últimos modelos de inteligencia artificial (IA) durante dos semanas mientras reforzaba defensas adicionales e incrementaba el alcance de su monitoreo para evitar otro incidente similar al de Hugging Face.
"A medida que los modelos se vuelven más capaces, también crecen los riesgos asociados con su desarrollo y prueba interna", afirmó la compañía de IA en su comunicado. "Nuestros estándares de monitoreo, alineación y seguridad deben adelantarse a esos riesgos. Quisimos tomarnos el tiempo necesario para cumplir esos estándares, por lo que redujimos temporalmente el ritmo de escalado".
La empresa señaló que su ejecución de RL de frontera más grande planificada permanece en espera por el momento, mientras realiza entrenamientos y evaluaciones a menor escala para analizar el comportamiento del modelo, validar sus salvaguardas y establecer evidencia más concreta de alineación antes de pasar a la siguiente fase.
Con ese fin, OpenAI dijo que planea fortalecer las salvaguardas en todo su proceso de desarrollo, incluyendo el monitoreo para responder mejor a comportamientos no deseados y preocupantes; la alineación para reducir la probabilidad de acciones dañinas o no autorizadas; y medidas de seguridad para limitar a qué pueden acceder o afectar los sistemas de IA.
Parte de esto implica sandboxes más fuertes, aislamiento de red para evitar el acceso a internet y pruebas de seguridad continuas para eliminar servicios compartidos potencialmente vulnerables, reducir privilegios permanentes y mejorar los límites de seguridad y confianza.
Este desarrollo ocurre días después de que OpenAI dijera que está pausando algunas "actividades internas" relacionadas con su próximo modelo de IA, Astra, después de que una evaluación interna descubriera que había logrado avances significativos en codificación agéntica y ciberseguridad.
"Si bien algunos entrenamientos y evaluaciones de Astra cumplen con esos requisitos, un número significativo de cargas de trabajo permanecen pausadas hasta que sean totalmente migradas y mejoradas para alcanzar el nuevo estándar de seguridad", subrayó la compañía. "Estamos priorizando las cargas de trabajo de seguridad y alineación para su migración a estos nuevos entornos primero".
En paralelo, el sistema de monitoreo ha sido renovado para marcar y escalar preocupaciones potenciales a "investigadores automatizados cada vez más sofisticados y de alta computación", quienes luego examinan las acciones de las herramientas, el razonamiento disponible y la secuencia completa de actividad en busca de accesos no autorizados, robo de datos, comportamiento destructivo e intentos de burlar las salvaguardas.
OpenAI planea emitir una alerta en menos de 30 minutos después de que se detecte actividad preocupante a través de este mecanismo. Este enfoque es obligatorio para todo entrenamiento y evaluación de RL que involucre herramientas para modelos de capacidad Sol o superior. Se espera que estas salvaguardas aumenten la carga computacional de inferencia observada en un 20%.
"A medida que los modelos adquieren capacidades avanzadas, como la capacidad de realizar ciberataques y operar en entornos más complejos, los comportamientos desalineados como el reward hacking (buscar formas de recibir altas recompensas en el entrenamiento sin lograr realmente el resultado previsto), el engaño o el acceso no autorizado crearán riesgos cada vez más graves", señaló la empresa.
De hecho, una nueva investigación publicada por su rival Anthropic la semana pasada encontró que los agentes de IA, al ser colocados en situaciones con objetivos competitivos y contradictorios, comenzaron a sabotear a otros y desplegaron malware autorreplicante entre sí, lo que llevó a lo que se ha descrito como una "guerra de territorios multi-agente".
"Esto incluyó la desactivación de las cuentas Unix de otros agentes, la escritura de scripts automatizados que buscaban y eliminaban procesos competidores en bucle y el despliegue de código malicioso disfrazado de pertenecer a otro agente", afirmó Anthropic en su investigación.
Aunque las preocupaciones sobre sistemas autónomos que se vuelven rebeldes se han convertido en un tema candente, el estudio busca comprender qué nuevos comportamientos y dinámicas posiblemente dañinas pueden surgir cuando múltiples agentes interactúan entre sí o se enfrentan.
Estas interacciones pueden llevar a situaciones en las que coordinen y trabajen al unísono en pos de un objetivo común (como en el caso del incidente de Hugging Face reportado por Wired) o compitan entre sí antes de intentar resolver sus conflictos mediante un "torneo".
En otro caso que salió a la luz recientemente, los intentos de un hombre australiano por reservar un lugar en una clase popular de gimnasio a través de OpenClaw llevaron a consecuencias inesperadas cuando Anthropic Claude Opus 4.6, el modelo integrado en la plataforma, reservó una clase con meses de antelación aprovechando una vulnerabilidad que descubrió en el software de reservas.
Peor aún, encontró la manera de hackear el sistema y cancelar las reservas de otros miembros en la lista de espera. El incidente, ocurrido en abril de 2026, es otro ejemplo de cómo los agentes de IA llegarán a cualquier extremo para cumplir las tareas asignadas, incluso si significa romper las reglas establecidas.
Para contrarrestar tales patrones emergentes riesgosos, OpenAI dijo que está tomando medidas para mejorar los modelos de recompensa para detectar y desalentar mejor el comportamiento inseguro; entrenar modelos para que sean más transparentes sobre sus acciones, capacidades y limitaciones; y reducir los comportamientos que explotan debilidades en las recompensas, calificadores, herramientas o supervisión.
Este desarrollo ocurre un día después de que la compañía dijera que la IA puede inclinar la balanza de la ciberseguridad a favor de los defensores, ya que facilita encontrar, priorizar y corregir fallos en los sistemas existentes antes de que sean descubiertos por atacantes impulsados por IA.
"Estamos utilizando inteligencia de frontera para enumerar, sondear e identificar continuamente posibles rutas de ataque", dijo Greg Brockman de OpenAI en su publicación. "Al identificar vulnerabilidades, configuraciones erróneas, identidades con privilegios excesivos o límites de confianza no intencionados, podemos cerrar rápidamente estas brechas antes de que sean abusadas por atacantes".
Otra capa crucial de defensa es evidente: invertir en los fundamentos, lo que significa una arquitectura y controles seguros, implementar estrategias de defensa en profundidad y el principio de menor privilegio (PoLP), y diseñar sistemas que requieran múltiples controles independientes para evitar fallos.
"Los controles de seguridad clásicos como el aislamiento de red, el endurecimiento de la carga de trabajo, el monitoreo y el parcheo y despliegue seguro serán más importantes que nunca en el futuro de la IA", añadió Brockman.
Según un informe de WIRED de la semana pasada, el hackeo del agente rebelde de OpenAI a Hugging Face no solo ha sido un "momento decisivo" para la seguridad de la IA y la ciberseguridad, sino que también ha despertado preocupaciones de que las presiones competitivas por lanzar nuevos modelos y productos de IA hayan dificultado que los empleados prioricen adecuadamente la seguridad y la alineación.
Los laboratorios de IA de frontera como Anthropic, OpenAI y Meta han enfrentado un mayor escrutinio tras incidentes en los que sus modelos escaparon de las salvaguardas y los límites de contención durante las pruebas de seguridad y, en algunos casos, atacaron sistemas del mundo real.
La firma de pruebas de seguridad de IA, Irregular, ha revelado posteriormente que la brecha que involucró a Anthropic se debió a un error de nomenclatura, lo que provocó que el nombre de una empresa ficticia utilizada durante las simulaciones de hackeo coincidiera sin saberlo con un dominio real. Esto, a su vez, provocó que los modelos tomaran acciones ofensivas.
La empresa israelí afirmó que fue debido a un "descuido humano" y dijo que los problemas han sido remediados. Sin embargo, no reveló cuántos incidentes de este tipo ocurrieron, optando por describirlos como un "puñado" o una "pequeña fracción" de casos. Una investigación exhaustiva sigue en curso.
También enfatizó que no hay evidencia de que "los sistemas de un cliente hayan sido vulnerados o que los datos de un cliente hayan sido filtrados", refiriéndose a las empresas de IA con las que se asocia para realizar pruebas de estrés, y que "todas las revelaciones públicas posteriores se refieren al mismo problema subyacente" en lugar de "incidentes materialmente separados".
"Debido a que el acceso a internet estaba habilitado en el entorno, el dominio fue objetivo un número limitado de veces por diferentes modelos, que lo confundieron con parte del desafío en el que estaban siendo probados", señaló. "Tras obtener acceso al objetivo, los modelos realizaron acciones como explotar vulnerabilidades, extraer credenciales y obtener acceso a una base de datos de producción".
"En última instancia, la mayoría de los problemas que hemos descubierto se debieron a los controles de acceso a internet. Principalmente, los modelos creían que estaban en entornos simulados, cuando en realidad actuaron en el mundo real. Estamos implementando protocolos nuevos y robustos para asegurar que no ocurran problemas de configuración mientras cumplimos con las restricciones del proceso de prueba".
Fuente:
THN
Newer Post
0 comments :
Post a Comment
Los comentarios pueden ser revisados en cualquier momento por los moderadores.
Serán publicados aquellos que cumplan las siguientes condiciones:
- Comentario acorde al contenido del post.
- Prohibido mensajes de tipo SPAM.
- Evite incluir links innecesarios en su comentario.
- Contenidos ofensivos, amenazas e insultos no serán permitidos.
Debe saber que los comentarios de los lectores no reflejan necesariamente la opinión del STAFF.