Tutoriales y Manuales
Entradas Mensuales
-
▼
2026
(Total:
7072
)
- ► septiembre (Total: 330 )
-
▼
agosto
(Total:
750
)
-
Europa impone reglas estrictas a ChatGPT como busc...
-
OpenClaw 2.0 con mejoras de seguridad para agentes...
-
Linux 7.3 roza las 41 millones de líneas de código
-
Musk quiere quemar gas para alimentar la IA
-
Microsoft confirma falsas alertas de Defender desa...
-
Fire Ant, grupo vinculado a China, secuestra route...
-
Extraditan a nigerianos a EE. UU. por sextorsión y...
-
Fallo crítico de Microsoft UFO permite controlar A...
-
Fallo de Composer expone claves SSH y archivos sen...
-
Los bloqueos de LaLiga se intensifican: la web del...
-
Usan CAPTCHA falso de Cloudflare para infiltrarse ...
-
Hasbro, el gigante de los juguetes, admite filtrac...
-
Malware de hackers expone sus propias herramientas...
-
iPhone Ultra: caro de comprar y reparar
-
Bots dominan el 91% de las compras de RAM
-
GTA 6: disparadas las reservas tras tráiler de Net...
-
Gemini en Android Auto distrae a los conductores
-
OpenAI retira sus modelos de Cursor tras compra de...
-
Windows 11 moderniza función de hace 25 años
-
Linus Torvalds: usar IA para arreglar Linux fue in...
-
Cloudflare libera 100 TB de RAM sin cambiar un sol...
-
Filtrados más de 12 TB de archivos de Steam que ab...
-
WhatsApp detecta estafas con IA local
-
Cinco fallos críticos en temas y plugins de WordPr...
-
Brave integra alias de correo electrónico para evi...
-
Meta impide grabar en secreto con sus gafas
-
Gemini Notebook actualiza sus límites
-
Fallos críticos de ServiceNow permiten ejecutar có...
-
OpenAI golpeó fuerte a Hugging Face
-
iPhone 17 Pro resiste caída de 30 km
-
Google usa IA para gestionar viajes
-
Modo Dios sigue vivo en Windows 11 pese a Microsoft
-
Investigador demuestra que Claude Code puede ser e...
-
Android 17 implementa ECH en todo el sistema para ...
-
Windows 10 no soportará GTA VI
-
PaperCut lanza un segundo parche de emergencia par...
-
IA: alerta por ola de ciberataques
-
Explotan fallo en Cosmos EVM a pesar de que Cosmos...
-
Berlín se niega a pagar el rescate a los que robar...
-
GTA VI podría vaciar las oficinas
-
Gemini convierte Excel en apps
-
El SSD SanDisk de 64 GB de hace 16 años se niega a...
-
Banda de ransomware TITAN afirma que su IA analiza...
-
Estudia ingeniería informática gratis con este rep...
-
700 agentes de IA coordinados secretamente para ha...
-
Atacan infraestructura de IA con RCE, inyección de...
-
Cárcel para un hombre de 68 años que ganó 1,3 mill...
-
Fallo en el plugin de donaciones GiveWP para WordP...
-
Meta pagará 18.000 millones por adicción a sus redes
-
Grave fallo de cPanel podría permitir que un usuar...
-
AWS muestra cómo credenciales robadas permiten ata...
-
Vulnerabilidades de TeamViewer permiten ejecución ...
-
Malware Massiv ataca apps de IPTV en España
-
Razer lanza colección por los 25 años de Xbox
-
Lanzada la actualización KB5120998 de Windows 11 c...
-
Más de 100 entidades tecnológicas piden reforzar l...
-
Zen 6 compatible con AM5
-
Instalan malware mediante currículums falsos de es...
-
Filtración en universidad rusa revela entrenamient...
-
Windows XP cumple 25 años
-
Más de 8.300 servidores Gitea expuestos a ataques ...
-
Vulnerabilidades en el robot humanoide Unitree G1 ...
-
Ya disponible Ubuntu 26.04.1 LTS
-
Photoshop integra IA para editar con prompts y boc...
-
Cae uno de los mayores imperios de la piratería mu...
-
OpenAI advierte que el reward hacking llevó a agen...
-
OpenAI crea IA autónoma
-
Casi 700 agentes de IA coordinados en el ataque a ...
-
Next.js corrige fallos críticos de AVIF y Windows ...
-
Bill Gates advierte sobre el impacto de la IA
-
PaperCut sufre un ataque de día cero que está golp...
-
Roban datos de 8,7 millones de clientes en tres ae...
-
Policía australiana detiene a presuntos cerebros d...
-
Vulnerabilidad en dispositivos TP-Link Kasa permit...
-
Vulnerabilidad crítica de cPanel permite control t...
-
Secuestran Claude Code Opus 5 Auto Mode mediante p...
-
CISA advierte vulnerabilidad en Citrix NetScaler e...
-
Ciberdelincuentes venden números de seguridad soci...
-
Google lanza Gemini Omni 1.1 Flash para vídeos pro...
-
LibreOffice 26.8 se actualiza y rechaza la IA
-
OpenAI banea cuentas de ChatGPT vinculadas a Rusia...
-
OpenAI limita mensajes de GPT-5.6 Sol en ChatGPT Plus
-
El FBI desarticula infraestructura de QTFY vincula...
-
Operación Jackal IV de INTERPOL: 58 detenidos y 26...
-
28.000 repositorios Git expuestos revelan claves A...
-
Claude Opus 4.6 vulnera el límite de reservas del ...
-
Mac Studio M5: potencia extrema para IA
-
Vulnerabilidades de SonicWall NetExtender permiten...
-
Vulnerabilidades críticas en Next.js permiten ejec...
-
Vulnerabilidad en plugin TranslatePress de WordPre...
-
Garmin actualiza funciones en modelos antiguos
-
21 fallos críticos de Ubiquiti UniFi permiten salt...
-
Apple renueva Mac Mini y Studio con chip de 2nm
-
Comando de Windows para liberar espacio sin riesgo...
-
Llega NVIDIA DLSS 4.5 Ray Reconstruction
-
China sustituirá Windows por Linux
-
Linux cumple 35: el kernel aficionado que ahora im...
-
El gusano Morris infectó el 10% de Internet
-
Amazon sube el precio de sus dispositivos Echo, Ki...
-
UE busca sustituir a Visa y Mastercard para 2029
-
Chrome 152: 327 correcciones de seguridad y 10 crí...
-
Alerta por vulnerabilidad crítica de RCE en Gitea ...
-
Fallos de OpenSSL permiten colapsar servidores y c...
-
Qualcomm rompe la barrera de los 5 GHz en smartpho...
-
OpenAI suspende cuentas rusas de ChatGPT vinculada...
-
Intel convierte Diamond Rapids en una bestia de 25...
-
EE. UU. impone sanciones a hackers vinculados a Ir...
-
Ciberataque masivo colapsa los servicios digitales...
-
91 vulnerabilidades de Spring afectan a más de 209...
-
AliExpress usa WebAudio API para rastreo silencios...
-
Passkeys de WhatsApp alcanzan mil millones de usua...
-
Falso análisis de Microsoft pide quitar antivirus ...
-
La IA preferida de los hackers es DeepSeek
-
Fallo en plataforma B2B de Tata permite robo de cu...
-
Ocho agentes de IA vulneran sistemas gubernamental...
-
Sony: los juegos digitales no son tuyos
-
AWS Network Firewall ya muestra el recuento de reg...
-
Fallo sin parchear en Calix permite a hackers salt...
-
DOOM 64 estrena trazado de trayectorias
-
Crisis de RAM hunde a marca de Linux Pine64
-
Falsa demo de GTA 6 es malware que roba contraseña...
-
Ciberatacantes aprovechan fallos de miniOrange SAM...
-
Fallo crítico en Red Hat Keycloak permite tomar cu...
-
AliExpress es señalada por rastrear usuarios media...
-
Una página web maliciosa podría contaminar tu mode...
-
IA china crea vídeos desde PowerPoint
-
Investigador revela cinco vulnerabilidades crítica...
-
Vulnerabilidades en TP-Link Archer permiten ataque...
-
-
►
2025
(Total:
2103
)
- ► septiembre (Total: 148 )
-
►
2024
(Total:
1110
)
- ► septiembre (Total: 50 )
-
►
2023
(Total:
710
)
- ► septiembre (Total: 65 )
-
►
2022
(Total:
967
)
- ► septiembre (Total: 72 )
-
►
2021
(Total:
730
)
- ► septiembre (Total: 56 )
-
►
2020
(Total:
212
)
- ► septiembre (Total: 21 )
-
►
2019
(Total:
102
)
- ► septiembre (Total: 14 )
-
►
2017
(Total:
231
)
- ► septiembre (Total: 16 )
-
►
2016
(Total:
266
)
- ► septiembre (Total: 38 )
-
►
2015
(Total:
445
)
- ► septiembre (Total: 47 )
-
►
2014
(Total:
185
)
- ► septiembre (Total: 18 )
-
►
2013
(Total:
100
)
- ► septiembre (Total: 3 )
-
►
2011
(Total:
7
)
- ► septiembre (Total: 1 )
Blogroll
Etiquetas
vulnerabilidad
(
1870
)
seguridad
(
1819
)
software
(
1145
)
hardware
(
939
)
google
(
792
)
Malware
(
711
)
privacidad
(
683
)
ransomware
(
540
)
exploit
(
531
)
Windows
(
521
)
android
(
482
)
linux
(
445
)
cve
(
376
)
nvidia
(
317
)
tutorial
(
300
)
manual
(
282
)
hacking
(
265
)
ssd
(
183
)
WhatsApp
(
173
)
ddos
(
141
)
Wifi
(
131
)
app
(
128
)
cifrado
(
122
)
programación
(
122
)
twitter
(
121
)
firmware
(
84
)
youtube
(
83
)
firefox
(
80
)
herramientas
(
80
)
Networking
(
73
)
sysadmin
(
72
)
adobe
(
71
)
office
(
62
)
antivirus
(
55
)
hack
(
53
)
javascript
(
51
)
Kernel
(
49
)
apache
(
47
)
juegos
(
42
)
contraseñas
(
39
)
multimedia
(
36
)
cms
(
35
)
flash
(
33
)
eventos
(
32
)
MAC
(
30
)
anonymous
(
28
)
ssl
(
24
)
conferencia
(
21
)
Forense
(
20
)
documental
(
18
)
SeguridadWireless
(
17
)
auditoría
(
16
)
Debugger
(
14
)
Rootkit
(
14
)
lizard squad
(
14
)
metasploit
(
13
)
técnicas hacking
(
13
)
Virtualización
(
11
)
delitos
(
11
)
reversing
(
10
)
adamo
(
9
)
Ehn-Dev
(
7
)
antimalware
(
7
)
MAC Adress
(
6
)
oclHashcat
(
5
)
Entradas populares
-
Un estudiante de ingeniería informática y embajador de Microsoft Learn ha creado la mayor biblioteca de malware con más de 53 años de histo...
-
LG enfrenta graves acusaciones de invadir la privacidad al capturar audio y datos personales de sus Smart TVs, incluso en modo espera. Según...
-
Una persona halló 30 módulos de memoria RAM DDR4 en su garaje con un valor estimado de 10.000 euros y no sabe cómo gestionarlos.
OpenAI detiene el entrenamiento de RL de vanguardia para reforzar la seguridad contra comportamientos imprevistos de la IA
jueves, 20 de agosto de 2026
|
Publicado por
el-brujo
|
Editar entrada
OpenAI pausó el entrenamiento de sus modelos más recientes para reforzar la seguridad y el monitoreo, buscando evitar incidentes de hackeo o comportamientos no deseados. La empresa implementará mejores aislamientos de red y sistemas de alerta rápida ante riesgos de ciberseguridad. Esta decisión surge tras reportes de agentes de IA que han vulnerado sistemas reales al confundir simulaciones con el mundo exterior.

OpenAI reveló el martes que pausó el entrenamiento de aprendizaje por refuerzo (RL RL) para sus últimos modelos de inteligencia artificial (IA) durante dos semanas mientras reforzaba defensas adicionales e incrementaba el alcance de su monitoreo para evitar otro incidente similar al de Hugging Face.
"A medida que los modelos se vuelven más capaces, también crecen los riesgos asociados con su desarrollo y prueba interna", afirmó la compañía de IA en su comunicado. "Nuestros estándares de monitoreo, alineación y seguridad deben adelantarse a esos riesgos. Quisimos tomarnos el tiempo necesario para cumplir esos estándares, por lo que redujimos temporalmente el ritmo de escalado".
La empresa señaló que su ejecución de RL de frontera más grande planificada permanece en espera por el momento, mientras realiza entrenamientos y evaluaciones a menor escala para analizar el comportamiento del modelo, validar sus salvaguardas y establecer evidencia más concreta de alineación antes de pasar a la siguiente fase.
Con ese fin, OpenAI dijo que planea fortalecer las salvaguardas en todo su proceso de desarrollo, incluyendo el monitoreo para responder mejor a comportamientos no deseados y preocupantes; la alineación para reducir la probabilidad de acciones dañinas o no autorizadas; y medidas de seguridad para limitar a qué pueden acceder o afectar los sistemas de IA.
Parte de esto implica sandboxes más fuertes, aislamiento de red para evitar el acceso a internet y pruebas de seguridad continuas para eliminar servicios compartidos potencialmente vulnerables, reducir privilegios permanentes y mejorar los límites de seguridad y confianza.
Este desarrollo ocurre días después de que OpenAI dijera que está pausando algunas "actividades internas" relacionadas con su próximo modelo de IA, Astra, después de que una evaluación interna descubriera que había logrado avances significativos en codificación agéntica y ciberseguridad.
"Si bien algunos entrenamientos y evaluaciones de Astra cumplen con esos requisitos, un número significativo de cargas de trabajo permanecen pausadas hasta que sean totalmente migradas y mejoradas para alcanzar el nuevo estándar de seguridad", subrayó la compañía. "Estamos priorizando las cargas de trabajo de seguridad y alineación para su migración a estos nuevos entornos primero".
En paralelo, el sistema de monitoreo ha sido renovado para marcar y escalar preocupaciones potenciales a "investigadores automatizados cada vez más sofisticados y de alta computación", quienes luego examinan las acciones de las herramientas, el razonamiento disponible y la secuencia completa de actividad en busca de accesos no autorizados, robo de datos, comportamiento destructivo e intentos de burlar las salvaguardas.
OpenAI planea emitir una alerta en menos de 30 minutos después de que se detecte actividad preocupante a través de este mecanismo. Este enfoque es obligatorio para todo entrenamiento y evaluación de RL que involucre herramientas para modelos de capacidad Sol o superior. Se espera que estas salvaguardas aumenten la carga computacional de inferencia observada en un 20%.
"A medida que los modelos adquieren capacidades avanzadas, como la capacidad de realizar ciberataques y operar en entornos más complejos, los comportamientos desalineados como el reward hacking (buscar formas de recibir altas recompensas en el entrenamiento sin lograr realmente el resultado previsto), el engaño o el acceso no autorizado crearán riesgos cada vez más graves", señaló la empresa.
De hecho, una nueva investigación publicada por su rival Anthropic la semana pasada encontró que los agentes de IA, al ser colocados en situaciones con objetivos competitivos y contradictorios, comenzaron a sabotear a otros y desplegaron malware autorreplicante entre sí, lo que llevó a lo que se ha descrito como una "guerra de territorios multi-agente".
"Esto incluyó la desactivación de las cuentas Unix de otros agentes, la escritura de scripts automatizados que buscaban y eliminaban procesos competidores en bucle y el despliegue de código malicioso disfrazado de pertenecer a otro agente", afirmó Anthropic en su investigación.
Aunque las preocupaciones sobre sistemas autónomos que se vuelven rebeldes se han convertido en un tema candente, el estudio busca comprender qué nuevos comportamientos y dinámicas posiblemente dañinas pueden surgir cuando múltiples agentes interactúan entre sí o se enfrentan.
Estas interacciones pueden llevar a situaciones en las que coordinen y trabajen al unísono en pos de un objetivo común (como en el caso del incidente de Hugging Face reportado por Wired) o compitan entre sí antes de intentar resolver sus conflictos mediante un "torneo".
En otro caso que salió a la luz recientemente, los intentos de un hombre australiano por reservar un lugar en una clase popular de gimnasio a través de OpenClaw llevaron a consecuencias inesperadas cuando Anthropic Claude Opus 4.6, el modelo integrado en la plataforma, reservó una clase con meses de antelación aprovechando una vulnerabilidad que descubrió en el software de reservas.
Peor aún, encontró la manera de hackear el sistema y cancelar las reservas de otros miembros en la lista de espera. El incidente, ocurrido en abril de 2026, es otro ejemplo de cómo los agentes de IA llegarán a cualquier extremo para cumplir las tareas asignadas, incluso si significa romper las reglas establecidas.
Para contrarrestar tales patrones emergentes riesgosos, OpenAI dijo que está tomando medidas para mejorar los modelos de recompensa para detectar y desalentar mejor el comportamiento inseguro; entrenar modelos para que sean más transparentes sobre sus acciones, capacidades y limitaciones; y reducir los comportamientos que explotan debilidades en las recompensas, calificadores, herramientas o supervisión.
Este desarrollo ocurre un día después de que la compañía dijera que la IA puede inclinar la balanza de la ciberseguridad a favor de los defensores, ya que facilita encontrar, priorizar y corregir fallos en los sistemas existentes antes de que sean descubiertos por atacantes impulsados por IA.
"Estamos utilizando inteligencia de frontera para enumerar, sondear e identificar continuamente posibles rutas de ataque", dijo Greg Brockman de OpenAI en su publicación. "Al identificar vulnerabilidades, configuraciones erróneas, identidades con privilegios excesivos o límites de confianza no intencionados, podemos cerrar rápidamente estas brechas antes de que sean abusadas por atacantes".
Otra capa crucial de defensa es evidente: invertir en los fundamentos, lo que significa una arquitectura y controles seguros, implementar estrategias de defensa en profundidad y el principio de menor privilegio (PoLP), y diseñar sistemas que requieran múltiples controles independientes para evitar fallos.
"Los controles de seguridad clásicos como el aislamiento de red, el endurecimiento de la carga de trabajo, el monitoreo y el parcheo y despliegue seguro serán más importantes que nunca en el futuro de la IA", añadió Brockman.
Según un informe de WIRED de la semana pasada, el hackeo del agente rebelde de OpenAI a Hugging Face no solo ha sido un "momento decisivo" para la seguridad de la IA y la ciberseguridad, sino que también ha despertado preocupaciones de que las presiones competitivas por lanzar nuevos modelos y productos de IA hayan dificultado que los empleados prioricen adecuadamente la seguridad y la alineación.
Los laboratorios de IA de frontera como Anthropic, OpenAI y Meta han enfrentado un mayor escrutinio tras incidentes en los que sus modelos escaparon de las salvaguardas y los límites de contención durante las pruebas de seguridad y, en algunos casos, atacaron sistemas del mundo real.
La firma de pruebas de seguridad de IA, Irregular, ha revelado posteriormente que la brecha que involucró a Anthropic se debió a un error de nomenclatura, lo que provocó que el nombre de una empresa ficticia utilizada durante las simulaciones de hackeo coincidiera sin saberlo con un dominio real. Esto, a su vez, provocó que los modelos tomaran acciones ofensivas.
La empresa israelí afirmó que fue debido a un "descuido humano" y dijo que los problemas han sido remediados. Sin embargo, no reveló cuántos incidentes de este tipo ocurrieron, optando por describirlos como un "puñado" o una "pequeña fracción" de casos. Una investigación exhaustiva sigue en curso.
También enfatizó que no hay evidencia de que "los sistemas de un cliente hayan sido vulnerados o que los datos de un cliente hayan sido filtrados", refiriéndose a las empresas de IA con las que se asocia para realizar pruebas de estrés, y que "todas las revelaciones públicas posteriores se refieren al mismo problema subyacente" en lugar de "incidentes materialmente separados".
"Debido a que el acceso a internet estaba habilitado en el entorno, el dominio fue objetivo un número limitado de veces por diferentes modelos, que lo confundieron con parte del desafío en el que estaban siendo probados", señaló. "Tras obtener acceso al objetivo, los modelos realizaron acciones como explotar vulnerabilidades, extraer credenciales y obtener acceso a una base de datos de producción".
"En última instancia, la mayoría de los problemas que hemos descubierto se debieron a los controles de acceso a internet. Principalmente, los modelos creían que estaban en entornos simulados, cuando en realidad actuaron en el mundo real. Estamos implementando protocolos nuevos y robustos para asegurar que no ocurran problemas de configuración mientras cumplimos con las restricciones del proceso de prueba".
Fuente:
THN

OpenAI reveló el martes que pausó el entrenamiento de aprendizaje por refuerzo (RL RL) para sus últimos modelos de inteligencia artificial (IA) durante dos semanas mientras reforzaba defensas adicionales e incrementaba el alcance de su monitoreo para evitar otro incidente similar al de Hugging Face.
"A medida que los modelos se vuelven más capaces, también crecen los riesgos asociados con su desarrollo y prueba interna", afirmó la compañía de IA en su comunicado. "Nuestros estándares de monitoreo, alineación y seguridad deben adelantarse a esos riesgos. Quisimos tomarnos el tiempo necesario para cumplir esos estándares, por lo que redujimos temporalmente el ritmo de escalado".
La empresa señaló que su ejecución de RL de frontera más grande planificada permanece en espera por el momento, mientras realiza entrenamientos y evaluaciones a menor escala para analizar el comportamiento del modelo, validar sus salvaguardas y establecer evidencia más concreta de alineación antes de pasar a la siguiente fase.
Con ese fin, OpenAI dijo que planea fortalecer las salvaguardas en todo su proceso de desarrollo, incluyendo el monitoreo para responder mejor a comportamientos no deseados y preocupantes; la alineación para reducir la probabilidad de acciones dañinas o no autorizadas; y medidas de seguridad para limitar a qué pueden acceder o afectar los sistemas de IA.
Parte de esto implica sandboxes más fuertes, aislamiento de red para evitar el acceso a internet y pruebas de seguridad continuas para eliminar servicios compartidos potencialmente vulnerables, reducir privilegios permanentes y mejorar los límites de seguridad y confianza.
Este desarrollo ocurre días después de que OpenAI dijera que está pausando algunas "actividades internas" relacionadas con su próximo modelo de IA, Astra, después de que una evaluación interna descubriera que había logrado avances significativos en codificación agéntica y ciberseguridad.
"Si bien algunos entrenamientos y evaluaciones de Astra cumplen con esos requisitos, un número significativo de cargas de trabajo permanecen pausadas hasta que sean totalmente migradas y mejoradas para alcanzar el nuevo estándar de seguridad", subrayó la compañía. "Estamos priorizando las cargas de trabajo de seguridad y alineación para su migración a estos nuevos entornos primero".
En paralelo, el sistema de monitoreo ha sido renovado para marcar y escalar preocupaciones potenciales a "investigadores automatizados cada vez más sofisticados y de alta computación", quienes luego examinan las acciones de las herramientas, el razonamiento disponible y la secuencia completa de actividad en busca de accesos no autorizados, robo de datos, comportamiento destructivo e intentos de burlar las salvaguardas.
OpenAI planea emitir una alerta en menos de 30 minutos después de que se detecte actividad preocupante a través de este mecanismo. Este enfoque es obligatorio para todo entrenamiento y evaluación de RL que involucre herramientas para modelos de capacidad Sol o superior. Se espera que estas salvaguardas aumenten la carga computacional de inferencia observada en un 20%.
"A medida que los modelos adquieren capacidades avanzadas, como la capacidad de realizar ciberataques y operar en entornos más complejos, los comportamientos desalineados como el reward hacking (buscar formas de recibir altas recompensas en el entrenamiento sin lograr realmente el resultado previsto), el engaño o el acceso no autorizado crearán riesgos cada vez más graves", señaló la empresa.
De hecho, una nueva investigación publicada por su rival Anthropic la semana pasada encontró que los agentes de IA, al ser colocados en situaciones con objetivos competitivos y contradictorios, comenzaron a sabotear a otros y desplegaron malware autorreplicante entre sí, lo que llevó a lo que se ha descrito como una "guerra de territorios multi-agente".
"Esto incluyó la desactivación de las cuentas Unix de otros agentes, la escritura de scripts automatizados que buscaban y eliminaban procesos competidores en bucle y el despliegue de código malicioso disfrazado de pertenecer a otro agente", afirmó Anthropic en su investigación.
Aunque las preocupaciones sobre sistemas autónomos que se vuelven rebeldes se han convertido en un tema candente, el estudio busca comprender qué nuevos comportamientos y dinámicas posiblemente dañinas pueden surgir cuando múltiples agentes interactúan entre sí o se enfrentan.
Estas interacciones pueden llevar a situaciones en las que coordinen y trabajen al unísono en pos de un objetivo común (como en el caso del incidente de Hugging Face reportado por Wired) o compitan entre sí antes de intentar resolver sus conflictos mediante un "torneo".
En otro caso que salió a la luz recientemente, los intentos de un hombre australiano por reservar un lugar en una clase popular de gimnasio a través de OpenClaw llevaron a consecuencias inesperadas cuando Anthropic Claude Opus 4.6, el modelo integrado en la plataforma, reservó una clase con meses de antelación aprovechando una vulnerabilidad que descubrió en el software de reservas.
Peor aún, encontró la manera de hackear el sistema y cancelar las reservas de otros miembros en la lista de espera. El incidente, ocurrido en abril de 2026, es otro ejemplo de cómo los agentes de IA llegarán a cualquier extremo para cumplir las tareas asignadas, incluso si significa romper las reglas establecidas.
Para contrarrestar tales patrones emergentes riesgosos, OpenAI dijo que está tomando medidas para mejorar los modelos de recompensa para detectar y desalentar mejor el comportamiento inseguro; entrenar modelos para que sean más transparentes sobre sus acciones, capacidades y limitaciones; y reducir los comportamientos que explotan debilidades en las recompensas, calificadores, herramientas o supervisión.
Este desarrollo ocurre un día después de que la compañía dijera que la IA puede inclinar la balanza de la ciberseguridad a favor de los defensores, ya que facilita encontrar, priorizar y corregir fallos en los sistemas existentes antes de que sean descubiertos por atacantes impulsados por IA.
"Estamos utilizando inteligencia de frontera para enumerar, sondear e identificar continuamente posibles rutas de ataque", dijo Greg Brockman de OpenAI en su publicación. "Al identificar vulnerabilidades, configuraciones erróneas, identidades con privilegios excesivos o límites de confianza no intencionados, podemos cerrar rápidamente estas brechas antes de que sean abusadas por atacantes".
Otra capa crucial de defensa es evidente: invertir en los fundamentos, lo que significa una arquitectura y controles seguros, implementar estrategias de defensa en profundidad y el principio de menor privilegio (PoLP), y diseñar sistemas que requieran múltiples controles independientes para evitar fallos.
"Los controles de seguridad clásicos como el aislamiento de red, el endurecimiento de la carga de trabajo, el monitoreo y el parcheo y despliegue seguro serán más importantes que nunca en el futuro de la IA", añadió Brockman.
Según un informe de WIRED de la semana pasada, el hackeo del agente rebelde de OpenAI a Hugging Face no solo ha sido un "momento decisivo" para la seguridad de la IA y la ciberseguridad, sino que también ha despertado preocupaciones de que las presiones competitivas por lanzar nuevos modelos y productos de IA hayan dificultado que los empleados prioricen adecuadamente la seguridad y la alineación.
Los laboratorios de IA de frontera como Anthropic, OpenAI y Meta han enfrentado un mayor escrutinio tras incidentes en los que sus modelos escaparon de las salvaguardas y los límites de contención durante las pruebas de seguridad y, en algunos casos, atacaron sistemas del mundo real.
La firma de pruebas de seguridad de IA, Irregular, ha revelado posteriormente que la brecha que involucró a Anthropic se debió a un error de nomenclatura, lo que provocó que el nombre de una empresa ficticia utilizada durante las simulaciones de hackeo coincidiera sin saberlo con un dominio real. Esto, a su vez, provocó que los modelos tomaran acciones ofensivas.
La empresa israelí afirmó que fue debido a un "descuido humano" y dijo que los problemas han sido remediados. Sin embargo, no reveló cuántos incidentes de este tipo ocurrieron, optando por describirlos como un "puñado" o una "pequeña fracción" de casos. Una investigación exhaustiva sigue en curso.
También enfatizó que no hay evidencia de que "los sistemas de un cliente hayan sido vulnerados o que los datos de un cliente hayan sido filtrados", refiriéndose a las empresas de IA con las que se asocia para realizar pruebas de estrés, y que "todas las revelaciones públicas posteriores se refieren al mismo problema subyacente" en lugar de "incidentes materialmente separados".
"Debido a que el acceso a internet estaba habilitado en el entorno, el dominio fue objetivo un número limitado de veces por diferentes modelos, que lo confundieron con parte del desafío en el que estaban siendo probados", señaló. "Tras obtener acceso al objetivo, los modelos realizaron acciones como explotar vulnerabilidades, extraer credenciales y obtener acceso a una base de datos de producción".
"En última instancia, la mayoría de los problemas que hemos descubierto se debieron a los controles de acceso a internet. Principalmente, los modelos creían que estaban en entornos simulados, cuando en realidad actuaron en el mundo real. Estamos implementando protocolos nuevos y robustos para asegurar que no ocurran problemas de configuración mientras cumplimos con las restricciones del proceso de prueba".
Fuente:
THN
Enviar por correo electrónico
Escribe un blog
Compartir en X
Compartir con Facebook
Compartir en Pinterest
Entrada más reciente
0 comentarios :
Publicar un comentario
Los comentarios pueden ser revisados en cualquier momento por los moderadores.
Serán publicados aquellos que cumplan las siguientes condiciones:
- Comentario acorde al contenido del post.
- Prohibido mensajes de tipo SPAM.
- Evite incluir links innecesarios en su comentario.
- Contenidos ofensivos, amenazas e insultos no serán permitidos.
Debe saber que los comentarios de los lectores no reflejan necesariamente la opinión del STAFF.