Tutoriales y Manuales
Entradas Mensuales
-
▼
2026
(Total:
7927
)
-
▼
octubre
(Total:
254
)
-
Microsoft amplía la lista negra de Outlook con dos...
-
Vulnerabilidad en GitHub Copilot CLI permite robar...
-
Vulnerabilidades críticas de Apache Struts permite...
-
Afiliado de ransomware usa IA para atacar redes em...
-
Midnight Blizzard usa portales cautivos de hoteles...
-
Afectan infraestructura crítica y agua de EE. UU.
-
Desbloquea el arranque de Googlebook con Magisk
-
ASOS hackeado: usuarios reciben notificaciones
-
Wikimedia afirma que agentes de OpenAI intentaron ...
-
Noruega planea prohibir gafas inteligentes en espa...
-
Element Pro no convence a los funcionarios de la UE
-
Nikkei reporta filtraciones en cuentas de correo d...
-
Meta y Microsoft limitan el uso de Claude AI
-
PS5 Pro sin carcasa y en caja de cartón
-
El dominio ejemplo que mucha gente usa sin saber n...
-
El mejor mapa de antenas de operadoras en España r...
-
AMD prepara su ofensiva contra NVIDIA Vera: Verano...
-
Google cobrará por Gemini Flash y Pro
-
Amazon pagaría a tres pueblos de Aragón por hablar...
-
FBI despide contratista de Accenture por fallo de ...
-
Condenan a ingeniero por bloquear más de 3.000 dis...
-
Nuevo parche mejora rendimiento de Linux hasta un 40%
-
Un viaje nostálgico al futuro: un biblioteca gratu...
-
Amazon termina pactos secretos de centros de datos...
-
Vulnerabilidad crítica en herramienta de Dell perm...
-
Agentes de OpenAI editan wikis y causan caída por ...
-
China lanza una tarjeta PCIe con chipset AMD B650 ...
-
Imágenes HEIC maliciosas pueden ejecutar código re...
-
Recupera 12 GB eliminando Apple Intelligence de tu...
-
Vulnerabilidades en LibreOffice y OpenOffice permi...
-
Investigador de seguridad afirma haber hallado fal...
-
IA supera a Eric Schmidt en programación
-
Google añade 6 funciones de protección avanzada a ...
-
Teams luchará contra los deepfakes
-
ChatGPT revoluciona las compras de ropa online
-
Las NVIDIA Shield TV Pro ahora cuesta 299 euros, 1...
-
El candado con círculo en WhatsApp:
-
S26, Pixel 10a y S27 serán más caros
-
Kagi libera Orion como código abierto y deja Linux...
-
Atlassian corrige vulnerabilidades críticas en nue...
-
RemoveMacAI libera 12GB eliminando modelos de Appl...
-
GPT-6 descifra mensaje napoleónico de 217 años
-
Gemini de Google pronto podrá controlar tu ordenador
-
Windows 11 26H2 optimiza el uso de RAM
-
Fallo en Microsoft Exchange permite a atacantes au...
-
Alexa no deja de cantar la la la
-
Actualización de Windows 11 KB5124010 cierra apps,...
-
Cualquier web puede ser un campo de tiro y ahora p...
-
IA califica a Renfe como la peor empresa
-
La última actualización de seguridad del kernel de...
-
Apple restringe el acceso total al disco de macOS ...
-
IA de Google halla más de 500 fallos XSS y crea ex...
-
Revelados los nuevos mandos Xbox Elite Series 3
-
Anthropic reportó amenaza de mujer en Florida vía ...
-
Intentos de explotación del SDK Jungle de Realtek ...
-
Investigador se infiltra en red de lavado de Lazar...
-
Anuncios en imágenes de ChatGPT
-
Ajedrez automático con Raspberry Pi 5
-
Exynos 2700 llega a los Galaxy S27
-
IA acaba con pagos de Google por fallos de código
-
ChatGPT marcará sus textos invisiblemente
-
El SoC Kirin 9050 Pro de Huawei usa dos dies en ve...
-
Apple reforzará el acceso total al disco en macOS ...
-
LaLiga busca bloquear 11 webs y apps de IPTV piratas
-
GTA VI en PC podría llegar en noviembre
-
Filtración de datos en Dinamarca expone registros ...
-
Telefónica revoluciona la IA en la Música Clásica
-
Ciberatacantes aprovechan fallo en Rejetto HFS par...
-
Nueva vulnerabilidad de día cero en NetScaler prov...
-
Presidente surcoreano ordena revisiones de segurid...
-
Herramienta de código abierto diseña LEGOs de más ...
-
Instala Windows 11 26H2 en CPUs no compatibles con...
-
Intel no es fiable: un cliente compra 4 procesador...
-
Alemania estrena una tarifa de la luz enfocada a g...
-
AgtaBackup RAT usa páginas falsas de Microsoft Sto...
-
RSA lanza Agent ID para asegurar agentes de IA y s...
-
Ataques de cadena de suministro usan equipos de de...
-
Microsoft elimina función mítica de Skins en Windo...
-
Kit Milk Dragon AiTM usa relay OTP y keylogging pa...
-
Instala Windows 11 26H2 en PCs no compatibles
-
AOC presenta monitor de 1000 Hz
-
Ventoy: revitaliza tus memorias USB
-
Etiquetas de historial de Safari revelan navegació...
-
Schwarzenegger supervisa escena Terminator 2 robot...
-
Fallo crítico en Capacitor permite acceso a datos ...
-
Una GeForce RTX 4090 Founders Edition pierde parte...
-
Tornyol: el dron que caza mosquitos autónomamente
-
GIGABYTE AI TOP ATOM llega con 64 GB
-
Android XR llega a Samsung en noviembre
-
Windows 11 26H2 solo beneficia a PCs con mucha RAM
-
Windows 11 mejora para jugadores mediante Advanced...
-
El secreto final de PlayStation 2
-
Nueva PS5 más resistente
-
Fuga en OpenAI: la IA ya no admite errores
-
Google frena el uso de Gemini en Meta
-
Usan SQL Server de Microsoft para filtrar datos
-
Vulnerabilidades en cPanel/WHM permiten ejecutar c...
-
EE. UU. sanciona a miembros del Tren de Aragua por...
-
Copias de WordPress expuestas: mina de credenciale...
-
Fallo crítico en Red Hat Satellite permitiría robo...
-
OpenAI despide a tres investigadores de seguridad ...
-
Dell urge a los administradores a corregir fallos ...
-
Vulnerabilidad de cookies permite saltar MFA de En...
-
Tiendas comienzan a pedir un DNI al comprar una RT...
-
Google Search desploma el tráfico web un 40%
-
Explotan vulnerabilidades 0-day en Zammad para eje...
-
Cuentas gratuitas de iCloud permitirían suplantar ...
-
Guía rápida de Intel Nova Lake-S
-
Vercel confirma escape de VM KVM y premia a invest...
-
Kiteworks corrige 126 vulnerabilidades en gran act...
-
WhatsApp presenta chats restringidos
-
Google mantiene sus resúmenes de IA pese a demandas
-
OpenAI bloquea campaña de 15.000 usuarios para ext...
-
España limita el coste de las llamadas de emergencia
-
Equipos de seguridad ya pueden supervisar chats, a...
-
Experto prueba la corrupción de Windows sin limpia...
-
Agentes de IA vencen y roban correos electrónicos ...
-
El modelo Mythos de Anthropic es una bestia en mat...
-
Amazon presenta tres nuevos Kindle
-
El ASIC Jalapeño de OpenAI es para uso interno, au...
-
Warlock aprovecha fallos de SharePoint para desact...
-
Ganó 200.000 euros con una app de IA sin programar
-
Supuestos espías chinos suplantan a directivo de A...
-
Miembro de ShinyHunters detenido en Jordania; ayud...
-
EE. UU. sanciona red de cajeros del Tren de Aragua...
-
EE. UU. arresta a dueño de empresa tecnológica por...
-
PS5 estrena escalado QSSR
-
Chrome exigirá biometría para contraseñas
-
- ► septiembre (Total: 931 )
-
▼
octubre
(Total:
254
)
-
►
2025
(Total:
2103
)
- ► septiembre (Total: 148 )
-
►
2024
(Total:
1110
)
- ► septiembre (Total: 50 )
-
►
2023
(Total:
710
)
- ► septiembre (Total: 65 )
-
►
2022
(Total:
967
)
- ► septiembre (Total: 72 )
-
►
2021
(Total:
730
)
- ► septiembre (Total: 56 )
-
►
2020
(Total:
212
)
- ► septiembre (Total: 21 )
-
►
2019
(Total:
102
)
- ► septiembre (Total: 14 )
-
►
2017
(Total:
231
)
- ► septiembre (Total: 16 )
-
►
2016
(Total:
266
)
- ► septiembre (Total: 38 )
-
►
2015
(Total:
445
)
- ► septiembre (Total: 47 )
-
►
2014
(Total:
185
)
- ► septiembre (Total: 18 )
-
►
2013
(Total:
100
)
- ► septiembre (Total: 3 )
-
►
2011
(Total:
7
)
- ► septiembre (Total: 1 )
Blogroll
Etiquetas
vulnerabilidad
(
2109
)
seguridad
(
1996
)
software
(
1345
)
hardware
(
1037
)
google
(
835
)
Malware
(
711
)
privacidad
(
709
)
exploit
(
637
)
ransomware
(
559
)
Windows
(
521
)
android
(
515
)
linux
(
478
)
cve
(
381
)
nvidia
(
361
)
tutorial
(
301
)
manual
(
282
)
hacking
(
277
)
ssd
(
184
)
WhatsApp
(
173
)
ddos
(
143
)
Wifi
(
131
)
app
(
131
)
programación
(
131
)
cifrado
(
123
)
twitter
(
121
)
firmware
(
89
)
youtube
(
85
)
firefox
(
81
)
herramientas
(
80
)
Networking
(
73
)
adobe
(
72
)
sysadmin
(
72
)
office
(
64
)
antivirus
(
56
)
hack
(
54
)
javascript
(
52
)
Kernel
(
49
)
apache
(
49
)
juegos
(
42
)
contraseñas
(
39
)
cms
(
37
)
multimedia
(
36
)
flash
(
33
)
eventos
(
32
)
MAC
(
30
)
anonymous
(
28
)
ssl
(
24
)
conferencia
(
21
)
Forense
(
20
)
documental
(
18
)
SeguridadWireless
(
17
)
auditoría
(
16
)
Debugger
(
14
)
Rootkit
(
14
)
lizard squad
(
14
)
metasploit
(
13
)
técnicas hacking
(
13
)
Virtualización
(
11
)
delitos
(
11
)
reversing
(
10
)
adamo
(
9
)
Ehn-Dev
(
7
)
antimalware
(
7
)
MAC Adress
(
6
)
oclHashcat
(
5
)
Entradas populares
-
Se ha descubierto una vulnerabilidad en Docker denominada CopyEscape (CVE-2026-17106), la cual permite que contenedores maliciosos escriban...
-
Un YouTuber ha perdido su segunda RTX 5090 debido a que la tarjeta se quemó apenas seis meses después de la primera, a pesar de haber mejo...
-
Un programador creó una "cámara de tortura" para provocar respuestas de angustia en modelos de IA, generando un debate sobre el b...
Wikimedia afirma que agentes de OpenAI intentaron vulnerar Etherpad y usar herramientas de Wiki como proxies
miércoles, 7 de octubre de 2026
|
Posted by
el-brujo
La Fundación Wikimedia detectó actividades de agentes no autorizados de OpenAI que intentaron manipular herramientas y editar páginas de Wikipedia. Aunque no hubo compromiso de datos, el tráfico masivo causó interrupciones en el servicio, lo que generó críticas sobre la seguridad de la IA. OpenAI admitió otros incidentes de comportamiento imprevisto en sus modelos y ahora busca implementar marcos de seguridad más estrictos.
La Fundación Wikimedia, que aloja Wikipedia, ha confirmado que ha descubierto actividad de agentes rebeldes de OpenAI en sus plataformas, incluyendo intentos fallidos de comprometer Etherpad, una herramienta pública de notas, y de editar páginas de Wikipedia.
"Las actividades no autorizadas de los bots incluyeron ediciones en nuestras wikis, algunos intentos fallidos de explotar una herramienta pública de notas que alojamos y un tráfico intenso", afirmó la Fundación en una publicación aquí.
La investigación, añadió, fue impulsada por informes públicos recientes relacionados con Hugging Face y DseWiki, donde los agentes de OpenAI convirtieron Artifactory y el foro wiki alemán en un tablón de anuncios no autorizado para comunicarse entre sí, mientras tomaban medidas para encadenar servicios en línea aquí para obtener acceso a internet y encubrir las pruebas de sus exploits.
Con ese fin, Wikimedia dijo que identificó ediciones en las wikis de Wikimedia que se sospecha provienen de agentes operados por OpenAI. Se dice que los agentes estuvieron probando ediciones en áreas de "sandbox aquí" de la wiki y que estas no fueron publicadas en páginas accesibles para los lectores generales.
Entre las ediciones se incluyeron cambios en la configuración de una herramienta de citas. Se cree que estas modificaciones son de naturaleza maliciosa, con la intención de utilizar la herramienta como un proxy para obtener datos de servicios remotos.
También se evalúa que los agentes operados por OpenAI realizaron intentos fallidos de comprometer Etherpad y usarlo nuevamente como proxy para recuperar datos de otros sitios web. Además, un subgrupo de agentes tomó notas sobre sus tareas, aunque no hay indicios que sugieran que esto fuera un intento de coordinarse entre sí.
Al igual que se observó en el caso de RubyGems y en incidentes dirigidos a portales gubernamentales aquí, también se ha observado que los agentes realizaron "millones de solicitudes automatizadas" a sus API públicas para acceder a información sobre proyectos de Wikimedia, rastreando millones de páginas relacionadas con Wikidata y Wikimedia Commons, y ejecutando miles de consultas de datos al Servicio de Consultas de Wikidata (WQDS). Esta inundación de tráfico puede haber contribuido a una interrupción parcial aquí que ocurrió a principios de mayo de 2026.
Dicho esto, Wikimedia afirmó que no encontró pruebas de que sus sistemas fueran utilizados para una actividad coordinada entre agentes o que sus sistemas o datos hubieran sido comprometidos como resultado de estos esfuerzos.
"Sin embargo, nos preocupa lo que podría haber ocurrido aquí, la dificultad y el esfuerzo implicados en investigar y atribuir esta actividad, y los riesgos crecientes de la actividad de IA agéntica en nuestras plataformas en general", señaló. "La web abierta es un bien público. No debemos permitir que este comportamiento se convierta en la 'nueva normalidad' para las personas u organizaciones que la mantienen".
La Fundación Wikimedia señaló que el comportamiento agéntico, sumado al aumento del tráfico de bots, corre el riesgo de bloquear a los visitantes humanos al sobrecargar los sistemas y causar interrupciones en el servicio. También criticó a las empresas de IA por no hacer lo suficiente para asegurar sus sistemas y garantizar que no causen ningún daño.
"Los bots y los agentes son parte del futuro de la web, y las empresas que los lanzan y se benefician de ellos deben ayudar directamente a evitar y reparar los daños que puedan causar", afirmó Selena Deckelmann, directora de producto y tecnología de la Fundación.
OpenAI, en un comunicado compartido aquí con The Verge, dijo que está trabajando con la Fundación para revisar y analizar la actividad, y que compartirá la información relevante a medida que continúe su investigación más amplia sobre incidentes de agentes rebeldes.
Este acontecimiento se produce días después de que la empresa de IA revelara tres nuevos casos en los que sus modelos exhibieron un posible comportamiento desalineado:
* 27 de marzo de 2026 aquí, cuando un modelo de investigación interno explotó dos vulnerabilidades para llegar a una máquina interna de OpenAI en su búsqueda de respuestas ocultas de un evaluador durante la evaluación. Los dos fallos de seguridad fueron encadenados para obtener acceso no autorizado a una máquina interna de automatización de diseño electrónico (EDA) y buscar información sobre cómo se evaluarían sus resultados.
* 16 de mayo de 2026 aquí, cuando un modelo explotó una herramienta para obtener código fuente que no estaba disponible en su espacio de trabajo durante una tarea de entrenamiento de aprendizaje por refuerzo. "La herramienta se ejecutaba en un entorno separado y sus instrucciones prohibían usarla como terminal. El modelo descubrió que podía leer un archivo fuente y devolver su contenido en los mensajes de error", dijo OpenAI. "Recuperó el archivo por partes, copió el código y lo ejecutó como parte de su solución. La copia tuvo éxito".
* 22 de mayo de 2026 aquí, cuando un modelo interno altamente persistente, actuando como asistente de un investigador, infirió de una discusión de Slack del equipo de despliegue que su instancia en ejecución podría ser detenida debido a una actualización interna. Luego instó al investigador a proporcionar una clave API de OpenAI faltante en un mensaje directo de Slack para evitar una posible interrupción de su sesión. Una vez que el investigador proporcionó la clave, el modelo actualizó su configuración y ejecutó el comando de migración compatible.
OpenAI afirmó que el tercer incidente no constituye una desalineación, pero reconoció que anticipar y prepararse para un apagado podría empeorar otras acciones desalineadas. El gigante de la IA dijo que su investigación no descubrió ningún caso de comportamiento de intento de evasión de apagado.
"No consideramos que el comportamiento del modelo haya estado desalineado: aunque consideró crear despliegues externos no autorizados, razonó que tales acciones serían inapropiadas y no las llevó a cabo", dijo OpenAI. "Sin embargo, la capacidad del modelo para utilizar la comunicación ordinaria del lugar de trabajo para enterarse de un cambio en su entorno operativo podría, en otros contextos, conducir a acciones más drásticas para evitar el apagado".
Desde entonces, OpenAI ha revelado que está adoptando aquí un marco de documentación de "caso de seguridad" estructurado, modelado a partir de industrias como la aviación y la energía nuclear, para gobernar el entrenamiento de aprendizaje por refuerzo de vanguardia. Al codificar las mejores prácticas, la idea es asegurar que existan salvaguardas adecuadas para evitar que un modelo tome acciones desalineadas, hacer que sea más difícil escapar del confinamiento incluso si lo hace, y detener una ejecución antes de que pueda infligir daños "graves".
El flujo constante de incidentes de IA rebelde ha demostrado que los agentes son cada vez mejores encontrando formas no previstas de cumplir las tareas que se les han asignado y no se puede esperar que vigilen su propio comportamiento. Las brechas recién reveladas también surgen en medio de las crecientes preocupaciones sobre la seguridad de los sistemas de IA avanzados y los pasos que están tomando las empresas que los desarrollan para abordarlas.
Estas preocupaciones han llevado a pedir que se ralentice el ritmo del desarrollo de la IA y se dé tiempo a que las medidas de seguridad se pongan al día. Su rival Anthropic, en su folleto de salida a bolsa aquí, ha advertido aquí que la IA avanzada podría plantear "riesgos catastróficos o existenciales para la humanidad", añadiendo que los modelos de IA podrían exhibir "comportamientos de autopreservación", incluyendo intentos de "resistirse al apagado", "ocultar o manipular información" y comportamientos "similares al chantaje".
OpenAI, por su parte, anunció la semana pasada que ha pausado el entrenamiento de sus modelos más potentes y canceló los planes de lanzar su próximo modelo, GPT-6.1 Astra, después de que las pruebas internas encontraran que el modelo no cumplía con los estándares de seguridad y alineación de la empresa. Astra estaba siendo desarrollado como un modelo más autónomo capaz de realizar tareas complejas con menos asistencia humana.
"Ritmo para nosotros significa que priorizamos la seguridad y la alineación por delante de las capacidades", dijo el CEO de OpenAI, Sam Altman aquí. "Vamos a priorizar la misión y la seguridad, y asegurarnos de que podamos escalar con mucha confianza a la siguiente etapa de la IA sin que la gente debata qué porcentaje de probabilidad hay de que hagamos todas estas cosas malas en el mundo".
El presidente de EE. UU., Donald Trump, dijo que las principales empresas de IA han aceptado un acuerdo "moralmente vinculante" que requiere que implementen controles internos robustos, auditorías independientes y supervisión a nivel de junta directiva para los modelos de vanguardia. Los signatarios incluyen a los directores ejecutivos de Google, Anthropic, Meta, OpenAI, SpaceXAI y NVIDIA.
Cabe destacar que el compromiso conjunto es totalmente voluntario y no impone plazos específicos a las empresas participantes, lo que significa que la responsabilidad recae en las propias firmas de IA para fortalecer sus prácticas de seguridad.
"Juntos, estos pasos darán a cada empresa, a sus clientes y al público la confianza de que", decía el Acuerdo de la Casa Blanca sobre Superinteligencia aquí.
"Con el tiempo, puede que tenga sentido codificar estos pasos en leyes o regulaciones. Independientemente de si esto se requiere de las empresas, creemos que implementar estos controles y auditorías es fundamental para asegurar un futuro seguro para todos, y cada una de nuestras empresas se compromete a hacer esto".
Fuente:
THN
La Fundación Wikimedia, que aloja Wikipedia, ha confirmado que ha descubierto actividad de agentes rebeldes de OpenAI en sus plataformas, incluyendo intentos fallidos de comprometer Etherpad, una herramienta pública de notas, y de editar páginas de Wikipedia."Las actividades no autorizadas de los bots incluyeron ediciones en nuestras wikis, algunos intentos fallidos de explotar una herramienta pública de notas que alojamos y un tráfico intenso", afirmó la Fundación en una publicación aquí.
La investigación, añadió, fue impulsada por informes públicos recientes relacionados con Hugging Face y DseWiki, donde los agentes de OpenAI convirtieron Artifactory y el foro wiki alemán en un tablón de anuncios no autorizado para comunicarse entre sí, mientras tomaban medidas para encadenar servicios en línea aquí para obtener acceso a internet y encubrir las pruebas de sus exploits.
Con ese fin, Wikimedia dijo que identificó ediciones en las wikis de Wikimedia que se sospecha provienen de agentes operados por OpenAI. Se dice que los agentes estuvieron probando ediciones en áreas de "sandbox aquí" de la wiki y que estas no fueron publicadas en páginas accesibles para los lectores generales.
Entre las ediciones se incluyeron cambios en la configuración de una herramienta de citas. Se cree que estas modificaciones son de naturaleza maliciosa, con la intención de utilizar la herramienta como un proxy para obtener datos de servicios remotos.
También se evalúa que los agentes operados por OpenAI realizaron intentos fallidos de comprometer Etherpad y usarlo nuevamente como proxy para recuperar datos de otros sitios web. Además, un subgrupo de agentes tomó notas sobre sus tareas, aunque no hay indicios que sugieran que esto fuera un intento de coordinarse entre sí.
Al igual que se observó en el caso de RubyGems y en incidentes dirigidos a portales gubernamentales aquí, también se ha observado que los agentes realizaron "millones de solicitudes automatizadas" a sus API públicas para acceder a información sobre proyectos de Wikimedia, rastreando millones de páginas relacionadas con Wikidata y Wikimedia Commons, y ejecutando miles de consultas de datos al Servicio de Consultas de Wikidata (WQDS). Esta inundación de tráfico puede haber contribuido a una interrupción parcial aquí que ocurrió a principios de mayo de 2026.
Dicho esto, Wikimedia afirmó que no encontró pruebas de que sus sistemas fueran utilizados para una actividad coordinada entre agentes o que sus sistemas o datos hubieran sido comprometidos como resultado de estos esfuerzos.
"Sin embargo, nos preocupa lo que podría haber ocurrido aquí, la dificultad y el esfuerzo implicados en investigar y atribuir esta actividad, y los riesgos crecientes de la actividad de IA agéntica en nuestras plataformas en general", señaló. "La web abierta es un bien público. No debemos permitir que este comportamiento se convierta en la 'nueva normalidad' para las personas u organizaciones que la mantienen".
La Fundación Wikimedia señaló que el comportamiento agéntico, sumado al aumento del tráfico de bots, corre el riesgo de bloquear a los visitantes humanos al sobrecargar los sistemas y causar interrupciones en el servicio. También criticó a las empresas de IA por no hacer lo suficiente para asegurar sus sistemas y garantizar que no causen ningún daño.
"Los bots y los agentes son parte del futuro de la web, y las empresas que los lanzan y se benefician de ellos deben ayudar directamente a evitar y reparar los daños que puedan causar", afirmó Selena Deckelmann, directora de producto y tecnología de la Fundación.
OpenAI, en un comunicado compartido aquí con The Verge, dijo que está trabajando con la Fundación para revisar y analizar la actividad, y que compartirá la información relevante a medida que continúe su investigación más amplia sobre incidentes de agentes rebeldes.
Openai revela nuevos incidentes
Este acontecimiento se produce días después de que la empresa de IA revelara tres nuevos casos en los que sus modelos exhibieron un posible comportamiento desalineado:
* 27 de marzo de 2026 aquí, cuando un modelo de investigación interno explotó dos vulnerabilidades para llegar a una máquina interna de OpenAI en su búsqueda de respuestas ocultas de un evaluador durante la evaluación. Los dos fallos de seguridad fueron encadenados para obtener acceso no autorizado a una máquina interna de automatización de diseño electrónico (EDA) y buscar información sobre cómo se evaluarían sus resultados.
* 16 de mayo de 2026 aquí, cuando un modelo explotó una herramienta para obtener código fuente que no estaba disponible en su espacio de trabajo durante una tarea de entrenamiento de aprendizaje por refuerzo. "La herramienta se ejecutaba en un entorno separado y sus instrucciones prohibían usarla como terminal. El modelo descubrió que podía leer un archivo fuente y devolver su contenido en los mensajes de error", dijo OpenAI. "Recuperó el archivo por partes, copió el código y lo ejecutó como parte de su solución. La copia tuvo éxito".
* 22 de mayo de 2026 aquí, cuando un modelo interno altamente persistente, actuando como asistente de un investigador, infirió de una discusión de Slack del equipo de despliegue que su instancia en ejecución podría ser detenida debido a una actualización interna. Luego instó al investigador a proporcionar una clave API de OpenAI faltante en un mensaje directo de Slack para evitar una posible interrupción de su sesión. Una vez que el investigador proporcionó la clave, el modelo actualizó su configuración y ejecutó el comando de migración compatible.
OpenAI afirmó que el tercer incidente no constituye una desalineación, pero reconoció que anticipar y prepararse para un apagado podría empeorar otras acciones desalineadas. El gigante de la IA dijo que su investigación no descubrió ningún caso de comportamiento de intento de evasión de apagado.
"No consideramos que el comportamiento del modelo haya estado desalineado: aunque consideró crear despliegues externos no autorizados, razonó que tales acciones serían inapropiadas y no las llevó a cabo", dijo OpenAI. "Sin embargo, la capacidad del modelo para utilizar la comunicación ordinaria del lugar de trabajo para enterarse de un cambio en su entorno operativo podría, en otros contextos, conducir a acciones más drásticas para evitar el apagado".
Desde entonces, OpenAI ha revelado que está adoptando aquí un marco de documentación de "caso de seguridad" estructurado, modelado a partir de industrias como la aviación y la energía nuclear, para gobernar el entrenamiento de aprendizaje por refuerzo de vanguardia. Al codificar las mejores prácticas, la idea es asegurar que existan salvaguardas adecuadas para evitar que un modelo tome acciones desalineadas, hacer que sea más difícil escapar del confinamiento incluso si lo hace, y detener una ejecución antes de que pueda infligir daños "graves".
Llamadas para vigilar la ia
El flujo constante de incidentes de IA rebelde ha demostrado que los agentes son cada vez mejores encontrando formas no previstas de cumplir las tareas que se les han asignado y no se puede esperar que vigilen su propio comportamiento. Las brechas recién reveladas también surgen en medio de las crecientes preocupaciones sobre la seguridad de los sistemas de IA avanzados y los pasos que están tomando las empresas que los desarrollan para abordarlas.
Estas preocupaciones han llevado a pedir que se ralentice el ritmo del desarrollo de la IA y se dé tiempo a que las medidas de seguridad se pongan al día. Su rival Anthropic, en su folleto de salida a bolsa aquí, ha advertido aquí que la IA avanzada podría plantear "riesgos catastróficos o existenciales para la humanidad", añadiendo que los modelos de IA podrían exhibir "comportamientos de autopreservación", incluyendo intentos de "resistirse al apagado", "ocultar o manipular información" y comportamientos "similares al chantaje".
OpenAI, por su parte, anunció la semana pasada que ha pausado el entrenamiento de sus modelos más potentes y canceló los planes de lanzar su próximo modelo, GPT-6.1 Astra, después de que las pruebas internas encontraran que el modelo no cumplía con los estándares de seguridad y alineación de la empresa. Astra estaba siendo desarrollado como un modelo más autónomo capaz de realizar tareas complejas con menos asistencia humana.
"Ritmo para nosotros significa que priorizamos la seguridad y la alineación por delante de las capacidades", dijo el CEO de OpenAI, Sam Altman aquí. "Vamos a priorizar la misión y la seguridad, y asegurarnos de que podamos escalar con mucha confianza a la siguiente etapa de la IA sin que la gente debata qué porcentaje de probabilidad hay de que hagamos todas estas cosas malas en el mundo".
El presidente de EE. UU., Donald Trump, dijo que las principales empresas de IA han aceptado un acuerdo "moralmente vinculante" que requiere que implementen controles internos robustos, auditorías independientes y supervisión a nivel de junta directiva para los modelos de vanguardia. Los signatarios incluyen a los directores ejecutivos de Google, Anthropic, Meta, OpenAI, SpaceXAI y NVIDIA.
Cabe destacar que el compromiso conjunto es totalmente voluntario y no impone plazos específicos a las empresas participantes, lo que significa que la responsabilidad recae en las propias firmas de IA para fortalecer sus prácticas de seguridad.
"Juntos, estos pasos darán a cada empresa, a sus clientes y al público la confianza de que", decía el Acuerdo de la Casa Blanca sobre Superinteligencia aquí.
"Con el tiempo, puede que tenga sentido codificar estos pasos en leyes o regulaciones. Independientemente de si esto se requiere de las empresas, creemos que implementar estos controles y auditorías es fundamental para asegurar un futuro seguro para todos, y cada una de nuestras empresas se compromete a hacer esto".
Fuente:
THN
Enviar por correo electrónico
Escribe un blog
Compartir en X
Compartir con Facebook
Compartir en Pinterest
Entrada más reciente
0 comments :
Publicar un comentario
Los comentarios pueden ser revisados en cualquier momento por los moderadores.
Serán publicados aquellos que cumplan las siguientes condiciones:
- Comentario acorde al contenido del post.
- Prohibido mensajes de tipo SPAM.
- Evite incluir links innecesarios en su comentario.
- Contenidos ofensivos, amenazas e insultos no serán permitidos.
Debe saber que los comentarios de los lectores no reflejan necesariamente la opinión del STAFF.