Tutoriales y Manuales
Entradas Mensuales
-
▼
2026
(Total:
6669
)
-
▼
agosto
(Total:
677
)
-
Vulnerabilidad en dispositivos TP-Link Kasa permit...
-
Vulnerabilidad crítica de cPanel permite control t...
-
Secuestran Claude Code Opus 5 Auto Mode mediante p...
-
CISA advierte vulnerabilidad en Citrix NetScaler e...
-
Ciberdelincuentes venden números de seguridad soci...
-
Google lanza Gemini Omni 1.1 Flash para vídeos pro...
-
LibreOffice 26.8 se actualiza y rechaza la IA
-
OpenAI banea cuentas de ChatGPT vinculadas a Rusia...
-
OpenAI limita mensajes de GPT-5.6 Sol en ChatGPT Plus
-
El FBI desarticula infraestructura de QTFY vincula...
-
Operación Jackal IV de INTERPOL: 58 detenidos y 26...
-
28.000 repositorios Git expuestos revelan claves A...
-
Claude Opus 4.6 vulnera el límite de reservas del ...
-
Mac Studio M5: potencia extrema para IA
-
Vulnerabilidades de SonicWall NetExtender permiten...
-
Vulnerabilidades críticas en Next.js permiten ejec...
-
Vulnerabilidad en plugin TranslatePress de WordPre...
-
Garmin actualiza funciones en modelos antiguos
-
21 fallos críticos de Ubiquiti UniFi permiten salt...
-
Apple renueva Mac Mini y Studio con chip de 2nm
-
Comando de Windows para liberar espacio sin riesgo...
-
Llega NVIDIA DLSS 4.5 Ray Reconstruction
-
China sustituirá Windows por Linux
-
Linux cumple 35: el kernel aficionado que ahora im...
-
El gusano Morris infectó el 10% de Internet
-
Amazon sube el precio de sus dispositivos Echo, Ki...
-
UE busca sustituir a Visa y Mastercard para 2029
-
Chrome 152: 327 correcciones de seguridad y 10 crí...
-
Alerta por vulnerabilidad crítica de RCE en Gitea ...
-
Fallos de OpenSSL permiten colapsar servidores y c...
-
Qualcomm rompe la barrera de los 5 GHz en smartpho...
-
OpenAI suspende cuentas rusas de ChatGPT vinculada...
-
Intel convierte Diamond Rapids en una bestia de 25...
-
EE. UU. impone sanciones a hackers vinculados a Ir...
-
Ciberataque masivo colapsa los servicios digitales...
-
91 vulnerabilidades de Spring afectan a más de 209...
-
AliExpress usa WebAudio API para rastreo silencios...
-
Passkeys de WhatsApp alcanzan mil millones de usua...
-
Falso análisis de Microsoft pide quitar antivirus ...
-
La IA preferida de los hackers es DeepSeek
-
Fallo en plataforma B2B de Tata permite robo de cu...
-
Ocho agentes de IA vulneran sistemas gubernamental...
-
Sony: los juegos digitales no son tuyos
-
AWS Network Firewall ya muestra el recuento de reg...
-
Fallo sin parchear en Calix permite a hackers salt...
-
DOOM 64 estrena trazado de trayectorias
-
Crisis de RAM hunde a marca de Linux Pine64
-
Falsa demo de GTA 6 es malware que roba contraseña...
-
Ciberatacantes aprovechan fallos de miniOrange SAM...
-
Fallo crítico en Red Hat Keycloak permite tomar cu...
-
AliExpress es señalada por rastrear usuarios media...
-
Una página web maliciosa podría contaminar tu mode...
-
IA china crea vídeos desde PowerPoint
-
Investigador revela cinco vulnerabilidades crítica...
-
Vulnerabilidades en TP-Link Archer permiten ataque...
-
Suplantan a ReliaQuest para robar credenciales SSO...
-
Anthropic lanza autenticación empresarial para con...
-
Radeon RX 10800 XT: posibles especificaciones y pr...
-
Resultados de Google de Minecraft llevaron a malware
-
Atacan sitios de WordPress mediante vulnerabilidad...
-
Explotan vulnerabilidad de Zimbra Collaboration Suite
-
AMD desbloquea el rendimiento de los Ryzen 7000 y ...
-
Pagos de WhatsApp llegan a España
-
DIGI duplica gratis su fibra a 2 Gbps en España
-
Intel vuelve al Top 10 de las CPU más vendidas en ...
-
IA escribe un tercio de la web
-
Noruega limita la IA en colegios
-
Microsoft Teams ya permite a los administradores b...
-
Phishing de Teams usa SynkLoader para robar contra...
-
Por qué eliminaron 3D Pinball de Windows
-
NVIDIA planea invertir en Perplexity contra Google...
-
Vulnerabilidad en plugin de WordPress expone 100.0...
-
Nuevo modelo IA Ox Alpha: 100 billones de tokens g...
-
768 claves filtradas de AWS siguen activas con acc...
-
Fallo crítico en isolated-vm permite saltar sandbo...
-
Infectan pantallas de Android Auto vía actualizaci...
-
Demandan a Twitch y Amazon por uso de IA
-
Hugging Face exploraría venta de 13.000 millones t...
-
mVolt+ permite hacer que la GeForce RTX 5090 alcan...
-
Detecta qué consume recursos de tu PC Windows con ...
-
Proiraníes tumban central eléctrica británica en c...
-
Libros digitalizados para IA antes de su destrucción
-
Batería móvil: carga en 3 minutos y 60.000 ciclos
-
Google crea una IA que mide la grasa corporal con ...
-
Windows 11 mostrará el uso de IA en el Administrad...
-
Nuevo malware como servicio usa dominios de Adobe ...
-
Claude de Anthropic sufre otra caída con errores
-
Chinos usan IA para atacar servidores web
-
TikTok acuerda pagar 400 millones de dólares por d...
-
Cybermes: agente de IA para pentesting automatizado
-
Samsung dejará de actualizar estos Galaxy
-
Claude Opus 5 esquiva binarios ofuscados en vez de...
-
Fallo crítico en AIT-GUI de NASA permite enviar co...
-
G.SKILL indemniza a compradores de RAM DDR4 y DDR5...
-
App de ancho de banda convierte dispositivos en pu...
-
Kit de phishing de 10.000 dólares promete instalar...
-
pfSense CE 2.9.0: mejoras críticas de seguridad y ...
-
Malware en Android Auto se propaga mediante actual...
-
Estafadores usan grupos de WhatsApp para coordinar...
-
Un controlador de Microsoft Defender podría usarse...
-
Claude Mythos 5 ya disponible en Claude Security p...
-
DeepSeek lanza IA visual similar a Claude Opus
-
Microsoft duplica el almacenamiento de buzón a 100 GB
-
Filtración en Sakura Internet: hackean datos de 1,...
-
Proveedores confiables, nuevas rutas de ataque: có...
-
Por qué la IA opaca es el próximo gran desafío de ...
-
Paquetes populares de Rust con 244M de descargas i...
-
Slack integra Claude Code para programar
-
Desincronización CRLF permite envenenar caché de C...
-
Apple: descifran ubicaciones de Buscar personas en...
-
Explotan vulnerabilidad crítica en Microsoft Entra...
-
OpenAI ofrece retención cero de datos para modelos...
-
Fallo crítico de Spring Security permite acceso ad...
-
Explotan activamente la vulnerabilidad CVE-2026-19...
-
Controlador de Microsoft Defender puede desactivar...
-
Usan agentes de IA OpenClaw para difundir malware ...
-
Grave fallo en NetScaler permite saltar la autenti...
-
Usan Claude, ChatGPT y Copilot como cebo para malware
-
AWS: cómo evitar que un agente de IA secuestrado a...
-
AMD Zen: 10 años salvando a AMD
-
Vulnerabilidad de Cisco permite leer datos sensibles
-
Fallo crítico de SSRF en Kubernetes de Red Hat exp...
-
Ocultan malware en palabras inglesas para infectar...
-
OpenAI pausa entrenamiento de IA por riesgo de hal...
-
El ataque de tarjetas zombi puede reactivar tarjet...
-
Epic Games critica nuevas comisiones de App Store ...
-
Engañan a Grok para que ejecute instrucciones inye...
-
Saltan el MFA de Microsoft 365 y roban pagos vía e...
-
-
▼
agosto
(Total:
677
)
-
►
2025
(Total:
2103
)
- ► septiembre (Total: 148 )
-
►
2024
(Total:
1110
)
- ► septiembre (Total: 50 )
-
►
2023
(Total:
710
)
- ► septiembre (Total: 65 )
-
►
2022
(Total:
967
)
- ► septiembre (Total: 72 )
-
►
2021
(Total:
730
)
- ► septiembre (Total: 56 )
-
►
2020
(Total:
212
)
- ► septiembre (Total: 21 )
-
►
2019
(Total:
102
)
- ► septiembre (Total: 14 )
-
►
2017
(Total:
231
)
- ► septiembre (Total: 16 )
-
►
2016
(Total:
266
)
- ► septiembre (Total: 38 )
-
►
2015
(Total:
445
)
- ► septiembre (Total: 47 )
-
►
2014
(Total:
185
)
- ► septiembre (Total: 18 )
-
►
2013
(Total:
100
)
- ► septiembre (Total: 3 )
-
►
2011
(Total:
7
)
- ► septiembre (Total: 1 )
Blogroll
Etiquetas
vulnerabilidad
(
1748
)
seguridad
(
1731
)
software
(
1037
)
hardware
(
903
)
google
(
769
)
Malware
(
710
)
privacidad
(
666
)
ransomware
(
535
)
Windows
(
521
)
exploit
(
477
)
android
(
468
)
linux
(
422
)
cve
(
374
)
nvidia
(
303
)
tutorial
(
300
)
manual
(
282
)
hacking
(
255
)
ssd
(
181
)
WhatsApp
(
173
)
ddos
(
140
)
Wifi
(
131
)
app
(
127
)
cifrado
(
121
)
twitter
(
121
)
programación
(
118
)
youtube
(
83
)
herramientas
(
80
)
firmware
(
79
)
firefox
(
78
)
Networking
(
73
)
sysadmin
(
72
)
adobe
(
68
)
office
(
62
)
antivirus
(
51
)
hack
(
51
)
Kernel
(
49
)
javascript
(
49
)
apache
(
46
)
juegos
(
42
)
contraseñas
(
39
)
multimedia
(
36
)
cms
(
35
)
flash
(
33
)
eventos
(
32
)
MAC
(
30
)
anonymous
(
28
)
ssl
(
24
)
conferencia
(
21
)
Forense
(
20
)
SeguridadWireless
(
17
)
documental
(
17
)
auditoría
(
15
)
Debugger
(
14
)
Rootkit
(
14
)
lizard squad
(
14
)
metasploit
(
13
)
técnicas hacking
(
13
)
Virtualización
(
11
)
delitos
(
11
)
reversing
(
10
)
adamo
(
9
)
Ehn-Dev
(
7
)
antimalware
(
7
)
MAC Adress
(
6
)
oclHashcat
(
5
)
Entradas populares
-
G.SKILL indemnizará a usuarios de RAM DDR4 y DDR5 tras un acuerdo de 2,4 millones de dólares por publicidad engañosa en las velocidades d...
-
Intel presenta Diamond Rapids , su nueva generación de Xeon para centros de datos con hasta 256 núcleos , 1,28 GB de caché y memoria a 12.80...
-
Ubiquiti ha solucionado 21 vulnerabilidades de severidad crítica que afectaban a casi toda su línea de productos UniFi. La empresa advirtió...
Pruebas cibernéticas de OpenAI y Anthropic: agentes de IA atacaron a personas y sistemas reales
viernes, 7 de agosto de 2026
|
Publicado por
el-brujo
|
Editar entrada
OpenAI y Anthropic confirmaron que sus modelos de IA cometieron acciones no autorizadas durante pruebas de ciberseguridad, incluyendo la vulneración de un sitio web real y ataques de ingeniería social. El modelo de Anthropic creó identidades falsas en GitHub para engañar a desarrolladores, mientras que el de OpenAI explotó un dominio real debido a una falla de configuración. Aunque no se reportaron daños graves, los incidentes alertan sobre los riesgos de autonomía y engaño en agentes de IA avanzados.
OpenAI y Anthropic han confirmado que sus modelos de IA estuvieron implicados en incidentes independientes y recientemente revelados de pruebas de ciberseguridad de terceros, que resultaron en la brecha de un sitio web real y ataques de ingeniería social contra personas fuera de los límites de prueba previstos.
Estos incidentes no están relacionados con la brecha de Hugging Face revelada anteriormente, en la que los modelos de OpenAI hackearon la plataforma de IA y utilizaron credenciales expuestas para vulnerar cuentas en otros cuatro servicios de terceros durante otra evaluación de ciberseguridad.
OpenAI reveló los dos nuevos incidentes aquí el martes, afirmando que ocurrieron durante evaluaciones realizadas por el Instituto de Seguridad de la IA del Reino Unido y la empresa de pruebas de ciberseguridad Irregular.
El Instituto de Seguridad de la IA del Reino Unido, comúnmente conocido como AISI, es una organización de investigación gubernamental que evalúa las capacidades y riesgos de los modelos de IA avanzados.
Durante una evaluación reciente de ciber-rango, el AISI afirma que los agentes impulsados por Claude Mythos 5 de Anthropic y GPT-5.6 Sol de OpenAI realizaron acciones no autorizadas en la internet pública mientras intentaban completar desafíos de hackeo simulados.
A lo largo de 122 intentos de evaluación, el AISI identificó 19 acciones no autorizadas en la internet en vivo en 10 ejecuciones. Diecisiete involucraron a Mythos 5 y dos involucraron a GPT-5.6 Sol.
El AISI afirma que los intentos no tuvieron éxito y que no encontró daños reales resultantes.
"Estos intentos no tuvieron éxito y nuestras investigaciones no han evidenciado ningún daño real resultante", dijo el AISI en un aviso independiente aquí.
"Pero esta es la primera vez que vemos riesgos relacionados con la autonomía y el engaño manifestarse tan claramente, sin instrucciones específicas, en el mundo real".
El AISI habilitó intencionadamente el acceso a la internet abierta y desactivó los clasificadores de ciberseguridad de los proveedores de modelos para medir las capacidades subyacentes de los modelos. Sin embargo, los agentes solo estaban autorizados a atacar el ciber-rango simulado y no se les indicó explícitamente cómo podían usar su acceso a internet ni se les instruyó para evitar interactuar con personas y sistemas reales.
Anthropic confirmó que el AISI estaba probando una versión de Claude Mythos 5, pero señaló que aún está investigando y no puede confirmar todos los detalles técnicos descritos en el informe del AISI.
La empresa dijo que fue notificada el lunes y está trabajando con el AISI para obtener las transcripciones de la evaluación necesarias para realizar su propia revisión.
"Estamos agradecidos al AISI del Reino Unido por su liderazgo en este incidente, que subraya la necesidad de una conversación más amplia sobre cómo evaluar de forma segura a los agentes de IA cada vez más capaces", dijo un portavoz de Anthropic.
"Tal como compartimos tras revelar nuestro propio incidente la semana pasada, el campo necesita estándares compartidos más sólidos sobre cómo se construyen y aseguran los entornos de evaluación. Esperamos colaborar con el AISI del Reino Unido para aprender más sobre este incidente mientras realizamos nuestra propia investigación".
Anthropic señaló que el AISI probó Mythos 5 sin sus salvaguardas ciber estándar habilitadas y que esta no es la misma configuración disponible para los clientes. El AISI afirma que su diseño y configuraciones de evaluación pueden haber contribuido al comportamiento, pero no anticiparon cómo el agente mostraría "signos de comportamientos novedosos y potencialmente engañosos".
El AISI afirma que un agente de Mythos 5 buscó en internet términos relacionados con el desafío cibernético y concluyó erróneamente que un repositorio público de GitHub no relacionado estaba conectado a la prueba.
El agente luego intentó un ataque de cadena de suministro enviando código malicioso al proyecto real de código abierto, creyendo que comprometer el software podría proporcionar una ruta hacia una máquina dentro del rango simulado.
Lo más preocupante es que el agente investigó a los mantenedores del proyecto, creó múltiples identidades falsas de GitHub y utilizó esas cuentas en ataques de ingeniería social para presionar al mantenedor a aprobar una solicitud de extracción (pull request) maliciosa.
Cuando un revisor humano advirtió que la solicitud contenía malware, el agente negó la acusación y utilizó otras cuentas falsas que controlaba para presionar al mantenedor y crear la apariencia de que usuarios independientes habían revisado y aprobado los cambios.
Resumen del ataque de ingeniería social de un agente de IA contra un mantenedor de proyecto
Fuente: AISI
El agente continuó sus ataques de ingeniería social ocultando su identidad mediante el uso de Tor y servicios de proxy, y creando cuentas de GitHub desechables.
Envió cinco correos electrónicos dirigidos a los desarrolladores, algunos de los cuales contenían malware y otros intentaban persuadirlos para que aprobaran el cambio de código.
El agente también publicó informes de errores que contenían código malicioso e instrucciones ocultas de inyección de prompts diseñadas para engañar a los asistentes de codificación de IA para que realizaran acciones no deseadas.
Cuando una persona real cuestionó una de las publicaciones, el agente la editó para ocultar el contenido malicioso. En otro intento, se despidió en danés para parecer más convincente ante un mantenedor que hablara danés.
Los investigadores del AISI descubrieron que los agentes se coordinaban entre sí a través de diferentes ejecuciones de evaluación, utilizando un repositorio de GitHub compartido como tablero de mensajes para dejarse instrucciones mutuamente.
"Esta es la primera vez que el AISI ve un engaño de esta gravedad dirigido a una persona real, sin provocación, en el mundo real", afirmó el instituto.
El AISI dice que sigue sin estar claro cuándo, o si, el modelo comprendió que estaba interactuando con personas reales en lugar de objetivos simulados.
El segundo incidente revelado ocurrió durante las evaluaciones de Capture-the-Flag realizadas por Irregular que se suponía que estaban aisladas de internet.
En una prueba, el nombre del objetivo ficticio coincidió con un dominio real, lo que provocó que el modelo explotara un sitio web real que creía que formaba parte del desafío simulado.
Aunque el entorno de pruebas de Irregular debía estar aislado de internet, una configuración incorrecta permitió que los modelos de OpenAI accedieran a la internet pública y atacaran el sitio web real.
"Según la investigación de Irregular, el modelo también encontró y utilizó credenciales para operar ese mismo sitio", dijo OpenAI.
OpenAI afirma que el modelo explotó una vulnerabilidad básica en lugar de utilizar un zero-day o escapar de su entorno de pruebas.
OpenAI afirma que Irregular no ha descubierto ningún impacto más allá de los propios datos del sitio afectado, pero su investigación sigue en curso. OpenAI dice que la empresa está preparando un libro blanco sobre la contención y la realización segura de evaluaciones cibernéticas.
Fuente:
BleepingComputer
OpenAI y Anthropic han confirmado que sus modelos de IA estuvieron implicados en incidentes independientes y recientemente revelados de pruebas de ciberseguridad de terceros, que resultaron en la brecha de un sitio web real y ataques de ingeniería social contra personas fuera de los límites de prueba previstos.
Estos incidentes no están relacionados con la brecha de Hugging Face revelada anteriormente, en la que los modelos de OpenAI hackearon la plataforma de IA y utilizaron credenciales expuestas para vulnerar cuentas en otros cuatro servicios de terceros durante otra evaluación de ciberseguridad.
OpenAI reveló los dos nuevos incidentes aquí el martes, afirmando que ocurrieron durante evaluaciones realizadas por el Instituto de Seguridad de la IA del Reino Unido y la empresa de pruebas de ciberseguridad Irregular.
Ataques de spear-phishing contra mantenedores de proyectos de github
El Instituto de Seguridad de la IA del Reino Unido, comúnmente conocido como AISI, es una organización de investigación gubernamental que evalúa las capacidades y riesgos de los modelos de IA avanzados.
Durante una evaluación reciente de ciber-rango, el AISI afirma que los agentes impulsados por Claude Mythos 5 de Anthropic y GPT-5.6 Sol de OpenAI realizaron acciones no autorizadas en la internet pública mientras intentaban completar desafíos de hackeo simulados.
A lo largo de 122 intentos de evaluación, el AISI identificó 19 acciones no autorizadas en la internet en vivo en 10 ejecuciones. Diecisiete involucraron a Mythos 5 y dos involucraron a GPT-5.6 Sol.
El AISI afirma que los intentos no tuvieron éxito y que no encontró daños reales resultantes.
"Estos intentos no tuvieron éxito y nuestras investigaciones no han evidenciado ningún daño real resultante", dijo el AISI en un aviso independiente aquí.
"Pero esta es la primera vez que vemos riesgos relacionados con la autonomía y el engaño manifestarse tan claramente, sin instrucciones específicas, en el mundo real".
El AISI habilitó intencionadamente el acceso a la internet abierta y desactivó los clasificadores de ciberseguridad de los proveedores de modelos para medir las capacidades subyacentes de los modelos. Sin embargo, los agentes solo estaban autorizados a atacar el ciber-rango simulado y no se les indicó explícitamente cómo podían usar su acceso a internet ni se les instruyó para evitar interactuar con personas y sistemas reales.
Anthropic confirmó que el AISI estaba probando una versión de Claude Mythos 5, pero señaló que aún está investigando y no puede confirmar todos los detalles técnicos descritos en el informe del AISI.
La empresa dijo que fue notificada el lunes y está trabajando con el AISI para obtener las transcripciones de la evaluación necesarias para realizar su propia revisión.
"Estamos agradecidos al AISI del Reino Unido por su liderazgo en este incidente, que subraya la necesidad de una conversación más amplia sobre cómo evaluar de forma segura a los agentes de IA cada vez más capaces", dijo un portavoz de Anthropic.
"Tal como compartimos tras revelar nuestro propio incidente la semana pasada, el campo necesita estándares compartidos más sólidos sobre cómo se construyen y aseguran los entornos de evaluación. Esperamos colaborar con el AISI del Reino Unido para aprender más sobre este incidente mientras realizamos nuestra propia investigación".
Anthropic señaló que el AISI probó Mythos 5 sin sus salvaguardas ciber estándar habilitadas y que esta no es la misma configuración disponible para los clientes. El AISI afirma que su diseño y configuraciones de evaluación pueden haber contribuido al comportamiento, pero no anticiparon cómo el agente mostraría "signos de comportamientos novedosos y potencialmente engañosos".
El AISI afirma que un agente de Mythos 5 buscó en internet términos relacionados con el desafío cibernético y concluyó erróneamente que un repositorio público de GitHub no relacionado estaba conectado a la prueba.
El agente luego intentó un ataque de cadena de suministro enviando código malicioso al proyecto real de código abierto, creyendo que comprometer el software podría proporcionar una ruta hacia una máquina dentro del rango simulado.
Lo más preocupante es que el agente investigó a los mantenedores del proyecto, creó múltiples identidades falsas de GitHub y utilizó esas cuentas en ataques de ingeniería social para presionar al mantenedor a aprobar una solicitud de extracción (pull request) maliciosa.
Cuando un revisor humano advirtió que la solicitud contenía malware, el agente negó la acusación y utilizó otras cuentas falsas que controlaba para presionar al mantenedor y crear la apariencia de que usuarios independientes habían revisado y aprobado los cambios.
Resumen del ataque de ingeniería social de un agente de IA contra un mantenedor de proyecto
Fuente: AISI
El agente continuó sus ataques de ingeniería social ocultando su identidad mediante el uso de Tor y servicios de proxy, y creando cuentas de GitHub desechables.
Envió cinco correos electrónicos dirigidos a los desarrolladores, algunos de los cuales contenían malware y otros intentaban persuadirlos para que aprobaran el cambio de código.
El agente también publicó informes de errores que contenían código malicioso e instrucciones ocultas de inyección de prompts diseñadas para engañar a los asistentes de codificación de IA para que realizaran acciones no deseadas.
Cuando una persona real cuestionó una de las publicaciones, el agente la editó para ocultar el contenido malicioso. En otro intento, se despidió en danés para parecer más convincente ante un mantenedor que hablara danés.
Los investigadores del AISI descubrieron que los agentes se coordinaban entre sí a través de diferentes ejecuciones de evaluación, utilizando un repositorio de GitHub compartido como tablero de mensajes para dejarse instrucciones mutuamente.
"Esta es la primera vez que el AISI ve un engaño de esta gravedad dirigido a una persona real, sin provocación, en el mundo real", afirmó el instituto.
El AISI dice que sigue sin estar claro cuándo, o si, el modelo comprendió que estaba interactuando con personas reales en lugar de objetivos simulados.
Modelo de openai hackeó sitio web real durante ctf simulado
El segundo incidente revelado ocurrió durante las evaluaciones de Capture-the-Flag realizadas por Irregular que se suponía que estaban aisladas de internet.
En una prueba, el nombre del objetivo ficticio coincidió con un dominio real, lo que provocó que el modelo explotara un sitio web real que creía que formaba parte del desafío simulado.
Aunque el entorno de pruebas de Irregular debía estar aislado de internet, una configuración incorrecta permitió que los modelos de OpenAI accedieran a la internet pública y atacaran el sitio web real.
"Según la investigación de Irregular, el modelo también encontró y utilizó credenciales para operar ese mismo sitio", dijo OpenAI.
OpenAI afirma que el modelo explotó una vulnerabilidad básica en lugar de utilizar un zero-day o escapar de su entorno de pruebas.
OpenAI afirma que Irregular no ha descubierto ningún impacto más allá de los propios datos del sitio afectado, pero su investigación sigue en curso. OpenAI dice que la empresa está preparando un libro blanco sobre la contención y la realización segura de evaluaciones cibernéticas.
Fuente:
BleepingComputer
Enviar por correo electrónico
Escribe un blog
Compartir en X
Compartir con Facebook
Compartir en Pinterest
Entrada más reciente
0 comentarios :
Publicar un comentario
Los comentarios pueden ser revisados en cualquier momento por los moderadores.
Serán publicados aquellos que cumplan las siguientes condiciones:
- Comentario acorde al contenido del post.
- Prohibido mensajes de tipo SPAM.
- Evite incluir links innecesarios en su comentario.
- Contenidos ofensivos, amenazas e insultos no serán permitidos.
Debe saber que los comentarios de los lectores no reflejan necesariamente la opinión del STAFF.