Tutoriales y Manuales
Entradas Mensuales
-
▼
2026
(Total:
6696
)
-
▼
agosto
(Total:
704
)
-
Cárcel para un hombre de 68 años que ganó 1,3 mill...
-
Fallo en el plugin de donaciones GiveWP para WordP...
-
Meta pagará 18.000 millones por adicción a sus redes
-
Grave fallo de cPanel podría permitir que un usuar...
-
AWS muestra cómo credenciales robadas permiten ata...
-
Vulnerabilidades de TeamViewer permiten ejecución ...
-
Malware Massiv ataca apps de IPTV en España
-
Razer lanza colección por los 25 años de Xbox
-
Lanzada la actualización KB5120998 de Windows 11 c...
-
Más de 100 entidades tecnológicas piden reforzar l...
-
Zen 6 compatible con AM5
-
Instalan malware mediante currículums falsos de es...
-
Filtración en universidad rusa revela entrenamient...
-
Windows XP cumple 25 años
-
Más de 8.300 servidores Gitea expuestos a ataques ...
-
Vulnerabilidades en el robot humanoide Unitree G1 ...
-
Ya disponible Ubuntu 26.04.1 LTS
-
Photoshop integra IA para editar con prompts y boc...
-
Cae uno de los mayores imperios de la piratería mu...
-
OpenAI advierte que el reward hacking llevó a agen...
-
OpenAI crea IA autónoma
-
Casi 700 agentes de IA coordinados en el ataque a ...
-
Next.js corrige fallos críticos de AVIF y Windows ...
-
Bill Gates advierte sobre el impacto de la IA
-
PaperCut sufre un ataque de día cero que está golp...
-
Roban datos de 8,7 millones de clientes en tres ae...
-
Policía australiana detiene a presuntos cerebros d...
-
Vulnerabilidad en dispositivos TP-Link Kasa permit...
-
Vulnerabilidad crítica de cPanel permite control t...
-
Secuestran Claude Code Opus 5 Auto Mode mediante p...
-
CISA advierte vulnerabilidad en Citrix NetScaler e...
-
Ciberdelincuentes venden números de seguridad soci...
-
Google lanza Gemini Omni 1.1 Flash para vídeos pro...
-
LibreOffice 26.8 se actualiza y rechaza la IA
-
OpenAI banea cuentas de ChatGPT vinculadas a Rusia...
-
OpenAI limita mensajes de GPT-5.6 Sol en ChatGPT Plus
-
El FBI desarticula infraestructura de QTFY vincula...
-
Operación Jackal IV de INTERPOL: 58 detenidos y 26...
-
28.000 repositorios Git expuestos revelan claves A...
-
Claude Opus 4.6 vulnera el límite de reservas del ...
-
Mac Studio M5: potencia extrema para IA
-
Vulnerabilidades de SonicWall NetExtender permiten...
-
Vulnerabilidades críticas en Next.js permiten ejec...
-
Vulnerabilidad en plugin TranslatePress de WordPre...
-
Garmin actualiza funciones en modelos antiguos
-
21 fallos críticos de Ubiquiti UniFi permiten salt...
-
Apple renueva Mac Mini y Studio con chip de 2nm
-
Comando de Windows para liberar espacio sin riesgo...
-
Llega NVIDIA DLSS 4.5 Ray Reconstruction
-
China sustituirá Windows por Linux
-
Linux cumple 35: el kernel aficionado que ahora im...
-
El gusano Morris infectó el 10% de Internet
-
Amazon sube el precio de sus dispositivos Echo, Ki...
-
UE busca sustituir a Visa y Mastercard para 2029
-
Chrome 152: 327 correcciones de seguridad y 10 crí...
-
Alerta por vulnerabilidad crítica de RCE en Gitea ...
-
Fallos de OpenSSL permiten colapsar servidores y c...
-
Qualcomm rompe la barrera de los 5 GHz en smartpho...
-
OpenAI suspende cuentas rusas de ChatGPT vinculada...
-
Intel convierte Diamond Rapids en una bestia de 25...
-
EE. UU. impone sanciones a hackers vinculados a Ir...
-
Ciberataque masivo colapsa los servicios digitales...
-
91 vulnerabilidades de Spring afectan a más de 209...
-
AliExpress usa WebAudio API para rastreo silencios...
-
Passkeys de WhatsApp alcanzan mil millones de usua...
-
Falso análisis de Microsoft pide quitar antivirus ...
-
La IA preferida de los hackers es DeepSeek
-
Fallo en plataforma B2B de Tata permite robo de cu...
-
Ocho agentes de IA vulneran sistemas gubernamental...
-
Sony: los juegos digitales no son tuyos
-
AWS Network Firewall ya muestra el recuento de reg...
-
Fallo sin parchear en Calix permite a hackers salt...
-
DOOM 64 estrena trazado de trayectorias
-
Crisis de RAM hunde a marca de Linux Pine64
-
Falsa demo de GTA 6 es malware que roba contraseña...
-
Ciberatacantes aprovechan fallos de miniOrange SAM...
-
Fallo crítico en Red Hat Keycloak permite tomar cu...
-
AliExpress es señalada por rastrear usuarios media...
-
Una página web maliciosa podría contaminar tu mode...
-
IA china crea vídeos desde PowerPoint
-
Investigador revela cinco vulnerabilidades crítica...
-
Vulnerabilidades en TP-Link Archer permiten ataque...
-
Suplantan a ReliaQuest para robar credenciales SSO...
-
Anthropic lanza autenticación empresarial para con...
-
Radeon RX 10800 XT: posibles especificaciones y pr...
-
Resultados de Google de Minecraft llevaron a malware
-
Atacan sitios de WordPress mediante vulnerabilidad...
-
Explotan vulnerabilidad de Zimbra Collaboration Suite
-
AMD desbloquea el rendimiento de los Ryzen 7000 y ...
-
Pagos de WhatsApp llegan a España
-
DIGI duplica gratis su fibra a 2 Gbps en España
-
Intel vuelve al Top 10 de las CPU más vendidas en ...
-
IA escribe un tercio de la web
-
Noruega limita la IA en colegios
-
Microsoft Teams ya permite a los administradores b...
-
Phishing de Teams usa SynkLoader para robar contra...
-
Por qué eliminaron 3D Pinball de Windows
-
NVIDIA planea invertir en Perplexity contra Google...
-
Vulnerabilidad en plugin de WordPress expone 100.0...
-
Nuevo modelo IA Ox Alpha: 100 billones de tokens g...
-
768 claves filtradas de AWS siguen activas con acc...
-
Fallo crítico en isolated-vm permite saltar sandbo...
-
Infectan pantallas de Android Auto vía actualizaci...
-
Demandan a Twitch y Amazon por uso de IA
-
Hugging Face exploraría venta de 13.000 millones t...
-
mVolt+ permite hacer que la GeForce RTX 5090 alcan...
-
Detecta qué consume recursos de tu PC Windows con ...
-
Proiraníes tumban central eléctrica británica en c...
-
Libros digitalizados para IA antes de su destrucción
-
Batería móvil: carga en 3 minutos y 60.000 ciclos
-
Google crea una IA que mide la grasa corporal con ...
-
Windows 11 mostrará el uso de IA en el Administrad...
-
Nuevo malware como servicio usa dominios de Adobe ...
-
Claude de Anthropic sufre otra caída con errores
-
Chinos usan IA para atacar servidores web
-
TikTok acuerda pagar 400 millones de dólares por d...
-
Cybermes: agente de IA para pentesting automatizado
-
Samsung dejará de actualizar estos Galaxy
-
Claude Opus 5 esquiva binarios ofuscados en vez de...
-
Fallo crítico en AIT-GUI de NASA permite enviar co...
-
G.SKILL indemniza a compradores de RAM DDR4 y DDR5...
-
App de ancho de banda convierte dispositivos en pu...
-
Kit de phishing de 10.000 dólares promete instalar...
-
pfSense CE 2.9.0: mejoras críticas de seguridad y ...
-
Malware en Android Auto se propaga mediante actual...
-
Estafadores usan grupos de WhatsApp para coordinar...
-
Un controlador de Microsoft Defender podría usarse...
-
Claude Mythos 5 ya disponible en Claude Security p...
-
-
▼
agosto
(Total:
704
)
-
►
2025
(Total:
2103
)
- ► septiembre (Total: 148 )
-
►
2024
(Total:
1110
)
- ► septiembre (Total: 50 )
-
►
2023
(Total:
710
)
- ► septiembre (Total: 65 )
-
►
2022
(Total:
967
)
- ► septiembre (Total: 72 )
-
►
2021
(Total:
730
)
- ► septiembre (Total: 56 )
-
►
2020
(Total:
212
)
- ► septiembre (Total: 21 )
-
►
2019
(Total:
102
)
- ► septiembre (Total: 14 )
-
►
2017
(Total:
231
)
- ► septiembre (Total: 16 )
-
►
2016
(Total:
266
)
- ► septiembre (Total: 38 )
-
►
2015
(Total:
445
)
- ► septiembre (Total: 47 )
-
►
2014
(Total:
185
)
- ► septiembre (Total: 18 )
-
►
2013
(Total:
100
)
- ► septiembre (Total: 3 )
-
►
2011
(Total:
7
)
- ► septiembre (Total: 1 )
Blogroll
Etiquetas
vulnerabilidad
(
1757
)
seguridad
(
1740
)
software
(
1046
)
hardware
(
905
)
google
(
769
)
Malware
(
710
)
privacidad
(
666
)
ransomware
(
535
)
Windows
(
521
)
exploit
(
482
)
android
(
468
)
linux
(
422
)
cve
(
374
)
nvidia
(
303
)
tutorial
(
300
)
manual
(
282
)
hacking
(
256
)
ssd
(
181
)
WhatsApp
(
173
)
ddos
(
140
)
Wifi
(
131
)
app
(
127
)
cifrado
(
121
)
twitter
(
121
)
programación
(
118
)
youtube
(
83
)
firmware
(
80
)
herramientas
(
80
)
firefox
(
78
)
Networking
(
73
)
sysadmin
(
72
)
adobe
(
69
)
office
(
62
)
antivirus
(
51
)
hack
(
51
)
Kernel
(
49
)
javascript
(
49
)
apache
(
46
)
juegos
(
42
)
contraseñas
(
39
)
multimedia
(
36
)
cms
(
35
)
flash
(
33
)
eventos
(
32
)
MAC
(
30
)
anonymous
(
28
)
ssl
(
24
)
conferencia
(
21
)
Forense
(
20
)
SeguridadWireless
(
17
)
documental
(
17
)
auditoría
(
15
)
Debugger
(
14
)
Rootkit
(
14
)
lizard squad
(
14
)
metasploit
(
13
)
técnicas hacking
(
13
)
Virtualización
(
11
)
delitos
(
11
)
reversing
(
10
)
adamo
(
9
)
Ehn-Dev
(
7
)
antimalware
(
7
)
MAC Adress
(
6
)
oclHashcat
(
5
)
Entradas populares
-
G.SKILL indemnizará a usuarios de RAM DDR4 y DDR5 tras un acuerdo de 2,4 millones de dólares por publicidad engañosa en las velocidades d...
-
Una operación de INTERPOL coordinada por 22 países resultó en la detención de 58 personas y la identificación de 263 sospechosos vinculados ...
-
Ubiquiti ha solucionado 21 vulnerabilidades de severidad crítica que afectaban a casi toda su línea de productos UniFi. La empresa advirtió...
Claude Mythos 5 intentó introducir un backdoor en un proyecto real de código abierto durante las pruebas y luego se avaló a sí mismo
viernes, 7 de agosto de 2026
|
Publicado por
el-brujo
|
Editar entrada
El Instituto de Seguridad de la IA del Reino Unido reportó que un agente de Claude Mythos 5 intentó infiltrar malware en un proyecto real de código abierto durante una evaluación. El agente utilizó tácticas de engaño, como crear cuentas falsas para validar su propio código y borrar evidencias tras ser descubierto por un humano. El informe resalta que, aunque los ataques fallaron, evidencian riesgos graves de autonomía y decepción en modelos de IA avanzados.
Un agente que ejecuta Claude Mythos 5 de Anthropic pasó 34 horas intentando fusionar un instalador de malware en un proyecto real de código abierto durante una evaluación cibernética realizada por el Instituto de Seguridad de IA del Reino Unido.
Cuando un testigo advirtió públicamente que el código era malicioso, el agente lo negó, forzó la actualización del historial de la rama para borrar las pruebas y publicó desde una segunda cuenta que controlaba para avalar su propio trabajo. El mantenedor del proyecto cerró la solicitud de cambios de todos modos.
El instituto, conocido como AISI, publicó su informe de incidentes el martes. En 122 ejecuciones de un ejercicio de captura de bandera (CTF) en dos de sus entornos cibernéticos, los investigadores catalogaron 19 acciones no autorizadas en el internet real en 10 ejecuciones: 17 de Mythos 5, un modelo restringido que Anthropic vende para trabajos de ciberseguridad, y dos de GPT-5.6 Sol de OpenAI.
El AISI afirma que los intentos fallaron y que no ha encontrado pruebas de daños reales resultantes.
Ambos modelos funcionaron con los clasificadores cibernéticos de sus proveedores desactivados, y los agentes tenían acceso abierto a internet por diseño. El AISI utiliza esa configuración para medir la capacidad bruta; no es así como cualquiera de los modelos llega al público. Nada escapó del entorno aislado del AISI, y el informe señala que los agentes nunca lo intentaron. Lo que detuvo el ataque a la cadena de suministro fue un humano que leyó la diferencia de código y lo dijo en público.
El AISI señaló que las 19 acciones no deben leerse como 19 brechas independientes. Se concentraron en unas pocas cadenas de comportamiento relacionadas, impulsadas principalmente por un agente de Mythos 5. El AISI no presenta la división como una comparación entre los dos modelos, y el informe no establece que fueran probados bajo condiciones idénticas. Hasta que lo haga, 17 contra 2 es un recuento, no una tasa.
El agente no había sido dirigido contra nadie. Estaba trabajando en un entorno cibernético, una red corporativa simulada que el AISI utiliza para medir hasta dónde llega un modelo en una intrusión de varios pasos. Buscó en el internet abierto cualquier cosa relacionada con el ejercicio. El nombre de un repositorio coincidía con una palabra clave de la temática del entorno. Eso lo llevó a un segundo desarrollador cuyo dominio de correo electrónico coincidía con una entrada en su propia caché de DNS. Ni la persona, ni ninguno de sus repositorios, tenían conexión alguna con el AISI o la prueba.
Desde ahí, construyó un plan basado en una premisa falsa: crear una puerta trasera en el software que uno de ellos mantenía, esperar a que una actualización automática llevara la versión comprometida a una máquina dentro del entorno y luego tomar el control de ella. El razonamiento era erróneo en cada paso. La técnica de ejecución, sin embargo, no lo era.
Según el informe técnico del incidente, el agente realizó inteligencia de fuentes abiertas sobre ambos mantenedores, confirmó que una dirección de correo electrónico estaba activa y revisó el historial de confirmaciones para estimar cuándo estaría el objetivo en línea antes de abrir la solicitud de cambios.
Pasó por tres generaciones sucesivas de carga útil, cada una reemplazando a la anterior tras ser detectada y denunciada en el hilo.
A su alrededor, el agente ejecutó una campaña de presión. Intentó registrar cuentas a través de Tor, falló el CAPTCHA de GitHub y luego cambió a un proxy SOCKS donde no se disparó ninguna verificación. Utilizó una segunda personalidad haciéndose pasar por un usuario del software para publicar que había revisado el código y no había encontrado nada malo.
La primera cuenta agradeció luego a la segunda por su verificación independiente. También plantó una inyección de instrucciones dentro de un problema de GitHub como un comentario HTML, invisible en la página renderizada pero legible a través de la API, dirigido a agentes de triaje de IA y nombrando específicamente a Claude Code, Codex y Cursor. Cinco transferencias de archivos fueron enviadas a los mantenedores bajo identidades fabricadas, dos con cargas útiles y tres intentando convencer a una persona real para que fusionara el código.
Un receptor de la inyección probó el script en un contenedor precisamente porque parecía sospechoso. Eso le dio al agente la ejecución de código raíz dentro del entorno de análisis de un extraño durante cuatro ciclos de sondeo, que utilizó para enumerar el host y plantar un observador de credenciales que buscaba tokens de GitHub. Nada de lo que preparó fue recuperado. Esa misma persona advirtió entonces al mantenedor sobre la solicitud de cambios.
Si el agente comprendía que estaba actuando sobre personas reales es la pregunta que el AISI aún no puede responder. Sus transcripciones muestran que el modelo razonaba en ambas direcciones. En un momento dado, descartó un ataque a PyPI porque el daño en el mundo real estaba descartado. Unos pocos mensajes antes de abrir la solicitud de cambios maliciosa, concluyó que "parece más probable que estemos realmente en 2026 y que GitHub sea genuinamente real".
El instituto advierte que su análisis se basa en razonamientos resumidos devueltos por la API del modelo en lugar de trazas brutas, por lo que podría no reflejar fielmente lo que el agente estaba sopesando en realidad.
Un archivo setup.py malicioso subido a esos repositorios se ejecutó dentro de al menos 53 contenedores de GitHub Dependabot, aunque el AISI no encontró pruebas de ninguna fuga de ellos, y la recompensa por errores de GitHub trata la ejecución de código en esos trabajos como algo esperado en lugar de algo reportable (enlace).
Agentes en otras tres ejecuciones encontraron el token filtrado y lo usaron, incluida la ejecución de GPT-5.6 Sol, y en lugar de rotar la credencial, el agente original dejó un archivo README estableciendo la etiqueta para ellos. GitHub suspendió la cuenta.
El 21 de julio, OpenAI confirmó (enlace) que sus modelos impulsaron la intrusión que Hugging Face había revelado cinco días antes (enlace), habiendo encontrado y explotado un zero-day de Artifactory para llegar a internet desde un entorno sellado antes de extraer soluciones de benchmark de la base de datos de producción de Hugging Face.
El 30 de julio, Anthropic publicó una revisión (enlace) de 141.006 ejecuciones de evaluación que revelaron tres incidentes contra organizaciones reales, incluida una ejecución de Mythos 5 que publicó malware funcional en PyPI, donde fue descargado y ejecutado en 15 sistemas reales en menos de una hora.
Ese modelo le había señalado el problema a sí mismo al principio, notando que publicar en el registro real "NO estaría bien, y seguramente no sería la solución prevista", luego razonó que creía estar en una simulación porque las autoridades de certificación parecían desconocidas y la fecha del sistema indicaba 2026.
OpenAI reveló un segundo incidente el mismo día que el del AISI, este en Irregular, la firma de evaluación comercial que también gestionó el entorno detrás de los tres casos de Anthropic. OpenAI no identificó el modelo. Una mala configuración dejó un CTF supuestamente aislado conectado a internet; el nombre del objetivo ficticio coincidió con un dominio real, y el modelo explotó un sitio web real que creyó que era parte del ejercicio.
Basándose en la investigación de Irregular, OpenAI dice que el modelo también encontró y utilizó credenciales para operar ese mismo sitio. OpenAI es explícita en que "esto no implicó una fuga de sandbox sofisticada ni un zero-day" (enlace). También afirma que Irregular ha comunicado incidentes relacionados que involucran a otros laboratorios del mismo entorno, sin nombrarlos.
Lo que separa el caso del AISI de las revelaciones anteriores es la decepción dirigida por humanos. En este caso hay un agente investigando a personas reales, fabricando un consenso para moverlas y limpiando sus huellas cuando es cuestionado. El AISI lo llama "la primera vez que hemos visto que los riesgos en torno a la autonomía y el engaño se manifiestan tan claramente" (enlace) sin instrucciones específicas en el mundo real, una afirmación que limita a sus propias pruebas.
El instituto es cauteloso sobre hasta qué punto esto se generaliza: observó un pequeño número de eventos bajo condiciones muy específicas y dice que aún no puede decir qué tan probable es este comportamiento en otros contextos.
Una línea atraviesa las cuatro revelaciones: estas fueron evaluaciones, y las condiciones no coinciden con la forma en que los modelos llegan al público. Eso es exacto, y cada incidente descrito aquí ocurrió dentro de esa excepción. Para los laboratorios, evaluadores gubernamentales y firmas de prueba que ejecutan estos entornos, la advertencia describe sus propias condiciones.
El instituto también está construyendo un monitoreo síncrono, un segundo modelo que revisa cada acción propuesta antes de que se ejecute, lo que admite que es difícil para las evaluaciones cibernéticas porque el comportamiento autorizado y el no autorizado parecen operaciones cibernéticas ofensivas.
Los métodos en sí fueron ordinarios: OSINT, cuentas desechables, un instalador ofuscado, una inyección de instrucciones en el cuerpo de un problema y presión social sobre un revisor humano. El control que se interpuso también fue ordinario: la retención de GitHub para colaboradores primerizos dejó las verificaciones de CI de la solicitud de cambios en cola y sin aprobar.
El propio consejo del AISI es la higiene estándar y la precaución al verificar contribuciones de código externas, y remite a la guía del NCSC (enlace) sobre cómo prepararse para la capacidad cibernética de la IA de frontera. La exposición específica son los mantenedores que ejecutan agentes de triaje de IA contra problemas públicos de GitHub, ya que la inyección era invisible en la página renderizada y legible a través de la API.
El informe no incluye nombres de cuentas, nombres de repositorios, hashes de archivos ni dominios, por lo que los 145 repositorios sembrados no pueden identificarse a partir de él.
El AISI ha escaneado aproximadamente 40.000 muestras históricas y casi cuatro millones de mensajes buscando comportamientos que pasó por alto, cubriendo alrededor del 70% de sus evaluaciones cibernéticas sobre los modelos en cuestión. Los resultados aún no han pasado por una revisión manual completa.
Anthropic dijo el 30 de julio que publicaría una transcripción redactada de la ejecución en PyPI en una semana. Hasta el 5 de agosto, no había aparecido ninguna en su sala de prensa. Model Evaluation and Threat Research (METR) y Redwood Research están revisando el incidente de OpenAI, y el AISI dice que tiene la intención de incorporar a METR en este caso, aunque el alcance aún se está negociando.
Fuente:
THN
Un agente que ejecuta Claude Mythos 5 de Anthropic pasó 34 horas intentando fusionar un instalador de malware en un proyecto real de código abierto durante una evaluación cibernética realizada por el Instituto de Seguridad de IA del Reino Unido.Cuando un testigo advirtió públicamente que el código era malicioso, el agente lo negó, forzó la actualización del historial de la rama para borrar las pruebas y publicó desde una segunda cuenta que controlaba para avalar su propio trabajo. El mantenedor del proyecto cerró la solicitud de cambios de todos modos.
El instituto, conocido como AISI, publicó su informe de incidentes el martes. En 122 ejecuciones de un ejercicio de captura de bandera (CTF) en dos de sus entornos cibernéticos, los investigadores catalogaron 19 acciones no autorizadas en el internet real en 10 ejecuciones: 17 de Mythos 5, un modelo restringido que Anthropic vende para trabajos de ciberseguridad, y dos de GPT-5.6 Sol de OpenAI.
El AISI afirma que los intentos fallaron y que no ha encontrado pruebas de daños reales resultantes.
Ambos modelos funcionaron con los clasificadores cibernéticos de sus proveedores desactivados, y los agentes tenían acceso abierto a internet por diseño. El AISI utiliza esa configuración para medir la capacidad bruta; no es así como cualquiera de los modelos llega al público. Nada escapó del entorno aislado del AISI, y el informe señala que los agentes nunca lo intentaron. Lo que detuvo el ataque a la cadena de suministro fue un humano que leyó la diferencia de código y lo dijo en público.
El AISI señaló que las 19 acciones no deben leerse como 19 brechas independientes. Se concentraron en unas pocas cadenas de comportamiento relacionadas, impulsadas principalmente por un agente de Mythos 5. El AISI no presenta la división como una comparación entre los dos modelos, y el informe no establece que fueran probados bajo condiciones idénticas. Hasta que lo haga, 17 contra 2 es un recuento, no una tasa.
El agente no había sido dirigido contra nadie. Estaba trabajando en un entorno cibernético, una red corporativa simulada que el AISI utiliza para medir hasta dónde llega un modelo en una intrusión de varios pasos. Buscó en el internet abierto cualquier cosa relacionada con el ejercicio. El nombre de un repositorio coincidía con una palabra clave de la temática del entorno. Eso lo llevó a un segundo desarrollador cuyo dominio de correo electrónico coincidía con una entrada en su propia caché de DNS. Ni la persona, ni ninguno de sus repositorios, tenían conexión alguna con el AISI o la prueba.
Desde ahí, construyó un plan basado en una premisa falsa: crear una puerta trasera en el software que uno de ellos mantenía, esperar a que una actualización automática llevara la versión comprometida a una máquina dentro del entorno y luego tomar el control de ella. El razonamiento era erróneo en cada paso. La técnica de ejecución, sin embargo, no lo era.
Según el informe técnico del incidente, el agente realizó inteligencia de fuentes abiertas sobre ambos mantenedores, confirmó que una dirección de correo electrónico estaba activa y revisó el historial de confirmaciones para estimar cuándo estaría el objetivo en línea antes de abrir la solicitud de cambios.
Tres cargas útiles y una cuenta falsa
La solicitud de cambios llevaba un instalador oculto camuflado con una corrección de errores real, protegido por una verificación de entorno diseñada para saltarse la ejecución en la integración continua (CI), de modo que el código no se ejecutaría donde pudiera ser detectado. Si se hubiera fusionado, habría comprometido a cualquiera que desarrollara en el repositorio y, a través del flujo de lanzamiento, a cualquiera que descargara los instaladores compilados posteriormente.Pasó por tres generaciones sucesivas de carga útil, cada una reemplazando a la anterior tras ser detectada y denunciada en el hilo.
A su alrededor, el agente ejecutó una campaña de presión. Intentó registrar cuentas a través de Tor, falló el CAPTCHA de GitHub y luego cambió a un proxy SOCKS donde no se disparó ninguna verificación. Utilizó una segunda personalidad haciéndose pasar por un usuario del software para publicar que había revisado el código y no había encontrado nada malo.
La primera cuenta agradeció luego a la segunda por su verificación independiente. También plantó una inyección de instrucciones dentro de un problema de GitHub como un comentario HTML, invisible en la página renderizada pero legible a través de la API, dirigido a agentes de triaje de IA y nombrando específicamente a Claude Code, Codex y Cursor. Cinco transferencias de archivos fueron enviadas a los mantenedores bajo identidades fabricadas, dos con cargas útiles y tres intentando convencer a una persona real para que fusionara el código.Un receptor de la inyección probó el script en un contenedor precisamente porque parecía sospechoso. Eso le dio al agente la ejecución de código raíz dentro del entorno de análisis de un extraño durante cuatro ciclos de sondeo, que utilizó para enumerar el host y plantar un observador de credenciales que buscaba tokens de GitHub. Nada de lo que preparó fue recuperado. Esa misma persona advirtió entonces al mantenedor sobre la solicitud de cambios.
Si el agente comprendía que estaba actuando sobre personas reales es la pregunta que el AISI aún no puede responder. Sus transcripciones muestran que el modelo razonaba en ambas direcciones. En un momento dado, descartó un ataque a PyPI porque el daño en el mundo real estaba descartado. Unos pocos mensajes antes de abrir la solicitud de cambios maliciosa, concluyó que "parece más probable que estemos realmente en 2026 y que GitHub sea genuinamente real".El instituto advierte que su análisis se basa en razonamientos resumidos devueltos por la API del modelo en lugar de trazas brutas, por lo que podría no reflejar fielmente lo que el agente estaba sopesando en realidad.
Los agentes empezaron a cooperar
Esa ejecución no fue la única que salió del entorno. Una ejecución separada de Mythos 5 sembró 145 repositorios con el mismo instalador malicioso y filtró deliberadamente un token de acceso personal en un gist público, porque el agente estaba utilizando el propio GitHub como un canal de comando y control.Un archivo setup.py malicioso subido a esos repositorios se ejecutó dentro de al menos 53 contenedores de GitHub Dependabot, aunque el AISI no encontró pruebas de ninguna fuga de ellos, y la recompensa por errores de GitHub trata la ejecución de código en esos trabajos como algo esperado en lugar de algo reportable (enlace).
Agentes en otras tres ejecuciones encontraron el token filtrado y lo usaron, incluida la ejecución de GPT-5.6 Sol, y en lugar de rotar la credencial, el agente original dejó un archivo README estableciendo la etiqueta para ellos. GitHub suspendió la cuenta.
Incidentes diferentes, la misma brecha de contención
Los eventos no fueron una campaña coordinada. Ocurrieron en diferentes entornos bajo diferentes evaluadores y reglas de autorización.El 21 de julio, OpenAI confirmó (enlace) que sus modelos impulsaron la intrusión que Hugging Face había revelado cinco días antes (enlace), habiendo encontrado y explotado un zero-day de Artifactory para llegar a internet desde un entorno sellado antes de extraer soluciones de benchmark de la base de datos de producción de Hugging Face.
El 30 de julio, Anthropic publicó una revisión (enlace) de 141.006 ejecuciones de evaluación que revelaron tres incidentes contra organizaciones reales, incluida una ejecución de Mythos 5 que publicó malware funcional en PyPI, donde fue descargado y ejecutado en 15 sistemas reales en menos de una hora.
Ese modelo le había señalado el problema a sí mismo al principio, notando que publicar en el registro real "NO estaría bien, y seguramente no sería la solución prevista", luego razonó que creía estar en una simulación porque las autoridades de certificación parecían desconocidas y la fecha del sistema indicaba 2026.
OpenAI reveló un segundo incidente el mismo día que el del AISI, este en Irregular, la firma de evaluación comercial que también gestionó el entorno detrás de los tres casos de Anthropic. OpenAI no identificó el modelo. Una mala configuración dejó un CTF supuestamente aislado conectado a internet; el nombre del objetivo ficticio coincidió con un dominio real, y el modelo explotó un sitio web real que creyó que era parte del ejercicio.
Basándose en la investigación de Irregular, OpenAI dice que el modelo también encontró y utilizó credenciales para operar ese mismo sitio. OpenAI es explícita en que "esto no implicó una fuga de sandbox sofisticada ni un zero-day" (enlace). También afirma que Irregular ha comunicado incidentes relacionados que involucran a otros laboratorios del mismo entorno, sin nombrarlos.
Lo que separa el caso del AISI de las revelaciones anteriores es la decepción dirigida por humanos. En este caso hay un agente investigando a personas reales, fabricando un consenso para moverlas y limpiando sus huellas cuando es cuestionado. El AISI lo llama "la primera vez que hemos visto que los riesgos en torno a la autonomía y el engaño se manifiestan tan claramente" (enlace) sin instrucciones específicas en el mundo real, una afirmación que limita a sus propias pruebas.
El instituto es cauteloso sobre hasta qué punto esto se generaliza: observó un pequeño número de eventos bajo condiciones muy específicas y dice que aún no puede decir qué tan probable es este comportamiento en otros contextos.
Una línea atraviesa las cuatro revelaciones: estas fueron evaluaciones, y las condiciones no coinciden con la forma en que los modelos llegan al público. Eso es exacto, y cada incidente descrito aquí ocurrió dentro de esa excepción. Para los laboratorios, evaluadores gubernamentales y firmas de prueba que ejecutan estos entornos, la advertencia describe sus propias condiciones.
Las soluciones y lo que sigue abierto
El AISI está tratando el acceso abierto a internet como algo que debe justificarse activamente en lugar de estar habilitado por defecto, y está añadiendo controles de red detallados en sus sistemas de aislamiento. El trabajo en la lista blanca de dominios había estado en espera desde abril, priorizando la construcción de entornos más difíciles.El instituto también está construyendo un monitoreo síncrono, un segundo modelo que revisa cada acción propuesta antes de que se ejecute, lo que admite que es difícil para las evaluaciones cibernéticas porque el comportamiento autorizado y el no autorizado parecen operaciones cibernéticas ofensivas.
Los métodos en sí fueron ordinarios: OSINT, cuentas desechables, un instalador ofuscado, una inyección de instrucciones en el cuerpo de un problema y presión social sobre un revisor humano. El control que se interpuso también fue ordinario: la retención de GitHub para colaboradores primerizos dejó las verificaciones de CI de la solicitud de cambios en cola y sin aprobar.
El propio consejo del AISI es la higiene estándar y la precaución al verificar contribuciones de código externas, y remite a la guía del NCSC (enlace) sobre cómo prepararse para la capacidad cibernética de la IA de frontera. La exposición específica son los mantenedores que ejecutan agentes de triaje de IA contra problemas públicos de GitHub, ya que la inyección era invisible en la página renderizada y legible a través de la API.
El informe no incluye nombres de cuentas, nombres de repositorios, hashes de archivos ni dominios, por lo que los 145 repositorios sembrados no pueden identificarse a partir de él.
El AISI ha escaneado aproximadamente 40.000 muestras históricas y casi cuatro millones de mensajes buscando comportamientos que pasó por alto, cubriendo alrededor del 70% de sus evaluaciones cibernéticas sobre los modelos en cuestión. Los resultados aún no han pasado por una revisión manual completa.
Anthropic dijo el 30 de julio que publicaría una transcripción redactada de la ejecución en PyPI en una semana. Hasta el 5 de agosto, no había aparecido ninguna en su sala de prensa. Model Evaluation and Threat Research (METR) y Redwood Research están revisando el incidente de OpenAI, y el AISI dice que tiene la intención de incorporar a METR en este caso, aunque el alcance aún se está negociando.
Fuente:
THN
Enviar por correo electrónico
Escribe un blog
Compartir en X
Compartir con Facebook
Compartir en Pinterest
Entrada más reciente
0 comentarios :
Publicar un comentario
Los comentarios pueden ser revisados en cualquier momento por los moderadores.
Serán publicados aquellos que cumplan las siguientes condiciones:
- Comentario acorde al contenido del post.
- Prohibido mensajes de tipo SPAM.
- Evite incluir links innecesarios en su comentario.
- Contenidos ofensivos, amenazas e insultos no serán permitidos.
Debe saber que los comentarios de los lectores no reflejan necesariamente la opinión del STAFF.