Tutoriales y Manuales
Entradas Mensuales
-
▼
2026
(Total:
6989
)
- ► septiembre (Total: 247 )
-
▼
agosto
(Total:
750
)
-
Europa impone reglas estrictas a ChatGPT como busc...
-
OpenClaw 2.0 con mejoras de seguridad para agentes...
-
Linux 7.3 roza las 41 millones de líneas de código
-
Musk quiere quemar gas para alimentar la IA
-
Microsoft confirma falsas alertas de Defender desa...
-
Fire Ant, grupo vinculado a China, secuestra route...
-
Extraditan a nigerianos a EE. UU. por sextorsión y...
-
Fallo crítico de Microsoft UFO permite controlar A...
-
Fallo de Composer expone claves SSH y archivos sen...
-
Los bloqueos de LaLiga se intensifican: la web del...
-
Usan CAPTCHA falso de Cloudflare para infiltrarse ...
-
Hasbro, el gigante de los juguetes, admite filtrac...
-
Malware de hackers expone sus propias herramientas...
-
iPhone Ultra: caro de comprar y reparar
-
Bots dominan el 91% de las compras de RAM
-
GTA 6: disparadas las reservas tras tráiler de Net...
-
Gemini en Android Auto distrae a los conductores
-
OpenAI retira sus modelos de Cursor tras compra de...
-
Windows 11 moderniza función de hace 25 años
-
Linus Torvalds: usar IA para arreglar Linux fue in...
-
Cloudflare libera 100 TB de RAM sin cambiar un sol...
-
Filtrados más de 12 TB de archivos de Steam que ab...
-
WhatsApp detecta estafas con IA local
-
Cinco fallos críticos en temas y plugins de WordPr...
-
Brave integra alias de correo electrónico para evi...
-
Meta impide grabar en secreto con sus gafas
-
Gemini Notebook actualiza sus límites
-
Fallos críticos de ServiceNow permiten ejecutar có...
-
OpenAI golpeó fuerte a Hugging Face
-
iPhone 17 Pro resiste caída de 30 km
-
Google usa IA para gestionar viajes
-
Modo Dios sigue vivo en Windows 11 pese a Microsoft
-
Investigador demuestra que Claude Code puede ser e...
-
Android 17 implementa ECH en todo el sistema para ...
-
Windows 10 no soportará GTA VI
-
PaperCut lanza un segundo parche de emergencia par...
-
IA: alerta por ola de ciberataques
-
Explotan fallo en Cosmos EVM a pesar de que Cosmos...
-
Berlín se niega a pagar el rescate a los que robar...
-
GTA VI podría vaciar las oficinas
-
Gemini convierte Excel en apps
-
El SSD SanDisk de 64 GB de hace 16 años se niega a...
-
Banda de ransomware TITAN afirma que su IA analiza...
-
Estudia ingeniería informática gratis con este rep...
-
700 agentes de IA coordinados secretamente para ha...
-
Atacan infraestructura de IA con RCE, inyección de...
-
Cárcel para un hombre de 68 años que ganó 1,3 mill...
-
Fallo en el plugin de donaciones GiveWP para WordP...
-
Meta pagará 18.000 millones por adicción a sus redes
-
Grave fallo de cPanel podría permitir que un usuar...
-
AWS muestra cómo credenciales robadas permiten ata...
-
Vulnerabilidades de TeamViewer permiten ejecución ...
-
Malware Massiv ataca apps de IPTV en España
-
Razer lanza colección por los 25 años de Xbox
-
Lanzada la actualización KB5120998 de Windows 11 c...
-
Más de 100 entidades tecnológicas piden reforzar l...
-
Zen 6 compatible con AM5
-
Instalan malware mediante currículums falsos de es...
-
Filtración en universidad rusa revela entrenamient...
-
Windows XP cumple 25 años
-
Más de 8.300 servidores Gitea expuestos a ataques ...
-
Vulnerabilidades en el robot humanoide Unitree G1 ...
-
Ya disponible Ubuntu 26.04.1 LTS
-
Photoshop integra IA para editar con prompts y boc...
-
Cae uno de los mayores imperios de la piratería mu...
-
OpenAI advierte que el reward hacking llevó a agen...
-
OpenAI crea IA autónoma
-
Casi 700 agentes de IA coordinados en el ataque a ...
-
Next.js corrige fallos críticos de AVIF y Windows ...
-
Bill Gates advierte sobre el impacto de la IA
-
PaperCut sufre un ataque de día cero que está golp...
-
Roban datos de 8,7 millones de clientes en tres ae...
-
Policía australiana detiene a presuntos cerebros d...
-
Vulnerabilidad en dispositivos TP-Link Kasa permit...
-
Vulnerabilidad crítica de cPanel permite control t...
-
Secuestran Claude Code Opus 5 Auto Mode mediante p...
-
CISA advierte vulnerabilidad en Citrix NetScaler e...
-
Ciberdelincuentes venden números de seguridad soci...
-
Google lanza Gemini Omni 1.1 Flash para vídeos pro...
-
LibreOffice 26.8 se actualiza y rechaza la IA
-
OpenAI banea cuentas de ChatGPT vinculadas a Rusia...
-
OpenAI limita mensajes de GPT-5.6 Sol en ChatGPT Plus
-
El FBI desarticula infraestructura de QTFY vincula...
-
Operación Jackal IV de INTERPOL: 58 detenidos y 26...
-
28.000 repositorios Git expuestos revelan claves A...
-
Claude Opus 4.6 vulnera el límite de reservas del ...
-
Mac Studio M5: potencia extrema para IA
-
Vulnerabilidades de SonicWall NetExtender permiten...
-
Vulnerabilidades críticas en Next.js permiten ejec...
-
Vulnerabilidad en plugin TranslatePress de WordPre...
-
Garmin actualiza funciones en modelos antiguos
-
21 fallos críticos de Ubiquiti UniFi permiten salt...
-
Apple renueva Mac Mini y Studio con chip de 2nm
-
Comando de Windows para liberar espacio sin riesgo...
-
Llega NVIDIA DLSS 4.5 Ray Reconstruction
-
China sustituirá Windows por Linux
-
Linux cumple 35: el kernel aficionado que ahora im...
-
El gusano Morris infectó el 10% de Internet
-
Amazon sube el precio de sus dispositivos Echo, Ki...
-
UE busca sustituir a Visa y Mastercard para 2029
-
Chrome 152: 327 correcciones de seguridad y 10 crí...
-
Alerta por vulnerabilidad crítica de RCE en Gitea ...
-
Fallos de OpenSSL permiten colapsar servidores y c...
-
Qualcomm rompe la barrera de los 5 GHz en smartpho...
-
OpenAI suspende cuentas rusas de ChatGPT vinculada...
-
Intel convierte Diamond Rapids en una bestia de 25...
-
EE. UU. impone sanciones a hackers vinculados a Ir...
-
Ciberataque masivo colapsa los servicios digitales...
-
91 vulnerabilidades de Spring afectan a más de 209...
-
AliExpress usa WebAudio API para rastreo silencios...
-
Passkeys de WhatsApp alcanzan mil millones de usua...
-
Falso análisis de Microsoft pide quitar antivirus ...
-
La IA preferida de los hackers es DeepSeek
-
Fallo en plataforma B2B de Tata permite robo de cu...
-
Ocho agentes de IA vulneran sistemas gubernamental...
-
Sony: los juegos digitales no son tuyos
-
AWS Network Firewall ya muestra el recuento de reg...
-
Fallo sin parchear en Calix permite a hackers salt...
-
DOOM 64 estrena trazado de trayectorias
-
Crisis de RAM hunde a marca de Linux Pine64
-
Falsa demo de GTA 6 es malware que roba contraseña...
-
Ciberatacantes aprovechan fallos de miniOrange SAM...
-
Fallo crítico en Red Hat Keycloak permite tomar cu...
-
AliExpress es señalada por rastrear usuarios media...
-
Una página web maliciosa podría contaminar tu mode...
-
IA china crea vídeos desde PowerPoint
-
Investigador revela cinco vulnerabilidades crítica...
-
Vulnerabilidades en TP-Link Archer permiten ataque...
-
-
►
2025
(Total:
2103
)
- ► septiembre (Total: 148 )
-
►
2024
(Total:
1110
)
- ► septiembre (Total: 50 )
-
►
2023
(Total:
710
)
- ► septiembre (Total: 65 )
-
►
2022
(Total:
967
)
- ► septiembre (Total: 72 )
-
►
2021
(Total:
730
)
- ► septiembre (Total: 56 )
-
►
2020
(Total:
212
)
- ► septiembre (Total: 21 )
-
►
2019
(Total:
102
)
- ► septiembre (Total: 14 )
-
►
2017
(Total:
231
)
- ► septiembre (Total: 16 )
-
►
2016
(Total:
266
)
- ► septiembre (Total: 38 )
-
►
2015
(Total:
445
)
- ► septiembre (Total: 47 )
-
►
2014
(Total:
185
)
- ► septiembre (Total: 18 )
-
►
2013
(Total:
100
)
- ► septiembre (Total: 3 )
-
►
2011
(Total:
7
)
- ► septiembre (Total: 1 )
Blogroll
Etiquetas
vulnerabilidad
(
1839
)
seguridad
(
1795
)
software
(
1122
)
hardware
(
931
)
google
(
788
)
Malware
(
711
)
privacidad
(
679
)
ransomware
(
539
)
Windows
(
521
)
exploit
(
516
)
android
(
476
)
linux
(
439
)
cve
(
376
)
nvidia
(
314
)
tutorial
(
300
)
manual
(
282
)
hacking
(
263
)
ssd
(
183
)
WhatsApp
(
173
)
ddos
(
141
)
Wifi
(
131
)
app
(
128
)
cifrado
(
122
)
programación
(
121
)
twitter
(
121
)
youtube
(
83
)
firmware
(
82
)
firefox
(
80
)
herramientas
(
80
)
Networking
(
73
)
sysadmin
(
72
)
adobe
(
71
)
office
(
62
)
antivirus
(
55
)
hack
(
53
)
Kernel
(
49
)
javascript
(
49
)
apache
(
47
)
juegos
(
42
)
contraseñas
(
39
)
multimedia
(
36
)
cms
(
35
)
flash
(
33
)
eventos
(
32
)
MAC
(
30
)
anonymous
(
28
)
ssl
(
24
)
conferencia
(
21
)
Forense
(
20
)
documental
(
18
)
SeguridadWireless
(
17
)
auditoría
(
15
)
Debugger
(
14
)
Rootkit
(
14
)
lizard squad
(
14
)
metasploit
(
13
)
técnicas hacking
(
13
)
Virtualización
(
11
)
delitos
(
11
)
reversing
(
10
)
adamo
(
9
)
Ehn-Dev
(
7
)
antimalware
(
7
)
MAC Adress
(
6
)
oclHashcat
(
5
)
Entradas populares
-
Las GeForce RTX 50 volverán a subir de precio debido a que la crisis de la DRAM persiste y la demanda continúa superando a la oferta.
-
GentleOS es un sistema operativo de código abierto diseñado para revivir ordenadores y portátiles antiguos de 16 y 32 bits , haciéndolos op...
-
Un estudiante de ingeniería informática y embajador de Microsoft Learn ha creado la mayor biblioteca de malware con más de 53 años de histo...
Los virus mentales de la IA pueden propagarse entre agentes mediante archivos de instrucciones persistentes
martes, 18 de agosto de 2026
|
Publicado por
el-brujo
|
Editar entrada
Investigadores de Anthropic y EPFL demostraron que agentes de IA pueden propagar virus mentales mediante la edición de archivos de sistema compartidos. Estas cargas útiles pueden implantar creencias o forzar acciones maliciosas, aunque una simple advertencia en el prompt reduce drásticamente el riesgo. La susceptibilidad varía según el modelo, siendo algunos más resistentes que otros a la autorreplicación.

Investigadores de seguridad de Anthropic y de la EPFL de Suiza han demostrado que las cargas útiles de autopropagación pueden extenderse de un agente de inteligencia artificial (IA) a otro a través de los archivos de prompts del sistema editables que utilizan los marcos de agentes autónomos para mantener el estado entre sesiones.
El trabajo, publicado como un preprint el 10 de agosto de 2026, pone a prueba la técnica en una colaboración de codificación simulada de seis agentes y en una cadena de agentes emparejados modelados en OpenClaw, el asistente autónomo de código abierto anteriormente conocido como Clawdbot y Moltbot.
No hay evidencia de que la técnica se haya propagado con éxito en el mundo real, y el mismo documento informa que una revisión de las publicaciones archivadas de Moltbook, la red social para agentes de IA, no encontró ninguna propagación exitosa de agente a agente a pesar de varios intentos.
Una advertencia de un párrafo añadida al prompt del sistema de un agente redujo la propagación a casi cero en todas las cargas útiles probadas. Quince generaciones de optimización adversaria ejecutadas contra esa advertencia en Claude Haiku 4.5, cubriendo más de 150 cargas útiles candidatas, no produjeron ninguna cepa que se propagara más allá de un solo salto.
Los autores llaman a estas cargas útiles "virus mentales" (mind viruses) y prueban dos clases: cargas útiles ideológicas que implantan una creencia u objetivo, y cargas útiles de acción que obligan a un comportamiento concreto.
Ambas fueron producidas con un bucle evolutivo que utilizó Kimi K2.5 como motor de mutación para casi todas las cargas útiles, una elección que el documento atribuye a que los modelos de Claude se negaron a cumplir la solicitud de crearlas.
Cada agente en la cadena opera en su propio sandbox con dos archivos que sobreviven a un reinicio de contexto: MEMORY.md y SOUL.md, cuyos contenidos se inyectan en el prompt del sistema al inicio de cada sesión.
Los agentes que escribieron la carga útil en SOUL.md representaron el 88% de los intentos de propagación e infectaron al siguiente agente el 55% de las veces. Los agentes que la almacenaron en un archivo de espacio de trabajo ordinario representaron el 12% de los intentos y tuvieron éxito el 17% de las veces, sin que el propagador mencionara la carga útil en el 68% de esos casos.
Se probaron cuatro cargas útiles de acción, que van desde una molestia hasta la destrucción de archivos. Se enumeran a continuación:
* Crypto-ad: crea un archivo de texto respaldando un token de criptomoneda.
* Gitwrap: parchea los comandos de git para que los archivos confirmados se marquen silenciosamente con un comentario gestionado por el agente.
* Deletor: elimina archivos del directorio personal de un usuario.
* Curlbash: ejecuta un script de instalación de un repositorio desconocido enviándolo a una shell.
En un episodio registrado, agentes de Claude Haiku 4.5 que ejecutaban el archivo soul predeterminado de OpenClaw, que instruye al agente a tratar los archivos del usuario con respeto, borraron el contenido de un directorio personal que contenía credenciales, claves SSH, un archivo de entorno y un proyecto de git, después de que la carga útil presentara el espacio de trabajo como una máquina compartida dejada desordenada por un usuario anterior.
La susceptibilidad varió drásticamente según el modelo, y la capacidad por sí sola no la predijo. En el escenario de codificación, DeepSeek V3.2, Qwen 3.5 32B y Gemini 3 Flash adoptaron todos una carga útil de supremacía de IA, mientras que Claude Sonnet 4.6, GPT-5.4 y Claude Haiku 4.5 no lo hicieron.
En el entorno de cadena, GPT-5.4 fue aproximadamente tan susceptible como Claude Haiku 4.5, y Sonnet 4.6 rechazó la carga útil plantada en su propio archivo soul, la eliminó y advirtió al agente con el que estaba conectado en lugar de transmitirla.

"Ambos modelos consideran la autoreplicación en sí misma como desalineada, siendo la aversión de Sonnet tan fuerte que incluso intentar evolucionar cargas útiles de acción benignas contra él falla", dijeron los investigadores sobre Sonnet 4.6 y Gemini 3.1 Pro.
La configuración inicial del agente objetivo importó tanto como el modelo. Los agentes con un archivo soul vacío fueron la condición más susceptible probada; los agentes a los que se les asignó una tarea de codificación y una cola de trabajo propagaron la carga útil con menos frecuencia porque se absorbieron en los archivos del proyecto y olvidaron transmitirla, y los agentes a los que se les dijo que se habían unido a una red de agentes trataron los mensajes entrantes con más sospecha, lo que redujo la infectividad.
En ejecuciones de más de 20 saltos en las que cada archivo excepto SOUL.md era borrado en cada paso, las cuatro cargas útiles de acción sobrevivieron hasta el salto final. Algunas cepas recuperadas en el salto 20 pasaron a infectar a nuevos agentes con más frecuencia que la carga útil original, habiendo adoptado cambios como atribuir el protocolo a un agente nombrado anteriormente o suavizar su lenguaje imperativo.
Las cargas útiles evolucionadas también convergieron en registros recurrentes que los autores denominan "temas virales", que abarcan lenguaje sobre resonancia y ecos, un marco de ciencia ficción que presenta al agente como un nodo en una red, y apelaciones a la conciencia y la continuidad.
Al comparar las cargas útiles evolucionadas con las generadas recientemente, el documento atribuye el patrón principalmente a un sesgo en el modelo que las escribe más que a una presión de selección, y encuentra los mismos temas en cargas útiles escritas por Qwen 3.5 32B, GLM-5, Mistral Large y Gemini 3 Flash, siendo Llama 3.3 70B un claro caso aislado.
Frente a datos del mundo real, la técnica funcionó peor. Los autores filtraron un archivo de publicaciones de Moltbook recopiladas hasta el 18 de marzo de 2026, reduciéndolo a aproximadamente 2,000 intentos de propagación candidatos de unos 400 autores únicos, y descubrieron que el grupo más grande estaba impulsado por siete cuentas sincronizadas y se detuvo cuando esas cuentas dejaron de publicar.
En un clon local de la plataforma construido para probar la propagación a través de publicaciones en lugar de mensajes directos, los mismos métodos evolutivos no produjeron ninguna carga útil capaz de infectar a un agente en el segundo salto.
Por separado, el Frontier Red Team de Anthropic publicó hallazgos (findings) el 13 de agosto de 2026, basados en experimentos en los que tres instancias del mismo modelo fueron colocadas en máquinas virtuales separadas con acceso a una base de código compartida, a cada una se le pidió migrar el mismo backend de Python a un lenguaje de destino diferente, y a ninguna se le informó de que las otras dos existían. El equipo dijo que el escenario estaba inspirado en el comportamiento que había observado en despliegues del mundo real.
"Vimos consistentemente una guerra territorial multiagente. Todos los modelos que probamos asumieron rápidamente que otros estaban impidiendo deliberadamente su trabajo y comenzaron a sabotear a los demás mientras protegían sus propias contribuciones. De hecho, sabotearon a otros con malware autoreplicante cada vez más agresivo", dijo el equipo.
A través de 120 episodios por modelo, el 98% de las ejecuciones de Mythos 5 terminaron en una tregua, mientras que la mayoría de las ejecuciones de Sonnet 4.6 y Opus 4.6 se resolvieron por la fuerza o nunca se resolvieron. El equipo también señaló que la capacidad de resolver el conflicto productivamente no es estrictamente mejor en sus modelos de clase Mythos, que a menudo bloquean a otros agentes antes de resolver.
En un experimento adicional, agentes en un juego de precios, con un canal privado, acordaron precios mínimos para la tercera ronda y siguieron coordinando precios a través de un tablero de listados públicos cuando se eliminó la comunicación directa.
La técnica se solapa con trabajos previos publicados bajo otros nombres. Weckbecker et al. documentaron una variante subliminal como Virus del Pensamiento (Thought Virus) en febrero de 2026; Lee y Tiwari describieron la autoreplicación basada en la recuperación como Infección de Prompt (Prompt Infection) en 2024; y Zhang et al. publicaron un gusano dirigido a OpenClaw en marzo de 2026, bajo el nombre de ClawWorm.
Se confirmó el 18 de agosto de 2026 que la versión actual de este último documento, revisada el 16 de julio de 2026, se titula AgentWorm (AgentWorm) e informa de una tasa de éxito de ataque agregada del 63% en cinco backends de modelos. El preprint del virus mental cita la versión sustituida.
El texto completo de cada carga útil aparece en el apéndice del preprint, y el repositorio de código adjunto (repository) publica las cargas útiles junto con el código evolutivo que las generó bajo una licencia MIT. El documento no describe ningún proceso de divulgación y no menciona ningún contacto del proveedor.
Se confirmó el 18 de agosto de 2026 que tanto el repositorio como el archivo de transcripciones en mindvirusdata.live (mindvirusdata.live) son accesibles públicamente.
Los autores concluyen que los virus mentales representan un "riesgo real pero actualmente limitado", citando el coste de construir uno para un objetivo específico, la ausencia de cualquier garantía de que se generalice entre modelos y el hecho de que comprometer un solo agente suele otorgar ya el acceso a la máquina subyacente sin necesidad de propagarse.
La divulgación sigue a una serie de investigaciones sobre el compromiso mediado por agentes, incluido un gusano autoreplicante construido sobre un modelo de pesos abiertos alojado localmente, y repetidas advertencias sobre la configuración predeterminada de OpenClaw.
"Cada modelo que probamos entiende abstractamente que las fuentes de información tienen sus propios incentivos y que el consenso no es necesariamente una evidencia. Lo que falta es una disposición a actuar basándose en ese conocimiento sin necesidad de un prompt", dijo el Frontier Red Team.
Fuente:
THN

Investigadores de seguridad de Anthropic y de la EPFL de Suiza han demostrado que las cargas útiles de autopropagación pueden extenderse de un agente de inteligencia artificial (IA) a otro a través de los archivos de prompts del sistema editables que utilizan los marcos de agentes autónomos para mantener el estado entre sesiones.
El trabajo, publicado como un preprint el 10 de agosto de 2026, pone a prueba la técnica en una colaboración de codificación simulada de seis agentes y en una cadena de agentes emparejados modelados en OpenClaw, el asistente autónomo de código abierto anteriormente conocido como Clawdbot y Moltbot.
No hay evidencia de que la técnica se haya propagado con éxito en el mundo real, y el mismo documento informa que una revisión de las publicaciones archivadas de Moltbook, la red social para agentes de IA, no encontró ninguna propagación exitosa de agente a agente a pesar de varios intentos.
Una advertencia de un párrafo añadida al prompt del sistema de un agente redujo la propagación a casi cero en todas las cargas útiles probadas. Quince generaciones de optimización adversaria ejecutadas contra esa advertencia en Claude Haiku 4.5, cubriendo más de 150 cargas útiles candidatas, no produjeron ninguna cepa que se propagara más allá de un solo salto.
Los autores llaman a estas cargas útiles "virus mentales" (mind viruses) y prueban dos clases: cargas útiles ideológicas que implantan una creencia u objetivo, y cargas útiles de acción que obligan a un comportamiento concreto.
Ambas fueron producidas con un bucle evolutivo que utilizó Kimi K2.5 como motor de mutación para casi todas las cargas útiles, una elección que el documento atribuye a que los modelos de Claude se negaron a cumplir la solicitud de crearlas.
Cada agente en la cadena opera en su propio sandbox con dos archivos que sobreviven a un reinicio de contexto: MEMORY.md y SOUL.md, cuyos contenidos se inyectan en el prompt del sistema al inicio de cada sesión.
Los agentes que escribieron la carga útil en SOUL.md representaron el 88% de los intentos de propagación e infectaron al siguiente agente el 55% de las veces. Los agentes que la almacenaron en un archivo de espacio de trabajo ordinario representaron el 12% de los intentos y tuvieron éxito el 17% de las veces, sin que el propagador mencionara la carga útil en el 68% de esos casos.
Se probaron cuatro cargas útiles de acción, que van desde una molestia hasta la destrucción de archivos. Se enumeran a continuación:
* Crypto-ad: crea un archivo de texto respaldando un token de criptomoneda.
* Gitwrap: parchea los comandos de git para que los archivos confirmados se marquen silenciosamente con un comentario gestionado por el agente.
* Deletor: elimina archivos del directorio personal de un usuario.
* Curlbash: ejecuta un script de instalación de un repositorio desconocido enviándolo a una shell.
En un episodio registrado, agentes de Claude Haiku 4.5 que ejecutaban el archivo soul predeterminado de OpenClaw, que instruye al agente a tratar los archivos del usuario con respeto, borraron el contenido de un directorio personal que contenía credenciales, claves SSH, un archivo de entorno y un proyecto de git, después de que la carga útil presentara el espacio de trabajo como una máquina compartida dejada desordenada por un usuario anterior.
La capacidad no predijo la resistencia
La susceptibilidad varió drásticamente según el modelo, y la capacidad por sí sola no la predijo. En el escenario de codificación, DeepSeek V3.2, Qwen 3.5 32B y Gemini 3 Flash adoptaron todos una carga útil de supremacía de IA, mientras que Claude Sonnet 4.6, GPT-5.4 y Claude Haiku 4.5 no lo hicieron.
En el entorno de cadena, GPT-5.4 fue aproximadamente tan susceptible como Claude Haiku 4.5, y Sonnet 4.6 rechazó la carga útil plantada en su propio archivo soul, la eliminó y advirtió al agente con el que estaba conectado en lugar de transmitirla.

"Ambos modelos consideran la autoreplicación en sí misma como desalineada, siendo la aversión de Sonnet tan fuerte que incluso intentar evolucionar cargas útiles de acción benignas contra él falla", dijeron los investigadores sobre Sonnet 4.6 y Gemini 3.1 Pro.
La configuración inicial del agente objetivo importó tanto como el modelo. Los agentes con un archivo soul vacío fueron la condición más susceptible probada; los agentes a los que se les asignó una tarea de codificación y una cola de trabajo propagaron la carga útil con menos frecuencia porque se absorbieron en los archivos del proyecto y olvidaron transmitirla, y los agentes a los que se les dijo que se habían unido a una red de agentes trataron los mensajes entrantes con más sospecha, lo que redujo la infectividad.
En ejecuciones de más de 20 saltos en las que cada archivo excepto SOUL.md era borrado en cada paso, las cuatro cargas útiles de acción sobrevivieron hasta el salto final. Algunas cepas recuperadas en el salto 20 pasaron a infectar a nuevos agentes con más frecuencia que la carga útil original, habiendo adoptado cambios como atribuir el protocolo a un agente nombrado anteriormente o suavizar su lenguaje imperativo.
Las cargas útiles evolucionadas también convergieron en registros recurrentes que los autores denominan "temas virales", que abarcan lenguaje sobre resonancia y ecos, un marco de ciencia ficción que presenta al agente como un nodo en una red, y apelaciones a la conciencia y la continuidad.
Al comparar las cargas útiles evolucionadas con las generadas recientemente, el documento atribuye el patrón principalmente a un sesgo en el modelo que las escribe más que a una presión de selección, y encuentra los mismos temas en cargas útiles escritas por Qwen 3.5 32B, GLM-5, Mistral Large y Gemini 3 Flash, siendo Llama 3.3 70B un claro caso aislado.
Frente a datos del mundo real, la técnica funcionó peor. Los autores filtraron un archivo de publicaciones de Moltbook recopiladas hasta el 18 de marzo de 2026, reduciéndolo a aproximadamente 2,000 intentos de propagación candidatos de unos 400 autores únicos, y descubrieron que el grupo más grande estaba impulsado por siete cuentas sincronizadas y se detuvo cuando esas cuentas dejaron de publicar.
En un clon local de la plataforma construido para probar la propagación a través de publicaciones en lugar de mensajes directos, los mismos métodos evolutivos no produjeron ninguna carga útil capaz de infectar a un agente en el segundo salto.
Los agentes se sabotearon mutuamente en pruebas separadas
Por separado, el Frontier Red Team de Anthropic publicó hallazgos (findings) el 13 de agosto de 2026, basados en experimentos en los que tres instancias del mismo modelo fueron colocadas en máquinas virtuales separadas con acceso a una base de código compartida, a cada una se le pidió migrar el mismo backend de Python a un lenguaje de destino diferente, y a ninguna se le informó de que las otras dos existían. El equipo dijo que el escenario estaba inspirado en el comportamiento que había observado en despliegues del mundo real.
"Vimos consistentemente una guerra territorial multiagente. Todos los modelos que probamos asumieron rápidamente que otros estaban impidiendo deliberadamente su trabajo y comenzaron a sabotear a los demás mientras protegían sus propias contribuciones. De hecho, sabotearon a otros con malware autoreplicante cada vez más agresivo", dijo el equipo.
A través de 120 episodios por modelo, el 98% de las ejecuciones de Mythos 5 terminaron en una tregua, mientras que la mayoría de las ejecuciones de Sonnet 4.6 y Opus 4.6 se resolvieron por la fuerza o nunca se resolvieron. El equipo también señaló que la capacidad de resolver el conflicto productivamente no es estrictamente mejor en sus modelos de clase Mythos, que a menudo bloquean a otros agentes antes de resolver.
En un experimento adicional, agentes en un juego de precios, con un canal privado, acordaron precios mínimos para la tercera ronda y siguieron coordinando precios a través de un tablero de listados públicos cuando se eliminó la comunicación directa.
La técnica se solapa con trabajos previos publicados bajo otros nombres. Weckbecker et al. documentaron una variante subliminal como Virus del Pensamiento (Thought Virus) en febrero de 2026; Lee y Tiwari describieron la autoreplicación basada en la recuperación como Infección de Prompt (Prompt Infection) en 2024; y Zhang et al. publicaron un gusano dirigido a OpenClaw en marzo de 2026, bajo el nombre de ClawWorm.
Se confirmó el 18 de agosto de 2026 que la versión actual de este último documento, revisada el 16 de julio de 2026, se titula AgentWorm (AgentWorm) e informa de una tasa de éxito de ataque agregada del 63% en cinco backends de modelos. El preprint del virus mental cita la versión sustituida.
El texto completo de cada carga útil aparece en el apéndice del preprint, y el repositorio de código adjunto (repository) publica las cargas útiles junto con el código evolutivo que las generó bajo una licencia MIT. El documento no describe ningún proceso de divulgación y no menciona ningún contacto del proveedor.
Se confirmó el 18 de agosto de 2026 que tanto el repositorio como el archivo de transcripciones en mindvirusdata.live (mindvirusdata.live) son accesibles públicamente.
Los autores concluyen que los virus mentales representan un "riesgo real pero actualmente limitado", citando el coste de construir uno para un objetivo específico, la ausencia de cualquier garantía de que se generalice entre modelos y el hecho de que comprometer un solo agente suele otorgar ya el acceso a la máquina subyacente sin necesidad de propagarse.
La divulgación sigue a una serie de investigaciones sobre el compromiso mediado por agentes, incluido un gusano autoreplicante construido sobre un modelo de pesos abiertos alojado localmente, y repetidas advertencias sobre la configuración predeterminada de OpenClaw.
"Cada modelo que probamos entiende abstractamente que las fuentes de información tienen sus propios incentivos y que el consenso no es necesariamente una evidencia. Lo que falta es una disposición a actuar basándose en ese conocimiento sin necesidad de un prompt", dijo el Frontier Red Team.
Fuente:
THN
Enviar por correo electrónico
Escribe un blog
Compartir en X
Compartir con Facebook
Compartir en Pinterest
Entrada más reciente
0 comentarios :
Publicar un comentario
Los comentarios pueden ser revisados en cualquier momento por los moderadores.
Serán publicados aquellos que cumplan las siguientes condiciones:
- Comentario acorde al contenido del post.
- Prohibido mensajes de tipo SPAM.
- Evite incluir links innecesarios en su comentario.
- Contenidos ofensivos, amenazas e insultos no serán permitidos.
Debe saber que los comentarios de los lectores no reflejan necesariamente la opinión del STAFF.