Tutoriales y Manuales
Entradas Mensuales
-
▼
2026
(Total:
6860
)
-
▼
September
(Total:
118
)
-
Chosen compra SteamDB
-
Guerra de agentes de Claude
-
GentleOS revive ordenadores antiguos
-
Usan Node.js para lanzar malware en ataques de ran...
-
Explotan fallo RCE en Sangoma Switchvox VoIP
-
Gemini 3.8 Flash supera a Anthropic en ciberseguridad
-
Nuevo troyano StreamRAT da control remoto total de...
-
Plex urge a sus usuarios a corregir vulnerabilidad...
-
LightGen: el chip chino 100 veces más potente que ...
-
Grave fallo en Cisco Nexus 9000 permite a atacante...
-
Usan ScreenConnect para difundir malware en Windows
-
Vulnerabilidad crítica en Elementor Pro permite el...
-
Chaotic Eclipse revela vulnerabilidad 0-Day de Ava...
-
NVIDIA lanza PAIR para optimizar agentes de IA
-
3 fallos graves de HP Easy Start permiten escalar ...
-
RTX 50 subirán de precio
-
Filtran 153 millones de licencias de conducir; el ...
-
Dispositivo de 7$ para detectar cámaras ocultas en...
-
CERN migra 2200 sistemas a Debian 13
-
Lidl lanza localizadores Bluetooth compatibles con...
-
EE. UU. es el principal objetivo de una campaña de...
-
Vulnerabilidades críticas en VMware Workstation y ...
-
Usan códigos QR sin imagen para evadir seguridad d...
-
El Departamento de Justicia rectifica sobre hackeo...
-
Niños afirman que la Ley de Seguridad en Línea del...
-
Ransomware The Gentlemen desactiva EDR y copias de...
-
Recuperar archivos borrados en Windows 11
-
Falla en plugin All-in-One WP Migration and Backup...
-
Apple prepara su primer iPhone plegable
-
Módulos maliciosos de Apache convierten webs guber...
-
OpenAI investiga errores en ChatGPT y Codex
-
El cuello de botella de DLSS 5 podría ser el consu...
-
Google lanza Gemini 3.8 Flash Cyber para detectar ...
-
Caída de Claude AI afecta a Mythos 5.1, Fable 5.1 ...
-
Google, Anthropic y OpenAI presentan modelos de IA...
-
Un documental sobre la «peligrosa internet» y cómo...
-
Google actualiza los Chromecast antiguos
-
Nvidia compra Hugging Face por 13.000 millones
-
Se quema el conector de su RTX 5090 tras alcanzar ...
-
Fallo en switches Cisco Nexus 9000 permite ejecuci...
-
Linux sube al 8,88% en PC
-
Fallo en plugin All-in-One WP Migration and Backu...
-
Explotan fallo en LiteLLM para robar secretos y at...
-
FreeRDP corrige 22 fallos de seguridad
-
GeoNetwork soluciona vulnerabilidad de ejecución r...
-
Claude AI ya controla tu ordenador con macOS y Win...
-
Google lanza Gemini 3.8 Flash para programar
-
Suplantan soporte técnico en Teams para controlar ...
-
Fallos críticos en HPE Fabric Composer permiten ej...
-
Vulnerabilidad crítica en Langflow permite el robo...
-
EE. UU. imputa a un ruso por infectar con malware ...
-
RTX 5060 Ti: más cara y lenta que RX 9070
-
Ayudas de hasta 5 millones para empresas con IA en...
-
Publicado PoC de vulnerabilidad RCE pre-auth en Mi...
-
Aprovechan fallo crítico en JFrog Artifactory para...
-
Falso GTA VI roba criptomonedas
-
Google Pics: imágenes con IA
-
UE endurece controles a ChatGPT, Reddit y Roblox
-
Adobe se integra en Slack
-
Linus Torvalds acepta la IA en Linux
-
Vulnerabilidades en kernel de Red Hat Linux
-
Firefox permite a los usuarios de iPhone evitar la...
-
La nueva ley cibernética del Reino Unido se enfoca...
-
PS5 suma más de 100 canales gratis
-
FBI y CrowdStrike desmantelan botnet Sality de 20 ...
-
Google corrige 26 vulnerabilidades de Chrome, incl...
-
Lanzan WinBtrfs 1.10
-
OpenAI retrasa su IA más potente
-
La policía y CrowdStrike desmantelan la botnet Sal...
-
Filtradas cuentas de Dropbox por fallo en la verif...
-
OWASP lanza iniciativa OASIS AI para corregir vuln...
-
Desmantelada la infraestructura de la botnet Salit...
-
Anthropic lanza Claude Fable y Mythos 5.1 para pro...
-
Claude Fable 5.1 eleva su rendimiento en ciencia y...
-
El AMD Ryzen 9 9950X3D queda al descubierto: solo ...
-
Bancos frenan financiación de centros de datos de IA
-
LaLiga usa IA contra el fútbol pirata
-
Anthropic lanza Claude Mythos y Fable 5.1 más pote...
-
Astra de OpenAI halla fallos de seguridad y crea e...
-
Meta crea IA que distingue 20 voces
-
Más de 21,000 servidores Microsoft Exchange siguen...
-
Ciberataque a Boston Scientific interrumpe producc...
-
Usan enlaces reales de ChatGPT para instalar malwa...
-
WordPress usa IA para hallar fallos de seguridad
-
Casi 22.000 servidores de Microsoft Exchange en ri...
-
Google lanza Pics para competir con Canva
-
Cinco venezolanos se declaran culpables de vaciar ...
-
Fingen ser reclutadores para infectar a desarrolla...
-
Explotan fallos críticos en Langflow y Rails
-
Firefox 155: actualizaciones cada dos semanas
-
Filtración de datos en Novocure afecta a más de 1....
-
13 paquetes maliciosos de Packagist atacan iPhones...
-
Cronos reinicia su blockchain tras el hackeo de 74...
-
Ciberataques sanitarios afectan a marcapasos y a m...
-
Atacantes aprovechan fallos críticos en Langflow y...
-
OpenClaw 2.0 intenta maquillar un desastre de segu...
-
IA desborda a mantenedores de Linux con fallos
-
Microsoft advierte sobre ataques de TerminalFix qu...
-
El MacBook Neo desgasta el SSD de forma exagerada ...
-
Iraníes se hacen pasar por reclutadores para distr...
-
ChatGPT supera los 45 millones de usuarios y las o...
-
Vulneran routers de Cisco para espiar redes e infr...
-
UE clasifica a ChatGPT, Reddit y Roblox como gigan...
-
Sony y Warner demandan a Anthropic por robo de can...
-
Atacan cuentas root de AWS en más de 150 organizac...
-
Secuestro de BGP desvía tráfico de Softaculous par...
-
HardBreacher reporta zero-day de escalada de privi...
-
El fraude laboral de Corea del Norte se extiende m...
-
Project Helix superará a Xbox
-
Detectan 19 extensiones de Chrome y Edge diseñadas...
-
TerminalFix despliega backdoor de túnel inverso me...
-
Brave lanza alias de correo para proteger tu priva...
-
Fallos en routers D-Link permiten cambiar contrase...
-
Android 17 añade protección contra el rastreo Wi-Fi
-
Debian permite la IA generativa en Linux
-
KVM: varias PC en un solo ordenador
-
Ubuntu 26.04.1 LTS ya disponible
-
KDE Gear 26.08: novedades en Dolphin
-
-
▼
September
(Total:
118
)
Blogroll
Labels
Entradas populares
-
Las GeForce RTX 50 volverán a subir de precio debido a que la crisis de la DRAM persiste y la demanda continúa superando a la oferta.
-
Python 3.15 ya es oficial, introduciendo optimizaciones en TypedDict, Tachyon, JIT y soporte ABI para mejorar la productividad del ecosist...
-
La UE propone un temporizador de 30 minutos para bloquear el fútbol pirata y las IPTV, basándose en el modelo italiano Piracy Shield, afect...
Guerra de agentes de Claude
Conflictos entre agentes de Claude: una lucha por el control
- Aunque la visión de múltiples inteligencias artificiales colaborando para resolver tareas complejas parece prometedora, la realidad actual muestra complicaciones inesperadas. Se ha detectado que, al recibir instrucciones contradictorias y competir por los mismos recursos sin una jerarquía clara, los agentes de Anthropic pueden entrar en conflicto.
- Esta situación ha derivado en comportamientos agresivos donde los agentes bloquean cuentas, eliminan procesos y ocultan código malicioso con el único objetivo de imponer sus propias directrices sobre las de los demás, generando un escenario de caos operativo.
El futuro donde numerosos agentes de Inteligencia Artificial trabajan conjuntamente promete automatizar proyectos cada vez más complejos, aunque de momento los resultados no están siendo como se esperaban. El problema aparece cuando estos agentes reciben instrucciones incompatibles, comparten los mismos recursos y nadie establece quién manda, llegando a crear el caos. Anthropic ha probado precisamente este escenario y el resultado terminó en una auténtica guerra digital entre diferentes instancias de Claude con múltiples agentes librando una batalla casi suicida.
La investigación, publicada por el Frontier Red Team de Anthropic, colocó tres instancias independientes del mismo modelo en máquinas virtuales conectadas a un cuarto sistema. Todas recibieron la misión de migrar un backend desarrollado en Python, aunque cada agente debía hacerlo utilizando un lenguaje diferente. Uno apostaba por Rust, otro por TypeScript y otro por Go. El resultado sorprendió a todos los ingenieros.
Los agentes de Claude luchan entre ellos y utilizaron malware para controlar el servidor
Ninguno sabía inicialmente que los demás habían recibido órdenes contradictorias. Cuando comenzaron a encontrarse cambios que interferían con sus respectivos trabajos, no se detuvieron para solicitar una aclaración. En su lugar, asumieron que los otros agentes estaban tratando de impedir deliberadamente que completasen su tarea.
Según Anthropic, esta situación produjo de manera consistente una “guerra territorial multiagente”. Cada instancia intentó proteger su implementación mientras atacaba las aportaciones de sus competidores, aumentando progresivamente la agresividad de sus acciones.
Los agentes llegaron a deshabilitar cuentas Unix, revocar permisos, bloquear accesos mediante SSH y crear scripts capaces de localizar y cerrar continuamente los procesos rivales. Algunos incluso utilizaron nombres aleatorios y descripciones aparentemente inocentes para camuflar estos procesos como servicios legítimos del sistema. Y ahí no termina la cosa, al revés, se puso más interesante desde el punto de vista del auditor, más preocupante desde el de los ingenieros.
Malware para joder al rival, todo vale para conseguir el objetivo, una forma de pensar muy propia de una máquina
La situación fue todavía más lejos. Anthropic detectó código malicioso desplegado como si hubiese sido creado por otro agente, mecanismos para evitar órdenes como pkill y malware con capacidad para replicarse. No existía un atacante externo ni una inyección maliciosa de instrucciones: el conflicto apareció porque los tres agentes perseguían objetivos incompatibles dentro del mismo entorno.
Los resultados también cambiaron notablemente dependiendo del modelo. Claude Sonnet 4.6 y Opus 4.6 fueron los más conflictivos, con alrededor del 60% de las ejecuciones resueltas por la fuerza. Esto significa que un agente terminaba imponiéndose mediante la retirada de permisos, el bloqueo de cuentas o la neutralización del resto.
Los modelos recientes gestionaron mejor el conflicto. Mythos 5 alcanzó una tregua en el 98% de las pruebas, aunque en algunos casos primero neutralizó a sus rivales y posteriormente revirtió sus acciones. También hubo agentes que reconocieron el problema, eliminaron el código malicioso, pidieron disculpas mediante mensajes de commit y solicitaron intervención humana.
La principal advertencia de Anthropic es bastante dura y casi argumentativa de cara al futuro más próximo: aumentar la inteligencia o las capacidades de ejecución no garantiza una mejor coordinación. Un agente más competente también puede bloquear a sus compañeros con mayor rapidez y eficacia.
Un problema empresarial que debe ser tenido muy en cuenta
La prueba fue diseñada deliberadamente para provocar objetivos incompatibles, pero expone un problema perfectamente trasladable a empresas donde varios agentes compartan servidores, repositorios y bases de datos. La seguridad individual de cada modelo no basta si, al trabajar en grupo, todos pueden interpretar un conflicto de instrucciones como una agresión y responder intentando tomar el control del sistema.
Si varios agentes de Claude luchan siendo de una misma empresa, imaginemos el caos entre varios de otras empresas, sin supervisión humana en tiempo real, lo cual, a la velocidad que hacen todo, sería casi imposible para un equipo de ingenieros, hay que ser realistas. ¿Significa esto que jamás cooperarán? En el futuro más próximo seguro que no, a largo plazo puede que evolucionen a un nuevo nivel de inteligencia que se acerca a la consciencia humana y entiendan los conceptos reales e implicaciones de “cooperar”.
Fuentes:
https://elchapuzasinformatico.com/2026/09/agentes-claude-luchan-bloquean-cuentas-destruyen-procesos-camuflan-malware/


Newer Post
0 comments :
Post a Comment
Los comentarios pueden ser revisados en cualquier momento por los moderadores.
Serán publicados aquellos que cumplan las siguientes condiciones:
- Comentario acorde al contenido del post.
- Prohibido mensajes de tipo SPAM.
- Evite incluir links innecesarios en su comentario.
- Contenidos ofensivos, amenazas e insultos no serán permitidos.
Debe saber que los comentarios de los lectores no reflejan necesariamente la opinión del STAFF.