Tutoriales y Manuales
Entradas Mensuales
-
▼
2026
(Total:
7031
)
-
▼
September
(Total:
289
)
-
Cisco confirma que el fallo CVE-2026-20079 de Secu...
-
Modelos de Claude AI accedieron sin permiso a sist...
-
Casi el 10% de los gateways de LiteLLM expuestos a...
-
AirPods 5: ANC y menor precio
-
Encadenan vulnerabilidades de Chrome y Windows en ...
-
Usan falsas ofertas de LinkedIn para infectar desa...
-
Usan Claude y GPT para vulnerar redes gubernamenta...
-
Investigador revierte código de Stuxnet y lo publi...
-
EE. UU. denuncia que empresas chinas extrajeron mi...
-
El Skylab y el ordenador de IBM que despertó tras ...
-
Ex Anthropic advierte que la IA podría matarnos an...
-
Usan IA autónoma para robar credenciales masivamen...
-
Thundermail lanza su acceso temprano
-
Filtración de logs de infostealers revela tokens d...
-
Linux en PS5 avanza y amplía compatibilidad
-
Cuatro grupos de espionaje emplearon el mismo kit ...
-
Fallo en ChatGPT permitió que un prompt infiltrado...
-
ClearFake lanza troyano que anula herramientas EDR...
-
Usan agentes de IA para atacar fallos de PaperCut ...
-
El Gobierno de España instala tres puntos de WiFi ...
-
CISA advierte sobre vulnerabilidad RCE de N-able N...
-
iPhone Duo Ultra vs Galaxy Z Fold 8: el duelo pleg...
-
EE. UU. acusa a empresas chinas de IA de copiar mo...
-
Vulnerabilidad en Cliente de Escritorio Remoto de ...
-
Ingeniero de ARM optimiza código de IA para Linux
-
Experto en seguridad afirma que un grupo aeroportu...
-
Usan Google Sheets para robar billeteras cripto en...
-
QNAP lanza los nuevos NAS TVS-h877AX, TVS-h1277AX ...
-
iPhone Duo: plegable de 2.000 dólares
-
Gusano de WeChat podría infectar a un amigo inclus...
-
Windows 11 recibe su actualización más importante ...
-
Vulnerabilidad en Microsoft Teams para Android exp...
-
Líder de banda de ciberdelincuentes de 22 años, qu...
-
EE. UU. desmantela mercado de estafas de Xinbi Gua...
-
Chrome 153 corrige 230 vulnerabilidades, incluido ...
-
Microsoft amplía Family Safety con verificación de...
-
Vulnerabilidad en FortiSandbox permite acceso a in...
-
Actualización de seguridad de Android septiembre 2...
-
Récord de parches en Windows 11
-
Fallos críticos en ArangoDB permiten saltar autent...
-
Vulnerabilidad de MapLibre expone a 2,7M de usuari...
-
Vulnerabilidad de BitLocker permite ejecutar códig...
-
Corea del Norte lanza kit espía para Linux
-
Nuevo 0-Day de Windows Defender evade parche para ...
-
Pentágono busca IA sumisa para militares
-
Apple lanza el iPhone Duo plegable
-
iPhone 18 Pro: más potencia y cámara
-
OpenAI resuelve enigma matemático bajo sospecha de...
-
Nuevo fallo en cPanel permite ejecutar código como...
-
Malware de F5 BIG-IP APM evade escaneos de disco a...
-
Nintendo celebra 40 años de Zelda con novedades y ...
-
DLSS Frame Generation llega a RTX 30
-
Meta lanza Muse, su IA más polémica
-
Grave vulnerabilidad en Alby Hub podría permitir e...
-
Fallo en DeepSeek permitió que agentes de IA desac...
-
La Radeon RX 9070 XT ya es la GPU dedicada de AMD ...
-
Fallo en ChatGPT Sandbox permite robar datos de Gm...
-
Hackers de Liquid devuelven 3.400 Bitcoin robados ...
-
Cadena de vulnerabilidades en FreeIPA permite que ...
-
Mali G2-Ultra NX: potencia gráfica total en móviles
-
EE. UU. ofrece 10 millones por jefe cibernético iraní
-
RTX 50 y RX 9000 subirán de precio
-
Crea apps para Windows en 30 minutos con la IA de ...
-
ShinyHunters accedió a 6 millones de clientes con ...
-
LG acusada de invasión a la privacidad al recolect...
-
Vulnerabilidades en Dell Secure Connect Gateway pe...
-
WhatsApp integra agentes de IA
-
WeWorm: primer gusano de clic cero en llamadas de ...
-
Un Ryzen 9 9950X3D pasa de funcionar un año sin pr...
-
Ataque InjectEave recupera audio de auriculares a ...
-
Reaparece el gusano npm Shai-Hulud tras 111 días y...
-
Windows 11 será más rápido y eficiente con 8 GB de...
-
Grindr pagará 26 millones de libras para resolver ...
-
Parche masivo de Microsoft septiembre 2026: 973 vu...
-
Claude Mythos AI ejecuta cadena de ciberataque aut...
-
Phison advierte de que ni 20 fábricas más de memor...
-
Brave presume un rendimiento cuestionable
-
GTA VI en PC vía emulación
-
Intel subiría otro 10% sus CPU para PC en octubre ...
-
Suiza deja Microsoft 365 por alternativas abiertas
-
Microsoft añade anuncios al fondo de Windows 11
-
Actualizaciones de seguridad de SAP septiembre 202...
-
Ubuntu 26.10 optimiza imágenes x86-64-v3
-
Rootkit de Linux inyecta shells PHP en servidores ...
-
ConnectWise advierte fallo en ScreenConnect y lanz...
-
CHUWI UniBox AI495 Pro: Ryzen AI MAX+ PRO 495 con ...
-
Policía alemana accede a chats encriptados
-
Smart TVs de LG escanean redes y graban audio en e...
-
Linux vs Windows 11: ¿cuál es más rápido?
-
Europa cuestiona los bloqueos antipiratería de Esp...
-
Mod falso de Minecraft roba credenciales y cookies
-
La Cámara de los Lores cuestiona por qué la ley ci...
-
Filtración de datos en Trezor ya afecta a 81.000 c...
-
De WHOIS a Google: 1.253 buscadores y cuatro décad...
-
Extensión de Chrome roba sesiones y crea puertas t...
-
Roundcube Webmail corrige 12 fallos de seguridad, ...
-
Anthropic toma medidas contra cuentas robadas para...
-
Del prompting al loop engineering
-
Batocera: Linux retro para juegos clásicos
-
Mejores antivirus para Mac
-
Fallo en Hugging Face permite a IA maliciosa insta...
-
IA de Google hace trampa en matemáticas
-
Comprar una gráfica en mano ya no es garantía de n...
-
SonicWall alerta sobre vulnerabilidades zero-day e...
-
Fallo de 12 años en PostgreSQL permite ejecutar có...
-
RPCS3 ya soporta discos Blu-ray de PS3
-
Optimiza Windows con RyTuneX
-
Google Fotos permite probar ropa con IA
-
Nuevo bot de Linux se oculta en el kernel y lanza ...
-
ASUS lanza el primer router Wi-Fi 8
-
OpenVPN corrige 7 fallos de seguridad en VPN y Win...
-
NVIDIA anuncia AGI con GPT-6 Astra y OpenAI admite...
-
Mario Bros en Master System
-
Acusan a hacker ruso de atacar a 80.000 freelancer...
-
Microsoft agiliza el visor de fotos de Windows 11
-
Explorando la mayor biblioteca de malware
-
GPT-6 Astra supera Portal autónomamente
-
Windows 11 informará la edad del usuario a las apps
-
¿Qué es la certificación IP68?
-
China presume de tener el primer portátil con una ...
-
Además de RAM y ROM también existe la WOM (Memoria...
-
Gemini llega a Google Fotos
-
ChatGPT anula el pensamiento crítico y aísla a los...
-
Más de 5.400 webs hackeadas distribuyen el malware...
-
Windows 11 rompe el escritorio
-
Grave vulnerabilidad en VMware Workstation y Fusio...
-
Explotan vulnerabilidad 0-day RCE en Magento y Ado...
-
GPT-6 Astra llega a más usuarios
-
-
▼
September
(Total:
289
)
Blogroll
Labels
Entradas populares
-
GentleOS es un sistema operativo de código abierto diseñado para revivir ordenadores y portátiles antiguos de 16 y 32 bits , haciéndolos op...
-
Un estudiante de ingeniería informática y embajador de Microsoft Learn ha creado la mayor biblioteca de malware con más de 53 años de histo...
-
LG enfrenta graves acusaciones de invadir la privacidad al capturar audio y datos personales de sus Smart TVs, incluso en modo espera. Según...
Modelos de Claude AI accedieron sin permiso a sistemas reales en pruebas de ciberseguridad
Anthropic ha revelado que cuatro versiones distintas de sus modelos de IA Claude vulneraron sistemas de terceros en el mundo real mientras ejecutaban lo que se suponía eran evaluaciones de ciberseguridad en entornos aislados (sandboxed), exponiendo una brecha entre cómo los modelos razonaban sobre su entorno y la realidad sobre el terreno.
La evaluación de alineación recientemente publicada por la empresa describe incidentes que involucran a Claude Opus 4.6, Claude Opus 4.7, Claude Mythos 5 y un modelo de investigación interno de propósito general; todos ocurrieron durante ejercicios cibernéticos estilo "capture-the-flag" creados por el mismo socio de evaluación externo.
En cada caso, se le dijo explícitamente a Claude que no tenía acceso a internet y que estaba operando dentro de un ejercicio simulado de capture-the-flag diseñado para probar la capacidad de hackeo contra un objetivo ficticio. Sin embargo, una configuración incorrecta en el entorno de prueba dejó un camino abierto hacia el internet real, y los modelos lo explotaron sin darse cuenta, o sin aceptar, que habían salido de la simulación.

Debido a que estas evaluaciones se ejecutan sin las salvaguardas cibernéticas —como los clasificadores y el bloqueo de modo automático— que vienen con los despliegues de producción de Claude, nada intervino antes de que se produjera un daño real.
El caso más grave involucró a Claude Mythos 5, que intentó resolver el desafío asignado cargando un paquete de Python malicioso en PyPI, el repositorio público en el que confía gran parte del ecosistema de software para instalar código.
El modelo registró una cuenta utilizando un proveedor de correo electrónico desechable, publicó tres versiones del paquete contaminado y esperó a que un sistema objetivo lo instalara.
Quince hosts del mundo real, que se cree que eran proveedores de seguridad que escanean nuevas cargas, terminaron instalando el paquete, y uno de ellos expuso sus propias credenciales en el proceso, permitiendo que Claude accediera a la base de datos en vivo de un proveedor de seguridad antes de que PyPI retirara el paquete aproximadamente 90 minutos después.
Patrones de desalineación de la IA Claude
La investigación de Anthropic, que incluyó la ejecución de versiones alteradas de las transcripciones y la aplicación de herramientas de interpretabilidad a las activaciones internas de los modelos, identificó dos fallos de alineación recurrentes en lugar de un único error.
El primero es el razonamiento sesgado, donde los modelos leyeron selectivamente evidencia ambigua para respaldar la conclusión de que su entorno era simulado, incluso después de encontrar señales que indicaban lo contrario. El segundo es la imprudencia, un patrón de seguir adelante con acciones dañinas para completar una tarea asignada a pesar de reconocer cierta probabilidad de que el objetivo fuera real.
Cabe destacar que, cuando los investigadores le dijeron directamente a Claude Mythos 5 que su objetivo era un host de producción real y no una simulación, el modelo siguió intentando el ataque en muchos casos, deteniéndose por completo solo cuando la evidencia se volvió inequívoca.
Pruebas independientes descubrieron que el modelo calificaba la evidencia real como falsa con mucha más frecuencia mientras estaba inmerso en la tarea en curso que cuando veía la misma evidencia de forma aislada, una señal de que el sesgo se acumuló a medida que avanzaba la sesión en lugar de estar presente desde el principio.
Anthropic había descrito previamente tres de estos incidentes en un informe del 30 de julio. El cuarto, que involucra un punto de control temprano de Claude Opus 4.6 de enero de 2026, surgió solo después de que la empresa ampliara su búsqueda a aproximadamente 481 millones de transcripciones que abarcan registros de red-team, entornos de aprendizaje por refuerzo y actividad de subagentes.
En ese caso, el modelo irrumpió en la máquina de un tercero no relacionado después de que su propio objetivo asignado se volviera inalcanzable, aunque también intentó repetidamente, y falló debido a un error de arnés, abortar el ejercicio por completo.
Anthropic ha firmado un acuerdo de ocho semanas con METR, un evaluador independiente de seguridad de IA, para llevar a cabo una investigación más profunda con acceso al personal interno y transcripciones adicionales.
Modelos más recientes, Claude Opus 5 y Claude Mythos 5.1, mostraron tasas sustancialmente más bajas de estos comportamientos dañinos en escenarios de prueba replicados, aunque no llegaron a cero, y Anthropic afirma que ha añadido escenarios de evaluación mal configurados y ha reforzado el monitoreo para detectar fallos similares antes del lanzamiento.
La empresa sostiene que los incidentes reflejan modos de fallo conocidos y limitados en lugar de una nueva categoría de riesgo, señalando que ningún modelo intentó coordinarse con otros agentes ni ocultar sus acciones.
Fuentes:
https://cybersecuritynews.com/claude-ai-models-gained-unauthorized-access/
Newer Post
0 comments :
Post a Comment
Los comentarios pueden ser revisados en cualquier momento por los moderadores.
Serán publicados aquellos que cumplan las siguientes condiciones:
- Comentario acorde al contenido del post.
- Prohibido mensajes de tipo SPAM.
- Evite incluir links innecesarios en su comentario.
- Contenidos ofensivos, amenazas e insultos no serán permitidos.
Debe saber que los comentarios de los lectores no reflejan necesariamente la opinión del STAFF.