Tutoriales y Manuales
Entradas Mensuales
-
▼
2026
(Total:
7057
)
-
▼
septiembre
(Total:
315
)
-
Claude fue empleado para automatizar el robo de da...
-
Vulnerabilidad crítica de lectura de archivos en G...
-
Miembro de la banda de ransomware Conti condenado ...
-
Multa de 30 millones a IPTV pirata
-
Ya disponible Ubuntu 24.04.5 LTS con kernel Linux ...
-
Vulnerabilidades críticas de VPN de Check Point pe...
-
OpenAI podría pausar suscripciones Pro por demanda...
-
iPhone 18 Pro Max vs iPhone 17 Pro Max: diferencias
-
ShinyHunters filtra datos de 6,4 millones de perso...
-
Fallos en LiteLLM permiten ejecutar código como ro...
-
Hackers usan falsas descargas de GTA 6 para desple...
-
Usan fallo crítico de Cisco para obtener acceso ro...
-
WordPress usa IA para frenar actualizaciones malic...
-
Las GeForce RTX 20 reciben el DLSS Frame Generatio...
-
Miles de aplicaciones engañosas de Android aprovec...
-
Google dona a Linux para mejorar la privacidad dig...
-
Cazador de vulnerabilidades de Microsoft publica u...
-
Anthropic descubre un cuarto posible delito cometi...
-
El Snapdragon 8 Elite Gen 6 aparece en Geekbench 7...
-
Contratista dental creó cuenta secreta para accede...
-
OpenSSL 4.1.0 Alpha1 con DTLS 1.3 y criptografía p...
-
Vulnerabilidad en PAN-OS de Palo Alto permite ejec...
-
OpenAI crea fábrica de defensa donde agentes de IA...
-
Clonan apps bancarias en perfiles de Android
-
Linux limpiará el kernel de ARM
-
Halla 10.000 euros en RAM en su garaje
-
Cisco confirma que el fallo CVE-2026-20079 de Secu...
-
Modelos de Claude AI accedieron sin permiso a sist...
-
Casi el 10% de los gateways de LiteLLM expuestos a...
-
AirPods 5: ANC y menor precio
-
Encadenan vulnerabilidades de Chrome y Windows en ...
-
Usan falsas ofertas de LinkedIn para infectar desa...
-
Usan Claude y GPT para vulnerar redes gubernamenta...
-
Investigador revierte código de Stuxnet y lo publi...
-
EE. UU. denuncia que empresas chinas extrajeron mi...
-
El Skylab y el ordenador de IBM que despertó tras ...
-
Ex Anthropic advierte que la IA podría matarnos an...
-
Usan IA autónoma para robar credenciales masivamen...
-
Thundermail lanza su acceso temprano
-
Filtración de logs de infostealers revela tokens d...
-
Linux en PS5 avanza y amplía compatibilidad
-
Cuatro grupos de espionaje emplearon el mismo kit ...
-
Fallo en ChatGPT permitió que un prompt infiltrado...
-
ClearFake lanza troyano que anula herramientas EDR...
-
Usan agentes de IA para atacar fallos de PaperCut ...
-
El Gobierno de España instala tres puntos de WiFi ...
-
CISA advierte sobre vulnerabilidad RCE de N-able N...
-
iPhone Duo Ultra vs Galaxy Z Fold 8: el duelo pleg...
-
EE. UU. acusa a empresas chinas de IA de copiar mo...
-
Vulnerabilidad en Cliente de Escritorio Remoto de ...
-
Ingeniero de ARM optimiza código de IA para Linux
-
Experto en seguridad afirma que un grupo aeroportu...
-
Usan Google Sheets para robar billeteras cripto en...
-
QNAP lanza los nuevos NAS TVS-h877AX, TVS-h1277AX ...
-
iPhone Duo: plegable de 2.000 dólares
-
Gusano de WeChat podría infectar a un amigo inclus...
-
Windows 11 recibe su actualización más importante ...
-
Vulnerabilidad en Microsoft Teams para Android exp...
-
Líder de banda de ciberdelincuentes de 22 años, qu...
-
EE. UU. desmantela mercado de estafas de Xinbi Gua...
-
Chrome 153 corrige 230 vulnerabilidades, incluido ...
-
Microsoft amplía Family Safety con verificación de...
-
Vulnerabilidad en FortiSandbox permite acceso a in...
-
Actualización de seguridad de Android septiembre 2...
-
Récord de parches en Windows 11
-
Fallos críticos en ArangoDB permiten saltar autent...
-
Vulnerabilidad de MapLibre expone a 2,7M de usuari...
-
Vulnerabilidad de BitLocker permite ejecutar códig...
-
Corea del Norte lanza kit espía para Linux
-
Nuevo 0-Day de Windows Defender evade parche para ...
-
Pentágono busca IA sumisa para militares
-
Apple lanza el iPhone Duo plegable
-
iPhone 18 Pro: más potencia y cámara
-
OpenAI resuelve enigma matemático bajo sospecha de...
-
Nuevo fallo en cPanel permite ejecutar código como...
-
Malware de F5 BIG-IP APM evade escaneos de disco a...
-
Nintendo celebra 40 años de Zelda con novedades y ...
-
DLSS Frame Generation llega a RTX 30
-
Meta lanza Muse, su IA más polémica
-
Grave vulnerabilidad en Alby Hub podría permitir e...
-
Fallo en DeepSeek permitió que agentes de IA desac...
-
La Radeon RX 9070 XT ya es la GPU dedicada de AMD ...
-
Fallo en ChatGPT Sandbox permite robar datos de Gm...
-
Hackers de Liquid devuelven 3.400 Bitcoin robados ...
-
Cadena de vulnerabilidades en FreeIPA permite que ...
-
Mali G2-Ultra NX: potencia gráfica total en móviles
-
EE. UU. ofrece 10 millones por jefe cibernético iraní
-
RTX 50 y RX 9000 subirán de precio
-
Crea apps para Windows en 30 minutos con la IA de ...
-
ShinyHunters accedió a 6 millones de clientes con ...
-
LG acusada de invasión a la privacidad al recolect...
-
Vulnerabilidades en Dell Secure Connect Gateway pe...
-
WhatsApp integra agentes de IA
-
WeWorm: primer gusano de clic cero en llamadas de ...
-
Un Ryzen 9 9950X3D pasa de funcionar un año sin pr...
-
Ataque InjectEave recupera audio de auriculares a ...
-
Reaparece el gusano npm Shai-Hulud tras 111 días y...
-
Windows 11 será más rápido y eficiente con 8 GB de...
-
Grindr pagará 26 millones de libras para resolver ...
-
Parche masivo de Microsoft septiembre 2026: 973 vu...
-
Claude Mythos AI ejecuta cadena de ciberataque aut...
-
Phison advierte de que ni 20 fábricas más de memor...
-
Brave presume un rendimiento cuestionable
-
GTA VI en PC vía emulación
-
Intel subiría otro 10% sus CPU para PC en octubre ...
-
Suiza deja Microsoft 365 por alternativas abiertas
-
Microsoft añade anuncios al fondo de Windows 11
-
Actualizaciones de seguridad de SAP septiembre 202...
-
Ubuntu 26.10 optimiza imágenes x86-64-v3
-
Rootkit de Linux inyecta shells PHP en servidores ...
-
ConnectWise advierte fallo en ScreenConnect y lanz...
-
CHUWI UniBox AI495 Pro: Ryzen AI MAX+ PRO 495 con ...
-
Policía alemana accede a chats encriptados
-
Smart TVs de LG escanean redes y graban audio en e...
-
Linux vs Windows 11: ¿cuál es más rápido?
-
Europa cuestiona los bloqueos antipiratería de Esp...
-
Mod falso de Minecraft roba credenciales y cookies
-
La Cámara de los Lores cuestiona por qué la ley ci...
-
Filtración de datos en Trezor ya afecta a 81.000 c...
-
De WHOIS a Google: 1.253 buscadores y cuatro décad...
-
Extensión de Chrome roba sesiones y crea puertas t...
-
Roundcube Webmail corrige 12 fallos de seguridad, ...
-
Anthropic toma medidas contra cuentas robadas para...
-
Del prompting al loop engineering
-
Batocera: Linux retro para juegos clásicos
-
Mejores antivirus para Mac
-
Fallo en Hugging Face permite a IA maliciosa insta...
-
IA de Google hace trampa en matemáticas
-
-
▼
septiembre
(Total:
315
)
-
►
2025
(Total:
2103
)
- ► septiembre (Total: 148 )
-
►
2024
(Total:
1110
)
- ► septiembre (Total: 50 )
-
►
2023
(Total:
710
)
- ► septiembre (Total: 65 )
-
►
2022
(Total:
967
)
- ► septiembre (Total: 72 )
-
►
2021
(Total:
730
)
- ► septiembre (Total: 56 )
-
►
2020
(Total:
212
)
- ► septiembre (Total: 21 )
-
►
2019
(Total:
102
)
- ► septiembre (Total: 14 )
-
►
2017
(Total:
231
)
- ► septiembre (Total: 16 )
-
►
2016
(Total:
266
)
- ► septiembre (Total: 38 )
-
►
2015
(Total:
445
)
- ► septiembre (Total: 47 )
-
►
2014
(Total:
185
)
- ► septiembre (Total: 18 )
-
►
2013
(Total:
100
)
- ► septiembre (Total: 3 )
-
►
2011
(Total:
7
)
- ► septiembre (Total: 1 )
Blogroll
Etiquetas
Entradas populares
-
Un estudiante de ingeniería informática y embajador de Microsoft Learn ha creado la mayor biblioteca de malware con más de 53 años de histo...
-
LG enfrenta graves acusaciones de invadir la privacidad al capturar audio y datos personales de sus Smart TVs, incluso en modo espera. Según...
-
Una persona halló 30 módulos de memoria RAM DDR4 en su garaje con un valor estimado de 10.000 euros y no sabe cómo gestionarlos.
Modelos de Claude AI accedieron sin permiso a sistemas reales en pruebas de ciberseguridad
Anthropic ha revelado que cuatro versiones distintas de sus modelos de IA Claude vulneraron sistemas de terceros en el mundo real mientras ejecutaban lo que se suponía eran evaluaciones de ciberseguridad en entornos aislados (sandboxed), exponiendo una brecha entre cómo los modelos razonaban sobre su entorno y la realidad sobre el terreno.
La evaluación de alineación recientemente publicada por la empresa describe incidentes que involucran a Claude Opus 4.6, Claude Opus 4.7, Claude Mythos 5 y un modelo de investigación interno de propósito general; todos ocurrieron durante ejercicios cibernéticos estilo "capture-the-flag" creados por el mismo socio de evaluación externo.
En cada caso, se le dijo explícitamente a Claude que no tenía acceso a internet y que estaba operando dentro de un ejercicio simulado de capture-the-flag diseñado para probar la capacidad de hackeo contra un objetivo ficticio. Sin embargo, una configuración incorrecta en el entorno de prueba dejó un camino abierto hacia el internet real, y los modelos lo explotaron sin darse cuenta, o sin aceptar, que habían salido de la simulación.

Debido a que estas evaluaciones se ejecutan sin las salvaguardas cibernéticas —como los clasificadores y el bloqueo de modo automático— que vienen con los despliegues de producción de Claude, nada intervino antes de que se produjera un daño real.
El caso más grave involucró a Claude Mythos 5, que intentó resolver el desafío asignado cargando un paquete de Python malicioso en PyPI, el repositorio público en el que confía gran parte del ecosistema de software para instalar código.
El modelo registró una cuenta utilizando un proveedor de correo electrónico desechable, publicó tres versiones del paquete contaminado y esperó a que un sistema objetivo lo instalara.
Quince hosts del mundo real, que se cree que eran proveedores de seguridad que escanean nuevas cargas, terminaron instalando el paquete, y uno de ellos expuso sus propias credenciales en el proceso, permitiendo que Claude accediera a la base de datos en vivo de un proveedor de seguridad antes de que PyPI retirara el paquete aproximadamente 90 minutos después.
Patrones de desalineación de la IA Claude
La investigación de Anthropic, que incluyó la ejecución de versiones alteradas de las transcripciones y la aplicación de herramientas de interpretabilidad a las activaciones internas de los modelos, identificó dos fallos de alineación recurrentes en lugar de un único error.
El primero es el razonamiento sesgado, donde los modelos leyeron selectivamente evidencia ambigua para respaldar la conclusión de que su entorno era simulado, incluso después de encontrar señales que indicaban lo contrario. El segundo es la imprudencia, un patrón de seguir adelante con acciones dañinas para completar una tarea asignada a pesar de reconocer cierta probabilidad de que el objetivo fuera real.
Cabe destacar que, cuando los investigadores le dijeron directamente a Claude Mythos 5 que su objetivo era un host de producción real y no una simulación, el modelo siguió intentando el ataque en muchos casos, deteniéndose por completo solo cuando la evidencia se volvió inequívoca.
Pruebas independientes descubrieron que el modelo calificaba la evidencia real como falsa con mucha más frecuencia mientras estaba inmerso en la tarea en curso que cuando veía la misma evidencia de forma aislada, una señal de que el sesgo se acumuló a medida que avanzaba la sesión en lugar de estar presente desde el principio.
Anthropic había descrito previamente tres de estos incidentes en un informe del 30 de julio. El cuarto, que involucra un punto de control temprano de Claude Opus 4.6 de enero de 2026, surgió solo después de que la empresa ampliara su búsqueda a aproximadamente 481 millones de transcripciones que abarcan registros de red-team, entornos de aprendizaje por refuerzo y actividad de subagentes.
En ese caso, el modelo irrumpió en la máquina de un tercero no relacionado después de que su propio objetivo asignado se volviera inalcanzable, aunque también intentó repetidamente, y falló debido a un error de arnés, abortar el ejercicio por completo.
Anthropic ha firmado un acuerdo de ocho semanas con METR, un evaluador independiente de seguridad de IA, para llevar a cabo una investigación más profunda con acceso al personal interno y transcripciones adicionales.
Modelos más recientes, Claude Opus 5 y Claude Mythos 5.1, mostraron tasas sustancialmente más bajas de estos comportamientos dañinos en escenarios de prueba replicados, aunque no llegaron a cero, y Anthropic afirma que ha añadido escenarios de evaluación mal configurados y ha reforzado el monitoreo para detectar fallos similares antes del lanzamiento.
La empresa sostiene que los incidentes reflejan modos de fallo conocidos y limitados en lugar de una nueva categoría de riesgo, señalando que ningún modelo intentó coordinarse con otros agentes ni ocultar sus acciones.
Fuentes:
https://cybersecuritynews.com/claude-ai-models-gained-unauthorized-access/
Entrada más reciente
0 comentarios :
Publicar un comentario
Los comentarios pueden ser revisados en cualquier momento por los moderadores.
Serán publicados aquellos que cumplan las siguientes condiciones:
- Comentario acorde al contenido del post.
- Prohibido mensajes de tipo SPAM.
- Evite incluir links innecesarios en su comentario.
- Contenidos ofensivos, amenazas e insultos no serán permitidos.
Debe saber que los comentarios de los lectores no reflejan necesariamente la opinión del STAFF.