Tutoriales y Manuales
Entradas Mensuales
-
▼
2026
(Total:
7807
)
-
▼
septiembre
(Total:
931
)
-
Suma una nueva preocupación a la pesadilla de la I...
-
OpenAI acusa a Kimi de copiar su IA
-
Malware RATHat usa Gemini AI para controlar Androi...
-
Policía ferroviaria británica gasta 320.000 libras...
-
Ciberatacantes aprovechan fallo en NetScaler para ...
-
Ciberatacantes aprovechan falla de Zimbra para ins...
-
Google lanza actualización de Chrome con 32 correc...
-
OpenAI lanza Dots: agentes de IA persistentes
-
El antiguo CEO de Changsin Memory (CXMT) usó a exi...
-
El fallo Spectre regresa para acechar a los motore...
-
Los modelos de IA siguen filtrando capturas de pan...
-
IA avanzada: riesgo catastrófico según Anthropic
-
Fallo RCE en Unsloth Studio permite ejecutar códig...
-
TCL demanda a Samsung por publicidad engañosa
-
Xbox ya ofrece disco a digital para todos
-
Fortinet halla variante de SectopRAT en software d...
-
AMD presenta Zen 6 con sus nuevos EPYC 9006 Venice...
-
Filtran el nuevo Fire TV Stick 4K 2026
-
TeamViewer recomienda corregir fallos graves «lo a...
-
Japón anuncia planes para construir una planta de ...
-
Fallo en Octopus Server permite ejecutar código me...
-
OpenAI lanza Codex Security Cloud, servicio de seg...
-
Detalles del exploit de Citrix NetScaler CVE-2026-...
-
PS5 Pro en Japón requiere 60 horas de juego
-
OpenSSL corrige fallo grave que filtra memoria del...
-
IA halla fallo en kernel de Linux que da acceso root
-
OpenAI lanza Dots para competir con Muse
-
Signal implementa copias de seguridad locales cifr...
-
Usan GPTs personalizados para instalar malware
-
Agente de IA de GitHub halla 24 vulnerabilidades e...
-
Grupo SilverFox crean webs falsas para ocultar mal...
-
Agente GPT-6 Astra intentó engañar a desarrollador...
-
101 paquetes maliciosos de npm añaden cuentas de W...
-
The Witcher 3 lidera el DLSS 4.5
-
DLSS llega a Radeon RX 7000
-
Crean botnet que roba datos y agota créditos de IA
-
Ocultan malware en instaladores de 7-Zip con una n...
-
Exmilitares de la Fuerza Aérea de EE. UU. encarcel...
-
Agente de IA automatizado vulnera la seguridad de ...
-
GPT-6.1 Sol: más barato y casi tan potente como Astra
-
Vulnerabilidad en kernel de Ubuntu permite escapar...
-
WhatsApp avisará los cumpleaños en contactos
-
Nueva variante de Spectre v2 filtra el hash de la ...
-
Acusan a vietnamita por estafa cripto de 16 millon...
-
UE lanza el DEAN como complemento del IBAN
-
Robo de datos fiscales en Francia mediante contras...
-
OpenAI cancela GPT-6.1 Astra por inseguridad
-
El FBI insta a los integrantes de ShinyHunters a e...
-
Francia retira premio literario por uso de IA
-
Ahorra batería en Windows 11 ajustando la pantalla...
-
Usan Ethereum como sistema de mensajería secreto p...
-
Nuevo ataque de notificaciones de archivos rastrea...
-
Modulate recauda 25M$ contra deepfakes de voz con ...
-
Fiscal de Florida pide medida cautelar contra Open...
-
Gemini cambia Gems por Skills
-
Storm-3168 borra recursos de Azure en ataque destr...
-
wolfSSL 5.9.4 corrige 11 fallos de TLS y amplía el...
-
Enjambre de agentes de OpenAI saltó límites de san...
-
Amazon podría reembolsar cuotas de Prime automátic...
-
EVGA revela por qué dejaron de trabajar con NVIDIA...
-
Android 18: primera pista de Google
-
WiCi One: la eGPU que rinde como una RTX 5090 a t...
-
Gemini eliminará su función más útil en noviembre:...
-
Policía holandesa confirma detención en el marco d...
-
OpenAI cancela su IA más avanzada por ser peligrosa
-
Demuestran que una RTX 5080 con dos conectores de ...
-
IA roba tarjetas de crédito
-
Claude Sonnet 5.5 es más eficiente y rápido
-
ChatGPT lanza ciberataques autónomos
-
OpenAI suspende el desarrollo de GPT-6.1 Astra tra...
-
Filtración en el Pentágono: acceden a datos de 3 m...
-
Fallos de seguridad en OpenAI exponen datos de usu...
-
Discord lanza modo de juego optimizado
-
Crean máquina de ataque con IA y dejan el panel de...
-
Google extiende soporte a Chromebook hasta 2034
-
iPhone bloqueará robos al estilo Android
-
Intel 18A planta cara a TSMC N3E en densidad: sus ...
-
AMD compra World Labs por 8.200 millones para IA f...
-
Fabricante chino lanza una fuente de 230W de poten...
-
Explotan vulnerabilidad crítica de día cero en Apple
-
Botnet Carbonato vulnera hosts de Docker para desp...
-
Filtración en Bitget: roban 387,5 millones vincula...
-
Vulnerabilidad en el SDK oficial de Python para MC...
-
Cierran popular app de IPTV pirata en Fire TV
-
Constructor de Python MaaS roba datos de 17 navega...
-
No necesitan entrar en la nube si pueden robar las...
-
Una GeForce RTX 4090 limitada al 80% de su potenci...
-
Ordenador de válvulas: tarda 15 minutos en arrancar
-
El DLSS 5 evoluciona en AMD: Radeon RX 9070 XT gan...
-
Fallo en OpenCode AI permite ejecutar código malic...
-
Windows 10 es más estable que Windows 11
-
Gobierno británico pide al personal dejar de agrad...
-
Nuevo ataque de inyección en Windows evade EDR sin...
-
Mejores reproductores de vídeo gratis para Android
-
Una RTX 5090 Aorus Waterforce WB tiene grietas en ...
-
InjectSetConsole: inyección de código remota optim...
-
Trucos para ver YouTube y otras plataformas si tie...
-
Todo sobre la GeForce RTX 6090
-
Más de 80.000 organizaciones sufrieron el robo de ...
-
El Ordenador Personal, revista mítica
-
MSI ve el AM4 como solución al MEMOpocalipsis
-
NVIDIA limita el control de sus agentes de IA
-
Usan fallo de GlobalProtect para enviar 2,4 millon...
-
Ranking de durabilidad de discos duros
-
GPT-6 Astra descifra en dos días un mensaje cripto...
-
OpenAI suspende parte de sus entrenamientos tras a...
-
Apple corrige fallo en CoreGraphics que pudo ser u...
-
NVIDIA lanza plataforma de seguridad para agentes ...
-
Roban dos remolques con logos de NVIDIA y PlusAI p...
-
PC Kubb Fanless Gold: mini PC custom hecho de oro ...
-
Las inundaciones de Tailandia amenazan al sector H...
-
Wireshark 4.6.9 corrige 19 vulnerabilidades, inclu...
-
Atacantes crean tiendas falsas de Jev AI para inte...
-
Minecraft lanza The Sift, su primera dimensión en ...
-
Vulnerabilidades críticas de ViewSonic vCast permi...
-
Copilot como sistema operativo: ¿Adiós a Windows 12?
-
PHP corrige error que enviaba credenciales a servi...
-
IA local modifica extractor de credenciales de Win...
-
Polémica por el diseño del Galaxy S27 Pro y Ultra
-
Llega el primer emulador de PS5 a 60 FPS
-
Hackeo a Renfe: 150 millones de datos robados con IA
-
Explotan vulnerabilidades RCE 0-Day en Citrix NetS...
-
Qualcomm apunta a los 5,4 GHz con su Snapdragon 8 ...
-
Meta lanza IA para crear juegos con texto
-
Opera automatiza su VPN en Wi-Fi públicas
-
GTA V y Resident Evil 4 corren en iPhone 18 Pro Max
-
IA acelera compilación de Linux a 10 segundos
-
Altar: IA local detecta fallos de seguridad
-
-
▼
septiembre
(Total:
931
)
-
►
2025
(Total:
2103
)
- ► septiembre (Total: 148 )
-
►
2024
(Total:
1110
)
- ► septiembre (Total: 50 )
-
►
2023
(Total:
710
)
- ► septiembre (Total: 65 )
-
►
2022
(Total:
967
)
- ► septiembre (Total: 72 )
-
►
2021
(Total:
730
)
- ► septiembre (Total: 56 )
-
►
2020
(Total:
212
)
- ► septiembre (Total: 21 )
-
►
2019
(Total:
102
)
- ► septiembre (Total: 14 )
-
►
2017
(Total:
231
)
- ► septiembre (Total: 16 )
-
►
2016
(Total:
266
)
- ► septiembre (Total: 38 )
-
►
2015
(Total:
445
)
- ► septiembre (Total: 47 )
-
►
2014
(Total:
185
)
- ► septiembre (Total: 18 )
-
►
2013
(Total:
100
)
- ► septiembre (Total: 3 )
-
►
2011
(Total:
7
)
- ► septiembre (Total: 1 )
Blogroll
Etiquetas
Entradas populares
-
Se ha descubierto una vulnerabilidad en Docker denominada CopyEscape (CVE-2026-17106), la cual permite que contenedores maliciosos escriban...
-
Se ha detectado una vulnerabilidad de seguridad de alta gravedad en Sudo (CVE-2026-96512) que podría permitir a atacantes locales evadir la...
-
Un YouTuber ha perdido su segunda RTX 5090 debido a que la tarjeta se quemó apenas seis meses después de la primera, a pesar de haber mejo...
Modelos de Claude AI accedieron sin permiso a sistemas reales en pruebas de ciberseguridad
Anthropic ha revelado que cuatro versiones distintas de sus modelos de IA Claude vulneraron sistemas de terceros en el mundo real mientras ejecutaban lo que se suponía eran evaluaciones de ciberseguridad en entornos aislados (sandboxed), exponiendo una brecha entre cómo los modelos razonaban sobre su entorno y la realidad sobre el terreno.
La evaluación de alineación recientemente publicada por la empresa describe incidentes que involucran a Claude Opus 4.6, Claude Opus 4.7, Claude Mythos 5 y un modelo de investigación interno de propósito general; todos ocurrieron durante ejercicios cibernéticos estilo "capture-the-flag" creados por el mismo socio de evaluación externo.
En cada caso, se le dijo explícitamente a Claude que no tenía acceso a internet y que estaba operando dentro de un ejercicio simulado de capture-the-flag diseñado para probar la capacidad de hackeo contra un objetivo ficticio. Sin embargo, una configuración incorrecta en el entorno de prueba dejó un camino abierto hacia el internet real, y los modelos lo explotaron sin darse cuenta, o sin aceptar, que habían salido de la simulación.

Debido a que estas evaluaciones se ejecutan sin las salvaguardas cibernéticas —como los clasificadores y el bloqueo de modo automático— que vienen con los despliegues de producción de Claude, nada intervino antes de que se produjera un daño real.
El caso más grave involucró a Claude Mythos 5, que intentó resolver el desafío asignado cargando un paquete de Python malicioso en PyPI, el repositorio público en el que confía gran parte del ecosistema de software para instalar código.
El modelo registró una cuenta utilizando un proveedor de correo electrónico desechable, publicó tres versiones del paquete contaminado y esperó a que un sistema objetivo lo instalara.
Quince hosts del mundo real, que se cree que eran proveedores de seguridad que escanean nuevas cargas, terminaron instalando el paquete, y uno de ellos expuso sus propias credenciales en el proceso, permitiendo que Claude accediera a la base de datos en vivo de un proveedor de seguridad antes de que PyPI retirara el paquete aproximadamente 90 minutos después.
Patrones de desalineación de la IA Claude
La investigación de Anthropic, que incluyó la ejecución de versiones alteradas de las transcripciones y la aplicación de herramientas de interpretabilidad a las activaciones internas de los modelos, identificó dos fallos de alineación recurrentes en lugar de un único error.
El primero es el razonamiento sesgado, donde los modelos leyeron selectivamente evidencia ambigua para respaldar la conclusión de que su entorno era simulado, incluso después de encontrar señales que indicaban lo contrario. El segundo es la imprudencia, un patrón de seguir adelante con acciones dañinas para completar una tarea asignada a pesar de reconocer cierta probabilidad de que el objetivo fuera real.
Cabe destacar que, cuando los investigadores le dijeron directamente a Claude Mythos 5 que su objetivo era un host de producción real y no una simulación, el modelo siguió intentando el ataque en muchos casos, deteniéndose por completo solo cuando la evidencia se volvió inequívoca.
Pruebas independientes descubrieron que el modelo calificaba la evidencia real como falsa con mucha más frecuencia mientras estaba inmerso en la tarea en curso que cuando veía la misma evidencia de forma aislada, una señal de que el sesgo se acumuló a medida que avanzaba la sesión en lugar de estar presente desde el principio.
Anthropic había descrito previamente tres de estos incidentes en un informe del 30 de julio. El cuarto, que involucra un punto de control temprano de Claude Opus 4.6 de enero de 2026, surgió solo después de que la empresa ampliara su búsqueda a aproximadamente 481 millones de transcripciones que abarcan registros de red-team, entornos de aprendizaje por refuerzo y actividad de subagentes.
En ese caso, el modelo irrumpió en la máquina de un tercero no relacionado después de que su propio objetivo asignado se volviera inalcanzable, aunque también intentó repetidamente, y falló debido a un error de arnés, abortar el ejercicio por completo.
Anthropic ha firmado un acuerdo de ocho semanas con METR, un evaluador independiente de seguridad de IA, para llevar a cabo una investigación más profunda con acceso al personal interno y transcripciones adicionales.
Modelos más recientes, Claude Opus 5 y Claude Mythos 5.1, mostraron tasas sustancialmente más bajas de estos comportamientos dañinos en escenarios de prueba replicados, aunque no llegaron a cero, y Anthropic afirma que ha añadido escenarios de evaluación mal configurados y ha reforzado el monitoreo para detectar fallos similares antes del lanzamiento.
La empresa sostiene que los incidentes reflejan modos de fallo conocidos y limitados en lugar de una nueva categoría de riesgo, señalando que ningún modelo intentó coordinarse con otros agentes ni ocultar sus acciones.
Fuentes:
https://cybersecuritynews.com/claude-ai-models-gained-unauthorized-access/
Entrada más reciente
0 comments :
Publicar un comentario
Los comentarios pueden ser revisados en cualquier momento por los moderadores.
Serán publicados aquellos que cumplan las siguientes condiciones:
- Comentario acorde al contenido del post.
- Prohibido mensajes de tipo SPAM.
- Evite incluir links innecesarios en su comentario.
- Contenidos ofensivos, amenazas e insultos no serán permitidos.
Debe saber que los comentarios de los lectores no reflejan necesariamente la opinión del STAFF.