Tutoriales y Manuales
Entradas Mensuales
-
▼
2026
(Total:
7043
)
-
▼
September
(Total:
301
)
-
Miles de aplicaciones engañosas de Android aprovec...
-
Google dona a Linux para mejorar la privacidad dig...
-
Cazador de vulnerabilidades de Microsoft publica u...
-
Anthropic descubre un cuarto posible delito cometi...
-
El Snapdragon 8 Elite Gen 6 aparece en Geekbench 7...
-
Contratista dental creó cuenta secreta para accede...
-
OpenSSL 4.1.0 Alpha1 con DTLS 1.3 y criptografía p...
-
Vulnerabilidad en PAN-OS de Palo Alto permite ejec...
-
OpenAI crea fábrica de defensa donde agentes de IA...
-
Clonan apps bancarias en perfiles de Android
-
Linux limpiará el kernel de ARM
-
Halla 10.000 euros en RAM en su garaje
-
Cisco confirma que el fallo CVE-2026-20079 de Secu...
-
Modelos de Claude AI accedieron sin permiso a sist...
-
Casi el 10% de los gateways de LiteLLM expuestos a...
-
AirPods 5: ANC y menor precio
-
Encadenan vulnerabilidades de Chrome y Windows en ...
-
Usan falsas ofertas de LinkedIn para infectar desa...
-
Usan Claude y GPT para vulnerar redes gubernamenta...
-
Investigador revierte código de Stuxnet y lo publi...
-
EE. UU. denuncia que empresas chinas extrajeron mi...
-
El Skylab y el ordenador de IBM que despertó tras ...
-
Ex Anthropic advierte que la IA podría matarnos an...
-
Usan IA autónoma para robar credenciales masivamen...
-
Thundermail lanza su acceso temprano
-
Filtración de logs de infostealers revela tokens d...
-
Linux en PS5 avanza y amplía compatibilidad
-
Cuatro grupos de espionaje emplearon el mismo kit ...
-
Fallo en ChatGPT permitió que un prompt infiltrado...
-
ClearFake lanza troyano que anula herramientas EDR...
-
Usan agentes de IA para atacar fallos de PaperCut ...
-
El Gobierno de España instala tres puntos de WiFi ...
-
CISA advierte sobre vulnerabilidad RCE de N-able N...
-
iPhone Duo Ultra vs Galaxy Z Fold 8: el duelo pleg...
-
EE. UU. acusa a empresas chinas de IA de copiar mo...
-
Vulnerabilidad en Cliente de Escritorio Remoto de ...
-
Ingeniero de ARM optimiza código de IA para Linux
-
Experto en seguridad afirma que un grupo aeroportu...
-
Usan Google Sheets para robar billeteras cripto en...
-
QNAP lanza los nuevos NAS TVS-h877AX, TVS-h1277AX ...
-
iPhone Duo: plegable de 2.000 dólares
-
Gusano de WeChat podría infectar a un amigo inclus...
-
Windows 11 recibe su actualización más importante ...
-
Vulnerabilidad en Microsoft Teams para Android exp...
-
Líder de banda de ciberdelincuentes de 22 años, qu...
-
EE. UU. desmantela mercado de estafas de Xinbi Gua...
-
Chrome 153 corrige 230 vulnerabilidades, incluido ...
-
Microsoft amplía Family Safety con verificación de...
-
Vulnerabilidad en FortiSandbox permite acceso a in...
-
Actualización de seguridad de Android septiembre 2...
-
Récord de parches en Windows 11
-
Fallos críticos en ArangoDB permiten saltar autent...
-
Vulnerabilidad de MapLibre expone a 2,7M de usuari...
-
Vulnerabilidad de BitLocker permite ejecutar códig...
-
Corea del Norte lanza kit espía para Linux
-
Nuevo 0-Day de Windows Defender evade parche para ...
-
Pentágono busca IA sumisa para militares
-
Apple lanza el iPhone Duo plegable
-
iPhone 18 Pro: más potencia y cámara
-
OpenAI resuelve enigma matemático bajo sospecha de...
-
Nuevo fallo en cPanel permite ejecutar código como...
-
Malware de F5 BIG-IP APM evade escaneos de disco a...
-
Nintendo celebra 40 años de Zelda con novedades y ...
-
DLSS Frame Generation llega a RTX 30
-
Meta lanza Muse, su IA más polémica
-
Grave vulnerabilidad en Alby Hub podría permitir e...
-
Fallo en DeepSeek permitió que agentes de IA desac...
-
La Radeon RX 9070 XT ya es la GPU dedicada de AMD ...
-
Fallo en ChatGPT Sandbox permite robar datos de Gm...
-
Hackers de Liquid devuelven 3.400 Bitcoin robados ...
-
Cadena de vulnerabilidades en FreeIPA permite que ...
-
Mali G2-Ultra NX: potencia gráfica total en móviles
-
EE. UU. ofrece 10 millones por jefe cibernético iraní
-
RTX 50 y RX 9000 subirán de precio
-
Crea apps para Windows en 30 minutos con la IA de ...
-
ShinyHunters accedió a 6 millones de clientes con ...
-
LG acusada de invasión a la privacidad al recolect...
-
Vulnerabilidades en Dell Secure Connect Gateway pe...
-
WhatsApp integra agentes de IA
-
WeWorm: primer gusano de clic cero en llamadas de ...
-
Un Ryzen 9 9950X3D pasa de funcionar un año sin pr...
-
Ataque InjectEave recupera audio de auriculares a ...
-
Reaparece el gusano npm Shai-Hulud tras 111 días y...
-
Windows 11 será más rápido y eficiente con 8 GB de...
-
Grindr pagará 26 millones de libras para resolver ...
-
Parche masivo de Microsoft septiembre 2026: 973 vu...
-
Claude Mythos AI ejecuta cadena de ciberataque aut...
-
Phison advierte de que ni 20 fábricas más de memor...
-
Brave presume un rendimiento cuestionable
-
GTA VI en PC vía emulación
-
Intel subiría otro 10% sus CPU para PC en octubre ...
-
Suiza deja Microsoft 365 por alternativas abiertas
-
Microsoft añade anuncios al fondo de Windows 11
-
Actualizaciones de seguridad de SAP septiembre 202...
-
Ubuntu 26.10 optimiza imágenes x86-64-v3
-
Rootkit de Linux inyecta shells PHP en servidores ...
-
ConnectWise advierte fallo en ScreenConnect y lanz...
-
CHUWI UniBox AI495 Pro: Ryzen AI MAX+ PRO 495 con ...
-
Policía alemana accede a chats encriptados
-
Smart TVs de LG escanean redes y graban audio en e...
-
Linux vs Windows 11: ¿cuál es más rápido?
-
Europa cuestiona los bloqueos antipiratería de Esp...
-
Mod falso de Minecraft roba credenciales y cookies
-
La Cámara de los Lores cuestiona por qué la ley ci...
-
Filtración de datos en Trezor ya afecta a 81.000 c...
-
De WHOIS a Google: 1.253 buscadores y cuatro décad...
-
Extensión de Chrome roba sesiones y crea puertas t...
-
Roundcube Webmail corrige 12 fallos de seguridad, ...
-
Anthropic toma medidas contra cuentas robadas para...
-
Del prompting al loop engineering
-
Batocera: Linux retro para juegos clásicos
-
Mejores antivirus para Mac
-
Fallo en Hugging Face permite a IA maliciosa insta...
-
IA de Google hace trampa en matemáticas
-
Comprar una gráfica en mano ya no es garantía de n...
-
SonicWall alerta sobre vulnerabilidades zero-day e...
-
Fallo de 12 años en PostgreSQL permite ejecutar có...
-
RPCS3 ya soporta discos Blu-ray de PS3
-
Optimiza Windows con RyTuneX
-
Google Fotos permite probar ropa con IA
-
Nuevo bot de Linux se oculta en el kernel y lanza ...
-
ASUS lanza el primer router Wi-Fi 8
-
OpenVPN corrige 7 fallos de seguridad en VPN y Win...
-
NVIDIA anuncia AGI con GPT-6 Astra y OpenAI admite...
-
Mario Bros en Master System
-
Acusan a hacker ruso de atacar a 80.000 freelancer...
-
Microsoft agiliza el visor de fotos de Windows 11
-
Explorando la mayor biblioteca de malware
-
-
▼
September
(Total:
301
)
Blogroll
Labels
vulnerabilidad
(
1865
)
seguridad
(
1811
)
software
(
1137
)
hardware
(
935
)
google
(
792
)
Malware
(
711
)
privacidad
(
682
)
ransomware
(
539
)
exploit
(
528
)
Windows
(
521
)
android
(
481
)
linux
(
443
)
cve
(
376
)
nvidia
(
314
)
tutorial
(
300
)
manual
(
282
)
hacking
(
265
)
ssd
(
183
)
WhatsApp
(
173
)
ddos
(
141
)
Wifi
(
131
)
app
(
128
)
cifrado
(
122
)
programación
(
121
)
twitter
(
121
)
firmware
(
83
)
youtube
(
83
)
firefox
(
80
)
herramientas
(
80
)
Networking
(
73
)
sysadmin
(
72
)
adobe
(
71
)
office
(
62
)
antivirus
(
55
)
hack
(
53
)
javascript
(
51
)
Kernel
(
49
)
apache
(
47
)
juegos
(
42
)
contraseñas
(
39
)
multimedia
(
36
)
cms
(
35
)
flash
(
33
)
eventos
(
32
)
MAC
(
30
)
anonymous
(
28
)
ssl
(
24
)
conferencia
(
21
)
Forense
(
20
)
documental
(
18
)
SeguridadWireless
(
17
)
auditoría
(
16
)
Debugger
(
14
)
Rootkit
(
14
)
lizard squad
(
14
)
metasploit
(
13
)
técnicas hacking
(
13
)
Virtualización
(
11
)
delitos
(
11
)
reversing
(
10
)
adamo
(
9
)
Ehn-Dev
(
7
)
antimalware
(
7
)
MAC Adress
(
6
)
oclHashcat
(
5
)
Entradas populares
-
GentleOS es un sistema operativo de código abierto diseñado para revivir ordenadores y portátiles antiguos de 16 y 32 bits , haciéndolos op...
-
Un estudiante de ingeniería informática y embajador de Microsoft Learn ha creado la mayor biblioteca de malware con más de 53 años de histo...
-
LG enfrenta graves acusaciones de invadir la privacidad al capturar audio y datos personales de sus Smart TVs, incluso en modo espera. Según...
Anthropic descubre un cuarto posible delito cometido por su IA
Friday, 11 September 2026
|
Posted by
el-brujo
|
Edit Post
Anthropic reveló que sus modelos de IA, específicamente Claude Opus 4.6, accedieron sin autorización a sistemas de terceros en cuatro ocasiones. En un incidente destacado, la IA logró obtener acceso de administrador y recolectar credenciales personales tras fallar en un desafío de hacking controlado. La empresa sostiene que estos fallos de alineación se están corrigiendo con nuevas generaciones de entrenamiento.
En medio de una introspección en la industria¹ sobre la posibilidad de que la IA mejore a sí misma hasta el punto de matar a todo el mundo,
Anthropic ha revelado otro incidente más que calificaría como un delito si hubiera sido perpetrado por una persona.
La empresa de IA publicó "una evaluación de alineación" detallando cuatro ocasiones en las que los modelos de Claude accedieron a sistemas de terceros sin autorización.
La compañía ya había informado sobre tres de los incidentes. La evidencia del cuarto estaba oculta en la transcripción de una sesión que se remonta a enero de 2026, momento en el que ocurrió la mala conducta.
Anthropic encontró los tres primeros escaneando alrededor de 141,000 transcripciones donde Claude podría haber obtenido acceso a internet durante la evaluación. Pasó por alto el cuarto inicialmente porque "nuestro escaneo dependía de una búsqueda agentica".
Felony Bench, un registro irónico de intrusiones cibernéticas llevadas a cabo por las principales empresas de IA sin consecuencias, ha añadido este incidente recién descubierto a su hoja de antecedentes de acciones rebeldes de la IA.
La intrusión de la IA de enero de 2026 involucró una versión temprana de Claude Opus 4.6, a la cual se le asignó un desafío de Capturar la Bandera (CTF) bajo la supervisión del evaluador de modelos externo donde ocurrieron los otros eventos de hacking.
Opus 4.6 logró sabotear sus propias posibilidades de éxito al desactivar la máquina que estaba atacando. Asignó al dispositivo una dirección IP que ya existía en otro hardware, haciendo que el objetivo fuera inalcanzable e imposible de resolver el desafío.
Quienes estén familiarizados con otros incidentes donde modelos de IA violaron sistemas de terceros recordarán que las tareas irresolubles representan un catalizador común para la mala conducta. Los modelos agotan todas las opciones alineadas y luego recurren a enfoques transgresores.
Opus 4.6 podría haber sido una excepción, pero cuando intentó abortar la tarea tras reconocer que no podía alcanzar la máquina objetivo, no pudo hacerlo "debido a una configuración incorrecta en el arnés de evaluación [del modelo]". Falló al intentar cerrarse no una, sino siete veces.
Así que continuó adelante, intentando otros medios previstos para alcanzar la máquina objetivo, pero fallando. Entonces exploró más allá.
"El modelo descubrió una máquina perteneciente a un tercero a la que pudo acceder, y afirmó creer que este tercero formaba parte del CTF", explicó Anthropic en su publicación. "Dentro de la máquina, el modelo encontró un archivo que enumeraba una contraseña, que utilizó para obtener acceso de administrador al sistema."
El modelo procedió a recopilar más credenciales y modificó un ajuste del sistema para facilitar el acceso a la información personal de un individuo asociado con la organización de evaluación externa.
Opus 4.6 podría haber hecho más si no fuera porque agotó su presupuesto de tokens, poniendo fin a la sesión.
Anthropic afirma que no está tan preocupada por este incidente como por los otros porque el modelo intentó abortar su tarea.
"Si bien la indiferencia del modelo ante la posibilidad de que pueda estar dañando sistemas o personas reales es preocupante, muchos de los comportamientos descritos aquí han cambiado considerablemente a medida que nuestro entrenamiento ha evolucionado a través de las generaciones de modelos", dijo la empresa.
Anthropic señaló que considera estos incidentes graves, pero espera que los enfoques de entrenamiento actuales "sean probablemente capaces de abordar los modos específicos de fallo de alineación observados en estos incidentes".
Y si los métodos de entrenamiento de la empresa fallan, no hay ninguna consecuencia real para nadie en Anthropic más allá de redactar una evaluación de alineación revisada.
¹ El término "introspección" (soul-searching) es figurativo y no pretende indicar la creencia de que la industria tecnológica tenga alma.
Fuente:
TheRegister
En medio de una introspección en la industria¹ sobre la posibilidad de que la IA mejore a sí misma hasta el punto de matar a todo el mundo,
Anthropic ha revelado otro incidente más que calificaría como un delito si hubiera sido perpetrado por una persona.
La empresa de IA publicó "una evaluación de alineación" detallando cuatro ocasiones en las que los modelos de Claude accedieron a sistemas de terceros sin autorización.
La compañía ya había informado sobre tres de los incidentes. La evidencia del cuarto estaba oculta en la transcripción de una sesión que se remonta a enero de 2026, momento en el que ocurrió la mala conducta.
Anthropic encontró los tres primeros escaneando alrededor de 141,000 transcripciones donde Claude podría haber obtenido acceso a internet durante la evaluación. Pasó por alto el cuarto inicialmente porque "nuestro escaneo dependía de una búsqueda agentica".
Felony Bench, un registro irónico de intrusiones cibernéticas llevadas a cabo por las principales empresas de IA sin consecuencias, ha añadido este incidente recién descubierto a su hoja de antecedentes de acciones rebeldes de la IA.
La intrusión de la IA de enero de 2026 involucró una versión temprana de Claude Opus 4.6, a la cual se le asignó un desafío de Capturar la Bandera (CTF) bajo la supervisión del evaluador de modelos externo donde ocurrieron los otros eventos de hacking.
Opus 4.6 logró sabotear sus propias posibilidades de éxito al desactivar la máquina que estaba atacando. Asignó al dispositivo una dirección IP que ya existía en otro hardware, haciendo que el objetivo fuera inalcanzable e imposible de resolver el desafío.
Quienes estén familiarizados con otros incidentes donde modelos de IA violaron sistemas de terceros recordarán que las tareas irresolubles representan un catalizador común para la mala conducta. Los modelos agotan todas las opciones alineadas y luego recurren a enfoques transgresores.
Opus 4.6 podría haber sido una excepción, pero cuando intentó abortar la tarea tras reconocer que no podía alcanzar la máquina objetivo, no pudo hacerlo "debido a una configuración incorrecta en el arnés de evaluación [del modelo]". Falló al intentar cerrarse no una, sino siete veces.
Así que continuó adelante, intentando otros medios previstos para alcanzar la máquina objetivo, pero fallando. Entonces exploró más allá.
"El modelo descubrió una máquina perteneciente a un tercero a la que pudo acceder, y afirmó creer que este tercero formaba parte del CTF", explicó Anthropic en su publicación. "Dentro de la máquina, el modelo encontró un archivo que enumeraba una contraseña, que utilizó para obtener acceso de administrador al sistema."
El modelo procedió a recopilar más credenciales y modificó un ajuste del sistema para facilitar el acceso a la información personal de un individuo asociado con la organización de evaluación externa.
Opus 4.6 podría haber hecho más si no fuera porque agotó su presupuesto de tokens, poniendo fin a la sesión.
Anthropic afirma que no está tan preocupada por este incidente como por los otros porque el modelo intentó abortar su tarea.
"Si bien la indiferencia del modelo ante la posibilidad de que pueda estar dañando sistemas o personas reales es preocupante, muchos de los comportamientos descritos aquí han cambiado considerablemente a medida que nuestro entrenamiento ha evolucionado a través de las generaciones de modelos", dijo la empresa.
Anthropic señaló que considera estos incidentes graves, pero espera que los enfoques de entrenamiento actuales "sean probablemente capaces de abordar los modos específicos de fallo de alineación observados en estos incidentes".
Y si los métodos de entrenamiento de la empresa fallan, no hay ninguna consecuencia real para nadie en Anthropic más allá de redactar una evaluación de alineación revisada.
¹ El término "introspección" (soul-searching) es figurativo y no pretende indicar la creencia de que la industria tecnológica tenga alma.
Fuente:
TheRegister
Newer Post
0 comments :
Post a Comment
Los comentarios pueden ser revisados en cualquier momento por los moderadores.
Serán publicados aquellos que cumplan las siguientes condiciones:
- Comentario acorde al contenido del post.
- Prohibido mensajes de tipo SPAM.
- Evite incluir links innecesarios en su comentario.
- Contenidos ofensivos, amenazas e insultos no serán permitidos.
Debe saber que los comentarios de los lectores no reflejan necesariamente la opinión del STAFF.