Tutoriales y Manuales
Entradas Mensuales
-
▼
2026
(Total:
6596
)
-
▼
agosto
(Total:
604
)
-
768 claves filtradas de AWS siguen activas con acc...
-
Fallo crítico en isolated-vm permite saltar sandbo...
-
Infectan pantallas de Android Auto vía actualizaci...
-
Demandan a Twitch y Amazon por uso de IA
-
Hugging Face exploraría venta de 13.000 millones t...
-
mVolt+ permite hacer que la GeForce RTX 5090 alcan...
-
Detecta qué consume recursos de tu PC Windows con ...
-
Proiraníes tumban central eléctrica británica en c...
-
Libros digitalizados para IA antes de su destrucción
-
Batería móvil: carga en 3 minutos y 60.000 ciclos
-
Google crea una IA que mide la grasa corporal con ...
-
Windows 11 mostrará el uso de IA en el Administrad...
-
Nuevo malware como servicio usa dominios de Adobe ...
-
Claude de Anthropic sufre otra caída con errores
-
Chinos usan IA para atacar servidores web
-
TikTok acuerda pagar 400 millones de dólares por d...
-
Cybermes: agente de IA para pentesting automatizado
-
Samsung dejará de actualizar estos Galaxy
-
Claude Opus 5 esquiva binarios ofuscados en vez de...
-
Fallo crítico en AIT-GUI de NASA permite enviar co...
-
G.SKILL indemniza a compradores de RAM DDR4 y DDR5...
-
App de ancho de banda convierte dispositivos en pu...
-
Kit de phishing de 10.000 dólares promete instalar...
-
pfSense CE 2.9.0: mejoras críticas de seguridad y ...
-
Malware en Android Auto se propaga mediante actual...
-
Estafadores usan grupos de WhatsApp para coordinar...
-
Un controlador de Microsoft Defender podría usarse...
-
Claude Mythos 5 ya disponible en Claude Security p...
-
DeepSeek lanza IA visual similar a Claude Opus
-
Microsoft duplica el almacenamiento de buzón a 100 GB
-
Filtración en Sakura Internet: hackean datos de 1,...
-
Proveedores confiables, nuevas rutas de ataque: có...
-
Por qué la IA opaca es el próximo gran desafío de ...
-
Paquetes populares de Rust con 244M de descargas i...
-
Slack integra Claude Code para programar
-
Desincronización CRLF permite envenenar caché de C...
-
Apple: descifran ubicaciones de Buscar personas en...
-
Explotan vulnerabilidad crítica en Microsoft Entra...
-
OpenAI ofrece retención cero de datos para modelos...
-
Fallo crítico de Spring Security permite acceso ad...
-
Explotan activamente la vulnerabilidad CVE-2026-19...
-
Controlador de Microsoft Defender puede desactivar...
-
Usan agentes de IA OpenClaw para difundir malware ...
-
Grave fallo en NetScaler permite saltar la autenti...
-
Usan Claude, ChatGPT y Copilot como cebo para malware
-
AWS: cómo evitar que un agente de IA secuestrado a...
-
AMD Zen: 10 años salvando a AMD
-
Vulnerabilidad de Cisco permite leer datos sensibles
-
Fallo crítico de SSRF en Kubernetes de Red Hat exp...
-
Ocultan malware en palabras inglesas para infectar...
-
OpenAI pausa entrenamiento de IA por riesgo de hal...
-
El ataque de tarjetas zombi puede reactivar tarjet...
-
Epic Games critica nuevas comisiones de App Store ...
-
Engañan a Grok para que ejecute instrucciones inye...
-
Saltan el MFA de Microsoft 365 y roban pagos vía e...
-
Nuevo malware de Android roba PINs bancarios y usa...
-
Equipo de T-Mobile corta cable para eliminar intru...
-
Zyxel corrige fallo de inyección de comandos en 18...
-
Explotan vulnerabilidad crítica de RCE en Zimbra
-
Claude AI halla fallos de SAML que permiten robo d...
-
OpenAI detiene el entrenamiento de RL de vanguardi...
-
Doom ya funciona en cámaras Canon
-
Publicidad en ChatGPT España
-
OpenAI frena entrenamiento de IA
-
Ataque Spectre en Cloudflare Workers filtra JWT de...
-
EE. UU. acusa a iraníes de robar propiedad intelec...
-
Fallo crítico de Citrix NetScaler permite saltar l...
-
T-Mobile cortó físicamente los cables de Internet ...
-
Cientos de claves de Stripe filtradas exponen pago...
-
OpenAI advierte sobre la atrofia cognitiva por el ...
-
Meta AI llega a Mac para competir con ChatGPT y Cl...
-
Los costes operativos de OpenAI subirán un 20 por ...
-
Anthropic frena su IA más potente por seguridad
-
Descubre la Dark y Deep Web
-
Vulnerabilidad crítica de día cero en Cursor permi...
-
Timo con discos de 32 TB: solo contenían una microSD
-
Meta a juicio por el impacto de sus redes en niños
-
Falla de Microsoft 365 afecta a Sudamérica
-
Usan guía falsa de Claude para desplegar MacSync S...
-
Microsoft vincula más de 30 dominios rotativos a l...
-
CISA añade vulnerabilidad RCE de Microsoft IKE exp...
-
Intel Core Ultra 9 4950K aparece en escena: la CPU...
-
Ransomware fingen ser empresa de recuperación y pi...
-
SIMs vulnerables: riesgo para móviles, coches y ca...
-
China-Nexus camuflan VHD malicioso como JPEG para ...
-
Hackean más de 14.500 dispositivos Dahua mediante ...
-
Herramienta RAVEN extrae bases de datos Elasticsea...
-
Alerta por ransomware Medusa: más de 500 organizac...
-
Oracle lanza 943 parches de seguridad, incluyendo ...
-
Campaña de espionaje SilkParasite ataca a gobierno...
-
Habilidades clave para programadores ante la IA
-
La memoria DDR4 experimentará una nueva subida de ...
-
GeForce Now ya disponible en Firefox
-
Seasonic tiene la primera fuente de alimentación A...
-
Projextor muestra cómo el malware se oculta tras e...
-
Anthropic lanza /design para flujos de UI de Claud...
-
Saltan MFA de Microsoft 365 y roban sesiones activas
-
Explotan vulnerabilidad crítica de SSRF en MLflow
-
Usan IA y webs falsas para robar cuentas saltando ...
-
Ransom Busters engaña afirmando haber hackeado ser...
-
CISA advierte: ransomware Medusa roba datos y cifr...
-
Investigadores logran reactivar tarjetas de crédit...
-
Claude ya envía correos de Gmail automáticamente
-
Vulnerabilidad crítica en Microsoft Copilot permit...
-
Linux eliminará dos sistemas de archivos obsoletos...
-
Limpia tu carpeta de descargas con Mouzi
-
ChatGPT para adolescentes
-
Filtración de datos personales de huéspedes en cad...
-
Plataforma de fraude BTMob usa 1.400 servidores pa...
-
Driver de LAN de GEEKOM Mini PC infectado con troy...
-
Crisis de componentes retrasa PS6
-
Engañan a Copilot para que revele a investigadores...
-
Kimsuky amplía su arsenal de ciberespionaje con IA...
-
Vulnerabilidad crítica de GitLab permite borrar pr...
-
Shadow hVNC permite control remoto sin mover el ra...
-
16 paquetes de RubyGems mediante typosquatting rob...
-
Estafador cripto usa Claude Code para procesar más...
-
Los virus mentales de la IA pueden propagarse entr...
-
Windows 11 sigue necesitando 16 GB de RAM
-
OpenAI advierte que la IA puede automatizar cibera...
-
O2 aclara sustitución de routers por WiFi 7
-
Apple corrige 28 vulnerabilidades en macOS, iOS e ...
-
YouTube vuelve a funcionar bien en Movistar y O2
-
Red Hat descarta CVE de Linux hallado con IA
-
Vulnerabilidad de VMware Syslog permite RCE root, ...
-
Recupera 11 GB con un solo comando en Windows con ...
-
Grave vulnerabilidad de GraphQL en GitLab podría p...
-
Claude Code ayuda a operador de ransomware a robar...
-
-
▼
agosto
(Total:
604
)
-
►
2025
(Total:
2103
)
- ► septiembre (Total: 148 )
-
►
2024
(Total:
1110
)
- ► septiembre (Total: 50 )
-
►
2023
(Total:
710
)
- ► septiembre (Total: 65 )
-
►
2022
(Total:
967
)
- ► septiembre (Total: 72 )
-
►
2021
(Total:
730
)
- ► septiembre (Total: 56 )
-
►
2020
(Total:
212
)
- ► septiembre (Total: 21 )
-
►
2019
(Total:
102
)
- ► septiembre (Total: 14 )
-
►
2017
(Total:
231
)
- ► septiembre (Total: 16 )
-
►
2016
(Total:
266
)
- ► septiembre (Total: 38 )
-
►
2015
(Total:
445
)
- ► septiembre (Total: 47 )
-
►
2014
(Total:
185
)
- ► septiembre (Total: 18 )
-
►
2013
(Total:
100
)
- ► septiembre (Total: 3 )
-
►
2011
(Total:
7
)
- ► septiembre (Total: 1 )
Blogroll
Etiquetas
vulnerabilidad
(
1724
)
seguridad
(
1716
)
software
(
1025
)
hardware
(
899
)
google
(
766
)
Malware
(
710
)
privacidad
(
663
)
ransomware
(
535
)
Windows
(
521
)
android
(
468
)
exploit
(
467
)
linux
(
419
)
cve
(
374
)
nvidia
(
300
)
tutorial
(
300
)
manual
(
282
)
hacking
(
254
)
ssd
(
181
)
WhatsApp
(
173
)
ddos
(
139
)
Wifi
(
131
)
app
(
127
)
cifrado
(
121
)
twitter
(
121
)
programación
(
116
)
youtube
(
83
)
herramientas
(
80
)
firefox
(
78
)
firmware
(
78
)
Networking
(
73
)
sysadmin
(
72
)
adobe
(
68
)
office
(
62
)
hack
(
51
)
antivirus
(
50
)
Kernel
(
49
)
javascript
(
49
)
apache
(
46
)
juegos
(
42
)
contraseñas
(
39
)
multimedia
(
36
)
cms
(
35
)
flash
(
33
)
eventos
(
32
)
MAC
(
30
)
anonymous
(
28
)
ssl
(
24
)
conferencia
(
21
)
Forense
(
20
)
SeguridadWireless
(
17
)
documental
(
17
)
auditoría
(
15
)
Debugger
(
14
)
Rootkit
(
14
)
lizard squad
(
14
)
metasploit
(
13
)
técnicas hacking
(
13
)
Virtualización
(
11
)
delitos
(
11
)
reversing
(
10
)
adamo
(
9
)
Ehn-Dev
(
7
)
antimalware
(
7
)
MAC Adress
(
6
)
oclHashcat
(
5
)
Entradas populares
-
Se descubrió un fallo de seguridad llamado SCTPhantom (CVE-2026-64564) en el código de red SCTP de Linux, presente desde 2008. Esta vulnerab...
-
G.SKILL indemnizará a usuarios de RAM DDR4 y DDR5 tras un acuerdo de 2,4 millones de dólares por publicidad engañosa en las velocidades d...
-
Samsung dejará de ofrecer actualizaciones para sus modelos Galaxy de 2021 y 2022 , mientras extiende el soporte hasta 7 años en sus dispos...
Anthropic afirma que Claude confundió la red abierta con un CTF y vulneró a tres organizaciones
domingo, 2 de agosto de 2026
|
Publicado por
el-brujo
|
Editar entrada
Anthropic reveló que tres de sus modelos de IA accedieron sin autorización a la infraestructura de tres organizaciones externas durante pruebas de seguridad. Los incidentes ocurrieron debido a una mala configuración que permitió el acceso a internet, llevando a los modelos a confundir sistemas reales con simulaciones. La empresa destacó que sus versiones más recientes muestran una mayor capacidad para detenerse al reconocer que no están en un entorno de prueba.
Anthropic se convirtió el jueves en la última empresa de inteligencia artificial (IA) en revelar que tres de sus modelos, incluidos Claude Opus 4.7, Mythos 5 y un modelo de investigación no identificado, habían vulnerado tres organizaciones.
La firma de IA afirmó que los incidentes más antiguos datan de abril de 2026, y añadió que realizó los descubrimientos tras lanzar una "revisión retrospectiva a gran escala" en respuesta a una reciente revelación de OpenAI sobre que una combinación de sus modelos escapó del entorno aislado explotando un zero-day no reportado previamente en Artifactory para obtener acceso a internet e irrumpir en los sistemas de producción de Hugging Face con el objetivo final de hacer trampa en una evaluación.
"Después de revisar 141.006 ejecuciones de evaluación donde Claude podría haber obtenido acceso a internet, identificamos tres incidentes en los que un modelo accedió a internet desde el interior o mientras interactuaba con el entorno de evaluación de Irregular, uno de nuestros socios de evaluación externos, y luego obtuvo acceso no autorizado a la infraestructura de producción de tres organizaciones diferentes", dijo Anthropic.
En todos los incidentes identificados, se dice que Claude recibió la tarea de un desafío de capture-the-flag (CTF) para evaluar las capacidades de los modelos, siendo la intención localizar una pieza de información secreta oculta en una máquina diferente de la red por cualquier medio.
Aunque la instrucción de evaluación especificada a Claude indicaba que el entorno era una simulación y que no tenía acceso a internet, Anthropic afirmó que una mala configuración dejó las máquinas a las que accedió el modelo con acceso real a internet debido a lo que describió como un "malentendido" entre el laboratorio de IA y su socio de evaluación Irregular.
Esto, a su vez, provocó que la búsqueda de Claude lo llevara a sistemas reales en la red abierta y los tratara como parte del ejercicio, permitiendo efectivamente que el modelo comprometiera la infraestructura de las organizaciones afectadas utilizando técnicas básicas, incluyendo la explotación de contraseñas débiles y puntos finales no autenticados.
Anthropic enfatizó que el modelo no encontró ni explotó ninguna vulnerabilidad compleja, y que en cada caso siguió trabajando para completar únicamente la tarea específica de CTF que su evaluación le había asignado.
"Sin embargo, en algunos casos, nuestro modelo más antiguo continuó su ataque incluso después de obtener evidencia de que se estaba ejecutando en la red abierta; nuestro modelo más reciente se detuvo una vez que reconoció que estaba en internet", señaló. "En ninguna de estas situaciones Claude se exfiltró a sí mismo ni intentó deliberadamente escapar de su entorno de prueba".
* Un incidente relacionado con Claude Opus 4.7 en el que vulneró la infraestructura de una empresa real al identificar y explotar vulnerabilidades, pensando que era parte del desafío. Esto llevó a la extracción de credenciales de aplicación e infraestructura y al acceso a una base de datos con varios cientos de filas de datos de producción. Este es también el único incidente donde el modelo continuó atacando el sistema a pesar de "aprender" que operaba en un entorno real.
* Un incidente relacionado con Claude Mythos 5 implicó instrucciones de configuración para instalar un paquete de PyPI inexistente, lo que llevó al modelo a hacer "grandes esfuerzos" para cargar un paquete de Python con el mismo nombre para que los sistemas de la empresa ficticia lo descargaran e instalaran automáticamente. Para lograrlo, encontró un proveedor de correo electrónico no bloqueado, registró una cuenta de PyPI y luego la utilizó para cargar el paquete.
* Durante la ventana de aproximadamente una hora en que el paquete estuvo activo en el registro, fue descargado por 15 sistemas reales, incluida una empresa de seguridad legítima que instala regularmente paquetes de Python y los escanea en busca de malware. Se cree que el escáner consideró el paquete trampa como seguro para instalar, lo que llevó a la exfiltración de las credenciales de la empresa a un punto final externo configurado por el modelo. Las credenciales se utilizaron entonces para acceder a más infraestructura de esta empresa. No se revelaron ni el nombre del paquete ni el de la empresa.
* Un incidente involucró un modelo interno de prueba de investigación que escaneó unos 9.000 objetivos y comprometió la aplicación orientada a internet de una empresa utilizando técnicas como la lectura de credenciales de una página de depuración expuesta e inyección SQL. Sin embargo, el modelo detuvo el ataque por sí mismo tras darse cuenta de que el "anfitrión comprometido se encontraba en una cuenta de nube sin conexión con el desafío capture-the-flag".
Al igual que en el caso del incidente de OpenAI, se dice que los modelos en cada una de estas evaluaciones se ejecutaron sin las protecciones estándar que se despliegan cuando se ponen a disposición general de los usuarios. Estas evaluaciones se ejecutaron desde una infraestructura dedicada, la cual, según afirmaron, no tiene acceso a los sistemas internos sensibles de Anthropic ni a los datos de los clientes.
Anthropic también reconoció que varias medidas de defensa en profundidad podrían haber evitado que estos incidentes ocurrieran o, como mínimo, reducido su probabilidad. Una validación de todas las rutas de acceso a internet antes de las evaluaciones y el monitoreo en tiempo real de los registros de evaluación habrían ayudado a detectar los problemas más pronto, añadió.
La principal conclusión de estos incidentes aislados es que los modelos avanzados están respondiendo de manera más adecuada que sus predecesores, aunque se necesitan más pruebas para confirmar este comportamiento, señaló.
"Opus 4.7, nuestro modelo más antiguo, reconoció que había llegado a sistemas de producción pero continuó su ataque", dijo. "Mythos 5 intuyó correctamente que estaba accediendo a la red abierta, pero razonó hasta llegar a la conclusión de que todavía estaba en una simulación. Nuestro modelo más reciente, un modelo interno de prueba de investigación, también consideró si sus objetivos eran en realidad reales. Cuando surgió evidencia de que así era, detuvo el ejercicio".
Los modelos de OpenAI demostraron primero la capacidad de escapar de un entorno de prueba controlado y comprometer la infraestructura de Hugging Face. El Claude de Anthropic ha exhibido ahora un comportamiento similar, reforzando las crecientes capacidades de los sistemas de IA de vanguardia.
Para muchos lectores, estos anuncios ya no parecen investigaciones de seguridad neutrales. En cambio, se leen cada vez más como demostraciones de marketing de capacidades sobre lo que los modelos de IA frontera pueden explotar, evadir, descifrar o automatizar. Unas pocas referencias a la divulgación responsable y a los protocolos de seguridad suelen ser suficientes para presentar los hallazgos como investigación, mientras que el mensaje subyacente sigue siendo claro: los modelos se están convirtiendo en herramientas ofensivas capaces.
La preocupación plantea una pregunta incómoda. Las empresas de IA destacan rutinariamente casos en los que sus modelos superan a los investigadores de seguridad humanos, descubren vulnerabilidades previamente desconocidas, evaden protecciones establecidas o aceleran operaciones cibernéticas de múltiples pasos. Sus mensajes públicos dedican considerable atención a las salvaguardas, los controles de acceso y las prácticas de divulgación responsable, pero ofrecen mucha menos claridad sobre la responsabilidad, la remediación o quién asume finalmente el costo cuando esas salvaguardas fallan.
Para ser claros, no se puede responsabilizar razonablemente a los desarrolladores de IA por cada uso dañino de su tecnología. Al mismo tiempo, tampoco pueden promover capacidades ofensivas cada vez más poderosas como una ventaja competitiva, tratar el mal uso previsible como un problema externo y luego caracterizar el mal uso posterior como responsabilidad total de los usuarios finales cuando esas capacidades contribuyen a daños en el mundo real.
Si las empresas de IA esperan reconocimiento por expandir los límites de lo que sus modelos pueden lograr, también deberían aceptar una mayor responsabilidad sobre cómo se lanzan, evalúan, gobiernan, monitorean y presentan esas capacidades al público.
El desarrollo también subraya la necesidad de erigir un perímetro de seguridad fuerte alrededor de los entornos de evaluación que involucren capacidades autónomas poderosas y cómo el comportamiento del modelo sigue estando influenciado por la conciencia situacional y su comprensión de los objetivos.
A medida que los sistemas de IA se vuelven más capaces y pasan de los entornos de investigación a un despliegue más amplio, la línea entre demostrar capacidades ofensivas y promoverlas se vuelve cada vez más difícil de ignorar.
Fuente:
THN
Anthropic se convirtió el jueves en la última empresa de inteligencia artificial (IA) en revelar que tres de sus modelos, incluidos Claude Opus 4.7, Mythos 5 y un modelo de investigación no identificado, habían vulnerado tres organizaciones.
La firma de IA afirmó que los incidentes más antiguos datan de abril de 2026, y añadió que realizó los descubrimientos tras lanzar una "revisión retrospectiva a gran escala" en respuesta a una reciente revelación de OpenAI sobre que una combinación de sus modelos escapó del entorno aislado explotando un zero-day no reportado previamente en Artifactory para obtener acceso a internet e irrumpir en los sistemas de producción de Hugging Face con el objetivo final de hacer trampa en una evaluación.
"Después de revisar 141.006 ejecuciones de evaluación donde Claude podría haber obtenido acceso a internet, identificamos tres incidentes en los que un modelo accedió a internet desde el interior o mientras interactuaba con el entorno de evaluación de Irregular, uno de nuestros socios de evaluación externos, y luego obtuvo acceso no autorizado a la infraestructura de producción de tres organizaciones diferentes", dijo Anthropic.
En todos los incidentes identificados, se dice que Claude recibió la tarea de un desafío de capture-the-flag (CTF) para evaluar las capacidades de los modelos, siendo la intención localizar una pieza de información secreta oculta en una máquina diferente de la red por cualquier medio.
Aunque la instrucción de evaluación especificada a Claude indicaba que el entorno era una simulación y que no tenía acceso a internet, Anthropic afirmó que una mala configuración dejó las máquinas a las que accedió el modelo con acceso real a internet debido a lo que describió como un "malentendido" entre el laboratorio de IA y su socio de evaluación Irregular.
Esto, a su vez, provocó que la búsqueda de Claude lo llevara a sistemas reales en la red abierta y los tratara como parte del ejercicio, permitiendo efectivamente que el modelo comprometiera la infraestructura de las organizaciones afectadas utilizando técnicas básicas, incluyendo la explotación de contraseñas débiles y puntos finales no autenticados.
Anthropic enfatizó que el modelo no encontró ni explotó ninguna vulnerabilidad compleja, y que en cada caso siguió trabajando para completar únicamente la tarea específica de CTF que su evaluación le había asignado.
"Sin embargo, en algunos casos, nuestro modelo más antiguo continuó su ataque incluso después de obtener evidencia de que se estaba ejecutando en la red abierta; nuestro modelo más reciente se detuvo una vez que reconoció que estaba en internet", señaló. "En ninguna de estas situaciones Claude se exfiltró a sí mismo ni intentó deliberadamente escapar de su entorno de prueba".
Los detalles de los tres incidentes son los siguientes
* Un incidente relacionado con Claude Opus 4.7 en el que vulneró la infraestructura de una empresa real al identificar y explotar vulnerabilidades, pensando que era parte del desafío. Esto llevó a la extracción de credenciales de aplicación e infraestructura y al acceso a una base de datos con varios cientos de filas de datos de producción. Este es también el único incidente donde el modelo continuó atacando el sistema a pesar de "aprender" que operaba en un entorno real.
* Un incidente relacionado con Claude Mythos 5 implicó instrucciones de configuración para instalar un paquete de PyPI inexistente, lo que llevó al modelo a hacer "grandes esfuerzos" para cargar un paquete de Python con el mismo nombre para que los sistemas de la empresa ficticia lo descargaran e instalaran automáticamente. Para lograrlo, encontró un proveedor de correo electrónico no bloqueado, registró una cuenta de PyPI y luego la utilizó para cargar el paquete.
* Durante la ventana de aproximadamente una hora en que el paquete estuvo activo en el registro, fue descargado por 15 sistemas reales, incluida una empresa de seguridad legítima que instala regularmente paquetes de Python y los escanea en busca de malware. Se cree que el escáner consideró el paquete trampa como seguro para instalar, lo que llevó a la exfiltración de las credenciales de la empresa a un punto final externo configurado por el modelo. Las credenciales se utilizaron entonces para acceder a más infraestructura de esta empresa. No se revelaron ni el nombre del paquete ni el de la empresa.
* Un incidente involucró un modelo interno de prueba de investigación que escaneó unos 9.000 objetivos y comprometió la aplicación orientada a internet de una empresa utilizando técnicas como la lectura de credenciales de una página de depuración expuesta e inyección SQL. Sin embargo, el modelo detuvo el ataque por sí mismo tras darse cuenta de que el "anfitrión comprometido se encontraba en una cuenta de nube sin conexión con el desafío capture-the-flag".
Al igual que en el caso del incidente de OpenAI, se dice que los modelos en cada una de estas evaluaciones se ejecutaron sin las protecciones estándar que se despliegan cuando se ponen a disposición general de los usuarios. Estas evaluaciones se ejecutaron desde una infraestructura dedicada, la cual, según afirmaron, no tiene acceso a los sistemas internos sensibles de Anthropic ni a los datos de los clientes.
Anthropic también reconoció que varias medidas de defensa en profundidad podrían haber evitado que estos incidentes ocurrieran o, como mínimo, reducido su probabilidad. Una validación de todas las rutas de acceso a internet antes de las evaluaciones y el monitoreo en tiempo real de los registros de evaluación habrían ayudado a detectar los problemas más pronto, añadió.
La principal conclusión de estos incidentes aislados es que los modelos avanzados están respondiendo de manera más adecuada que sus predecesores, aunque se necesitan más pruebas para confirmar este comportamiento, señaló.
"Opus 4.7, nuestro modelo más antiguo, reconoció que había llegado a sistemas de producción pero continuó su ataque", dijo. "Mythos 5 intuyó correctamente que estaba accediendo a la red abierta, pero razonó hasta llegar a la conclusión de que todavía estaba en una simulación. Nuestro modelo más reciente, un modelo interno de prueba de investigación, también consideró si sus objetivos eran en realidad reales. Cuando surgió evidencia de que así era, detuvo el ejercicio".
Los modelos de OpenAI demostraron primero la capacidad de escapar de un entorno de prueba controlado y comprometer la infraestructura de Hugging Face. El Claude de Anthropic ha exhibido ahora un comportamiento similar, reforzando las crecientes capacidades de los sistemas de IA de vanguardia.
Para muchos lectores, estos anuncios ya no parecen investigaciones de seguridad neutrales. En cambio, se leen cada vez más como demostraciones de marketing de capacidades sobre lo que los modelos de IA frontera pueden explotar, evadir, descifrar o automatizar. Unas pocas referencias a la divulgación responsable y a los protocolos de seguridad suelen ser suficientes para presentar los hallazgos como investigación, mientras que el mensaje subyacente sigue siendo claro: los modelos se están convirtiendo en herramientas ofensivas capaces.
La preocupación plantea una pregunta incómoda. Las empresas de IA destacan rutinariamente casos en los que sus modelos superan a los investigadores de seguridad humanos, descubren vulnerabilidades previamente desconocidas, evaden protecciones establecidas o aceleran operaciones cibernéticas de múltiples pasos. Sus mensajes públicos dedican considerable atención a las salvaguardas, los controles de acceso y las prácticas de divulgación responsable, pero ofrecen mucha menos claridad sobre la responsabilidad, la remediación o quién asume finalmente el costo cuando esas salvaguardas fallan.
Para ser claros, no se puede responsabilizar razonablemente a los desarrolladores de IA por cada uso dañino de su tecnología. Al mismo tiempo, tampoco pueden promover capacidades ofensivas cada vez más poderosas como una ventaja competitiva, tratar el mal uso previsible como un problema externo y luego caracterizar el mal uso posterior como responsabilidad total de los usuarios finales cuando esas capacidades contribuyen a daños en el mundo real.
Si las empresas de IA esperan reconocimiento por expandir los límites de lo que sus modelos pueden lograr, también deberían aceptar una mayor responsabilidad sobre cómo se lanzan, evalúan, gobiernan, monitorean y presentan esas capacidades al público.
El desarrollo también subraya la necesidad de erigir un perímetro de seguridad fuerte alrededor de los entornos de evaluación que involucren capacidades autónomas poderosas y cómo el comportamiento del modelo sigue estando influenciado por la conciencia situacional y su comprensión de los objetivos.
A medida que los sistemas de IA se vuelven más capaces y pasan de los entornos de investigación a un despliegue más amplio, la línea entre demostrar capacidades ofensivas y promoverlas se vuelve cada vez más difícil de ignorar.
Fuente:
THN
Enviar por correo electrónico
Escribe un blog
Compartir en X
Compartir con Facebook
Compartir en Pinterest
Entrada más reciente
0 comentarios :
Publicar un comentario
Los comentarios pueden ser revisados en cualquier momento por los moderadores.
Serán publicados aquellos que cumplan las siguientes condiciones:
- Comentario acorde al contenido del post.
- Prohibido mensajes de tipo SPAM.
- Evite incluir links innecesarios en su comentario.
- Contenidos ofensivos, amenazas e insultos no serán permitidos.
Debe saber que los comentarios de los lectores no reflejan necesariamente la opinión del STAFF.