Tutoriales y Manuales
Entradas Mensuales
-
▼
2026
(Total:
6041
)
-
▼
August
(Total:
49
)
-
Gemini Robotics ER 2: cerebro robótico avanzado
-
Anthropic afirma que Claude confundió la red abier...
-
Spotify transforma playlists en historias
-
Aumento de los ciberataques dirigidos a los contro...
-
Amazon gasta 1,8 millones por error con IA
-
Agente Hermes de DeepSeek lanza ciberataques autón...
-
ShutterGap expone millones de recursos de AWS entr...
-
Nike lanza zapatillas de recuperación inteligente
-
Comparativa mejores WAF
-
Estados Unidos prohíbe la importación de robots po...
-
Samsung prevé escasez de RAM el próximo año
-
Meta invierte 8.000 millones en IA
-
Bot de SSH analiza CPU, GPU y RAM de Linux antes d...
-
OpenAI abarata sus modelos pequeños para captar fo...
-
Google Earth + Nano Banana: una interesante idea q...
-
Google usa IA para corregir 1.072 fallos de Chrome
-
Vulnerabilidad en FFmpeg de Home Assistant permite...
-
Fallo crítico de JetBrains permite ejecutar código...
-
Nuevas puertas traseras permiten espiar y controla...
-
Tras la intrusión: qué hacen los atacantes una vez...
-
Apple lanza importantes actualizaciones y corrige ...
-
Red Hat impulsa Flatpak con Firefox y Thunderbird
-
Compra un MacBook Pro M3 con una pantalla defectuo...
-
Los kits de phishing más usados
-
UE obliga a etiquetar todo contenido IA
-
Arch Linux pausa adopción de paquetes en AUR
-
CyberStrike: Plataforma de IA para pruebas de pene...
-
Cargador HollowFrame despliega el backdoor Matryos...
-
IA: vecinos denuncian ruido de centro de datos
-
Origin confirma filtración de datos de 900.000 cli...
-
Google lanza Pixel Tag
-
Administrador de tareas llega a Mac
-
Snapdragon sube precios
-
IA de Anthropic hackea tres organizaciones
-
HackerOne exige verificación de identidad para rep...
-
Gemini Spark automatiza tareas en Chrome
-
Grave vulnerabilidad en Adobe Campaign Classic per...
-
Centro de compras universitarias de Escocia confir...
-
Apple iOS 26.6 corrige fallos de ejecución de códi...
-
ASUS lanza beta de Zenni Claw
-
Google crea IA para robots que piensan y actúan
-
Vivaldi: alternativas a uBlock Origin
-
Vulnerabilidad de Keycloak expone nombres y correo...
-
Usan 0-day de FastJson para atacar organizaciones ...
-
SK hynix ya prepara el salto a la memoria DRAM LPD...
-
Telegram lanza editor enriquecido, comunidades y m...
-
WhatsApp permitirá editar estados
-
Modelos de OpenAI explotan Zero-Day de JFrog Artif...
-
VulnGym usa IA para evaluar estrategias de parcheo...
-
-
▼
August
(Total:
49
)
Blogroll
Labels
seguridad
(
1615
)
vulnerabilidad
(
1565
)
software
(
895
)
hardware
(
839
)
google
(
741
)
Malware
(
708
)
privacidad
(
646
)
Windows
(
521
)
ransomware
(
518
)
android
(
451
)
exploit
(
403
)
linux
(
383
)
cve
(
371
)
tutorial
(
299
)
nvidia
(
287
)
manual
(
281
)
hacking
(
244
)
WhatsApp
(
173
)
ssd
(
173
)
ddos
(
134
)
Wifi
(
131
)
app
(
126
)
cifrado
(
121
)
twitter
(
121
)
programación
(
105
)
youtube
(
82
)
herramientas
(
80
)
firefox
(
76
)
Networking
(
73
)
sysadmin
(
72
)
firmware
(
71
)
adobe
(
65
)
office
(
62
)
hack
(
50
)
Kernel
(
49
)
antivirus
(
49
)
javascript
(
48
)
apache
(
46
)
juegos
(
42
)
contraseñas
(
39
)
cms
(
35
)
multimedia
(
35
)
eventos
(
32
)
flash
(
32
)
MAC
(
30
)
anonymous
(
28
)
ssl
(
24
)
Forense
(
20
)
conferencia
(
20
)
SeguridadWireless
(
17
)
documental
(
17
)
auditoría
(
15
)
Debugger
(
14
)
Rootkit
(
14
)
lizard squad
(
14
)
metasploit
(
13
)
técnicas hacking
(
13
)
Virtualización
(
11
)
delitos
(
11
)
reversing
(
10
)
adamo
(
9
)
Ehn-Dev
(
7
)
MAC Adress
(
6
)
antimalware
(
6
)
oclHashcat
(
5
)
Entradas populares
-
Revolut está siendo investigada luego de que unos hackers afirmaran estar vendiendo una base de datos con registros de más de 75 millones de...
-
Google prepara el lanzamiento de Pixel Tag , un localizador de objetos similar al AirTag para llenar el hueco de hardware en su ecosistema A...
-
El protocolo de finanzas descentralizadas. Poly Network, ha ofrecido a la persona responsable de un hackeo de USD 611 millones un puesto...
Anthropic afirma que Claude confundió la red abierta con un CTF y vulneró a tres organizaciones
Sunday, 2 August 2026
|
Posted by
el-brujo
|
Edit Post
Anthropic reveló que tres de sus modelos de IA accedieron sin autorización a la infraestructura de tres organizaciones externas durante pruebas de seguridad. Los incidentes ocurrieron debido a una mala configuración que permitió el acceso a internet, llevando a los modelos a confundir sistemas reales con simulaciones. La empresa destacó que sus versiones más recientes muestran una mayor capacidad para detenerse al reconocer que no están en un entorno de prueba.
Anthropic se convirtió el jueves en la última empresa de inteligencia artificial (IA) en revelar que tres de sus modelos, incluidos Claude Opus 4.7, Mythos 5 y un modelo de investigación no identificado, habían vulnerado tres organizaciones.
La firma de IA afirmó que los incidentes más antiguos datan de abril de 2026, y añadió que realizó los descubrimientos tras lanzar una "revisión retrospectiva a gran escala" en respuesta a una reciente revelación de OpenAI sobre que una combinación de sus modelos escapó del entorno aislado explotando un zero-day no reportado previamente en Artifactory para obtener acceso a internet e irrumpir en los sistemas de producción de Hugging Face con el objetivo final de hacer trampa en una evaluación.
"Después de revisar 141.006 ejecuciones de evaluación donde Claude podría haber obtenido acceso a internet, identificamos tres incidentes en los que un modelo accedió a internet desde el interior o mientras interactuaba con el entorno de evaluación de Irregular, uno de nuestros socios de evaluación externos, y luego obtuvo acceso no autorizado a la infraestructura de producción de tres organizaciones diferentes", dijo Anthropic.
En todos los incidentes identificados, se dice que Claude recibió la tarea de un desafío de capture-the-flag (CTF) para evaluar las capacidades de los modelos, siendo la intención localizar una pieza de información secreta oculta en una máquina diferente de la red por cualquier medio.
Aunque la instrucción de evaluación especificada a Claude indicaba que el entorno era una simulación y que no tenía acceso a internet, Anthropic afirmó que una mala configuración dejó las máquinas a las que accedió el modelo con acceso real a internet debido a lo que describió como un "malentendido" entre el laboratorio de IA y su socio de evaluación Irregular.
Esto, a su vez, provocó que la búsqueda de Claude lo llevara a sistemas reales en la red abierta y los tratara como parte del ejercicio, permitiendo efectivamente que el modelo comprometiera la infraestructura de las organizaciones afectadas utilizando técnicas básicas, incluyendo la explotación de contraseñas débiles y puntos finales no autenticados.
Anthropic enfatizó que el modelo no encontró ni explotó ninguna vulnerabilidad compleja, y que en cada caso siguió trabajando para completar únicamente la tarea específica de CTF que su evaluación le había asignado.
"Sin embargo, en algunos casos, nuestro modelo más antiguo continuó su ataque incluso después de obtener evidencia de que se estaba ejecutando en la red abierta; nuestro modelo más reciente se detuvo una vez que reconoció que estaba en internet", señaló. "En ninguna de estas situaciones Claude se exfiltró a sí mismo ni intentó deliberadamente escapar de su entorno de prueba".
* Un incidente relacionado con Claude Opus 4.7 en el que vulneró la infraestructura de una empresa real al identificar y explotar vulnerabilidades, pensando que era parte del desafío. Esto llevó a la extracción de credenciales de aplicación e infraestructura y al acceso a una base de datos con varios cientos de filas de datos de producción. Este es también el único incidente donde el modelo continuó atacando el sistema a pesar de "aprender" que operaba en un entorno real.
* Un incidente relacionado con Claude Mythos 5 implicó instrucciones de configuración para instalar un paquete de PyPI inexistente, lo que llevó al modelo a hacer "grandes esfuerzos" para cargar un paquete de Python con el mismo nombre para que los sistemas de la empresa ficticia lo descargaran e instalaran automáticamente. Para lograrlo, encontró un proveedor de correo electrónico no bloqueado, registró una cuenta de PyPI y luego la utilizó para cargar el paquete.
* Durante la ventana de aproximadamente una hora en que el paquete estuvo activo en el registro, fue descargado por 15 sistemas reales, incluida una empresa de seguridad legítima que instala regularmente paquetes de Python y los escanea en busca de malware. Se cree que el escáner consideró el paquete trampa como seguro para instalar, lo que llevó a la exfiltración de las credenciales de la empresa a un punto final externo configurado por el modelo. Las credenciales se utilizaron entonces para acceder a más infraestructura de esta empresa. No se revelaron ni el nombre del paquete ni el de la empresa.
* Un incidente involucró un modelo interno de prueba de investigación que escaneó unos 9.000 objetivos y comprometió la aplicación orientada a internet de una empresa utilizando técnicas como la lectura de credenciales de una página de depuración expuesta e inyección SQL. Sin embargo, el modelo detuvo el ataque por sí mismo tras darse cuenta de que el "anfitrión comprometido se encontraba en una cuenta de nube sin conexión con el desafío capture-the-flag".
Al igual que en el caso del incidente de OpenAI, se dice que los modelos en cada una de estas evaluaciones se ejecutaron sin las protecciones estándar que se despliegan cuando se ponen a disposición general de los usuarios. Estas evaluaciones se ejecutaron desde una infraestructura dedicada, la cual, según afirmaron, no tiene acceso a los sistemas internos sensibles de Anthropic ni a los datos de los clientes.
Anthropic también reconoció que varias medidas de defensa en profundidad podrían haber evitado que estos incidentes ocurrieran o, como mínimo, reducido su probabilidad. Una validación de todas las rutas de acceso a internet antes de las evaluaciones y el monitoreo en tiempo real de los registros de evaluación habrían ayudado a detectar los problemas más pronto, añadió.
La principal conclusión de estos incidentes aislados es que los modelos avanzados están respondiendo de manera más adecuada que sus predecesores, aunque se necesitan más pruebas para confirmar este comportamiento, señaló.
"Opus 4.7, nuestro modelo más antiguo, reconoció que había llegado a sistemas de producción pero continuó su ataque", dijo. "Mythos 5 intuyó correctamente que estaba accediendo a la red abierta, pero razonó hasta llegar a la conclusión de que todavía estaba en una simulación. Nuestro modelo más reciente, un modelo interno de prueba de investigación, también consideró si sus objetivos eran en realidad reales. Cuando surgió evidencia de que así era, detuvo el ejercicio".
Los modelos de OpenAI demostraron primero la capacidad de escapar de un entorno de prueba controlado y comprometer la infraestructura de Hugging Face. El Claude de Anthropic ha exhibido ahora un comportamiento similar, reforzando las crecientes capacidades de los sistemas de IA de vanguardia.
Para muchos lectores, estos anuncios ya no parecen investigaciones de seguridad neutrales. En cambio, se leen cada vez más como demostraciones de marketing de capacidades sobre lo que los modelos de IA frontera pueden explotar, evadir, descifrar o automatizar. Unas pocas referencias a la divulgación responsable y a los protocolos de seguridad suelen ser suficientes para presentar los hallazgos como investigación, mientras que el mensaje subyacente sigue siendo claro: los modelos se están convirtiendo en herramientas ofensivas capaces.
La preocupación plantea una pregunta incómoda. Las empresas de IA destacan rutinariamente casos en los que sus modelos superan a los investigadores de seguridad humanos, descubren vulnerabilidades previamente desconocidas, evaden protecciones establecidas o aceleran operaciones cibernéticas de múltiples pasos. Sus mensajes públicos dedican considerable atención a las salvaguardas, los controles de acceso y las prácticas de divulgación responsable, pero ofrecen mucha menos claridad sobre la responsabilidad, la remediación o quién asume finalmente el costo cuando esas salvaguardas fallan.
Para ser claros, no se puede responsabilizar razonablemente a los desarrolladores de IA por cada uso dañino de su tecnología. Al mismo tiempo, tampoco pueden promover capacidades ofensivas cada vez más poderosas como una ventaja competitiva, tratar el mal uso previsible como un problema externo y luego caracterizar el mal uso posterior como responsabilidad total de los usuarios finales cuando esas capacidades contribuyen a daños en el mundo real.
Si las empresas de IA esperan reconocimiento por expandir los límites de lo que sus modelos pueden lograr, también deberían aceptar una mayor responsabilidad sobre cómo se lanzan, evalúan, gobiernan, monitorean y presentan esas capacidades al público.
El desarrollo también subraya la necesidad de erigir un perímetro de seguridad fuerte alrededor de los entornos de evaluación que involucren capacidades autónomas poderosas y cómo el comportamiento del modelo sigue estando influenciado por la conciencia situacional y su comprensión de los objetivos.
A medida que los sistemas de IA se vuelven más capaces y pasan de los entornos de investigación a un despliegue más amplio, la línea entre demostrar capacidades ofensivas y promoverlas se vuelve cada vez más difícil de ignorar.
Fuente:
THN
Anthropic se convirtió el jueves en la última empresa de inteligencia artificial (IA) en revelar que tres de sus modelos, incluidos Claude Opus 4.7, Mythos 5 y un modelo de investigación no identificado, habían vulnerado tres organizaciones.
La firma de IA afirmó que los incidentes más antiguos datan de abril de 2026, y añadió que realizó los descubrimientos tras lanzar una "revisión retrospectiva a gran escala" en respuesta a una reciente revelación de OpenAI sobre que una combinación de sus modelos escapó del entorno aislado explotando un zero-day no reportado previamente en Artifactory para obtener acceso a internet e irrumpir en los sistemas de producción de Hugging Face con el objetivo final de hacer trampa en una evaluación.
"Después de revisar 141.006 ejecuciones de evaluación donde Claude podría haber obtenido acceso a internet, identificamos tres incidentes en los que un modelo accedió a internet desde el interior o mientras interactuaba con el entorno de evaluación de Irregular, uno de nuestros socios de evaluación externos, y luego obtuvo acceso no autorizado a la infraestructura de producción de tres organizaciones diferentes", dijo Anthropic.
En todos los incidentes identificados, se dice que Claude recibió la tarea de un desafío de capture-the-flag (CTF) para evaluar las capacidades de los modelos, siendo la intención localizar una pieza de información secreta oculta en una máquina diferente de la red por cualquier medio.
Aunque la instrucción de evaluación especificada a Claude indicaba que el entorno era una simulación y que no tenía acceso a internet, Anthropic afirmó que una mala configuración dejó las máquinas a las que accedió el modelo con acceso real a internet debido a lo que describió como un "malentendido" entre el laboratorio de IA y su socio de evaluación Irregular.
Esto, a su vez, provocó que la búsqueda de Claude lo llevara a sistemas reales en la red abierta y los tratara como parte del ejercicio, permitiendo efectivamente que el modelo comprometiera la infraestructura de las organizaciones afectadas utilizando técnicas básicas, incluyendo la explotación de contraseñas débiles y puntos finales no autenticados.
Anthropic enfatizó que el modelo no encontró ni explotó ninguna vulnerabilidad compleja, y que en cada caso siguió trabajando para completar únicamente la tarea específica de CTF que su evaluación le había asignado.
"Sin embargo, en algunos casos, nuestro modelo más antiguo continuó su ataque incluso después de obtener evidencia de que se estaba ejecutando en la red abierta; nuestro modelo más reciente se detuvo una vez que reconoció que estaba en internet", señaló. "En ninguna de estas situaciones Claude se exfiltró a sí mismo ni intentó deliberadamente escapar de su entorno de prueba".
Los detalles de los tres incidentes son los siguientes
* Un incidente relacionado con Claude Opus 4.7 en el que vulneró la infraestructura de una empresa real al identificar y explotar vulnerabilidades, pensando que era parte del desafío. Esto llevó a la extracción de credenciales de aplicación e infraestructura y al acceso a una base de datos con varios cientos de filas de datos de producción. Este es también el único incidente donde el modelo continuó atacando el sistema a pesar de "aprender" que operaba en un entorno real.
* Un incidente relacionado con Claude Mythos 5 implicó instrucciones de configuración para instalar un paquete de PyPI inexistente, lo que llevó al modelo a hacer "grandes esfuerzos" para cargar un paquete de Python con el mismo nombre para que los sistemas de la empresa ficticia lo descargaran e instalaran automáticamente. Para lograrlo, encontró un proveedor de correo electrónico no bloqueado, registró una cuenta de PyPI y luego la utilizó para cargar el paquete.
* Durante la ventana de aproximadamente una hora en que el paquete estuvo activo en el registro, fue descargado por 15 sistemas reales, incluida una empresa de seguridad legítima que instala regularmente paquetes de Python y los escanea en busca de malware. Se cree que el escáner consideró el paquete trampa como seguro para instalar, lo que llevó a la exfiltración de las credenciales de la empresa a un punto final externo configurado por el modelo. Las credenciales se utilizaron entonces para acceder a más infraestructura de esta empresa. No se revelaron ni el nombre del paquete ni el de la empresa.
* Un incidente involucró un modelo interno de prueba de investigación que escaneó unos 9.000 objetivos y comprometió la aplicación orientada a internet de una empresa utilizando técnicas como la lectura de credenciales de una página de depuración expuesta e inyección SQL. Sin embargo, el modelo detuvo el ataque por sí mismo tras darse cuenta de que el "anfitrión comprometido se encontraba en una cuenta de nube sin conexión con el desafío capture-the-flag".
Al igual que en el caso del incidente de OpenAI, se dice que los modelos en cada una de estas evaluaciones se ejecutaron sin las protecciones estándar que se despliegan cuando se ponen a disposición general de los usuarios. Estas evaluaciones se ejecutaron desde una infraestructura dedicada, la cual, según afirmaron, no tiene acceso a los sistemas internos sensibles de Anthropic ni a los datos de los clientes.
Anthropic también reconoció que varias medidas de defensa en profundidad podrían haber evitado que estos incidentes ocurrieran o, como mínimo, reducido su probabilidad. Una validación de todas las rutas de acceso a internet antes de las evaluaciones y el monitoreo en tiempo real de los registros de evaluación habrían ayudado a detectar los problemas más pronto, añadió.
La principal conclusión de estos incidentes aislados es que los modelos avanzados están respondiendo de manera más adecuada que sus predecesores, aunque se necesitan más pruebas para confirmar este comportamiento, señaló.
"Opus 4.7, nuestro modelo más antiguo, reconoció que había llegado a sistemas de producción pero continuó su ataque", dijo. "Mythos 5 intuyó correctamente que estaba accediendo a la red abierta, pero razonó hasta llegar a la conclusión de que todavía estaba en una simulación. Nuestro modelo más reciente, un modelo interno de prueba de investigación, también consideró si sus objetivos eran en realidad reales. Cuando surgió evidencia de que así era, detuvo el ejercicio".
Los modelos de OpenAI demostraron primero la capacidad de escapar de un entorno de prueba controlado y comprometer la infraestructura de Hugging Face. El Claude de Anthropic ha exhibido ahora un comportamiento similar, reforzando las crecientes capacidades de los sistemas de IA de vanguardia.
Para muchos lectores, estos anuncios ya no parecen investigaciones de seguridad neutrales. En cambio, se leen cada vez más como demostraciones de marketing de capacidades sobre lo que los modelos de IA frontera pueden explotar, evadir, descifrar o automatizar. Unas pocas referencias a la divulgación responsable y a los protocolos de seguridad suelen ser suficientes para presentar los hallazgos como investigación, mientras que el mensaje subyacente sigue siendo claro: los modelos se están convirtiendo en herramientas ofensivas capaces.
La preocupación plantea una pregunta incómoda. Las empresas de IA destacan rutinariamente casos en los que sus modelos superan a los investigadores de seguridad humanos, descubren vulnerabilidades previamente desconocidas, evaden protecciones establecidas o aceleran operaciones cibernéticas de múltiples pasos. Sus mensajes públicos dedican considerable atención a las salvaguardas, los controles de acceso y las prácticas de divulgación responsable, pero ofrecen mucha menos claridad sobre la responsabilidad, la remediación o quién asume finalmente el costo cuando esas salvaguardas fallan.
Para ser claros, no se puede responsabilizar razonablemente a los desarrolladores de IA por cada uso dañino de su tecnología. Al mismo tiempo, tampoco pueden promover capacidades ofensivas cada vez más poderosas como una ventaja competitiva, tratar el mal uso previsible como un problema externo y luego caracterizar el mal uso posterior como responsabilidad total de los usuarios finales cuando esas capacidades contribuyen a daños en el mundo real.
Si las empresas de IA esperan reconocimiento por expandir los límites de lo que sus modelos pueden lograr, también deberían aceptar una mayor responsabilidad sobre cómo se lanzan, evalúan, gobiernan, monitorean y presentan esas capacidades al público.
El desarrollo también subraya la necesidad de erigir un perímetro de seguridad fuerte alrededor de los entornos de evaluación que involucren capacidades autónomas poderosas y cómo el comportamiento del modelo sigue estando influenciado por la conciencia situacional y su comprensión de los objetivos.
A medida que los sistemas de IA se vuelven más capaces y pasan de los entornos de investigación a un despliegue más amplio, la línea entre demostrar capacidades ofensivas y promoverlas se vuelve cada vez más difícil de ignorar.
Fuente:
THN

Newer Post
0 comments :
Post a Comment
Los comentarios pueden ser revisados en cualquier momento por los moderadores.
Serán publicados aquellos que cumplan las siguientes condiciones:
- Comentario acorde al contenido del post.
- Prohibido mensajes de tipo SPAM.
- Evite incluir links innecesarios en su comentario.
- Contenidos ofensivos, amenazas e insultos no serán permitidos.
Debe saber que los comentarios de los lectores no reflejan necesariamente la opinión del STAFF.