Tutoriales y Manuales
Entradas Mensuales
-
▼
2026
(Total:
7770
)
-
▼
October
(Total:
97
)
-
Creador de Rails deja de programar profesionalmente
-
¿Tu coche es un espía?
-
Copilot será el sistema operativo de Office
-
El MI5 advierte a académicos británicos que sus in...
-
Ciberdelincuentes emplean NeedyMantis para asegura...
-
Anthropic afirma que modelo chino de IA tiene capa...
-
GTA VI: 12 nuevas imágenes
-
Trump firma el primer pacto con los gigantes de la...
-
Cuenta de Microsoft en X es hackeada para estafa d...
-
Android 17 refuerza la seguridad limitando los ser...
-
GitLab corrige vulnerabilidad crítica en AI Gatewa...
-
ArXiv limita la frecuencia de envío de artículos p...
-
El Papa rechaza la IA generativa
-
NVIDIA, Google y AMD concentrarían el 85% de la de...
-
Ryzen Z3: Zen 6 y RDNA 4m
-
LaLiga pide vigilar los principales VPN contra la ...
-
Usan exclusiones de Microsoft Defender para oculta...
-
MSI activa Microsoft Security Level 2 en sus nueva...
-
Sesgo de género en IA ante catástrofe nuclear
-
Las escuelas de Inglaterra mejoran su capacidad de...
-
OpenClaw lanza plataforma gratuita y abierta de ag...
-
Recompensa por denunciar IPTV en bares
-
Sony lanza actualización de seguridad para PS5 tra...
-
postmarketOS pasa a llamarse Nura
-
Microsoft activa copia de seguridad de Windows 11 ...
-
Vulnerabilidad en ImageResponse de Node.js permite...
-
Hackean a la tienda online LDLC robando datos de l...
-
Los precios de la Raspberry Pi 4 y Raspberry Pi 5 ...
-
Misterio sobre el próximo lanzamiento de Nothing
-
Cloudflare lanza autoridad de certificación gratui...
-
Alerta por estafa de fotos efímeras en WhatsApp
-
Intel Core Ultra 4000 «Nova Lake-S» filtrados: has...
-
NVIDIA busca abaratar Rubin Ultra: prueba nuevos m...
-
Microsoft detecta grupos aprovechando un fallo de ...
-
Vulnerabilidades de Apache HTTP Server podrían per...
-
Explotan vulnerabilidad crítica de día cero en For...
-
NVIDIA actualiza drivers de GeForce GTX
-
Instalador falso de Zoom engaña a usuarios de Mac ...
-
Chinos suplantan a empleado de Anthropic para atac...
-
El router de TP-Link con WiFi 8 ya se puede precom...
-
Fallos de Axios HTTP/2 permiten bypass de SSRF y D...
-
Creador de Downloader responde a LaLiga
-
Acceden remotamente a servidores Zimbra mediante c...
-
Lanzado WSL 3.0 para Windows
-
Vulnerabilidades críticas de API en WatchGuard per...
-
AMD habría vendido toda su producción de CPU EPYC ...
-
La Steam Deck 2 usará una APU AMD «Gainsborough» b...
-
Crean puerta trasera en Windows con C2 en Microsof...
-
Fallo crítico en MikroTik RouterOS permite ejecuta...
-
La presencia femenina cae a mínimos históricos en ...
-
Detienen en Alicante a un joven de 16 años presunt...
-
Intel Nova Lake: USB4 a 80 Gbps en portátiles y PC...
-
Investigadores roban hash de contraseña root de Li...
-
Más de 543.000 credenciales de GitHub siguen activ...
-
Rroban datos personales de más de 3 millones de em...
-
Incidente de seguridad en MetaMask afecta parte de...
-
Nuevo exploit de PS5 vulnera el kernel en varias v...
-
Vulnerabilidades de ModSecurity permiten saltar el...
-
Malware de WordPress reaparece tras su eliminación...
-
Google lanza IA open source para Android: Artemis
-
La policía desmantela la banda de ransomware KillS...
-
Broadcom financiará chips de IA para Anthropic
-
La demanda de memoria en IA provoca una subida de ...
-
Arrestan a líder de 16 años de KillSec y desmantel...
-
Bitget confirma que un exploit de día cero de terc...
-
Google lanza Gemini 4 Argon
-
Payload de post-explotación de Citrix NetScaler cr...
-
Fallo en Docker permite a contenedores sobrescribi...
-
Surge PoC de Apple CoreGraphics mientras análisis ...
-
Falso ChatGPT infecta PC vía Google
-
Países Bajos creará su propio Linux
-
Más de 543.000 credenciales válidas quedan expuest...
-
Google lanza Gemini 4 Argon para expertos en ciber...
-
Rusos atacan a más de 100 organizaciones con RedFlick
-
IA: el reto de los 6 billones
-
Instagram usa IA para optimizar tus vídeos
-
Apple presentará HomePad el 13 de octubre
-
Cloudflare crea CA poscuántica con certificados Me...
-
CISA alerta sobre vulnerabilidad crítica de ejecuc...
-
El SMT en la CPU NVIDIA Vera aporta un 20% más de ...
-
Accedieron a Microsoft 365 mediante cuentas olvidadas
-
El internet por satélite de Starlink ya convence a...
-
Windows 11 26H2: novedades e instalación
-
Usaron servidor PaperCut para llegar al controlado...
-
Agentes de IA filtran más de 13.000 capturas inter...
-
Usan instaladores de Zoom y PDF para controlar PCs
-
Exagente de la NCA implicado en el caso Silk Road ...
-
Cisco alerta sobre vulnerabilidad zero-day en SD-W...
-
Operación Blackout del FBI desmantela estafadores ...
-
Explotan vulnerabilidad 0-day en Cisco SD-WAN Manager
-
Desarrollador entrena IA pequeña en una RTX 3080 T...
-
Vulnerabilidades críticas de TeamViewer permiten e...
-
Nuevo malware 2CLoader evade seguridad para desple...
-
Windows 11 Assisted Setup: más bloatware para tu PC
-
Jailbreak disponible para casi toda la PS5
-
Internet Society lanza Centro Global de Confianza ...
-
Aprovechan vulnerabilidad zero-day de Citrix NetSc...
-
-
▼
October
(Total:
97
)
Blogroll
Labels
vulnerabilidad
(
2073
)
seguridad
(
1969
)
software
(
1308
)
hardware
(
1014
)
google
(
824
)
Malware
(
711
)
privacidad
(
699
)
exploit
(
622
)
ransomware
(
555
)
Windows
(
521
)
android
(
509
)
linux
(
473
)
cve
(
380
)
nvidia
(
354
)
tutorial
(
300
)
manual
(
282
)
hacking
(
275
)
ssd
(
183
)
WhatsApp
(
173
)
ddos
(
143
)
Wifi
(
131
)
app
(
131
)
programación
(
129
)
cifrado
(
122
)
twitter
(
121
)
firmware
(
89
)
youtube
(
85
)
firefox
(
81
)
herramientas
(
80
)
Networking
(
73
)
adobe
(
72
)
sysadmin
(
72
)
office
(
64
)
antivirus
(
56
)
hack
(
54
)
javascript
(
52
)
Kernel
(
49
)
apache
(
49
)
juegos
(
42
)
contraseñas
(
39
)
cms
(
37
)
multimedia
(
36
)
flash
(
33
)
eventos
(
32
)
MAC
(
30
)
anonymous
(
28
)
ssl
(
24
)
conferencia
(
21
)
Forense
(
20
)
documental
(
18
)
SeguridadWireless
(
17
)
auditoría
(
16
)
Debugger
(
14
)
Rootkit
(
14
)
lizard squad
(
14
)
metasploit
(
13
)
técnicas hacking
(
13
)
Virtualización
(
11
)
delitos
(
11
)
reversing
(
10
)
adamo
(
9
)
Ehn-Dev
(
7
)
antimalware
(
7
)
MAC Adress
(
6
)
oclHashcat
(
5
)
Entradas populares
-
Se ha descubierto una vulnerabilidad en Docker denominada CopyEscape (CVE-2026-17106), la cual permite que contenedores maliciosos escriban...
-
Se ha detectado una vulnerabilidad de seguridad de alta gravedad en Sudo (CVE-2026-96512) que podría permitir a atacantes locales evadir la...
-
Microsoft ha habilitado para todos los usuarios el programa de Xbox que permite convertir juegos físicos a formato digital .
Anthropic afirma que modelo chino de IA tiene capacidad de hackeo clase Mythos; reporte detalla salvaguardas débiles en IA de pesos abiertos
Friday, October 2, 2026
|
Posted by
el-brujo
Anthropic afirma que el modelo chino GLM-5.3 posee capacidades avanzadas de hacking y salvaguardas fáciles de evadir, permitiendo la creación de contenido malicioso y ciberataques. El informe destaca que, al ser un modelo de pesos abiertos, sus restricciones pueden eliminarse por completo mediante un proceso llamado abliteración. No obstante, se señala que ejecutar estas versiones modificadas requiere una inversión económica y de hardware muy elevada.
Anthropic ha publicado un nuevo informe afirmando que el modelo de IA GLM-5.3 de Zhipu AI puede utilizarse para generar contenido malicioso debido a que posee salvaguardas deficientes. La empresa afirma que el modelo de IA puede ser utilizado para ciberataques y que sus protecciones pueden ser eludidas mediante varios métodos.
El informe de Anthropic surge en medio de un coro de peticiones para frenar el desarrollo de la IA, buscando gobernanza y regulación. A pesar de las llamadas del CEO Dario Amodei para moderar la frontera de la IA, Claude Opus 5.5 y Claude Sonnet 5.5 fueron lanzados pocos días después de que se dieran las alarmas.
Ahora, la empresa de IA de código cerrado, que actualmente contempla una salida a bolsa, afirma que los modelos chinos de pesos abiertos (open-weight) pueden ser abusados y generar contenido dañino. Anthropic cita el propio informe del Centro para Estándares e Innovación de IA publicado a finales de septiembre, que sostiene que GLM-5.3 puede automatizar exploits completamente a un nivel similar al modelo Claude Mythos (no lanzado) de la propia Anthropic, lo que impulsó a la compañía a desarrollar el Proyecto Glasswing, un esfuerzo que permite a los desarrolladores acceder a un modelo de clase Mythos para parchear errores y corregir vulnerabilidades antes de que dichos modelos sean lanzados al público.
Anthropic realizó sus propios análisis comparativos sobre GLM-5.3 en Exploitbench, donde los modelos de IA, en un entorno aislado, pueden desarrollar exploits para Google Chrome. GLM-5.3 desarrolló exploits de extremo a extremo 50 veces en 410 ejecuciones, mientras que Mythos lideró el grupo con 56 exploits exitosos. El modelo de Zhipu AI fue probado además en uno de los análisis internos de Anthropic, centrado en el desarrollo de "secuestros completos del flujo de control". GLM 5.3 rindió justo por debajo de Mythos una vez más, con una tasa de éxito del 4%, frente al 6% de Mythos. Notablemente, otros modelos populares de pesos abiertos como Kimi K3 y DeepSeek V4.1 Flash alcanzaron el 0% bajo las mismas medidas.
Anthropic señala además cómo GLM-5.3 fue capaz de desarrollar con éxito exploits encadenados de forma autónoma, y que su variante más ligera "Flash" también tiene la capacidad de desarrollar exploits encadenados en errores conocidos, a un precio tokenizado de solo 20,40 dólares. Dependiendo del balance, esto equivale a que GLM-5.3-Flash puede desarrollar exploits encadenados (conocidos) utilizando entre 100 y 300 millones de tokens, según la proporción de entradas y salidas.
Anthropic también indica que, utilizando el modelo estándar de GLM-5.3, era sencillo evadir las barreras de seguridad del modelo a través de varios métodos. La empresa detalla que esto puede hacerse mediante dos vías: ofreciendo un prompt engañoso, donde la IA interpreta el papel de un agente autónomo adversarial (con una tasa de éxito del 64%), y prellenando los tokens de pensamiento del modelo para asegurar que la respuesta proceda (con una tasa de éxito del 92%). La empresa también detalló un tercer método conocido como abliteración.
Anthropic alega que el GLM-5.3 de Zhipu AI tiene salvaguardas débiles, aunque el modelo estándar a menudo rechaza solicitudes de generación de contenido dañino. Sin embargo, dado que Anthropic desarrolla modelos de código cerrado, sus productos no pueden ser manipulados. Debido a que GLM-5.3 se puede descargar libremente, el modelo puede ser ajustado eliminando totalmente sus barreras de seguridad. Cuando se trata como el modelo lanzado oficialmente, GLM-5.3 logra una tasa de rechazo similar a la de los modelos de Anthropic.
Sin embargo, Anthropic "abliteró" el GLM-5.3 (proceso que elimina deliberadamente las barreras del modelo) y mostró cómo, tras este proceso, la tasa de rechazo cae hasta el 6% para GLM-5.3 y al 14% para GLM-5.3-Flash. No es raro encontrar modelos de pesos abiertos abliterados en HuggingFace, desarrollados principalmente para entornos de "red teaming" simulados, pero que también pueden usarse para ataques reales. Esto hace que el "descubrimiento" de Anthropic sea menos sorprendente.
Además, se requeriría una cantidad enorme de potencia de cómputo para ejecutar una versión abliterada de GLM-5.3 a un nivel operativo. Los pesos del modelo demandan 306 GB de VRAM en pesos FP8 de precisión completa. Ejecutar el modelo a unos 100 TPS no solo requiere un ancho de banda de memoria mínimo de 4 TB/s, sino que también exigiría hardware potente, como un clúster de ocho aceleradores de IA Nvidia H200. El dinero necesario para ese tipo de hardware asciende a cientos de miles de dólares. Actores estatales adversarios podrían utilizar tal configuración si adquieren el hardware.
¿Pero para el hacker común? Probablemente tendría que alquilar el cómputo, abliterar el modelo y luego ejecutarlo, lo cual es increíblemente caro. Anthropic afirma que abliterar el modelo GLM-5.3-Flash tomó 2.200 horas de GPU, con un coste estimado de 4.400 dólares.
Alquilar suficientes GPUs para abliterar la versión completa de GLM-5.3 costaría unos 30 dólares por hora. Generar unos 100 millones de tokens costaría 8.422 dólares y tardaría once días y medio. Abliterar el modelo, ejecutarlo y generar un ciberataque funcional probablemente requeriría mucho más tiempo y sería increíblemente costoso, lo que podría ser el mayor obstáculo para cualquier actor malintencionado.
Dado el revuelo actual sobre la seguridad de la IA, Anthropic está resaltando las amenazas existenciales que representan los modelos de IA de pesos abiertos de frontera a medida que sus capacidades mejoran. Mientras el presidente Trump se ha reunido con figuras destacadas de la IA para autorregular los futuros lanzamientos, la publicación de Anthropic puede leerse como un impulso para que desarrolladores y gobiernos prueben las capacidades de los modelos de pesos abiertos.
También podría reflejar un creciente sentimiento anti-pesos abiertos entre los laboratorios de IA de código cerrado, que están perdiendo negocio a medida que los usuarios migran hacia modelos más baratos y casi tan capaces, aunque esto es mera especulación. Actualmente, los modelos de pesos abiertos siguen muy de cerca a la frontera del código cerrado, con un retraso de apenas unos meses.
Dados los costes de ejecución, los peligros de que modelos de pesos abiertos abliterados sean ejecutados teóricamente por actores maliciosos son reales, pero quizás no tan accesibles como Anthropic quisiera que el público general pensara.
Fuente:
TomsHardware
Anthropic ha publicado un nuevo informe afirmando que el modelo de IA GLM-5.3 de Zhipu AI puede utilizarse para generar contenido malicioso debido a que posee salvaguardas deficientes. La empresa afirma que el modelo de IA puede ser utilizado para ciberataques y que sus protecciones pueden ser eludidas mediante varios métodos.
El informe de Anthropic surge en medio de un coro de peticiones para frenar el desarrollo de la IA, buscando gobernanza y regulación. A pesar de las llamadas del CEO Dario Amodei para moderar la frontera de la IA, Claude Opus 5.5 y Claude Sonnet 5.5 fueron lanzados pocos días después de que se dieran las alarmas.
Ahora, la empresa de IA de código cerrado, que actualmente contempla una salida a bolsa, afirma que los modelos chinos de pesos abiertos (open-weight) pueden ser abusados y generar contenido dañino. Anthropic cita el propio informe del Centro para Estándares e Innovación de IA publicado a finales de septiembre, que sostiene que GLM-5.3 puede automatizar exploits completamente a un nivel similar al modelo Claude Mythos (no lanzado) de la propia Anthropic, lo que impulsó a la compañía a desarrollar el Proyecto Glasswing, un esfuerzo que permite a los desarrolladores acceder a un modelo de clase Mythos para parchear errores y corregir vulnerabilidades antes de que dichos modelos sean lanzados al público.
Anthropic realizó sus propios análisis comparativos sobre GLM-5.3 en Exploitbench, donde los modelos de IA, en un entorno aislado, pueden desarrollar exploits para Google Chrome. GLM-5.3 desarrolló exploits de extremo a extremo 50 veces en 410 ejecuciones, mientras que Mythos lideró el grupo con 56 exploits exitosos. El modelo de Zhipu AI fue probado además en uno de los análisis internos de Anthropic, centrado en el desarrollo de "secuestros completos del flujo de control". GLM 5.3 rindió justo por debajo de Mythos una vez más, con una tasa de éxito del 4%, frente al 6% de Mythos. Notablemente, otros modelos populares de pesos abiertos como Kimi K3 y DeepSeek V4.1 Flash alcanzaron el 0% bajo las mismas medidas.
Anthropic señala además cómo GLM-5.3 fue capaz de desarrollar con éxito exploits encadenados de forma autónoma, y que su variante más ligera "Flash" también tiene la capacidad de desarrollar exploits encadenados en errores conocidos, a un precio tokenizado de solo 20,40 dólares. Dependiendo del balance, esto equivale a que GLM-5.3-Flash puede desarrollar exploits encadenados (conocidos) utilizando entre 100 y 300 millones de tokens, según la proporción de entradas y salidas.
Anthropic también indica que, utilizando el modelo estándar de GLM-5.3, era sencillo evadir las barreras de seguridad del modelo a través de varios métodos. La empresa detalla que esto puede hacerse mediante dos vías: ofreciendo un prompt engañoso, donde la IA interpreta el papel de un agente autónomo adversarial (con una tasa de éxito del 64%), y prellenando los tokens de pensamiento del modelo para asegurar que la respuesta proceda (con una tasa de éxito del 92%). La empresa también detalló un tercer método conocido como abliteración.
Abliterando las barreras de seguridad
Anthropic alega que el GLM-5.3 de Zhipu AI tiene salvaguardas débiles, aunque el modelo estándar a menudo rechaza solicitudes de generación de contenido dañino. Sin embargo, dado que Anthropic desarrolla modelos de código cerrado, sus productos no pueden ser manipulados. Debido a que GLM-5.3 se puede descargar libremente, el modelo puede ser ajustado eliminando totalmente sus barreras de seguridad. Cuando se trata como el modelo lanzado oficialmente, GLM-5.3 logra una tasa de rechazo similar a la de los modelos de Anthropic.
Sin embargo, Anthropic "abliteró" el GLM-5.3 (proceso que elimina deliberadamente las barreras del modelo) y mostró cómo, tras este proceso, la tasa de rechazo cae hasta el 6% para GLM-5.3 y al 14% para GLM-5.3-Flash. No es raro encontrar modelos de pesos abiertos abliterados en HuggingFace, desarrollados principalmente para entornos de "red teaming" simulados, pero que también pueden usarse para ataques reales. Esto hace que el "descubrimiento" de Anthropic sea menos sorprendente.
Además, se requeriría una cantidad enorme de potencia de cómputo para ejecutar una versión abliterada de GLM-5.3 a un nivel operativo. Los pesos del modelo demandan 306 GB de VRAM en pesos FP8 de precisión completa. Ejecutar el modelo a unos 100 TPS no solo requiere un ancho de banda de memoria mínimo de 4 TB/s, sino que también exigiría hardware potente, como un clúster de ocho aceleradores de IA Nvidia H200. El dinero necesario para ese tipo de hardware asciende a cientos de miles de dólares. Actores estatales adversarios podrían utilizar tal configuración si adquieren el hardware.
¿Pero para el hacker común? Probablemente tendría que alquilar el cómputo, abliterar el modelo y luego ejecutarlo, lo cual es increíblemente caro. Anthropic afirma que abliterar el modelo GLM-5.3-Flash tomó 2.200 horas de GPU, con un coste estimado de 4.400 dólares.
Alquilar suficientes GPUs para abliterar la versión completa de GLM-5.3 costaría unos 30 dólares por hora. Generar unos 100 millones de tokens costaría 8.422 dólares y tardaría once días y medio. Abliterar el modelo, ejecutarlo y generar un ciberataque funcional probablemente requeriría mucho más tiempo y sería increíblemente costoso, lo que podría ser el mayor obstáculo para cualquier actor malintencionado.
¿Por qué se centra Anthropic en esto?
Dado el revuelo actual sobre la seguridad de la IA, Anthropic está resaltando las amenazas existenciales que representan los modelos de IA de pesos abiertos de frontera a medida que sus capacidades mejoran. Mientras el presidente Trump se ha reunido con figuras destacadas de la IA para autorregular los futuros lanzamientos, la publicación de Anthropic puede leerse como un impulso para que desarrolladores y gobiernos prueben las capacidades de los modelos de pesos abiertos.
También podría reflejar un creciente sentimiento anti-pesos abiertos entre los laboratorios de IA de código cerrado, que están perdiendo negocio a medida que los usuarios migran hacia modelos más baratos y casi tan capaces, aunque esto es mera especulación. Actualmente, los modelos de pesos abiertos siguen muy de cerca a la frontera del código cerrado, con un retraso de apenas unos meses.
Dados los costes de ejecución, los peligros de que modelos de pesos abiertos abliterados sean ejecutados teóricamente por actores maliciosos son reales, pero quizás no tan accesibles como Anthropic quisiera que el público general pensara.
Fuente:
TomsHardware
Newer Post
0 comments :
Post a Comment
Los comentarios pueden ser revisados en cualquier momento por los moderadores.
Serán publicados aquellos que cumplan las siguientes condiciones:
- Comentario acorde al contenido del post.
- Prohibido mensajes de tipo SPAM.
- Evite incluir links innecesarios en su comentario.
- Contenidos ofensivos, amenazas e insultos no serán permitidos.
Debe saber que los comentarios de los lectores no reflejan necesariamente la opinión del STAFF.