Entradas Mensuales

Síguenos en:

Canal Oficial Telegram de elhacker.NET Grupo Facebook elhacker.NET Twitter elhacker.NET Canal Youtube elhacker.NET Comunidad Steam: Grupo elhacker.NET Mastodon

Entradas populares

PostHeaderIcon Anthropic afirma que modelo chino de IA tiene capacidad de hackeo clase Mythos; reporte detalla salvaguardas débiles en IA de pesos abiertos


Anthropic afirma que el modelo chino GLM-5.3 posee capacidades avanzadas de hacking y salvaguardas fáciles de evadir, permitiendo la creación de contenido malicioso y ciberataques. El informe destaca que, al ser un modelo de pesos abiertos, sus restricciones pueden eliminarse por completo mediante un proceso llamado abliteración. No obstante, se señala que ejecutar estas versiones modificadas requiere una inversión económica y de hardware muy elevada.






Anthropic ha publicado un nuevo informe afirmando que el modelo de IA GLM-5.3 de Zhipu AI puede utilizarse para generar contenido malicioso debido a que posee salvaguardas deficientes. La empresa afirma que el modelo de IA puede ser utilizado para ciberataques y que sus protecciones pueden ser eludidas mediante varios métodos.

El informe de Anthropic surge en medio de un coro de peticiones para frenar el desarrollo de la IA, buscando gobernanza y regulación. A pesar de las llamadas del CEO Dario Amodei para moderar la frontera de la IA, Claude Opus 5.5 y Claude Sonnet 5.5 fueron lanzados pocos días después de que se dieran las alarmas.




Ahora, la empresa de IA de código cerrado, que actualmente contempla una salida a bolsa, afirma que los modelos chinos de pesos abiertos (open-weight) pueden ser abusados y generar contenido dañino. Anthropic cita el propio informe del Centro para Estándares e Innovación de IA publicado a finales de septiembre, que sostiene que GLM-5.3 puede automatizar exploits completamente a un nivel similar al modelo Claude Mythos (no lanzado) de la propia Anthropic, lo que impulsó a la compañía a desarrollar el Proyecto Glasswing, un esfuerzo que permite a los desarrolladores acceder a un modelo de clase Mythos para parchear errores y corregir vulnerabilidades antes de que dichos modelos sean lanzados al público.

Anthropic realizó sus propios análisis comparativos sobre GLM-5.3 en Exploitbench, donde los modelos de IA, en un entorno aislado, pueden desarrollar exploits para Google Chrome. GLM-5.3 desarrolló exploits de extremo a extremo 50 veces en 410 ejecuciones, mientras que Mythos lideró el grupo con 56 exploits exitosos. El modelo de Zhipu AI fue probado además en uno de los análisis internos de Anthropic, centrado en el desarrollo de "secuestros completos del flujo de control". GLM 5.3 rindió justo por debajo de Mythos una vez más, con una tasa de éxito del 4%, frente al 6% de Mythos. Notablemente, otros modelos populares de pesos abiertos como Kimi K3 y DeepSeek V4.1 Flash alcanzaron el 0% bajo las mismas medidas.

Anthropic señala además cómo GLM-5.3 fue capaz de desarrollar con éxito exploits encadenados de forma autónoma, y que su variante más ligera "Flash" también tiene la capacidad de desarrollar exploits encadenados en errores conocidos, a un precio tokenizado de solo 20,40 dólares. Dependiendo del balance, esto equivale a que GLM-5.3-Flash puede desarrollar exploits encadenados (conocidos) utilizando entre 100 y 300 millones de tokens, según la proporción de entradas y salidas.


Anthropic también indica que, utilizando el modelo estándar de GLM-5.3, era sencillo evadir las barreras de seguridad del modelo a través de varios métodos. La empresa detalla que esto puede hacerse mediante dos vías: ofreciendo un prompt engañoso, donde la IA interpreta el papel de un agente autónomo adversarial (con una tasa de éxito del 64%), y prellenando los tokens de pensamiento del modelo para asegurar que la respuesta proceda (con una tasa de éxito del 92%). La empresa también detalló un tercer método conocido como abliteración.


Abliterando las barreras de seguridad



Anthropic alega que el GLM-5.3 de Zhipu AI tiene salvaguardas débiles, aunque el modelo estándar a menudo rechaza solicitudes de generación de contenido dañino. Sin embargo, dado que Anthropic desarrolla modelos de código cerrado, sus productos no pueden ser manipulados. Debido a que GLM-5.3 se puede descargar libremente, el modelo puede ser ajustado eliminando totalmente sus barreras de seguridad. Cuando se trata como el modelo lanzado oficialmente, GLM-5.3 logra una tasa de rechazo similar a la de los modelos de Anthropic.

Sin embargo, Anthropic "abliteró" el GLM-5.3 (proceso que elimina deliberadamente las barreras del modelo) y mostró cómo, tras este proceso, la tasa de rechazo cae hasta el 6% para GLM-5.3 y al 14% para GLM-5.3-Flash. No es raro encontrar modelos de pesos abiertos abliterados en HuggingFace, desarrollados principalmente para entornos de "red teaming" simulados, pero que también pueden usarse para ataques reales. Esto hace que el "descubrimiento" de Anthropic sea menos sorprendente.

Además, se requeriría una cantidad enorme de potencia de cómputo para ejecutar una versión abliterada de GLM-5.3 a un nivel operativo. Los pesos del modelo demandan 306 GB de VRAM en pesos FP8 de precisión completa. Ejecutar el modelo a unos 100 TPS no solo requiere un ancho de banda de memoria mínimo de 4 TB/s, sino que también exigiría hardware potente, como un clúster de ocho aceleradores de IA Nvidia H200. El dinero necesario para ese tipo de hardware asciende a cientos de miles de dólares. Actores estatales adversarios podrían utilizar tal configuración si adquieren el hardware.

¿Pero para el hacker común? Probablemente tendría que alquilar el cómputo, abliterar el modelo y luego ejecutarlo, lo cual es increíblemente caro. Anthropic afirma que abliterar el modelo GLM-5.3-Flash tomó 2.200 horas de GPU, con un coste estimado de 4.400 dólares.


Alquilar suficientes GPUs para abliterar la versión completa de GLM-5.3 costaría unos 30 dólares por hora. Generar unos 100 millones de tokens costaría 8.422 dólares y tardaría once días y medio. Abliterar el modelo, ejecutarlo y generar un ciberataque funcional probablemente requeriría mucho más tiempo y sería increíblemente costoso, lo que podría ser el mayor obstáculo para cualquier actor malintencionado.


¿Por qué se centra Anthropic en esto?



Dado el revuelo actual sobre la seguridad de la IA, Anthropic está resaltando las amenazas existenciales que representan los modelos de IA de pesos abiertos de frontera a medida que sus capacidades mejoran. Mientras el presidente Trump se ha reunido con figuras destacadas de la IA para autorregular los futuros lanzamientos, la publicación de Anthropic puede leerse como un impulso para que desarrolladores y gobiernos prueben las capacidades de los modelos de pesos abiertos.

También podría reflejar un creciente sentimiento anti-pesos abiertos entre los laboratorios de IA de código cerrado, que están perdiendo negocio a medida que los usuarios migran hacia modelos más baratos y casi tan capaces, aunque esto es mera especulación. Actualmente, los modelos de pesos abiertos siguen muy de cerca a la frontera del código cerrado, con un retraso de apenas unos meses.

Dados los costes de ejecución, los peligros de que modelos de pesos abiertos abliterados sean ejecutados teóricamente por actores maliciosos son reales, pero quizás no tan accesibles como Anthropic quisiera que el público general pensara.

Fuente:
TomsHardware

0 comments :

Post a Comment

Los comentarios pueden ser revisados en cualquier momento por los moderadores.

Serán publicados aquellos que cumplan las siguientes condiciones:
- Comentario acorde al contenido del post.
- Prohibido mensajes de tipo SPAM.
- Evite incluir links innecesarios en su comentario.
- Contenidos ofensivos, amenazas e insultos no serán permitidos.

Debe saber que los comentarios de los lectores no reflejan necesariamente la opinión del STAFF.