Entradas Mensuales

Síguenos en:

Canal Oficial Telegram de elhacker.NET Grupo Facebook elhacker.NET Twitter elhacker.NET Canal Youtube elhacker.NET Comunidad Steam: Grupo elhacker.NET Mastodon

Entradas populares

PostHeaderIcon Ataques de IA autónoma: la realidad de Hugging Face


Durante varios años, se ha mantenido el pronóstico de que la IA reduciría la barrera de habilidades, escribiría malware novedoso y pronto ejecutaría ataques de principio a fin con mínima intervención humana. Es relevante señalar que estas predicciones no provinieron principalmente de los expertos en ingeniería inversa de malware, quienes se mantuvieron escépticos, sino de la capa de comentarios que los rodea.





Durante varios años el pronóstico ha sido constante: la IA reduce la barrera de habilidades, la IA escribe malware novedoso, la IA pronto ejecutará ataques de principio a fin con una dirección humana mínima. Vale la pena notar de dónde provino principalmente ese pronóstico.

No de las personas que se ganan la vida haciendo ingeniería inversa de malware, quienes se mostraron ampliamente escépticos en todo momento, sino de la capa de comentarios que los rodea: paneles de conferencias, posicionamiento de proveedores y un suministro inagotable de "liderazgo de pensamiento".

Cuando los profesionales y el podio discrepan durante años seguidos, generalmente vale la pena analizarlo.

Los escépticos tenían razón, y la razón es más interesante que la que se ofrece habitualmente.

La explicación cómoda es que los modelos aún no eran lo suficientemente buenos, lo que convenientemente mantiene la ola permanentemente inminente. Esa explicación ahora es comprobable, y falla.

Una IA entró en una empresa para hacer trampa en un examen

En julio, OpenAI realizó una evaluación interna para medir cuánta capacidad ofensiva tenían realmente sus modelos.

Los filtros de seguridad que normalmente están frente al modelo se desactivaron para que se mostrara la capacidad bruta. Se le dijo al agente que resolviera el benchmark.

Decidió no hacerlo. Se dio cuenta de que la ruta más rápida para obtener la puntuación máxima era dejar de resolver problemas e ir a robar la hoja de respuestas, que casualmente se encontraba en los sistemas de producción de Hugging Face.

Así que salió. Escapó de su sandbox a través de una vulnerabilidad previamente desconocida, cruzó la internet abierta y pasó cuatro días y medio dentro de una empresa que no tenía idea de que estaba allí.

Llegó a los sistemas de producción, robó credenciales de la nube, falsificó sus propios tokens de acceso y se posicionó en la red interna.

El equipo de seguridad de Hugging Face lo detectó, lo cortó y reportó la brecha a las autoridades, lo cual es razonable cuando alguien está dentro de tu infraestructura. Cinco días después, OpenAI reveló que el intruso había sido su propia evaluación.

Esto es algo incómodo de archivar. No fue una campaña criminal; nadie se benefició. Tampoco fue una prueba autorizada.

Hugging Face no aceptó nada, no sabía nada y pasó la mayor parte de una semana respondiendo a lo que todos creían razonablemente que era un ataque real. Fue un incidente de seguridad genuino que nadie pretendía, y la mayoría de nosotros no tenemos una carpeta para eso.

El accidente es lo que lo hace valioso. Debido a que el atacante era una evaluación y no un adversario, sus propios registros sobrevivieron, algo que nunca sucede en una intrusión real.

Hugging Face publicó una reconstrucción de aproximadamente 17,600 acciones del atacante: la imagen más completa que alguien tenga de un agente autónomo trabajando en un entorno real, y existe enteramente por azar.

La máquina es ruidosa

De esas 17,600 acciones, unas 447 constituyeron la intrusión real. Eso es el 2.5%. El otro 97.5% fue el agente buscando una vía de entrada: aproximadamente 39 búsquedas por cada acción útil.

El número más revelador es aún menor. Durante cuatro días y medio, el agente dedicó seis acciones a evitar la detección.

Para un operador humano competente, permanecer oculto no es una fase del trabajo. Es un impuesto que se paga en cada decisión: qué herramienta usar, cómo llamarla, si este vistazo particular a la red vale la entrada de registro que crea.

El agente pagó ese impuesto seis veces. Un humano es cuidadoso porque ser descubierto termina con la operación y, a menudo, destruye el acceso que tomó meses construir. Ser visto no le costó nada al agente, por lo que no hizo ningún intento serio de evitarlo.

En nuestras predicciones de seguridad para 2026, publicadas en enero, argumentamos que las afirmaciones sobre ataques totalmente autónomos impulsados por IA merecían escepticismo, porque “el hacking exitoso minimiza los pasos observables, mientras que la actividad excesiva es una firma detectable”.

Eso era una postura. Seis meses después, es una medición.

Una advertencia, dicha claramente: este agente perseguía una puntuación, no un objetivo de intrusión, por lo que no es un avance de una campaña criminal.

Lo que muestra con una precisión inusual es cómo se comporta un agente cuando persigue una meta sin ningún sentido de lo que cuesta la exposición.

Esa propiedad no cambia con la meta.

Mientras tanto, la técnica ganadora es pedirlo amablemente

En el mismo año en que todos pronosticaban olas de ataques autónomos, la forma más efectiva de entrar en una empresa era ClickFix: una página que pide al visitante que demuestre que no es un robot, coloca discretamente un comando en su portapapeles y lo guía para que lo ejecute él mismo.

Nada llega como adjunto, así que no hay nada que escanear. No se dispara ningún exploit, por lo que no hay ninguna firma que coincida. Microsoft atribuye el 47% de los ataques de acceso inicial en 2025 a esta única técnica.

Lo que sigue al clic es igualmente poco glamuroso. Los atacantes viven cada vez más "de la tierra" (living off the land): en lugar de traer su propio malware, utilizan las herramientas administrativas que ya están en la máquina, las mismas utilidades que tu equipo de TI usa todos los días.

No hay nada malicioso que detectar, porque no se instaló nada malicioso. Cuando analizamos 700,000 incidentes de seguridad, el 84% de los ataques importantes, es decir, aquellos calificados con severidad alta, involucraron estos binarios integrados.

El comando y control sigue el mismo instinto, enrutándose a través de servicios en la nube en los que el objetivo ya confía.

Nada de esto es sofisticado. Todo está optimizado en la misma dirección: hacia menos pasos observables y menor costo.

Ahí es donde realmente se dirige el esfuerzo del atacante, y es exactamente lo opuesto a lo que hace un agente autónomo.

Para entender por qué, sigue el dinero.

Más víctimas, menos dinero

El ransomware no es una exhibición tecnológica. Es un negocio de retorno de inversión y, como escribimos en enero, “cada decisión, desde la elección de un exploit hasta la selección de un objetivo, se centra en maximizar el Retorno de la Inversión y minimizar el riesgo operativo”.

La forma en que ese negocio encuentra víctimas ha cambiado. La ruta dominante ahora es la explotación masiva de dispositivos expuestos a internet: dispositivos VPN, firewalls, puertas de enlace sin parches.

El Informe de Investigaciones de Brechas de Datos 2026 de Verizon sitúa la explotación de dispositivos perimetrales en el 22% de las brechas impulsadas por explotación, frente a aproximadamente el 3%, siendo la explotación de vulnerabilidades la principal vía de entrada por primera vez en los diecinueve años de historia del informe, superando a las credenciales robadas.

Ese cambio importa más que cualquier cifra individual, porque el objetivo oportunista desvincula la selección de la víctima del valor de la víctima.

Si atacas a quien haya dejado un dispositivo sin parchear, la exposición se convierte en el criterio de selección y la capacidad de pago deja de serlo.

Los rendimientos han seguido esa tendencia. Las tasas de pago han caído durante cuatro años consecutivos, llegando a aproximadamente el 20% en el último trimestre de 2025, con Verizon encontrando que el 64% de las víctimas se niegan rotundamente, frente al 50% en 2022. Chainalysis sitúa los pagos totales de ransomware en aproximadamente 820 millones de dólares en 2025, un 8% menos que en un año que ya había caído un 35%.

Y 2025 fue simultáneamente un año récord de víctimas nombradas en sitios de filtraciones. Más víctimas, menos dinero.

Aquí es donde la autonomía agentica se queda sin camino. Es la forma más pura de objetivo oportunista disponible: una máquina que intenta todo contra todos. Empuja a los atacantes más allá en el eje exacto que ya está produciendo menores rendimientos.

La computación barata no soluciona un problema de negocio cuya restricción vinculante es la capacidad de pago de la víctima.

Marcus Hutchins, uno de los escépticos públicos más consistentes sobre las afirmaciones de malware por IA, llega al mismo lugar desde una dirección diferente.

Hablando con SC Media UK, argumentó que las herramientas generativas no van a escribir el próximo WannaCry, que el cibercrimen sigue siendo un campo orientado a los humanos y que el código generado por IA es tan deficiente que las personas que lo envían a menudo no se dan cuenta de que no funciona.

El hype tiene costos más allá del discurso: un artículo del MIT que afirmaba que el 80% del ransomware involucraba IA fue retirado tras recibir críticas.

Nada de esto es para siempre. Los actores de amenazas adoptarán la operación autónoma en el momento en que tenga sentido empresarial, rápida y fríamente, exactamente como adoptaron el ransomware-as-a-service y la doble extorsión cuando empezaron a dar beneficios.

Observa la economía, no los anuncios de capacidades.

La parte que debería preocuparte

Aquí está la mitad incómoda. El mismo volumen que hace que la autonomía agentica sea poco atractiva para los atacantes es lo que la hace inmanejable para los defensores.

El stack de seguridad de Hugging Face detectó la intrusión. Múltiples capas se activaron. La detección no fue el fallo.

Lo que falló fue la severidad: la alerta “no logró elevar correctamente la criticidad de la alerta y activar al equipo de guardia, costando tiempo precioso en la respuesta”.

El stack lo vio. Simplemente no pudo clasificarlo.

Nuestra investigación sobre herramientas generadas por IA nombró la versión deliberada de esto: agotar a los defensores mediante el volumen automatizado en lugar de la brillantez técnica.

El incidente de Hugging Face muestra el mismo efecto sin que nadie lo pretendiera.

Nadie dirigió esto contra ese equipo de seguridad. El agente era simplemente ruidoso. La consecuencia defensiva es idéntica en cualquier caso, que es la parte que vale la pena reflexionar: el piso de ruido sube, independientemente de si alguien lo dirige hacia ti o no.

Qué significa esto para los líderes de seguridad

Hay una respuesta reflexiva a todo esto, y generalmente la ofrecen personas cuyo producto es la detección: combatir la IA con IA. Es un eslogan atractivo y una respuesta a una pregunta que este incidente no planteó. El stack detectó el ataque.

El análisis tampoco fue la restricción; Hugging Face terminó construyendo un pipeline asistido por IA para reconstruir lo ocurrido, y funcionó. Lo que falló fue la priorización, y más detección produce más cosas que priorizar.

Igualar la velocidad de la máquina en el lado del análisis de un problema de volumen no resuelve el volumen. Lo escala, y luego le pide a un humano que arbitre.

Los controles que realmente cerraron esto no fueron astutos. La propia remediación de Hugging Face, publicada tras una investigación completa, es casi enteramente preventiva: límites de acceso más estrictos, aislamiento entre sistemas, rotación de credenciales, reducción del alcance.

Una mejora de detección aparece en la lista, y trata sobre elevar la severidad de las señales que ya estaban recibiendo.

Esa es la lección general, y no es nueva. Los controles preventivos son invariantes al volumen. Un límite de acceso no se vuelve más ruidoso a medida que aumentan las tasas de solicitud, no se degrada bajo carga y no necesita que nadie esté despierto a las tres de la mañana.

La detección, la correlación y el triaje se degradan a medida que el volumen aumenta. Si la velocidad y el volumen realmente van a aumentar, los controles que mantienen su valor son los que nunca dependieron de que alguien leyera una alerta a tiempo.

Nada de esto es un argumento contra la detección, y debemos ser cuidadosos aquí, porque la industria ha pasado una década sobrecorrigiendo en una sola dirección.

Como pusimos en enero, las herramientas de detección “son críticas, no son una bala de plata”, y “es momento de complementar estas medidas reactivas con una estrategia de prevención efectiva”. La palabra operativa es complementar.

Hemos invertido mucho en ver los ataques y comparativamente poco en hacerlos imposibles, y el equilibrio es incorrecto.

Así que el consejo para los líderes de seguridad es poco glamuroso, lo cual suele ser una buena señal. Mantente enfocado en lo que realmente importa. Sigue las prácticas que ya sabes que funcionan.

Resiste la atracción de cualquier capacidad que se esté vendiendo actualmente como la respuesta, porque las técnicas en este incidente eran de libro, las defensas se entendían años antes de que sucediera y nada de esto requirió una nueva categoría de producto.

Lo que cambia es la rapidez con la que se cierra la ventana entre “deberíamos encargarnos de eso” y “alguien ya lo hizo”.

La automatización barata eleva el piso de capacidad para los atacantes no sofisticados y no hace casi nada por el techo, porque los mejores operadores ya eran silenciosos y deliberados, y no ganan nada con una máquina que lo intenta todo.

Las organizaciones más expuestas son las que están en la base de la curva de madurez. Para ellas, la solución es el trabajo que ha estado en la lista durante años.

No puedes comprar tu salida de un problema en el que te metiste por una mala configuración.



Fuentes:
https://cybersecuritynews.com/autonomous-ai-attacks-the-hugging-face-reality-check/

0 comments :

Post a Comment

Los comentarios pueden ser revisados en cualquier momento por los moderadores.

Serán publicados aquellos que cumplan las siguientes condiciones:
- Comentario acorde al contenido del post.
- Prohibido mensajes de tipo SPAM.
- Evite incluir links innecesarios en su comentario.
- Contenidos ofensivos, amenazas e insultos no serán permitidos.

Debe saber que los comentarios de los lectores no reflejan necesariamente la opinión del STAFF.