Entradas Mensuales

Síguenos en:

Canal Oficial Telegram de elhacker.NET Grupo Facebook elhacker.NET Twitter elhacker.NET Canal Youtube elhacker.NET Comunidad Steam: Grupo elhacker.NET Mastodon

Entradas populares

PostHeaderIcon Fallo grave de Nvidia podría provocar caídas en el monitoreo de GPU de servidores expuestos


Nvidia enfrenta diversos retos, desde el lanzamiento de hardware limitado y problemas de suministro de RAM hasta acusaciones de envíos ilegales a China. Simultáneamente, Microsoft optaría por sus chips en lugar de Intel para nuevas laptops. Por otro lado, se detectó una grave vulnerabilidad en miles de servidores GPU que exponía datos críticos a internet, riesgo que Nvidia ya ha corregido.





Investigadores encontraron miles de servidores de GPU que exponen el DCGM Exporter de Nvidia a Internet, con cientos potencialmente vulnerables a un fallo de alta gravedad que podría permitir que atacantes no autenticados bloqueen el servicio de monitoreo de la GPU e interrumpan las cargas de trabajo de IA.

Los DCGM Exporters leen la telemetría de las GPU de un host, incluyendo su hardware, utilización, uso de memoria, consumo de energía y eventos de error. Cada GPU tiene su propio ID único, o UUID, y todas estas métricas se exponen en texto plano a través de HTTP.

Esta exposición proporciona a los posibles atacantes información detallada útil para el reconocimiento, incluyendo el mapeo de la infraestructura de GPU, la identificación de sistemas potencialmente vulnerables y el monitoreo de la actividad de la carga de trabajo.


Michael Katchinskiy, investigador de la startup de seguridad de centros de datos Lava, encontró y reportó el error en el servicio de monitoreo de salud y rendimiento de la GPU. En septiembre, el gigante de las GPU, Nvidia, lanzó un arreglo para el fallo, rastreado como CVE-2026-47483, y le asignó una calificación de gravedad alta de 8.2 en el CVSS.


“Una vez que nos dimos cuenta de cuánto revelaban estos endpoints, la siguiente pregunta fue: ¿Cuántos de ellos están expuestos a Internet?”, dijo Katchinskiy en un blog el jueves.

Así que los investigadores comenzaron a escanear Internet en busca de DCGM Exporters expuestos. Y la escala de la exposición resultó ser “especialmente significativa”, escribió.

A lo largo de cuatro escaneos entre marzo y mayo, los cazadores de amenazas encontraron alrededor de 2,100 servidores de GPU exponiendo métricas de DCGM Exporter a la Internet abierta. Estos incluían 12,000 UUID de GPU. Ninguno de ellos requería autenticación.

Los hosts pertenecían a unas 300 organizaciones, según Katchinskiy, y casi la mitad —5,274 de las GPU expuestas, o el 44 por ciento del total— se encontraban en los EE. UU.

Estas GPU representaban unos 100 millones de dólares en hardware, e incluían GPU Nvidia Blackwell Ultra B300, H200 y H100 —utilizadas para ejecutar cargas de trabajo de IA a gran escala— además de sistemas RTX 5090 y 4090 de consumo.

Mientras investigaban los sistemas expuestos, el equipo de Lava descubrió que aproximadamente el 25 por ciento de los hosts DCGM expuestos también revelaban datos de la herramienta de perfilado integrada /debug/pprof/ de Go. El perfilador recopila y expone datos de rendimiento en tiempo real, como el uso de CPU y memoria para las aplicaciones Go en ejecución. Esto incluye el uso de CPU, asignaciones de memoria, estados de goroutine y eventos de bloqueo.

“Con suficientes solicitudes concurrentes no autenticadas, el exportador podría quedarse sin memoria y colapsar, cortando la visibilidad de la salud y actividad de la GPU”, escribió Katchinskiy.

La presión sobre la CPU y la memoria también podría afectar las cargas de trabajo de entrenamiento o inferencia de IA.

Nvidia solucionó el problema en la versión 4.8.2, y los operadores deben actualizar a esa versión o una posterior.

Además de la telemetría de la GPU, Lava analizó el Prometheus Node Exporter, que monitorea el hardware del servidor y los sistemas operativos, y también expone métricas a través de HTTP. El equipo encontró 12,096 hosts públicos de Node Exporter que exponían datos sobre modelos de servidor, sistemas operativos, versiones de firmware, nombres de host, rutas de almacenamiento y hardware de red comúnmente utilizados en clústeres de GPU.

Esta información revela cómo están construidos y configurados los entornos, lo que también podría ser utilizado por atacantes para el reconocimiento, relacionando el sistema con vulnerabilidades conocidas.

Los servicios de monitoreo expuestos públicamente afectaron la infraestructura de clientes en proveedores de neocloud y nube de GPU, incluyendo Nebius, Voltage Park, Lambda, Northern Data y DigitalOcean. Lava informó todo esto a los proveedores afectados, y Katchinskiy afirma que estos proveedores trabajaron con los clientes para solucionar las exposiciones.

Para los operadores: la firma de seguridad indica que los servicios de Nvidia DCGM Exporter, Node Exporter y Prometheus no deben ser accesibles directamente desde la Internet pública y recomienda restringirlos a una infraestructura de monitoreo autorizada.

“Los hallazgos resaltan una brecha de seguridad creciente en la infraestructura de IA: las empresas gastan millones en GPUs mientras dejan sistemas críticos expuestos”, escribió Katchinskiy. “Esas exposiciones pueden revelar cómo se construyen los entornos de IA y, en algunos casos, permitir que los atacantes los interrumpan”.

Fuente:
TheRegister

0 comments :

Publicar un comentario

Los comentarios pueden ser revisados en cualquier momento por los moderadores.

Serán publicados aquellos que cumplan las siguientes condiciones:
- Comentario acorde al contenido del post.
- Prohibido mensajes de tipo SPAM.
- Evite incluir links innecesarios en su comentario.
- Contenidos ofensivos, amenazas e insultos no serán permitidos.

Debe saber que los comentarios de los lectores no reflejan necesariamente la opinión del STAFF.