Les moniteurs GPU Nvidia exposés peuvent révéler les secrets de l’infrastructure de l’IA

Lucas Morel

if ( !emtpy($headline_subheadline ) ) : ?>

Des milliers d’instances DCGM Exporter exposées fuient la télémétrie GPU, et certaines exposent également des points de terminaison de profilage qui pourraient permettre à des attaquants non authentifiés de faire planter le service.

endif; ?>

Un composant du logiciel de surveillance GPU de Nvidia que les entreprises utilisent pour garder un œil sur leur infrastructure de formation et d’inférence en IA est vulnérable aux attaques par déni de service (DoS) et à la divulgation d’informations.

L’exportateur Nvidia DCGM contient une vulnérabilité d’épuisement des ressources non authentifiée qui pourrait permettre à des attaquants distants de faire planter le service de surveillance et potentiellement perturber les charges de travail d’IA exécutées sur le même hôte.

Nvidia a publié un correctif pour la faille en mai lorsque les chercheurs de Lava Security ont découvert des milliers d’instances DCGM Exporter accessibles depuis Internet, dont environ un quart exposaient les points de terminaison de profilage associés à la vulnérabilité.

« Au cours de nos recherches, nous avons trouvé plus de 2 000 serveurs GPU exposant Nvidia DCGM Exporter directement à l’Internet public sans authentification », a déclaré Michael Katchinskiy, chercheur à Lava, dans un article de blog. « Sur quatre analyses, ces serveurs ont signalé plus de 12 000 GPU uniques, représentant un matériel estimé à 100 millions de dollars. »

DCGM Exporter est un agent de télémétrie que Nvidia utilise pour collecter les métriques des GPU Nvidia et les mettre à la disposition des systèmes de surveillance tels que Prometheus. Lava avait signalé la faille à Nvidia, qui lui avait attribué CVE-2026-47483 avec un indice de gravité élevé de CVSS 8.2.

Les points de terminaison de profilage exposés ont entraîné des plantages de surveillance

Le problème réside dans la manière dont un exportateur DCGM non corrigé gère les requêtes simultanées et non authentifiées adressées à ses points de terminaison de profilage « /debug/pprof/ ». Un grand nombre de demandes de profilage simultanées peuvent entraîner une consommation de mémoire suffisamment élevée pour épuiser les ressources et faire planter l’exportateur.

Lorsqu’ils sont accessibles au public sans authentification, ces points de terminaison peuvent en révéler beaucoup sur l’infrastructure informatique d’une organisation, explique Lava. Les systèmes exposés comprenaient les GPU Nvidia Blackwell Ultra B300, les H200 et H100 utilisés pour les charges de travail d’IA à grande échelle, ainsi que les systèmes RTX 5090 et 4090 grand public.

« Quiconque pouvait atteindre ces points finaux pouvait voir quel matériel les organisations utilisaient, à quel point il était utilisé et des détails sur l’infrastructure d’IA qui l’entoure », a prévenu Katchinskiy. Bien que ces informations ne donnent pas accès aux pondérations des modèles, aux données d’entraînement ou à d’autres actifs protégés, elles peuvent aider un attaquant à profiler une cible et à identifier les composants ou les versions logicielles les plus faibles.

Lava a recommandé de restreindre l’accès public à DCGM Exporter et Prometheus sauf si un accès externe est nécessaire, de lier les exportateurs à des interfaces de bouclage ou privées et d’appliquer des contrôles d’accès via des pare-feu, des groupes de sécurité ou d’autres mesures réseau.

Ces étapes doivent suivre la mise à niveau vers la version 4.8.2 ou ultérieure et la vérification que l’option « –enable-pprof » est désactivée. Katchinskiy a noté que cette fonctionnalité de profilage peut être activée par défaut dans les logiciels non corrigés.

Intelligence artificielleVulnérabilitésSécurité