数千台GPU服务器正暴露在公共互联网上,且在未设置密码等基础防护的情况下,广播着高价值加速器的详细遥测数据。其中潜伏的一个高危漏洞,允许任何访问者直接崩溃旨在监控这些昂贵芯片的服务。

数据中心安全初创公司Lava的研究员Michael Katchinskiy在扫描暴露的监控服务时发现了这一漏洞,并向英伟达报告。英伟达将其编号为CVE-2026-47483,CVSS评分为8.2分。目前,修复补丁已于9月发布。

亿元级算力资产“裸奔”

此次暴露事件折射出更广泛的安全隐患。今年3月至5月,Lava进行的四次全网扫描发现,约2,100个运行英伟达DCGM Exporter的主机泄露了超过12,000个唯一的GPU UUID,且均未要求身份验证。这些主机归属于约300家组织,近半数GPU(约5,274台,占比44%)位于美国境内。Lava估计,这些硬件的市场价值超过1亿美元。

暴露的机器配置混杂,既包括H100、H200和Blackwell Ultra B300等数据中心主力机型,也包含RTX 4090和5090等消费级显卡。这些主机分布在Nebius、Voltage Park、Lambda、Northern Data和DigitalOcean等Neocloud及GPU云提供商中。

监控失明引发的连锁反应

DCGM Exporter负责从英伟达数据中心GPU管理器提取指标,并格式化为Prometheus可识别的数据。运维人员依赖这些数据跟踪集群的利用率、温度、内存消耗和错误情况。该漏洞存在于Exporter的/debug/pprof端点,这些性能分析接口接受未经身份验证的请求。一旦遭遇大量并发请求,服务会因资源耗尽而崩溃,切断对GPU健康和活动状态的监控。

这种崩溃不仅让操作员“失明”,还会波及共置的人工智能工作负载。共享同一服务器的训练或推理作业可能变慢或停滞,而底层GPU仍在计算。对于时效性强的推理服务或大规模训练集群,这种长达数分钟甚至数小时的监控盲区至关重要。

此外,Lava还发现12,096个Prometheus Node Exporter主机通过明文HTTP暴露指标,泄露服务器型号、操作系统版本、固件及网络硬件详情。这些数据有助于攻击者绘制环境地图,并将主机与已知弱点匹配。

便利性牺牲了安全性

英伟达已在DCGM Exporter 4.8.2版本中修复该问题,并将相关DCGM组件更新至4.5.3版。然而,仅打补丁无法解决根本问题。许多服务仍可从互联网任意位置访问,防火墙、网络分段或身份验证层才是真正的防御手段。

行业观察人士指出,遥测服务本应位于严格的访问控制之后,但在实践中,便利性往往胜出。云提供商为简化客户仪表板有时暴露指标,内部团队在测试后忘记关闭端口,形成了隐蔽但广泛的攻击面。

Lava演示了资源耗尽攻击:重复的性能分析请求导致内存使用率飙升,直至Exporter进程终止。尽管底层工作负载仍在继续,但团队无法对看不见的问题做出反应。建议运营商立即升级至DCGM Exporter 4.8.2或更高版本,将监控服务置于身份验证之后,限制网络访问仅限于受信任IP,并在生产环境中避免暴露/debug端点。

这一事件揭示了基础设施扩展速度与安全习惯跟进缓慢之间的差距。随着AI算力需求激增,监控堆栈的安全纪律必须与高昂的硬件成本相匹配。除非改变让遥测数据保持开放的普遍习惯,否则类似的发现将继续出现,AI操作员也将持续付出代价。