NVIDIA 发布 DSX MaxLPS:动态功率分配让 AI 工厂同功率多装 40% GPU
NVIDIA 技术博客介绍 DSX MaxLPS 技术套件,通过动态功率分配、每瓦性能优化和 45°C 液冷站点设计,在固定功率预算内提升 AI 工厂吞吐量。在 Vera Rubin NVL72 和 GB200 NVL72 系统上验证,可在同一设施 envelope 内实现最多 40% 的额外 GPU 容量,每瓦性能提升 1.3–1.5 倍。
NVIDIA 在技术博客中发布了 DSX MaxLPS(Maximum Land Power Shell),一套芯片、散热、系统和软件技术的组合,目标是在固定功率预算下最大化 AI 工厂吞吐量。NVIDIA 指出,AI 工厂的问题已不再是数据中心能塞下多少 GPU,而是每兆瓦电力能产出多少 AI 输出。
传统静态机架供电按最坏峰值需求预留功率,导致大量电力余量被闲置。NVIDIA 给出的一个代表性功率预算显示,100 MW 电网输入中,约 20 MW 用于设施开销、10 MW 机架损耗、10 MW 因故障重启等运行低效不可用,最终仅约 60 MW 可用于 AI 负载。
核心组件 Dynamic Power Software(DPS,目前处于开发者预览阶段)从电网层到 GPU 建模数据中心拓扑,持续比较分配功率与实际消耗,当某些 GPU 或机架低于预留水平时,将余量动态分配给同组其他设备,站点总功率 envelope 保持不变。
该方案已在 NVIDIA Vera Rubin NVL72 和 GB200 NVL72 系统上验证:降低单机架功率需求,在同一设施 envelope 内可容纳最多 40% 的额外 GPU 容量,每瓦性能提升 1.3–1.5 倍。NVIDIA 说明这些结果取决于优化的基础设施设计、工作负载画像,以及围绕 45°C 液冷的早期站点级配合。
为什么值得关注
在电力成为 AI 基建首要瓶颈的背景下,该方案直接提升单位兆瓦的推理产出,对 AI 数据中心运营方的容量规划和成本结构有实际影响。