跳转至

用强化学习削减AI数据中心能耗:从单GPU到整个集群的LLM训练实测功耗控制

文章背景与核心概要

现代人工智能的发展严重依赖于强化学习后训练,然而标准的数据中心电源管理却对工作负载“盲目”,长期依赖静态上限和被动节流,无差别地拖慢硬件运行速度。这种粗放式的管理方式在面对大语言模型(LLM)训练时,往往会导致能源的大量浪费以及算力效率的低下。

本文深入研究了利用强化学习(RL)对大语言模型(LLM)训练进行细粒度功耗控制的方法。作者在1到4张NVIDIA A100 GPU上,针对7B、14B和72B参数规模,通过半秒级的功耗遥测对GRPO(群组相对策略优化)训练进行了仪器化测试(累计收集了超过38,000个样本),并训练了一个PPO元控制器,用于根据测得的功耗约束自适应调整工作负载生成参数。

实验结果表明,在单GPU/小规模测试中,与完整的500步7B模型轨迹相比,元控制器将功耗超标违规减少了 89.8%,Token输出增加了 18.1%,能效提升了 26.2%(以每MWh输出的Token数衡量)。在72B大规模模型的集群实测中,通过将执行器转向“生成并发度”,控制器成功保持了10%–22%的功耗控制权限。在16-GPU集群上运行72B rollout生成工作负载时,重建后的控制器比静态安全基线实现了 多出35.7%的产出(违规率仅为2.27%),比不受控操作 减少了87.2%的违规。这一突破为数据中心的安全铭牌超额订阅(约2倍)铺平了道路。


核心发现与方法论 / Key Findings & Methodology

1. 仪器化与数据收集 / 1. Instrumentation and Data Collection

  • 工作负载特征分析: 评估了7B、14B和72B模型规模下的GRPO训练动态。
  • 遥测技术: 收集了高频(0.5秒分辨率)功耗遥测数据,产生了超过380,000个数据样本,以理解LLM训练常规中的真实功耗峰值和瞬态行为。
  • Workload Characterization: Evaluated GRPO training dynamics across 7B, 14B, and 72B model scales.
  • Telemetry: Gathered high-frequency (0.5s resolution) power telemetry yielding >380,000 data samples to understand real-world power spikes and transient behavior during LLM training routines.

2. PPO元控制器性能(7B规模) / 2. PPO Meta-Controller Performance (7B Scale)

  • 功耗超标违规: 减少了 89.8%
  • 吞吐量: Token输出增加了 18.1%
  • 能效: 相比静态阈值机制,提升了 26.2%(Tokens/MWh)。
  • Power-Limit Violations: Cut by 89.8%.
  • Throughput: Token output increased by 18.1%.
  • Energy Efficiency: Improved by 26.2% (tokens/MWh) compared to static threshold mechanisms.

3. 克服72B规模的扩展挑战 / 3. Overcoming Scaling Challenges at 72B

  • 分片瓶颈: 由于控制权限的丧失,在模型分片下天真地应用群组大小执行器宣告失败。
  • 占用率与容量原则: 调整生成成功恢复了功耗控制权限(17–22%)。
  • 集群部署: 在16-GPU集群上运行的修正版控制器展示出:
  • 与静态基线相比,产出高出35.7%
  • 相比不受约束的操作,违规率降低了87.2%
  • 在30秒或更长的测量窗口内实现零违规,为安全的数据中心铭牌超额订阅(约2倍)铺平了道路。
  • The Sharding Bottleneck: Naively applying group-size actuators failed under model sharding due to a loss of control authority.
  • The Occupancy-versus-Volume Principle: Adjusting generation concurrency successfully restored power authority (17–22%).
  • Fleet Rollout: A revised controller operating on a 16-GPU fleet demonstrated:
  • 35.7% higher output over static baselines.
  • 87.2% fewer violations than unconstrained operations.
  • Zero violations over measurement windows of 30 seconds or longer, paving the way for safe datacenter nameplate oversubscription (approx. 2×).