跳转至

并行与分布式推理语言模型的性能基础

文章背景与核心概要

随着带有可验证奖励的强化学习(RLVR)等后训练范式的最新进展(如 DeepSeek-R1、o3 和 Kimi k1.5 模型所示),大语言模型(LLM)在思维链推理、长视距规划和自我纠错能力方面得到了显著提升。然而,这种计算密集型的方法需要数百万 GPU 小时以及多模型流水线,对现代硬件造成了巨大压力,这也使得推理语言模型(RLM)的训练成为一项严峻的并行与分布式系统挑战。

本文系统化了“面向大模型的强化学习”(RL-for-LLM)范式,主要贡献包括:1. 对主流后训练框架(如 PPO、GRPO 及其变体)进行了以计算为中心的分析;2. 运用并行计算的工作-深度(work-depth)模型,引入了模型内和模型间并行策略的严谨分类法(涵盖传统技术以及诸如分离式部署、阶段融合、混合并行和异步执行等新方法);3. 提炼出实践指南并指出了未来的开放研究方向,以帮助构建可扩展、高效且具成本效益的推理语言模型。


Metadata & Publication Details

  • arXiv ID: arXiv:2608.27046 [cs.LG]
  • Subjects: Machine Learning (cs.LG); Artificial Intelligence (cs.AI); Distributed, Parallel, and Cluster Computing (cs.DC); Performance (cs.PF)
  • Submission Date: 27 August 2026
  • DOI: 10.48550/arXiv.2608.27046
  • Authors:
  • Maciej Besta
  • Leonard Schmidt
  • Lara Nonino
  • Robert Gerstenberger
  • Pierre Pang
  • Patrik Okanovic
  • Ales Kubicek
  • Tiancheng Chen
  • Baraq Lipshitz
  • Torsten Hoefler

Metadata & Publication Details

  • arXiv ID: arXiv:2608.27046 [cs.LG]
  • Subjects: Machine Learning (cs.LG); Artificial Intelligence (cs.AI); Distributed, Parallel, and Cluster Computing (cs.DC); Performance (cs.PF)
  • Submission Date: 27 August 2026
  • DOI: 10.48550/arXiv.2608.27046
  • Authors:
  • Maciej Besta
  • Leonard Schmidt
  • Lara Nonino
  • Robert Gerstenberger
  • Pierre Pang
  • Patrik Okanovic
  • Ales Kubicek
  • Tiancheng Chen
  • Baraq Lipshitz
  • Torsten Hoefler