如何稳定且高效地训练评判模型(Critic)
文章背景与核心概要
在大语言模型的强化学习训练中,基于群组的方法(如GRPO)通过为每个提示词采样多个响应,从而绕过了对传统评判模型(Critic)的需求。尽管理论上一个可靠的评判模型可以通过单个响应估算出token级别的优势函数,但标准的训练方法往往表现出极大的不稳定性,难以收敛。
本文深入研究了这些不稳定性产生的根源,并正式推出了最佳实践评判模型优化(Best-Practice Critic Optimization, BPCO),这是一种结合了多种稳定训练策略的鲁棒训练方案,包括DPPO、将价值预测约束在奖励范围内、蒙特卡洛价值目标、未归一化的策略优势以及长度自适应的广义优势估计。由于评判模型仅在训练阶段使用,BPCO允许其利用对策略模型不可见的奖励定义信息(如参考答案或评分标准)。在涵盖15亿参数到30B-A3B混合专家(MoE)模型的各项数学推理任务中,BPCO不仅在仅需为每个提示采样单个响应的情况下始终超越强力的Critic基线,还能匹配甚至超越基于群组的基线方法。
📌 摘要 / Summary
Group-based reinforcement learning methods (such as GRPO for large language models) bypass the need for a critic by sampling multiple responses for each prompt. While a reliable critic could theoretically estimate token-level advantages from a single response, standard training recipes tend to be unstable.
群组基基础的强化学习方法(例如用于大语言模型的 GRPO)通过为每个提示采样多个响应,避免了对评判模型(Critic)的需求。虽然理论上可靠的评判模型可以从单个响应中估计出 Token 级别的优势,但标准的训练配方往往是不稳定的。
This paper investigates these instabilities and introduces Best-Practice Critic Optimization (BPCO), a robust training recipe combining: * DPPO * Value predictions bounded to the reward range * Monte Carlo value targets * Unnormalized policy advantages * Length-adaptive generalized advantage estimation
本文研究了这些不稳定性,并引入了最佳实践评判模型优化(Best-Practice Critic Optimization, BPCO),这是一种结合了以下技术的稳健训练配方: * DPPO * 限制在奖励范围内的价值预测 * 蒙特卡洛价值目标 * 未归一化的策略优势 * 长度自适应的广义优势估计
Because the critic is exclusively used during training, BPCO can condition it on reward-defining information (like reference answers or grading rubrics) that remain hidden from the policy. Across various mathematical reasoning tasks—ranging from 1.5B parameters to 30B-A3B mixtures of experts—BPCO consistently outperforms strong critic-based baselines and matches or exceeds group-based baselines while sampling only a single response per prompt.
由于评判模型仅在训练期间使用,BPCO 可以让其条件化依赖于对策略模型保持隐藏的、定义奖励的信息(例如参考答案或评分标准)。在各种数学推理任务中(从 1.5B 参数到 30B-A3B 混合专家模型),BPCO 在每个提示仅采样一个响应的同时,始终优于强大的基于 Critic 的基线,并且达到或超过了基于群组的基线。
🔗 链接与资源 / Links & Resources
- Paper: View PDF | arXiv HTML
- Code Repository: GitHub - QPHutu/golden_critic
- DOI: 10.48550/arXiv.2608.23566