引导而非求解:为大型代码智能体训练小型评论员模型
文章背景与核心概要
编写代码的任务通常具有极高的复杂性,需要模型同时具备从高层架构规划到底层代码实现的多种能力。然而,现有的代码智能体在对所有这些任务进行联合优化时,往往会因为不同能力的最优解不一致而导致高层规划成为主要的性能瓶颈。为了解决这一痛点,本文作者引入了一种专门针对高层规划优化的独立“评论员模型(critic model)”,用于在推理过程中动态引导代码智能体。
通过构建监督微调(SFT)和直接偏好优化(DPO)数据集,该评论员模型学会了识别智能体所犯的错误,并提供简洁、准确的高层方向指导,而不直接生成底层的执行代码。实验表明,经过微调的 4B 和 8B 评论员模型显著提升了六个大型代码智能体在 SWE-Bench Verified 上的任务解决率,并在减少推理步骤的同时降低了每道题目的推理成本。
引导而非求解:为大型代码智能体训练小型评论员模型
元数据
- arXiv ID: 2606.21811v2 [cs.SE]
- 研究领域: 软件工程 (
cs.SE); 人工智能 (cs.AI); 机器学习 (cs.LG) - 作者: Shubham Gandhi, Yiqing Xie, Atharva Naik, Ruichen Zhu, Carolyn Rose
- 提交时间: 2026年6月20日 (最后修订: 2026年9月1日)
- 相关链接: 查看 PDF | HTML 版本 | GitHub 仓库
执行摘要
编码任务本质上非常复杂,需要多种能力,从高级架构规划到低级代码实现。虽然现有的编码智能体针对联合能力进行了训练,但诸如高级规划等单个能力可能会有不同的最优解,并仍然是主要的性能瓶颈。
为了克服这一问题,作者引入了一种专门用于高级规划的专用评论员模型,以便在推理过程中动态引导编码智能体。通过构建监督微调(SFT)和直接偏好优化(DPO)数据集,评论员模型学会了发现智能体的错误,并提供简明、准确的高级指导,而不直接生成低级执行代码。
核心结果: * 性能提升: 微调后的 4B 和 8B 评论员模型显著提升了六个大型编码智能体在 SWE-Bench Verified 上的解决率(例如,将 GLM-4.7-Flash-30B-A3B 和 GPT-OSS-120B 的解决率分别提升了 16.0% 和 14.4%)。 * 成本降低: 通过引导智能体以更少的步骤解决任务,评论员模型降低了每个样本的推理成本(例如,将 GPT-OSS-20B 的成本从 0.07 美元降至 0.03 美元)。
摘要
Coding tasks are typically complicated and require multiple capabilities, ranging from high-level planning to low-level implementation. While coding agents are optimized for the joint capabilities, individual capabilities such as high-level planning may have different optima and remain a major bottleneck. To address this challenge, we train a separate critic model that is specialized in high-level planning to steer the coding agent in inference. We construct SFT and DPO data to train the critic model to identify errors made by the coding agent and provide correct and clear high-level guidance without generating concrete actions. Experiments show that our fine-tuned 4B and 8B critic models significantly improve the performance of 6 larger coding agents (e.g., improving the resolved rates of GLM-4.7-Flash-30B-A3B and GPT-OSS-120B by 16.0% and 14.4% on SWE-Bench Verified). The critic model also reduces the total inference costs for some coding agents by solving tasks in fewer steps (e.g., reducing the per-example inference cost for GPT-OSS-20B from $0.07 to $0.03).
编码任务通常很复杂,需要多种能力,从高级规划到低级实现。虽然编码智能体针对联合能力进行了优化,但诸如高级规划等单个能力可能会有不同的最优解,并仍然是一个主要的性能瓶颈。为了应对这一挑战,我们训练了一个专门从事高级规划的独立评论员模型,以便在推理中引导编码智能体。我们构建了 SFT 和 DPO 数据来训练评论员模型,使其能够识别编码智能体所犯的错误,并提供正确、清晰的高级指导,而不生成具体的行动。实验表明,我们微调的 4B 和 8B 评论员模型显著提高了 6 个大型编码智能体的性能(例如,在 SWE-Bench Verified 上,将 GLM-4.7-Flash-30B-A3B 和 GPT-OSS-120B 的解决率分别提高了 16.0% 和 14.4%)。评论员模型还通过以更少的步骤解决任务,降低了某些编码智能体的总推理成本(例如,将 GPT-OSS-20B 的每个样本推理成本从 0.07 美元降至 0.03 美元)。
附加资源与引用工具
- 数据集与代码: GitHub - shubhamrgandhi/critic-training
- 标识符:
- DOI: 10.48550/arXiv.2606.21811
- 外部索引: Google Scholar | Semantic Scholar | NASA ADS
许可证: 知识共享署名 4.0 国际
