跳转至

文章背景与核心概要

为了提升大语言模型(LLM)解决实际软件工程问题的能力,研究人员通常依赖于大规模智能体轨迹数据集进行监督微调(SFT)。然而,任务的成功并不等同于高质量的监督数据:成功的轨迹往往包含无效、冗余甚至有风险的步骤。直接使用这些未经提炼的路径进行微调,可能会引入噪声,并导致模型习得不良的问题解决习惯。

为了解决这一问题,作者提出了 SWE-Prime,这是一种多粒度、两阶段的 SFT 数据筛选方法,旨在从轨迹和片段两个层面逐步过滤训练数据。该方法通过轨迹级筛选(评估过程质量、结果质量和代表性)和片段级选择(评估步骤贡献度、可学习性和风险),仅保留高质量的解题路径进行损失计算。

实验结果表明,在 SWE-Bench ProSWE-Bench Verified 上,仅使用通过 SWE-Prime 筛选出的 10% 轨迹子集进行训练,其性能显著优于使用完整数据集训练的模型,相对性能提升分别高达 12.2% 和 24.2%


SWE-Prime:更少的轨迹,更优的性能

摘要

To enhance Large Language Models' (LLMs) capabilities in resolving real-world software engineering issues, researchers typically rely on supervised fine-tuning (SFT) using large-scale agent trajectory datasets. However, task success does not inherently guarantee high-quality supervision: successful trajectories often include ineffective, redundant, or risky steps. Utilizing these unrefined paths for SFT can inject noise and teach models undesirable problem-solving habits.

为了提升大语言模型(LLM)解决实际软件工程问题的能力,研究人员通常依赖于大规模智能体轨迹数据集进行监督微调(SFT)。然而,任务的成功并不等同于高质量的监督数据:成功的轨迹往往包含无效、冗余甚至有风险的步骤。直接使用这些未经提炼的路径进行微调,可能会引入噪声,并导致模型习得不良的问题解决习惯。

To overcome this, the authors propose SWE-Prime, a multi-granularity, two-stage SFT data selection method designed to filter training data progressively at both the trajectory and segment levels: 1. Trajectory-Level Screening: Filters based on process quality, result quality, and data representativeness to isolate a superior subset of successful trajectories. 2. Segment-Level Selection: Groups consecutive steps into semantic segments, assessing them by their contribution to the final solution, learnability, and potential risks. During SFT, all segments remain in sequence to preserve context, but only the selected segments contribute to the loss computation.

为了克服这一问题,作者提出了 SWE-Prime,这是一种多粒度、两阶段的 SFT 数据筛选方法,旨在从轨迹和片段两个层面逐步过滤训练数据: 1. 轨迹级筛选: 基于过程质量、结果质量和数据代表性进行过滤,以分离出一组更优的成功轨迹子集。 2. 片段级选择: 将连续步骤分组为语义片段,通过它们对最终解决方案的贡献、可学习性以及潜在风险进行评估。在 SFT 过程中,所有片段保持顺序以保留上下文,但仅有被选中的片段参与损失计算。

Experiments on SWE-Bench Pro and SWE-Bench Verified demonstrate that training models on just a 10% trajectory subset selected via SWE-Prime significantly outperforms training on the full resolved dataset, delivering relative performance gains of up to 12.2% and 24.2%, respectively.

SWE-Bench ProSWE-Bench Verified 上的实验表明,仅使用通过 SWE-Prime 筛选出的 10% 轨迹子集进行训练,其性能显著优于使用完整数据集训练的模型,相对性能提升分别高达 12.2% 和 24.2%


元数据与文档信息

字段 详情
arXiv 标识符 arXiv:2608.27449 [cs.SE]
主要学科 软件工程 (cs.SE)
次要学科 人工智能 (cs.AI), 计算与语言 (cs.CL)
提交日期 2026年8月27日
作者 Dewu Zheng, Ruizhe Ye, Yanlin Wang, Yang Ye, Hongyu Zhang, Ensheng Shi, Xilin Liu, Yuchi Ma, Jianxing Yu, Zibin Zheng
篇幅 9 页,5 张图表
DOI 10.48550/arXiv.2608.27449

访问链接与资源

外部引用与工具