文章背景与核心概要
当前的推理时大语言模型(LLM)解码方法通常会探索多个候选轨迹,但它们将每个轨迹视为不可分割的原子单元——要么整体保留,要么全部丢弃。这种做法在处理那些具有高质量前缀但后缀质量退化的“部分有前景”的候选轨迹时,会浪费大量的计算资源。
为了解决这一效率低下问题,本文作者推出了选择性再生解码(Selective Regenerative Decoding, SRD)。SRD 能够执行轨迹级干预,将候选轨迹路由至丢弃、保留,或者仅对后缀中质量退化的部分进行选择性精炼,同时保留有用的前缀——整个过程无需更大的目标模型。在温和的假设下,SRD 在样本效率上比拒绝采样实现了可证明的 1.28 至 1.36 倍增益,且具有更高的期望轨迹质量,并且这种增益会随着候选池的扩大而增加。
选择性再生解码:轨迹级干预的推理时推理
作者: Sophia Xiao Pu, Yumo Xu, Sailik Sengupta, Millennium Bismay, Ruixue Lian, James Gung, Yi-an Lai, Arshit Gupta
提交时间: 2026年8月25日(提交至 ARR)
研究领域: 人工智能(cs.AI)
arXiv: 2608.24338 [cs.AI] | DOI: 10.48550/arXiv.2608.24338
📌 摘要 (Summary)
当前大语言模型(LLM)的推理时解码方法通过探索多个候选轨迹来提升推理能力,但它们将每个轨迹视为原子单元:要么整体保留,要么不可逆地丢弃。这导致计算资源被浪费在那些“部分有前景”的候选轨迹上——它们的高质量前缀与退化的后缀一同被抛弃。为此,我们引入了选择性再生解码(SRD),它将每个候选轨迹路由至丢弃、保留,或仅对边缘候选轨迹的退化后缀部分进行精炼,同时保留其有用的前缀,且无需更大的目标模型。在温和的假设下,SRD 在样本效率上比拒绝采样实现了可证明的 1.28 至 1.36 倍提升,并具有严格更高的期望轨迹质量,且随着候选池的扩大增益更为明显。在 MATH500、GPQA Diamond、HotpotQA 以及 AlpacaEval 上使用多种生成-奖励模型对进行的测试表明,SRD 能够在消耗极少生成 Token 的情况下匹配 Best-of-N 的准确率,并在低算力场景下优于推测性拒绝采样。通过实现片段级干预而非全轨迹选择,SRD 为推理时推理的准确率-计算量权衡开辟了一个此前未被充分探索的全新空间。
🔬 摘要原文 (Abstract)
Inference-time decoding methods improve LLM reasoning by exploring multiple candidate trajectories, yet treat each trajectory as atomic: either retaining it whole or discarding it irreversibly. This wastes computation on partially promising candidates whose high-quality prefixes are abandoned alongside degraded suffixes. We introduce Selective Regenerative Decoding (SRD), which routes each candidate to discard, keep, or refine only the degraded portion of the suffix while preserving the useful prefix of borderline candidates, without requiring a larger target model. Under mild assumptions, SRD achieves a provable 1.28-to-1.36-fold gain in sample efficiency over rejection sampling with strictly higher expected trajectory quality, with the gain growing as the candidate pool grows. Across MATH500, GPQA Diamond, HotpotQA, and AlpacaEval with multiple generation-reward model pairs, SRD matches Best-of-N accuracy with substantially fewer generated tokens and outperforms speculative rejection in low-compute regimes. By enabling segment-level intervention rather than whole-trajectory selection, SRD opens a previously underexplored region of the accuracy-compute tradeoff for inference-time reasoning.
📊 核心亮点与发现 (Key Highlights & Findings)
- 片段级干预: 与检测到错误就丢弃整个轨迹不同,SRD 会保留有用的前缀,并仅重新生成发生退化的后缀。
- 理论效率: 与传统的拒绝采样相比,SRD 带来了可证明的 1.28倍到1.36倍的样本效率提升,同时产生严格更高的期望轨迹质量。
- 实证验证: 在多个基准数据集(包括 MATH500、GPQA Diamond、HotpotQA 和 AlpacaEval)以及多样化的生成-奖励模型对上进行了测试。
- 性能表现: SRD 能够以显著更少的生成 Token 数量匹配 Best-of-N 的准确率,在低算力体制下表现尤为优于推测性拒绝采样。
🔗 链接与资源 (Links & Resources)
- 全文访问: 查看 PDF | HTML 版本(实验性) | TeX 源码
- 引用工具: NASA ADS | Google Scholar | Semantic Scholar