跳转至

通过置信度动态实现大型推理模型的提前停止

文章背景与核心概要

大型推理模型在处理复杂任务时,往往依赖于冗长的思维链(Chain-of-Thought)生成过程。然而,这种延长的推理过程不仅会带来巨大的计算开销,有时还会因为“过度思考”(overthinking)导致性能下降。

本文提出了 CoDE-Stop(Confidence Dynamics Early Stop),这是一种旨在确定最佳推理终止点的新型方法。通过分析中间答案的置信度,研究人员发现正确的推理轨迹通常会较早达到高置信度,而错误的轨迹则表现出不稳定或不可靠的置信度模式。CoDE-Stop 利用这些动态特性,无需额外训练即可停止推理,在保持卓越的精度-计算权衡的同时,减少了 25% 到 50% 的 Token 使用量。


核心贡献

核心贡献

  • 置信度动态分析: 作者详细研究了模型置信度在推理过程中的演变规律,并区分了成功与失败的推理轨迹。
  • CoDE-Stop 方法: 一种即插即用的提前停止机制,无需重新训练,可无缝集成到现有的大型推理模型中。
  • 效率提升: 在多种推理和科学基准测试中,证明了显著的计算节省(总 Token 使用量减少 25–50%)。
  • Confidence Dynamics Analysis: The authors provide a detailed study of how model confidence evolves during reasoning, distinguishing between successful and unsuccessful trajectories.
  • CoDE-Stop Method: A plug-and-play early stopping mechanism that requires no retraining and integrates seamlessly into existing large reasoning models.
  • Efficiency Gains: Demonstrates significant computational savings (25–50% reduction in total token usage) across diverse reasoning and science benchmarks.

访问与资源

访问与资源


提交历史

提交历史

  • v1: 2026 年 4 月 6 日(周一)
  • v2: 2026 年 8 月 14 日(周五)(当前版本)
  • v1: Mon, 6 Apr 2026
  • v2: Fri, 14 Aug 2026 (Current version)