通过置信度动态实现大型推理模型的提前停止
文章背景与核心概要
大型推理模型在处理复杂任务时,往往依赖于冗长的思维链(Chain-of-Thought)生成过程。然而,这种延长的推理过程不仅会带来巨大的计算开销,有时还会因为“过度思考”(overthinking)导致性能下降。
本文提出了 CoDE-Stop(Confidence Dynamics Early Stop),这是一种旨在确定最佳推理终止点的新型方法。通过分析中间答案的置信度,研究人员发现正确的推理轨迹通常会较早达到高置信度,而错误的轨迹则表现出不稳定或不可靠的置信度模式。CoDE-Stop 利用这些动态特性,无需额外训练即可停止推理,在保持卓越的精度-计算权衡的同时,减少了 25% 到 50% 的 Token 使用量。
核心贡献
核心贡献
- 置信度动态分析: 作者详细研究了模型置信度在推理过程中的演变规律,并区分了成功与失败的推理轨迹。
- CoDE-Stop 方法: 一种即插即用的提前停止机制,无需重新训练,可无缝集成到现有的大型推理模型中。
- 效率提升: 在多种推理和科学基准测试中,证明了显著的计算节省(总 Token 使用量减少 25–50%)。
- Confidence Dynamics Analysis: The authors provide a detailed study of how model confidence evolves during reasoning, distinguishing between successful and unsuccessful trajectories.
- CoDE-Stop Method: A plug-and-play early stopping mechanism that requires no retraining and integrates seamlessly into existing large reasoning models.
- Efficiency Gains: Demonstrates significant computational savings (25–50% reduction in total token usage) across diverse reasoning and science benchmarks.
访问与资源
访问与资源
提交历史
提交历史
- v1: 2026 年 4 月 6 日(周一)
- v2: 2026 年 8 月 14 日(周五)(当前版本)
- v1: Mon, 6 Apr 2026
- v2: Fri, 14 Aug 2026 (Current version)
