文章背景与核心概要
大语言模型(LLMs)在执行长链推理时往往面临效率低下的问题。一旦中间答案在各个推理步骤中趋于稳定,继续推理所带来的边际效益将急剧递减,同时显著增加推理成本。现有的方法(如基于置信度或熵的早退机制)往往无法准确捕获真正的推理稳定性,而基于一致性的方法则需要进行缓慢的多步轨迹评估。
为了克服这些局限,本文提出了 SABER——一种无需训练的框架,通过对抗分支探测实现稳定性感知早退。该方法通过在中间推理状态周围生成轻量级的语义扰动来构建对抗分支,并在不执行完整轨迹展开的情况下探测并估计可能的最终结果。实验结果表明,SABER 在多个推理基准和模型架构上,能够在保持与完整长度推理相当的竞争力的同时,平均减少 30.2% 到 39.8% 的推理 Token 消耗。
SABER: Stability-Aware Early Exit for LLM Reasoning via Adversarial Branch Probing
SABER: Stability-Aware Early Exit for LLM Reasoning via Adversarial Branch Probing
Summary
Large Reasoning Models (LRMs) often suffer from inefficiency during long-chain reasoning. Once intermediate answers stabilize across steps, continuing the reasoning process yields diminishing marginal returns while significantly increasing inference costs. Existing methods (such as confidence- or entropy-based early exits) fail to accurately capture true reasoning stability, whereas consistency-based approaches require slow, multi-step trajectory evaluations.
Summary
Large Reasoning Models (LRMs) often suffer from inefficiency during long-chain reasoning. Once intermediate answers stabilize across steps, continuing the reasoning process yields diminishing marginal returns while significantly increasing inference costs. Existing methods (such as confidence- or entropy-based early exits) fail to accurately capture true reasoning stability, whereas consistency-based approaches require slow, multi-step trajectory evaluations.
To overcome this, SABER introduces a training-free framework for stability-aware early exit via adversarial branch probing: * Adversarial Branch Probing: Generates lightweight semantic perturbations around intermediate reasoning states. * Probing: Estimates likely final outcomes without executing full trajectory rollouts. * Early Exit Strategy: Exits early if probed outcomes remain consistent across the branches; otherwise, it continues the reasoning process.
To overcome this, SABER introduces a training-free framework for stability-aware early exit via adversarial branch probing: * Adversarial Branch Probing: Generates lightweight semantic perturbations around intermediate reasoning states. * Probing: Estimates likely final outcomes without executing full trajectory rollouts. * Early Exit Strategy: Exits early if probed outcomes remain consistent across the branches; otherwise, it continues the reasoning process.
Experimental results across multiple reasoning benchmarks and architectures demonstrate that SABER cuts reasoning token consumption by 30.2% to 39.8% on average while maintaining competitive accuracy relative to full-length reasoning.
Experimental results across multiple reasoning benchmarks and architectures demonstrate that SABER cuts reasoning token consumption by 30.2% to 39.8% on average while maintaining competitive accuracy relative to full-length reasoning.
Document Metadata
Document Metadata
| Metadata Field | Details |
|---|---|
| arXiv ID | arXiv:2608.27963 [cs.AI] |
| Title | SABER: Stability-Aware Early Exit for LLM Reasoning via Adversarial Branch Probing |
| Authors | Wanli Cheng, Haiya Xiang, Juntao Li, Hongling Wang, Wenliang Chen |
| Primary Subject | Artificial Intelligence (cs.AI) |
| Submission Date | August 28, 2026 |
| Conference | EMNLP 2026 Main Conference |
| Full-Text Access | View PDF | TeX Source |
Metadata Field Details arXiv ID arXiv:2608.27963[cs.AI]Title SABER: Stability-Aware Early Exit for LLM Reasoning via Adversarial Branch Probing Authors Wanli Cheng, Haiya Xiang, Juntao Li, Hongling Wang, Wenliang Chen Primary Subject Artificial Intelligence ( cs.AI)Submission Date August 28, 2026 Conference EMNLP 2026 Main Conference Full-Text Access View PDF | TeX Source
Abstract
Large Reasoning Models (LRMs) achieve strong reasoning capabilities, yet long-chain reasoning becomes inefficient once the intermediate answer stabilizes across reasoning steps: additional reasoning yields little marginal benefit while incurring substantial inference cost. Existing early-exit methods based on confidence or entropy poorly capture reasoning stability, while consistency-based approaches rely on multi-step trajectory agreement, requiring sequential evaluations that delay exit.
Abstract
Large Reasoning Models (LRMs) achieve strong reasoning capabilities, yet long-chain reasoning becomes inefficient once the intermediate answer stabilizes across reasoning steps: additional reasoning yields little marginal benefit while incurring substantial inference cost. Existing early-exit methods based on confidence or entropy poorly capture reasoning stability, while consistency-based approaches rely on multi-step trajectory agreement, requiring sequential evaluations that delay exit.
To better balance efficiency and reliability, we propose SABER, a training-free framework for stability-aware early exit via adversarial branch probing. SABER constructs simple yet effective semantic perturbations around intermediate reasoning states to form adversarial branches, and applies lightweight probing to estimate their likely final outcomes without full trajectory rollouts. When the probed outcomes remain consistent across branches, SABER exits early; otherwise, it continues reasoning. Experiments across multiple reasoning benchmarks and model architectures show that SABER reduces reasoning token consumption by 30.2%–39.8% on average while maintaining competitive accuracy with full-length reasoning.
To better balance efficiency and reliability, we propose SABER, a training-free framework for stability-aware early exit via adversarial branch probing. SABER constructs simple yet effective semantic perturbations around intermediate reasoning states to form adversarial branches, and applies lightweight probing to estimate their likely final outcomes without full trajectory rollouts. When the probed outcomes remain consistent across branches, SABER exits early; otherwise, it continues reasoning. Experiments across multiple reasoning benchmarks and model architectures show that SABER reduces reasoning token consumption by 30.2%–39.8% on average while maintaining competitive accuracy with full-length reasoning.
Additional Resources & Tools
- Code & Catalogs: Hugging Face | CatalyzeX Code Finder | DagsHub
- Academic References: Google Scholar | Semantic Scholar | NASA ADS
- Interactive Preprints & Demos: alphaXiv | Replicate | Hugging Face Spaces
Additional Resources & Tools
- Code & Catalogs: Hugging Face | CatalyzeX Code Finder | DagsHub
- Academic References: Google Scholar | Semantic Scholar | NASA ADS
- Interactive Preprints & Demos: alphaXiv | Replicate | Hugging Face Spaces