文章背景与核心概要
在自回归大语言模型的生成过程中,传统的解码方法(如温度采样或Top-p/Top-k截断)通常通过重新缩放整个概率分布或截断低概率尾部来促进生成多样性。然而,这些常规技术在开放式生成场景中往往表现不佳——此时虽然有多个合理的续写方向,但过多的概率质量仍然集中在最平庸、最高频的单个选项上,导致模型生成的文本趋于保守和重复。
为了克服这一痛点,本文作者团队提出了 XTC(Exclude Top Choices,排除首选),这是一种轻量级的、具备头感知能力(head-aware)的解码算子。其核心机制是:当识别出多个超出绝对合理性阈值 \(\tau\) 的候选词时,XTC 会以一定的概率 \(\rho\) 移除其中占据主导地位的候选词,在重新归一化前仅保留相对较弱但依然合理的替代选项。实验表明,XTC 在显著提升文本多样性(Distinct-2 提升 11%–15%)、减少重复(重复三元组减少 27%–47%)的同时,并未牺牲文本的流畅度与指令遵循能力,目前该算法已被集成至 llama.cpp、ExLlamaV2 等主流推理框架中。
XTC: Head-Aware Sampling by Excluding Top Choices
arXiv: 2608.22758 [cs.CL]
Submitted: August 24, 2026
Authors: Philipp Emanuel Weidmann, Allen Roush, Judah Goldfeder, Sanjay Basu, Ravid Shwartz-Ziv
Subjects: Computation and Language (cs.CL); Artificial Intelligence (cs.AI); Machine Learning (cs.LG)
📌 Summary
标准的自回归语言模型解码方法通过重新缩放整个下一个 Token 的概率分布或截断其低概率尾部来促进多样性。然而,这些策略忽视了开放式生成中一个常见的场景:在该场景下,几种续写方向都是合理的,但过多的概率质量仍然集中在最平庸的选择上。
为了解决这个问题,作者引入了 XTC (Exclude Top Choices),这是一种轻量级的、具备头感知能力的解码算子,专门针对这一生成模式: * 工作原理: XTC 识别出概率超过绝对合理性阈值 (\(\tau\)) 的 Token。如果有至少两个 Token 符合条件,它会以概率 \(\rho\) 移除占主导地位的候选词,在重新归一化之前仅保留最弱的合理替代项。 * 核心结果: * 在涵盖多个模型(Gemma 3、DeepSeek R1 和 Llama 3.3)的 60 项实验中,XTC 显著改善了多样性-重复率的帕累托前沿(Pareto frontier)。 * 在创意生成任务中,Distinct-2 提高了 11–15%,重复三元组(repeat trigrams)减少了 27–47%。结合温度缩放后,这些增幅分别高达 38% 和 71%。 * 一项涉及 150 名人工评委的双盲评估显示,在不牺牲文本流畅度的前提下,62.3% 的评委更青睐 XTC 的创造力(\(p < 10^{-4}\))。 * XTC 现已被集成到诸如
llama.cpp、ExLlamaV2和text-generation-webui等流行的推理框架中。
Abstract
自回归语言模型的标准解码规则通过重新缩放完整的下一个 Token 分布或截断其低概率尾部来促进多样性。这些策略忽视了一个常见的开放式生成场景:在该场景中,有几个续写方向是合理的,但过多的概率质量仍然集中在最平庸的选择上。我们引入了 XTC (Exclude Top Choices),这是一种轻量级的头感知解码算子,直接针对这一模式。XTC 识别出概率超过绝对合理性阈值 \(\tau\) 的 Token:当至少有两个 Token 符合条件时,它会以概率 \(\rho\) 移除占主导地位的合格选项,并且在重新归一化之前仅保留最弱的合理替代项。
在针对 Gemma 3 27B Q4、Gemma 3 12B Q6 和 DeepSeek R1 14B Q6 的 60 项实验中,以及在 Llama 3.3 70B Q4 上进行的大规模验证中,XTC 改善了多样性-重复率的帕累托前沿。在创意生成方面,这四个模型的 Distinct-2 提高了 11--15%,重复三元组减少了 27--47%。结合温度缩放,与基线相比,Distinct-2 的增幅达到了 38%,重复三元组的减少量达到了 71%。一项包含 150 名资深评委的盲法亚马逊 Mechanical Turk 研究表明,在流畅度没有降低的情况下,对 XTC 创造力的偏好达到了 62.3% (\(p<10^{-4}\)),而 GPT-4o 对照裁判在每一项指标上都复制了 Anthropic 裁判的偏好方向。在搭配 Llama 3.3 70B Q4 的 IFEval 上,XTC 将提示词级别的严格准确率保持在基线 1.7 个百分点以内,同时恢复了大部分的多样性增益;而一个在 Distinct-2 上匹配的温度设置则会使 IFEval 下降 8.8 个百分点。该效果可与温度和重复惩罚叠加,在各种量化级别和模型系列中均表现出鲁棒性,并且在十二种提示词流派中保持一致。XTC 已被 this http URL、ExLlamaV2 以及 text-generation-webui 采纳。
Access Full-Text & Resources
- PDF: View PDF
- HTML (Experimental): arXiv HTML
- TeX Source: Download eprint
- License: Creative Commons Attribution 4.0
