文章背景与核心概要
随着大语言模型(LLM)在各个领域的广泛应用,幻觉检测(即识别模型生成错误或虚假信息的能力)成为了确保模型安全可靠落地的关键挑战。在无法于推理时获取真实证据的“闭卷(Closed-book)”设置下,如何准确估计模型输出的不确定性尤为重要。本文深入探讨了监督式不确定性量化(UQ)集成在幻觉检测中的鲁棒性与有效性。
作者通过在包含带标签LLM响应的小型特定领域数据集上,对来自异构UQ评分器的输出训练分类器,跨越4个LLM、9个数据集以及3种生成范式(短文本问答、长文本生成和代码生成)进行了系统性的鲁棒性分析。研究发现,监督式集成不仅在绝大多数实验设置下显著超越了单个最佳评分器,而且展现出极高的样本效率(仅需100个带标签样本)以及良好的域内分布偏移泛化能力,为构建更可靠的LLM应用提供了坚实的方法论支撑。
当监督式UQ集成提升LLM幻觉检测能力时?一项鲁棒性研究
arXiv: 2608.24492 [cs.LG]
提交时间: 2026年8月25日
作者: Mohit Singh Chauhan, Vipin Gyanchandani, Dylan Bouchard
主要学科: 机器学习 (cs.LG)
次要学科: 人工智能 (cs.AI), 计算与语言 (cs.CL)
摘要 (Summary)
本文研究了在闭卷设置(即推理时无法获取真实证据)下,监督式不确定性量化(UQ)集成用于检测大语言模型(LLM)幻觉的鲁棒性与有效性。
通过在一个包含带标签LLM响应的小型特定领域数据集上训练分类器来处理异构UQ评分器的输出,作者跨越以下维度进行了系统性的鲁棒性分析: * 4个 LLM * 9个 数据集 * 3种 生成范式(短文本问答、长文本生成和代码生成)
核心发现:
- 高性能: 监督式集成在 32个设置中的30个 上均优于最佳的单个评分器。
- 样本效率: 仅需 100个带标签实例 即可实现性能提升。
- 领域迁移: 集成在面对分布偏移(域内迁移)时仍能保持大部分优势,在 28个迁移设置中的23个 上击败了最佳的非集成评分器。
- 方法论权衡: 基于采样的黑盒集成接近完整集成的效果,而单次生成的白盒集成其实用价值有限。