跳转至

大语言模型知道该问什么以及何时发问吗?多轮信息搜寻能力评估

文章背景与核心概要

在面对信息不足(不充分说明)的用户提问时,理想的AI模型应当能够识别出上下文的缺失、准确指出缺少哪些信息并主动追问,直到获得明确的唯一解时再给出最终答案。本文将多轮信息搜寻正式建模为“\(k\)项信息不足的约束满足问题”(其中 \(k\) 用于衡量缺失信息的程度),并推出了 MT-InfoSeek 这一全面的评估套件,涵盖数学、逻辑、生物、医学和常识等领域的 5,251 个问题及 9,006 个任务实例。

作者从三个核心维度对当前的大语言模型(LLMs)进行了评估:它们问什么、在什么时候发问,以及获取的信息如何影响最终答案。关键研究结果表明: * 低估缺失上下文: 模型虽然能够认识到需要更多信息,但系统性地低估了缺失信息的数量(例如,在 \(k=2\) 的逻辑问题中,模型对缺失信息量的预测偏低次数是偏高次数的约四倍)。 * 查询效率低下: 模型难以识别出最小的充分查询集,仅在提供真实的 \(k\) 值时获得微乎其微的收益,并且经常过早终止对话。 * 顺序敏感性: 在具有顺序依赖性的任务中,即使最终收集到了所有必要的数据,错误的查询顺序也会降低最终的准确率。 * 评估空白: 通过将最终充分性与答案生成进行独立评估,本研究证明多轮信息搜寻能力与基础答案生成能力存在本质区别,且这是标准基准测试尚未涵盖的盲区。


Metadata & Reference Information

  • arXiv ID: arXiv:2608.14808 [cs.AI]

  • Subjects: Artificial Intelligence (cs.AI); Computation and Language (cs.CL); Machine Learning (cs.LG)

    • Subjects: Artificial Intelligence (cs.AI); Computation and Language (cs.CL); Machine Learning (cs.LG)
  • Submission Date: August 14, 2026

    • Submission Date: August 14, 2026
  • Authors: Yepeng Huang, Jiawen Zhang, Michelle Dai, Xiaorui Su, Shanghua Gao, Zi Wang, Marinka Zitnik

    • Authors: Yepeng Huang, Jiawen Zhang, Michelle Dai, Xiaorui Su, Shanghua Gao, Zi Wang, Marinka Zitnik
  • License: Creative Commons Attribution 4.0 International (License icon preserved below per instructions):

license icon

license icon