← 最新论文
🤖 AI

Do LLMs Know What to Ask and When? Evaluating Multi-Turn Information Seeking

本文介绍了 MT-InfoSeek,这是一个受控评估套件,它证明了虽然大语言模型能够识别出在欠定(underspecified)的多轮任务中需要额外信息,但它们会系统性地低估所需信息的量,无法识别最小充分查询,并且在查询排序方面表现挣扎,从而揭示了它们的信息寻求能力与当前评估指标之间存在明显的差距。

原作者: Yepeng Huang, Jiawen Zhang, Michelle Dai, Xiaorui Su, Shanghua Gao, Zi Wang, Marinka Zitnik

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Yepeng Huang, Jiawen Zhang, Michelle Dai, Xiaorui Su, Shanghua Gao, Zi Wang, Marinka Zitnik

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,一位医生坐在患者对面,而患者只说了一句:“我疼。”为了做出诊断,医生不能靠猜测,必须通过提出具体问题来填补缺失的细节。是剧痛还是钝痛?具体位置在哪里?这种情况持续多久了?在人工智能的世界里,大型语言模型通常被测试其回答问题的能力,但很少被测试其是否具备“知道自己信息不足以回答问题”的能力。这是一个关键的差距。一个合格的人工智能应该能够识别出情况是不完整的,弄清楚究竟缺少了什么,并在给出结论之前进行询问。如果它过早地做出猜测,就有可能表现得“自信地错误”。

哈佛大学和 Google DeepMind 的研究人员建立了一种新的方法来测试这项特定技能。他们创建了一个受控环境,让人工智能面对一个带有缺失部分的谜题。这个谜题可能是一个隐藏了数字的数学题,一个缺少事实的逻辑谜题,或者是一个未询问症状的医疗场景。目标不仅是让 AI 解开谜题,还要让它学会如何按照正确的顺序提出正确的问题,直到答案变得清晰。研究人员想看看这些模型能否像一名熟练的调查员那样,准确知道需要哪些证据,还是会由于线索不足而草率地得出结论。

该团队开发了一个名为 MT-INFOSEK 的测试套件,其中包含超过 5,000 个涵盖五个不同领域的不同问题:数学、逻辑、生物、医学和常识。在这些测试中,AI 被给出的起点是刻意不完整的。例如,在医学测试中,AI 可能知道患者有盆腔疼痛,但不知道疼痛持续了多久,也不知道患者是否怀孕。随后,AI 必须与一个“先知”(oracle)进行对话,向其逐一提出问题——这个系统会提供问题的真实答案。AI 必须决定何时停止提问并给出最终答案。研究人员衡量成功的标准不仅在于最终答案是否正确,还在于 AI 是否确实收集了足够的信息来确保该答案的确定性。

结果显示,目前的模型存在显著的弱点。虽然 AI 系统通常能意识到自己缺少信息,但它们总是低估了所需信息的量。当研究人员创建需要两个缺失信息才能解决的问题时,模型往往会误以为只有一个信息缺失。在逻辑谜题中,模型低估缺失信息量的概率比高估的概率高出约四倍。它们还难以识别出哪些问题才是真正能解决问题的关键。即使研究人员明确告诉模型需要问多少个问题,模型也经常无法选出正确的一组问题。它们会问一些无关的问题,或者过早停止提问,导致谜题悬而未决。

研究还观察了提问的顺序。在医学等领域,信息的先后顺序至关重要。医生必须在决定下一步进行哪些检查之前,先确定疼痛是急性的还是慢性的。研究人员发现,当 AI 模型问对了问题但顺序不对时,其最终的准确率会大幅下降。这表明,知道问什么只是成功的一半;知道何时问才是同样重要的。此外,研究人员发现,模型可以从一个糟糕的首个问题中恢复过来。如果一个模型在开始时问了一个无用的问题,但随后在接下来的回合中继续提出相关问题,它仍然可以达到正确的解决方案。然而,许多模型未能做到这一点,即使在尚未收集到足够证据的情况下,也会在短短几轮后就停止尝试。

或许最令人惊讶的发现是,一个模型提出好问题的能力与其给出好答案的能力是分离的。研究人员通过以下方式测试了这一点:他们提取一段 AI 已收集完所有必要信息的对话,然后让另一个不同的模型仅根据这段对话来解决谜题。他们发现,有些模型在给定全套事实时可以完美地解决谜题,即便它们自己在收集这些事实的过程中失败了。这意味着,失败并非源于模型的推理能力或知识储备,而是源于获取信息的过程。这些模型并不擅长解决问题,而是不擅长“知道自己不知道什么”。

研究人员总结道,目前对人工智能的评估是不完整的。仅仅衡量模型回答的最终准确率,会掩盖模型可能是通过猜测或忽略缺失信息才得到答案这一事实。要真正理解 AI 如何与世界互动,我们必须衡量它识别不确定性、识别缺失内容以及逐步获取缺失信息的能力。这个全新的框架提供了一种实现这一目标的方法,它表明虽然今天的模型功能强大,但它们仍然缺乏人类专家那种“知道何时停止猜测并开始提问”的直觉。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →