← 最新论文
💬 NLP

Explicit Evidence Grounding via Structured Inline Citation Generation

本文介绍了 FullCite,这是一个能够生成将主张与特定证据跨度相链接的结构化行内引用框架,并通过在三个基准测试上的评估表明,虽然大语言模型能有效识别相关文档,但它们在精确的证据跨度识别方面仍存在困难,从而突显了忠实归因问答研究领域的一个关键方向。

原作者: Anar Yeginbergen, Amelie Wührl, Anna Rogers, Rodrigo Agerri

发布于 2026-06-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Anar Yeginbergen, Amelie Wührl, Anna Rogers, Rodrigo Agerri

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在向一位非常聪明、博学多才的图书管理员(一个人工智能)提问。在过去,这位图书管理员只会直接给你答案。如果你问:“《傲慢与偏见》是谁写的?”,她会说:“简·奥斯汀。”但她不会把书展示给你看,你只能听凭她的回答。

有时,图书管理员可能会表现得很自信但其实是错误的,或者她会将记忆中的事实与多年前读过的一本书中的事实混淆。在一些高风险的情况下——比如询问医疗建议或法律事实——你需要确切知道这位图书管理员是从哪里获得这些信息的。

这篇论文介绍了一个名为 FullCite 的新系统。把 FullCite 想象成一位极其严谨的图书管理员,她不仅会给你答案,还必须把答案和你所查找的准确书籍中的特定高亮页面一并递给你。

以下是该论文通过简单的类比进行的拆解:

问题所在:“模糊引用”型图书管理员

现在的多数 AI 系统就像一位图书管理员,她会说:“我在一本关于历史的书里读到了这个,”但她不会告诉你具体是哪本书,更不用说哪一页了。

  • 文档级引用(Document-level citation): 这就像是指向整个图书馆的书架并说:“答案就在这些书中的一本里。”这很有帮助,但仍然很模糊。
  • 证据级引用(Evidence-level citation): 这就像是精确指向某一页上的某一个句子。这才是我们真正为了建立信任所需要的,但这对于 AI 来说非常困难。

解决方案:FullCite

研究人员构建了一个名为 FullCite 的框架,强制要求 AI 同时完成两件事:

  1. 指明具体的文档(书)。
  2. 引用支持该答案的精确文本片段(句子)。

他们测试了三种让 AI 实现这一目标的不同方法:

  1. “直接要求”法(基于提示词/Prompt-based): 他们只是简单地告诉 AI:“请引用原文。”AI 会尽力尝试,但有时会偷懒或者编造引用。
  2. “严格规则手册”法(约束解码/Constrained Decoding): 他们把 AI 关进一个笼子里,让它只能输入符合特定模式的词汇。这就像是给 AI 一个填空表,它不能写出任何不是原文精确复制的内容。这种方法非常准确,但也很僵化;如果 AI 出错,它必须从头开始。
  3. “事后修正”法(事后处理/Posthoc): AI 先写出答案并猜测引用的内容。然后,第二步会回溯并寻找与 AI 猜测内容最匹配的原文文本来替换它。事实证明,这是最成功的方法。

研究发现(结果)

研究人员在三种不同类型的问题上进行了测试:医疗类(BioASQ)、常识类(ASQA)和专家知识类(ExpertQA)。

  • 找书容易,找页难: AI 其实很擅长挑选正确的“书”(文档)。然而,它在寻找精确的“句子”(证据跨度)方面却很吃力。这就像图书管理员知道答案在《哈利·波特》里,但却找不到关于分院帽的具体段落。
  • “事后修正”法胜出: “事后处理”(Posthoc)方法成为了表现最出色的选手。它将 AI 寻找精确句子的能力从 12% 的低分提升到了高达 61% 的水平(在其中一项测试中)。
  • “首页偏见”: 研究人员注意到一个有趣的习惯。当 AI 有五本书可选时,它几乎总是选择前两本,而忽略其余的书。这就像一个学生只读了教科书的前两章,就自以为掌握了整个学科。这被称为“迷失在中间”(lost-in-the-middle)现象。
  • “是非题”很棘手: 当被问及简单的“是或否”问题时,AI 经常会跳过引用,直接回答“是”或“否”。这让 AI 看起来很聪明(因为回答正确),但实际上它是在“作弊”,因为它没有展示其论据过程。

巨大的权衡

论文强调了一个微妙的平衡。当 AI 变得更擅长寻找精确句子(证据)时,它在如何匹配答案的含义方面有时会变得略微不那么“忠实”。这有点像找到了一句技术上正确但感觉略微脱离语境的完美引文。然而,FullCite 系统在处理这种平衡方面比其他方法做得更好。

核心结论

论文得出结论:虽然 AI 越来越擅长寻找正确的来源,但它在寻找来源中的精确证据方面仍需帮助。FullCite 的进步之处在于,它强制要求 AI 通过将每一项主张都链接到特定的句子来展示其推导过程,从而使 AI 更加诚实和透明。

重要提示: 论文并未声称该系统已准备好用于医院或法庭。这是一项研究,旨在表明我们需要更多地关注如何教导 AI 去寻找精确的证据,而不只是寻找正确的文档,从而使它们真正值得信赖。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →