← 最新论文
💬 NLP

Evidence Attribution in Visual Document Understanding without Coordinates or Region Labels

本文表明,用基于文本的“引用与检索”接口取代基于坐标的边界框输出,可以显著减少视觉文档理解中的归因幻觉并提高证据召回率,同时还能实现无需昂贵区域级标签的高效训练。

原作者: Zhuchenyang Liu, Yao Zhang, Yu Xiao

发布于 2026-07-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhuchenyang Liu, Yao Zhang, Yu Xiao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你是一名正在试图破解谜题的侦探,但你的犯罪现场不是一个犯罪现场,而是一叠巨大的、杂乱无章的文件——收据、图表和手写笔记。在人工智能的世界里,这些被称为“视觉文档”。为了让计算机成为一名优秀的侦探,它不能仅仅猜测答案;它必须准确地指出它在哪里找到了线索。这被称为“归因”(attribution)。

长期以来,让计算机指向线索的标准方法是要求它在文本周围画一个框,并给出该框的 GPS 坐标(例如“x=50, y=100”)。这就像是要求一个孩子通过大喊数字来指着页面上的某个特定单词。这是一种笨拙的玩“我看到了”(I Spy)游戏的方式。你即将阅读的这篇论文研究了为什么这种“坐标游戏”失败得如此严重。它指出,问题不在于计算机太笨而找不到线索,而在于游戏规则(坐标)太令人困惑了。研究人员提出了一个新规则:与其大喊数字,不如让计算机直接逐字逐句地把线索读出来。然后,一个聪明的助手(检索系统)会找到这些词在页面上的确切位置。

伟大的“指向”故障

研究人员从一个令人沮丧的观察开始。当他们要求强大的 AI 模型回答关于长文档的问题并证明其工作时,这些模型在获得正确答案方面表现出色,但在展示它们是在哪里找到答案时却表现得很糟糕。即使答案是完美的,AI 也经常会指向错误的段落,或者在空白页中间画一个框。论文称之为“归属幻觉”(Attribution Hallucination)。这就像一个学生做对了数学题,却把解题过程写在了老师的办公桌背面,而不是笔记本上。

一个大问题是:AI 实际上是由于找不到位置而变差了,还是仅仅因为不擅长使用“坐标”这种语言?

“朗读”实验

为了测试这一点,团队使用六种不同的 AI 模型进行了一场大规模实验。他们保持所有内容不变——文档、问题和模型——但改变了游戏的规则。

游戏 A(旧方法): AI 必须输出一组数字(坐标)来在证据周围画一个框。
游戏 B(新方法): AI 被要求通过引用文档中的确切文本来简单地“大声读出证据”。随后,一个独立的计算机程序会获取该引用并自动找到文档中匹配的部分。

结果就像一个魔术。当 AI 被允许“朗读”而不是“大喊数字”时,它寻找正确位置的能力大幅飙升。

  • 旧方法: AI 找到正确证据的概率不到 8%
  • 新方法: AI 找到正确证据的概率在 26% 到 47% 之间。

这是一个巨大的飞跃!“幻觉”(指向错误位置)的发生率减少了大约一半。最令人惊讶的部分是?实际回答的质量并没有太大变化。模型本身依然一样聪明;它们只是在不需要为坐标而挣扎时,能更好地展示它们的工作。

为什么坐标是问题所在

论文认为,失败的原因并非缺乏智能。它是一个“接口伪影”(interface artifact)。想象一下,要求一位厨师描述一份食谱。如果你强迫他们仅使用一组数字组成的秘密代码来描述食材,他们可能会做出正确的菜肴,但在列出食材时却会出错。但如果你让他们直接说“两杯面粉”,清单就会变得准确。

研究人员发现,AI 模型实际上知道信息在哪里;只是当被迫使用坐标时,它们会用文字(如“在第 2 页,桌子下面”)来描述它。通过切换到“引用”方法,他们让 AI 使用了其天生的优势:语言。

教导 AI 成为更好的侦探

研究人员不仅停留在改变规则上;他们还希望教导 AI 在这个新游戏中变得更好,而不需要人类去为每一个框进行评分。他们创建了一种特殊的训练方法,称为 GRPO(组相对策略优化)。

想象一个游戏,AI 尝试回答一个问题,而一个“法官”(另一个 AI)查看答案和证据。法官不需要人类告诉他们证据在哪里。相反,法官只需检查:“答案对吗?引用的词是否真的支持该答案?”如果 AI 引用了正确的词,它就会获得奖励。如果它胡编乱造,则得零分。

使用这种方法,他们训练了一个较小的 AI 模型(一个 80 亿参数的主干网络)来更好地寻找证据。

  • 训练前: 该模型的“严格归属准确率”为 22.4%
  • 训练后: 它跃升至 33.8%

这是一件大事,因为这意味着我们可以教导 AI 变得更可靠、更可验证,而无需昂贵的人力标签来在成千上万的页面上画框。

总结

这篇论文为如何让 AI 更加可靠提供了一条切实可行的路径。它表明,“坐标接口”(用数字画框)是一个弱点,会导致 AI 产生幻觉。通过切换到“语言接口”(引用文本并让系统寻找位置),我们可以显著提高 AI 指向其证据的能力。

研究结果表明,问题不在于 AI 看不到文档,而在于我们要求它指向的方式出了问题。通过让 AI 使用引用语说话,并让智能系统进行指向,我们就能得到一个更值得信赖的侦探。论文建议,对于法律、医学和金融等需要证明来源与得到答案同样重要的领域,这是一种可行且具有成本效益的方法,可以构建更好的 AI。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →