Chain of Evidence: Pixel-Level Visual Attribution for Iterative Retrieval-Augmented Generation
本文介绍了证据链(CoE),这是一种与检索器无关的框架,它利用视觉语言模型在迭代检索增强生成中实现像素级视觉归因,从而通过直接对文档截图进行推理来提供精确的边界框引用并保留关键视觉布局信息,以此克服仅依赖文本解析的局限性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你是一名侦探,正在试图解开一个复杂的谜团。过去,你必须阅读数百页的打字报告才能找到线索。如果报告写着“嫌疑人当时在巴黎”,你只能选择相信。但如果这份报告实际上是一张杂乱的传单,上面有地图、火车票的照片和手写便条呢?如果你只是把传单上的文字打出来,你就会丢失地图和照片,而且完全不知道线索究竟藏在页面的哪个位置。
这正是本文作者们试图通过一个名为**证据链(Chain of Evidence, CoE)**的新系统来解决的问题。
问题所在:“模糊的复印件”
当前用于回答问题的 AI 系统(称为检索增强生成,即 RAG)通常按以下方式工作:
- 你提出一个问题。
- AI 找到一些文档。
- 它剥离所有的图片、图表和复杂的排版,将一切转化为纯文本(就像一张模糊的复印件)。
- 它给你一个答案,并说:“我在文档 A 中找到了这个。”
关键缺陷: 如果文档 A 是包含图表的幻灯片,或者是包含复杂表格的 PDF,将其转化为纯文本就会破坏其逻辑。这就像试图只通过阅读配料表来理解食谱,却忽略了展示如何混合食材的图片。此外,当 AI 说“文档 A"时,它并没有告诉你答案具体位于该文档的哪个部分。你必须手动滚动 50 页才能找到那个特定的句子。这就是“验证瓶颈”。
解决方案:“像素级侦探”
作者们提出了证据链(CoE),通过将文档视为图像(截图)而不仅仅是文本,从而改变了游戏规则。
将 CoE 想象成一名侦探,他不仅阅读报告,还会查看文档的原始、未编辑的照片。
- 不再剥离: 它不会先将文档转换为文本。它查看截图,保留所有的图表、箭头和排版布局。
- “魔法荧光笔”: CoE 不再只是说“它在文档 3 中”,而是在图像中答案确切所在的精确位置画出一个框(边界框)。它直接指向图表中的特定数字或段落中的特定行。
- 链条: 对于需要多步骤的复杂问题(例如“谁导演了这部电影,他们又在哪里上的学?”),CoE 会构建一条视觉链条。它会向你展示:“步骤 1:查看文档 A 上的这个框以找到导演。步骤 2:查看文档 B 上的这个框以找到学校。”
他们如何测试
为了证明这行之有效,团队构建了两个新的“训练场”(数据集):
- Wiki-CoE: 将维基百科页面转化为截图的庞大集合。他们选取了需要跨越多页的问题,并教导 AI 找到答案的确切视觉位置。
- SlideVQA: 一个包含布局杂乱、带有箭头和复杂图表的演示幻灯片集合。这是“困难模式”测试,因为基于文本的系统通常在此处失败。
结果:为何这很重要
该论文表明,CoE 是一个游戏规则改变者,特别是对于不仅仅是纯文本的文档:
- 更擅长定位“在哪里”: 在复杂的幻灯片上,依赖文本的普通 AI 系统往往会迷失方向。CoE 通过观察视觉布局,更准确地识别出了证据。
- 值得信赖: 因为 CoE 会在证据周围画框,你可以立即验证答案。你无需猜测;你可以直接在屏幕上看到证明。
- 不需要特定的搜索引擎: CoE 与任何能查找文档的搜索工具配合使用。它只需获取前 5 个结果(作为图像),然后理清逻辑。
核心结论
作者们认为,为了让 AI 真正值得信赖,特别是面对报告、幻灯片和图表等复杂文档时,它必须“看见”文档,而不仅仅是“阅读”其文本版本。证据链将 AI 转变为一个视觉侦探,能够直接用手指指向真相,使推理过程透明化,便于人类检查。
简而言之: CoE 不再给你一个模糊的书籍引用,而是把书递给你,翻到确切的那一页,并在你需要的句子周围画个圈。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。