VLD-RAG: Agentic Vision-Language Retrieval-Augmented Generation for Long, Visually-Rich Multi-Page Documents
VLD-RAG 是一种智能体多模态检索增强生成框架,它利用保持页面结构的索引、混合检索策略以及协同的多智能体工作流,通过综合跨长篇、视觉丰富的多页文档中分散的文本和视觉证据,来有效地回答问题。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在试图破解一个长达100页的巨大谜团,但线索散落在各处。有些线索是用纯文本写的,有些隐藏在复杂的图表中,有些藏在图解中,还有些仅仅是页面布局的一部分。这就是“视觉丰富型文档”(visually-rich documents)的世界——想想看那些我们在现实世界中看到的、信息密集且色彩斑斓的报告、手册和幻灯片。长期以来,计算机试图阅读这些文档时遇到了一个大问题:它们往往试图剥离所有的图片和布局,只去读取文字。这就像是试图通过只读对话气泡来理解一本漫画书,却忽略了绘画内容;你会因此错过语境、笑点和剧情转折。
为了解决这个问题,科学家们使用了一种叫做检索增强生成(Retrieval-Augmented Generation, RAG)的技术。把 RAG 想象成一位超级聪明的图书管理员,他不仅能背诵书籍,还能在回答你的问题之前,跑出去找到你需要的确切页面。然而,当这些“书”是这些杂乱、多页的视觉文档时,标准的图书管理员往往会迷失方向。他们可能会抓错页面,因为他们只看了文字;或者他们可能会错过一个关键图表,因为他们不知道如何去“看”图像。大问题在于:我们如何构建一个系统,能够跨越数十页寻找正确的证据,完美地融合文本与图像,从而正确地回答问题?
于是有了 VLD-RAG,这是一个旨在成为处理这类长篇视觉文档的终极侦探的新型框架。这项研究背后的研究人员意识到,要解决一个横跨150页的谜团,你不能只依赖一种招式。相反,他们构建了一个“智能体化”(agentic)的系统——一个由 AI 专家组成的团队协同工作。想象一下由三位侦探组成的组合:一位是关键词猎人(Keyword Hunter),负责扫描精确的词汇和数字;另一位是视觉侦探(Visual Sleuth),观察页面的整体“氛围”和布局;第三位是批判性验证者(Critical Verifier),负责检查他们的工作。
以下是他们如何协作的。首先,系统会将你的问题分解为一个计划。它不仅仅是问“利润是多少?”,而是会问:“在第3节中寻找表格,寻找标题为‘第四季度结果’的图表,并在文本中检查具体的美元金额。”然后,关键词猎人和视觉侦探会同时出发去搜索文档。猎人抓取带有正确词汇的页面,而侦探则抓取那些看起来包含答案的页面,即使上面的文字不同。
神奇之处在于他们如何交换笔记。如果猎人说:“第12页看起来不错,”但侦探说:“第12页看起来完全不对,”系统并不会仅仅靠猜测。它会使用一种特殊的“一致性检查”来意识到出了问题。如果证据显得薄弱或缺失,批判性验证者就会介入并说:“嘿,我们漏掉了什么!让我们尝试用另一种方式提问。”这会触发第二次搜索,不断精炼线索,直到他们找到正确的页面。最后,系统收集证据——包括文本片段、图表裁剪图和页码——并将它们喂给生成器以撰写最终答案,确保每一项主张都有实际文档作为支撑。
研究人员在两个巨大的挑战上测试了这支侦探团队:MMLongBench-Doc 和 LongDocURL。这些是文档阅读领域的“奥林匹克”,包含了数百份文档、数千页的内容、复杂的表格以及刁钻的问题。结果令人印象深刻。VLD-RAG 不仅比以往的方法更频繁地找到正确的页面,而且找到的正确页面也更多。在平均每份文档 85.6 页的 LongDocURL 基准测试中,当查看前 5 个结果时,VLD-RAG 在 81.16% 的案例中成功检索到了正确的证据页(Recall@5),击败了所有其他方法。它还将最相关的页面排在了更高的位置,这意味着答案通常就坐在列表的最顶端。
论文指出,这种成功源于没有强迫计算机在“阅读”和“观看”之间做选择。通过保持视觉布局与文本的独立但又协同工作,并让 AI 智能体互相检查,该系统避免了那种试图将丰富的、色彩斑斓的文档压扁成纯文本时所产生的错误。虽然研究人员指出,这种方法专门针对信息分散在多个页面上的文档,但研究结果强烈表明,对于这些复杂的、多页的谜团,由专业化、相互验证的智能体组成的团队远比孤独的“独狼式”搜索更为优越。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。