← 最新论文
💬 NLP

Attention Grounded Enhancement for Visual Document Retrieval

本文提出了AGREE,这是一个利用多模态大语言模型的跨模态注意力作为代理监督信号,以引导视觉文档检索器学习细粒度、区域级相关性的框架,从而在与仅依赖全局监督的基线模型相比时,显著提升了在复杂非抽取式查询上的性能。

原作者: Wanqing Cui, Wei Huang, Yazhi Guo, Yibo Hu, Meiguang Jin, Junfeng Ma, Keping Bi

发布于 2026-05-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Wanqing Cui, Wei Huang, Yazhi Guo, Yibo Hu, Meiguang Jin, Junfeng Ma, Keping Bi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在一座庞大而杂乱的文档图书馆中寻找特定的一页。有些页面只是纯文本,但许多是复杂的“视觉文档”,其中充满了图表、表格、照片和文本的混合体。

问题:“概要”与“细节”
当前针对这些文档的搜索引擎就像一位只阅读书籍封底摘要的图书管理员。他们可以告诉你:“是的,这本书涉及你询问的主题”,但他们不知道哪个具体段落哪张图表包含答案。

由于他们只关注“大局”(全局相关性),往往容易受骗。如果你提出一个棘手的问题,需要连接两个不相邻的概念(例如将“瓶颈”一词与图表中的隐藏符号联系起来),这位图书管理员可能会完全忽略它。他们过于依赖寻找精确的关键词匹配,就像一只追逐 squeaky 玩具的狗,而不是理解实际含义。

解决方案:AGREE(“超级教师”图书管理员)
本文作者提出了一种名为AGREE(Attention-Grounded REtriever Enhancement,基于注意力 grounding 的检索器增强)的新训练方法。

将 AGREE 想象成聘请一位超级聪明、极度敏锐的教师(多模态大语言模型,即 MLLM)来培训图书管理员。

以下是训练步骤:

  1. 教师的“目光”:当教师看到问题和文档时,他们不仅仅说“是的,这相关”。他们会用手指指向页面上确切的相关位置。
    • 类比:想象教师正在使用激光笔。如果你问“隐藏符号在哪里?”,教师不会只是点头;他们会将激光照在那个微小的符号上,即使它很小,同时也照在解释它的附近文本上。他们既突出明显的匹配项,也突出微妙、隐藏的关联。
  2. “热力图”课程:教师创建一张“热力图”(显示他们关注点的视觉指南)。这张图告诉图书管理员:“请关注图表的这个特定角落,以及表格中的这个特定单词。”
  3. 训练:随后,图书管理员(搜索引擎)被迫从这张热力图中学习。他们不再仅仅学习“书 A 是匹配的”,而是学习“为了找到答案,我必须专门查看右上角和左下角的文本”。
  4. 结果:图书管理员不再基于整本书进行猜测,而是开始理解为什么某页是相关的。他们学会了识别将问题与答案联系起来的“隐形”线索。

为何这很重要
本文在名为ViDoRe V2的极具挑战性的基准测试中对此进行了测试,该测试充满了需要推理而非仅仅关键词匹配的棘手问题。

  • AGREE 之前:图书管理员就像一个死记硬背了目录却找不到内部具体事实的学生。
  • AGREE 之后:图书管理员变成了一名侦探。即使问题使用的词汇与文档不同(例如,询问“同性恋客户”却在文本中找到"LGBT"下的答案),他们也能找到答案。

关键要点
本文声称,通过使用这种“教师的目光”(注意力图)来引导搜索引擎,系统能更准确地找到正确信息。它不仅知道某份文档是相关的,还知道相关性隐藏在哪里

简单来说:AGREE 教导搜索引擎停止浏览封面,转而阅读细则,并利用一位超级聪明的 AI 教师来精确指示其应关注的地方。

本文指出,该方法在复杂问题上显著优于以往的方法,且代码可供他人尝试。它并未声称用于医疗诊断或其他超出文档搜索和检索之外的具体现实世界应用。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →