想象一下,你正在一座巨大的图书馆中寻找某句特定的话,但你并非阅读文字,而是在查看书页的照片。
旧方法:“整页”问题
目前,大多数帮助你从文档中查找信息的 AI 系统,运作起来就像一位笨拙的图书管理员。当你提出问题时,它们会从书架上抓取整页内容递给你。
- 问题所在: 如果你询问的是 300 字页面中间的一个小图表,AI 会给你整页内容。你现在不得不从 290 个无关的单词中费力搜寻,才能找到你需要的那句话。这不仅缓慢,浪费计算机算力,还常常让 AI 感到困惑,导致其产生“幻觉”(编造内容),因为它看到了过多的干扰信息。
- 类比: 这就像你问朋友“天气怎么样?”,对方却把整份报纸递给你,包括体育版、漫画和股市行情,仅仅因为天气预报在第 4 版。
新方案:LFRAG(“智能剪刀”)
该论文介绍了一种名为LFRAG(面向布局的细粒度检索增强生成)的新系统。你可以将 LFRAG 想象为一位拥有智能剪刀且深刻理解页面组织方式的图书管理员。
将页面切割为“语义块”:
LFRAG 不会把整页递给你,而是先查看文档的布局(标题、表格和图片的位置)。它将页面切割成逻辑上的“块”。
- 类比: 想象一个披萨。旧方法给你整个披萨。LFRAG 则根据配料将披萨切成片。如果你想要意大利辣香肠,它只给你那片意大利辣香肠,而不是包含你不需要的饼边和奶酪的整个披萨。
理解“邻里关系”:
有时,图片和其说明文字在物理上是分开的纸片,但它们属于同一整体。LFRAG 足够智能,能在切割前将这些相关部分重新粘合。它知道“图注”和其下方的文字是一个整体单元。
- 类比: 它知道“标题”和下方的“段落”是一家人,因此将它们保留在同一个块中,而不是将它们拆散。
“后期交互”搜索:
当你提问时,LFRAG 不仅查看文字,还会查看文档的形状和结构。它将你的问题与包含答案的具体“切片”(块)进行匹配。
- 类比: 它不是向整个图书馆大喊你的问题,而是直接对着包含答案的那片披萨轻声细语。
结果:更快、更智能、更经济
作者在它们构建的一个名为LFDocQA的巨大新数据集上测试了这一新系统,这就像是一个拥有由人类标记“切出”答案的巨型文档图书馆。
- 准确性: LFRAG 找到正确信息的能力远胜于旧的“整页”方法。这就像在 haystack(干草堆)中找到针,却无需翻遍整个干草堆。
- 效率: 由于它只将小型且相关的“切片”发送给负责撰写答案的 AI,它节省了73%的计算机算力(token),并将生成答案的速度提高了3.6 倍。
- 质量: 答案更加准确,因为 AI 不会被无关文本分散注意力。
总结
LFRAG 将游戏规则从“给我整页”转变为“给我确切的段落或图表”。通过尊重文档的视觉布局并将其切割为有意义的片段,它使 AI 阅读变得更快、更经济且更加准确,而不会迷失在整页的干扰信息中。
技术摘要:LFRAG – 面向多模态文档理解的布局导向细粒度检索增强生成
问题陈述
多模态检索增强生成(RAG)已成为一种利用视觉丰富文档(如科学论文、财务报告)中的外部知识来增强大语言模型(LLM)的范式。然而,现有的多模态 RAG 系统主要依赖粗粒度的页面级检索。这种方法将整个文档页面视为最小检索单元,引入了显著的局限性:
- 细粒度结构丢失:无法捕捉页面内的层次化语义和布局结构,例如表格的行 - 列关系或图文关联。
- 冗余上下文:检索整个页面会引入大量无关内容,增加下游生成的计算开销,并提高幻觉风险。
- 分辨率损失:视觉 - 语言模型(VLM)中的固定分辨率图像分块通常会对高分辨率页面进行下采样,导致细粒度信息丢失。
现有解决方案要么通过 OCR 将文档转换为纯文本(丢弃视觉/结构数据),要么使用 VLM 编码完整页面(忽略页面内布局)。目前缺乏能够有效地将文档分割为语义连贯的块,同时保留布局信息以进行精确检索的框架。
方法论:LFRAG 框架
为了解决这些挑战,作者提出了LFRAG(布局导向细粒度检索增强生成),这是一个将检索范式从页面级转变为块级的框架。该系统通过四个关键阶段运行:
布局分割与语义块聚合:
- 系统首先使用布局检测模型(DocLayout-YOLO)识别结构区域(如标题、图片、表格、段落)。
- 为了防止过度碎片化(例如将图片与其说明文字分离),采用了一种基于图的语义块聚合算法。该算法根据重叠度、垂直距离和类型一致性,将空间相邻且语义兼容的区域合并为连贯的块。
- 同时创建一个辅助的“掩码页面”块,以保留单个裁剪未捕获的全局背景上下文。
语义 - 布局特征融合编码:
- 设计了一种分层编码策略。块图像由视觉编码器编码,而完整页面被编码以生成全局嵌入。
- 一种交叉注意力机制将全局布局上下文整合到局部块表示中。
- 布局类型标签(如
<Figure>、<Table>)被编码并与投影后的视觉嵌入拼接,以增强结构感知能力。
块级晚期交互检索:
- 检索利用晚期交互机制(受 ColBert 启发)。查询令牌和块表示被编码为多向量嵌入。
- 相关性使用MaxSim 分数(查询令牌与块令牌之间的最大点积)计算,允许在不进行早期融合的情况下进行细粒度对齐。
- 基于该分数检索前 k 个相关块。
增强生成:
- 检索到的前 k 个块和原始查询被输入到 VLM 中进行答案生成。通过将输入限制为精确的块而非完整页面,模型基于结构化的证据进行操作,从而减少噪声。
基准构建:LFDocQA
鉴于缺乏细粒度评估标准,作者构建了LFDocQA,这是首个具有块级边界框标注的多模态文档基准。
- 组成:它包含两个子集:LF-Docmatix(源自一般文档)和LF-PaperTab(源自具有复杂布局的学术论文)。
- 标注:半自动流水线利用大语言模型识别特定查询的真实相关块,确保查询明确地与布局区域而非整个页面对齐。
- 规模:该数据集包含 1,000 个问答对,具有详细的块级标注,涵盖文本、表格和图表等多样化的内容类型。
实验结果
在 LFDocQA 和公共基准(ViDoRe V1, VisDoMBench)上的广泛实验表明:
- 检索性能:LFRAG 实现了最先进的性能。在 LFDocQA(域内)上,它在块级检索中,nDCG@3 优于最佳基线(ColQwen2.5-v0.2)4.95%,Recall@3 优于3.85%。
- 生成性能:与最佳基线相比,LFRAG 将答案准确率提高了7.20%。
- 效率:通过过滤掉无关上下文,LFRAG 将生成任务中的输入令牌消耗减少了73.07%(从约 8–10k 令牌降至约 1.7–2.9k 令牌),同时保持或提高了答案质量。
- 泛化能力:该框架在公共页面级基准上表现出强大的泛化能力,在 ViDoRe V1 上实现了最高的平均 Recall@5,在 VisDoMBench 上实现了最高的平均 ANLCS。
意义与贡献
本文声称有三项主要贡献:
- LFRAG 框架:一种新颖的多模态 RAG 框架,集成了布局分割、语义 - 布局融合编码和块级晚期交互,以实现精确检索和高效生成。
- LFDocQA 基准:首个块级多模态检索和问答基准,填补了现有页面级评估的空白,并实现了严格的细粒度评估。
- 实证验证:广泛的实验证实,从页面级检索转向块级检索显著提高了检索准确率,减少了生成开销,并降低了视觉丰富文档理解中的幻觉风险。
作者得出结论,有效的细粒度检索依赖于语义有意义的分割而非任意分割,并且整合布局信息对于处理复杂的文档结构至关重要。未来的工作计划扩展该框架以更好地处理表格等结构化数据,并探索自适应粒度策略。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。