← 最新论文
💻 computer science

LFRAG: Layout-oriented Fine-grained Retrieval-Augmented Generation on Multimodal Document Understanding

本文提出了 LFRAG,这是一个新颖的框架,通过利用布局感知分割和语义 - 布局融合,将检索增强生成从粗粒度的页面级检索转变为细粒度的块级检索,从而在新引入的 LFDocQA 基准测试上实现了最先进的性能并显著提升了效率。

原作者: Yifan Zhu, Yu Mi, Yue Lu, Yanchu Guan, Zhixuan Chu

发布于 2026-05-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Yifan Zhu, Yu Mi, Yue Lu, Yanchu Guan, Zhixuan Chu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在一座巨大的图书馆中寻找某句特定的话,但你并非阅读文字,而是在查看书页的照片。

旧方法:“整页”问题
目前,大多数帮助你从文档中查找信息的 AI 系统,运作起来就像一位笨拙的图书管理员。当你提出问题时,它们会从书架上抓取整页内容递给你。

  • 问题所在: 如果你询问的是 300 字页面中间的一个小图表,AI 会给你整页内容。你现在不得不从 290 个无关的单词中费力搜寻,才能找到你需要的那句话。这不仅缓慢,浪费计算机算力,还常常让 AI 感到困惑,导致其产生“幻觉”(编造内容),因为它看到了过多的干扰信息。
  • 类比: 这就像你问朋友“天气怎么样?”,对方却把整份报纸递给你,包括体育版、漫画和股市行情,仅仅因为天气预报在第 4 版。

新方案:LFRAG(“智能剪刀”)
该论文介绍了一种名为LFRAG(面向布局的细粒度检索增强生成)的新系统。你可以将 LFRAG 想象为一位拥有智能剪刀且深刻理解页面组织方式的图书管理员。

  1. 将页面切割为“语义块”:
    LFRAG 不会把整页递给你,而是先查看文档的布局(标题、表格和图片的位置)。它将页面切割成逻辑上的“块”。

    • 类比: 想象一个披萨。旧方法给你整个披萨。LFRAG 则根据配料将披萨切成片。如果你想要意大利辣香肠,它只给你那片意大利辣香肠,而不是包含你不需要的饼边和奶酪的整个披萨。
  2. 理解“邻里关系”:
    有时,图片和其说明文字在物理上是分开的纸片,但它们属于同一整体。LFRAG 足够智能,能在切割前将这些相关部分重新粘合。它知道“图注”和其下方的文字是一个整体单元。

    • 类比: 它知道“标题”和下方的“段落”是一家人,因此将它们保留在同一个块中,而不是将它们拆散。
  3. “后期交互”搜索:
    当你提问时,LFRAG 不仅查看文字,还会查看文档的形状结构。它将你的问题与包含答案的具体“切片”(块)进行匹配。

    • 类比: 它不是向整个图书馆大喊你的问题,而是直接对着包含答案的那片披萨轻声细语。

结果:更快、更智能、更经济
作者在它们构建的一个名为LFDocQA的巨大新数据集上测试了这一新系统,这就像是一个拥有由人类标记“切出”答案的巨型文档图书馆。

  • 准确性: LFRAG 找到正确信息的能力远胜于旧的“整页”方法。这就像在 haystack(干草堆)中找到针,却无需翻遍整个干草堆。
  • 效率: 由于它只将小型且相关的“切片”发送给负责撰写答案的 AI,它节省了73%的计算机算力(token),并将生成答案的速度提高了3.6 倍
  • 质量: 答案更加准确,因为 AI 不会被无关文本分散注意力。

总结
LFRAG 将游戏规则从“给我整页”转变为“给我确切的段落或图表”。通过尊重文档的视觉布局并将其切割为有意义的片段,它使 AI 阅读变得更快、更经济且更加准确,而不会迷失在整页的干扰信息中。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →