← 最新论文
💬 NLP

MAGE-RAG: Multigranular Adaptive Graph Evidence for Agentic Multimodal RAG in Long-Document QA

MAGE-RAG 是一种用于长文档多模态问答的多粒度自适应图框架,它通过迭代地激活和剪枝页面及元素节点来构建查询时证据子图,从而在证据覆盖范围与噪声减少之间取得平衡,在 LongDocURL 和 MMLong-Doc 上实现了最先进的性能。

原作者: Yilong Zuo, Xunkai Li, Jing Yuan, Qiangqiang Dai, Hongchao Qin, Ronghua Li

发布于 2026-06-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Yilong Zuo, Xunkai Li, Jing Yuan, Qiangqiang Dai, Hongchao Qin, Ronghua Li

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一名正在试图破解谜题的侦探,但交给你的不是桌上的几件线索,而是一本厚达 500 页、充满了文字、图表、照片和复杂图解的百科全书。你的目标是在其中找到隐藏的特定答案。

这就是**长文档多模态问答(Long-Document Multimodal Question Answering)**所面临的挑战。这篇论文介绍了一种名为 MAGE-RAG 的新系统来解决这个问题。以下是它的工作原理,通过简单的解释呈现:

问题所在:“一刀切”的错误

目前的系统尝试用两种有缺陷的方式来破解这个谜题:

  1. “仅限文本”法: 它们阅读文字,却丢弃了图片和布局。这就像是在阅读一部电影的剧本,却从未见过演员或场景。你可能会错过隐藏在图表或图解中的关键线索。
  2. “整页抓取”法: 它们抓取整页书的内容并展示给 AI。但如果答案只是页面中间的一小句话,AI 就会被周围所有的无关杂物(如广告、页脚或无关图像)所淹没。这就像是试图通过把整个干草堆交给机器人来寻找其中的一根针。

这两种方法都陷入了“固定”模式:无论问题有多难或多易,它们都会抓取固定数量的页面或区块。

解决方案:MAGE-RAG(聪明的侦探)

MAGE-RAG 扮演着一个聪明的、适应性强的侦探角色,它不只是抓取页面,而是构建了一张文档的动态地图

1. 地图(多粒度图谱)

在侦探开始寻找之前,MAGE-RAG 会先构建一张特殊的“地图”。

  • 页面节点(Page Nodes): 这些是大的地标(整个页面)。
  • 元素节点(Element Nodes): 这些是微小的细节(特定的段落、表格、图表或列表)。
  • 连接(Connections): 地图绘制了这些项目之间的线条,展示它们是如何关联的。例如,它知道某个图表是位于特定章节之内的,或者某个表格是紧邻某段文字的。

这张地图允许系统根据需要进行“放大”查看微小细节,或“缩小”以观察整个页面。

2. 调查过程(查询时控制)

当你提出问题时,MAGE-RAG 不会直接把数据一股脑丢给 AI。它玩的是一场带有严格预算(即对使用时间和内存的限制)的“热与冷”游戏。

  • 第 1 步:切入点: 它首先抓取几个可能的页面(就像侦探走进正确的房间)。
  • 第 2 步:迭代搜寻: 系统有一个“控制器”,充当项目经理的角色。它会询问:
    • “我们掌握的信息足够了吗?”
    • “我们是否应该放大并打开那个特定的图表?”(打开节点)
    • “我们应该看前一页还是后一页?”(搜索/扩展)
    • “这个段落无关紧要吗?让我们忽略它。”(剪枝)
  • 第 3 步:预算: 侦探有一条规则:“我只能看 5 页并打开 10 个细节。”如果答案很简单,他们会提前停止。如果答案很复杂且散落在书中的各处,他们会动用全部预算进行深度挖掘。

3. 最终报告(结构化渲染)

一旦侦探收集齐了正确的线索,他们不会只交上一堆乱七八糟的纸张。他们会将证据组织成一份整洁、结构化的报告。他们向 AI 展示特定的文本、图表的精确裁剪图以及相关的页面布局,剔除所有噪音。

为什么它更好(结果)

论文在两个充满长篇、复杂文档的困难数据集(LongDocURL 和 MMLongBench-Doc)上对其进行了测试。

  • 准确性: MAGE-RAG 在一个测试中达到了约 52.75% 的准确率,在另一个测试中达到了 53.26%,击败了以往依赖固定页面计数或纯文本搜索的方法。
  • 效率: 它不仅仅是通过“读得更多”来获胜,而是通过“读得更聪明”来获胜。它成功找到了那些散布在不同页面或隐藏在复杂布局中的答案,而其他系统则错过了这些答案。
  • 透明度: 因为系统保留了“追踪记录”(每一步操作的日志),我们可以清楚地看到它是如何成功或失败的。是漏掉了正确的页面?还是过早地剪枝掉了某个线索?这使得系统更容易进行调试。

核心结论

MAGE-RAG 改变了游戏规则——从“抓取几页并寄希望于运气”转变为“构建地图、追踪线索,并只向 AI 展示解决谜题所需的精准信息”。它平衡了观察大局(页面)的需求与观察精细细节(特定图表或文本)的需求,同时在严格的时间和资源预算内运行。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →