← 最新论文
💬 NLP

G2G^2-Reader: Dual Evolving Graphs for Multimodal Document QA

G2G^2-Reader 通过引入一个演进式的双图系统——即用于保留原生文档结构的内容图(Content Graph)和用于指导迭代式证据收集的规划图(Planning Graph)——解决了多模态长文档问答中检索增强生成的脆弱性问题,并在 VisDoMBench 上实现了最先进的性能。

原作者: Yaxin Du, Junru Song, Yifan Zhou, Cheng Wang, Jiahao Gu, Zimeng Chen, Menglan Chen, Wen Yao, Yang Yang, Ying Wen, Siheng Chen

发布于 2026-01-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Yaxin Du, Junru Song, Yifan Zhou, Cheng Wang, Jiahao Gu, Zimeng Chen, Menglan Chen, Wen Yao, Yang Yang, Ying Wen, Siheng Chen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图破解一部长达 500 页的宏大推理小说,这部小说由文字、图表、照片和手写笔记混合而成。你是一位专家级侦探(AI),但你的记忆力非常短暂:你一次只能在大脑中保留大约 10 页的内容。

这就是这个被称为 多模态文档问答(Multimodal Document QA)的问题。目前的 AI 系统尝试通过将书切成无数细小的、扁平的碎片(就像把拼图切成一个个独立的方块)来解决这个问题,并从中搜索正确的碎片。问题在于,这破坏了整体画面。一个图表与其说明文字被分开了;一个图形与其解释性的段落被分开了。AI 最终得到的是“语义碎片”——这些碎片在自身独立存在时是无法理解的。

G2-Reader 是一个旨在解决这一问题的全新系统。作者提出了一个使用两个演进图(可以理解为两种不同的地图)协同工作的方案。

1. 内容图(Content Graph):“活的百科全书”

与其将文档切成扁平的碎片,G2-Reader 构建了一个内容图

  • 类比: 想象文档不是一叠纸,而是一座城市
    • 节点(建筑): 每个段落、表格或图形都是一座建筑。
    • 边(道路): 它们之间的连接是道路。标题是连接到图片的道路;引用是连接到前文段落的道路。
  • 魔力(演进): 在旧系统中,这些道路仅仅基于物理上的相邻关系。在 G2-Reader 中,系统表现得像是一个不断在街道上巡逻的城市规划师。它会问:“这座建筑真的和那座建筑有关联吗?”
    • 如果第一章的一个图表解释了第五章的一个图形,规划师就会建立一条新的、隐形的道路将两者连接起来。
    • 它会更新建筑上的“标牌”(摘要),使其包含来自邻近建筑的上下文信息。
    • 结果: AI 不再只是看到一个漂浮的图表;它看到的是一个与它所讲述的故事相连的图表。这保留了文档的“原生结构”。

2. 规划图(Planning Graph):“代理侦探的笔记本”

一旦城市地图构建完成,AI 就需要解决特定的问题。这就是规划图发挥作用的地方。

  • 类比: 想象一名侦探正在试图破解一起复杂的案件。他不是在盲目猜测,而是在笔记本中写下一个子问题流程图
    • 根节点: 主问题(“谁偷了饼干?”)。
    • 分支: 更小的问题(“管家进入过房间吗?”、“饼干罐开着吗?”)。
  • 魔力(动态重规划):
    • AI 作为一个智能体(Agent)运行。它遵循流程图,在“内容图”(城市)中寻找每个子问题的证据。
    • “证据检查员”: 在收集完线索后,系统的一个特殊部分充当质量控制检查员。它查看笔记本并询问:“我们是否有足够的证据来破解主案?”
    • “重规划”: 如果检查员说:“不,我们缺少关于管家不在场证明的数据,”系统不会仅仅进行猜测。它会重写流程图。它会增加一个新的分支到笔记本中,专门用于寻找那个缺失的不在场证明。
    • 结果: AI 永远不会陷入死循环。它对已知信息和仍需寻找的信息拥有持久的记忆,从而引导它循序渐进地找到答案。

它们如何协同工作

可以将内容图视为图书馆(书籍被完美地组织在一起,并带有交叉引用),而将规划图视为图书管理员的策略(寻找正确书籍的逐步计划)。

  1. 图书管理员(规划图)将大问题分解为小的任务。
  2. 对于每个任务,他们前往图书馆(内容图)。由于图书馆是具有“生命力”的连接,他们能瞬间找到相关的文本、表格和图像集群。
  3. 如果图书管理员意识到自己遗漏了一个线索,他们不会盲目游荡;他们会更新自己的策略图,并回到图书馆去寻找那个特定的缺失部分。

结果

作者在名为 VisDoMBench 的基准测试中测试了这个系统,该测试涉及关于幻灯片、科学论文和表格的复杂问题。

  • 他们使用了一个开源 AI 模型(Qwen3-VL-32B)作为“大脑”。
  • 成果: G2-Reader 达到了 66.21% 的准确率
  • 对比: 这击败了尝试独立完成此任务的最佳开源模型(29.90%),甚至击败了一个庞大的、专有的“超级模型”(GPT-5),后者的得分仅为 53.08%

核心启示

该论文声称,对于包含图片和表格的复杂多页文档,结构比单纯的原始算力更重要。通过赋予 AI 一个结构化的文档地图(内容图)和一个搜索它的动态计划(规划图),一个较小的开源 AI 可以超越那些仅仅试图一次性阅读所有内容的更大、更“笨”的系统。

该论文并非声称这已准备好用于医疗诊断或法律法庭;它仅仅证明了这种“双图”架构是阅读和推理复杂文档的一种更优越的方式。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →