← 最新论文
💻 computer science

An LMM for Precisely Grounding Elements in Documents

本文介绍了 PreciseDoc,这是一种大型多模态模型,旨在通过使用大规模生成的合成训练数据以及将定位与推理统一起来的联合强化学习范式,来提高富文本文档中的视觉定位精度。

原作者: Yijian Lu, Chuangxin Zhao, Kai Sun, Lei Hou, Juanzi Li, Ji Qi

发布于 2026-06-24
📖 1 分钟阅读☕ 轻松阅读

原作者: Yijian Lu, Chuangxin Zhao, Kai Sun, Lei Hou, Juanzi Li, Ji Qi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一个巨大的、杂乱无章的文档库——简历、学术论文、图表和表格。你要求一个聪明的机器人(一种多模态大模型,或称 LMM)寻找特定的信息,比如“在这一份简历中找出电话号码”。

目前的机器人就像是那些能读懂文字但却不擅长指点位置的学生。它们可能会说:“电话号码是 555-0199”,但它们无法告诉你这个号码在页面上的具体位置。如果你要求它们在那个号码周围画个框,它们可能会画在错误的段落上,或者完全错过它。这是一个问题,因为如果机器人无法指向证据,你就无法信任它的答案。

《PreciseDoc》这篇论文介绍了一种专门为成为“指点大师”且成为更好的“思考者”而设计的全新机器人。以下是他们如何构建它的,用简单的语言来解释:

1. 构建更好的训练健身房(数据引擎)

为了教机器人精准地指点,你需要练习材料。作者意识到,现有的练习材料要么太简单,要么缺乏训练所需的“标准答案”(精确的坐标)。

因此,他们建立了两个工厂来大规模生产完美的练习文档:

  • “数字蓝图”工厂: 他们使用计算机代码(LaTeX)生成了数千份完美的简历和文档。因为这些文档是用代码构建的,所以他们完全掌握了每个单词的具体位置,就像拥有房屋的数字蓝图一样。
  • “手写笔记”工厂: 真实的文档通常有凌乱的手写体,或者看起来像是用抖动的相机扫描出来的。为了教机器人处理这种情况,他们创建了一个系统,将单个手写字母(像积木一样)组装成句子,然后添加“相机效果”,如模糊或阴影。这创造了看起来和感觉起来都像真实世界一样凌乱,但仍然带有完美“标准答案”的合成文档。

2. 两阶段训练过程

这个机器人不仅学会了指点,还学会了在指点时进行思考。训练分为两个阶段:

阶段 1:“冷启动”(学习基本功)
在机器人能够自主学习之前,研究人员给了它一份“小抄”。他们提取了现有的问题和答案,并将正确的“指向框”手动插入到机器人的思维过程中。

  • 类比: 想象你在教一个孩子解数学题,你不仅向他们展示步骤,还用高亮标出他们在每一步中使用的确切数字。机器人学会了在给出最终结果之前先说:“我正在看这里的这个框来寻找答案。”

阶段 2:强化学习(带着哨子的教练)
一旦机器人掌握了基础知识,研究人员就让它进行自主练习,但配备了一位严格的教练。

  • 奖励机制: 当机器人猜出一个答案时,教练会检查两件事:
    1. 你得到正确的答案了吗?(答案奖励)
    2. 你指对了位置吗?(定位奖励)
  • “匈牙利算法”技巧: 这是研究人员用来将机器人的框与真实框进行完美匹配的一种高级数学工具。
    • 问题: 如果机器人画了 10 个框,虽然它们都略有不同,但都覆盖了同一个词,那么一个偷懒的评分系统可能会因为它“找到了这个词”而给它满分。
    • 解决方法: 匈牙利算法强制执行一对一匹配。如果机器人为一个词画了 10 个框,则只有一个会被给予信用,而另外 9 个会被惩罚。这防止了机器人通过“刷框”来欺骗系统。
  • 长度惩罚: 教练还会惩罚那些画了许多与任何内容都不匹配的框的机器人。这迫使机器人保持精准,而不是盲目猜测。

3. 结果

这个被称为 PreciseDoc(及其推理版本 PreciseDoc-Reasoner)的新型机器人接受了测试,并与其它顶尖机器人进行了对比。

  • 指点能力: 它在文档中围绕单词、短语和行线绘制紧凑、准确的框方面表现得更好,超越了许多现有模型。
  • 思考能力: 当被问及复杂的文档问题时,它不仅仅是猜测;它会指向它用来得出结论的具体证据。它能够高精度地定位简历中的个人信息或图表中的数据。
  • 通用理解能力: 尽管它是专门针对指点和推理进行训练的,但它在通用的文档理解任务上依然表现出色,其表现与规模更大、更复杂的模型旗鼓相当。

总结

简而言之,作者构建了一个不仅能“阅读”文档,还能“看见”并“指向”信息所在之处的机器人。他们通过创建一个带有完美标准答案的海量合成练习文档库,并教给机器人一条严格的规则:你必须指向证据,才能证明你的答案是正确的。 这使得机器人的推理过程变得透明且更加可靠。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →