← 最新论文
💬 NLP

HPD-Parsing: Hierarchical Parallel Document Parsing

HPD-Parsing 引入了一种结合全局布局分析、并发块级内容生成以及渐进式多标记预测的分层并行解码范式,在保持竞争性准确度的同时,实现了每秒 4,752 个标记的吞吐量(比现有模型快 2.62 倍)。

原作者: Shu Wei, Jingjing Wu, Lingshu Zhang, Qunyi Xie, Hao Zou, Le Xiang, Xu Fan, Yangliu Xu, Manhui Lin, Xiaolong Ma, Cheng Cui, Tengyu Du, YY

发布于 2026-07-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Shu Wei, Jingjing Wu, Lingshu Zhang, Qunyi Xie, Hao Zou, Le Xiang, Xu Fan, Yangliu Xu, Manhui Lin, Xiaolong Ma, Cheng Cui, Tengyu Du, YY

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图阅读一本被胶水粘死的、极其庞大且复杂的图书馆书籍。为了理解它,你必须从第一页到最后一页,一个接一个地阅读每一个单词,绝不能跳过任何部分。这就是目前许多现代计算机程序尝试“阅读”PDF或扫描件等文档的方式。它们使用一种叫做视觉语言模型(Vision-Language Model, VLM)的人工智能,这种模型就像一个既能看图又能识字的超级智能机器人。虽然这些机器人理解文档内容的能力正变得极其出色,但它们的处理速度却慢得令人痛苦。这就像是在玩一个巨大的拼图游戏,却只能一次只看一块碎片,必须等前一个碎片放好后才能碰下一个。随着文档变得越来越长,且充斥着密集的文本、表格和数学公式,这种“一个接一个”的方法就会变成一场交通大堵塞,使得快速处理成千上万份文档变得难上加难。

这正是名为 HPD-Parsing 的新思路大显身手的地方。该项目的研究人员意识到,虽然文档需要一个全局规划(比如知道章节的顺序),但每个部分的实际阅读过程并不一定需要严格按线性顺序进行。他们提出了一种更聪明的工作方式:与其让一个机器人按顺序阅读整本书,不如使用一个团队。一个“管理者”机器人负责理清布局并指向不同的部分,而一个“工人”机器人团队则负责阅读这些部分。他们还加入了一个窍门,让机器人可以一次性预测多个单词,从而避免了在每个单词后都停下来思考。结果显示,这种系统速度极快——每秒处理超过 4,752 个单词——且完全没有损失理解文档的能力。

问题所在:缓慢的单列队伍

把传统的文档解析器想象成一个试图吃完一顿丰盛多道菜宴席的单人。他必须先喝完汤,才能动沙拉;必须吃完沙拉,才能吃主菜。即使汤很简单,在汤喝完之前,他也无法开始吃沙拉。在计算机科学领域,这被称为自回归生成(autoregressive generation)。计算机逐个生成输出(即它从文档中读出的文本)中的标记(token,即单词的一个微小片段)。它观察自己刚刚写下的内容,决定下一步写什么,写下它,然后重复此过程。

对于短笔记,这没问题。但对于一份包含图表、数学方程和密集文本的 50 页文档,这种单列队伍会造成严重的瓶颈。计算机大部分时间都在等待自己完成上一步,才能进行下一步。研究人员发现,对于长文档,解码文本所花费的时间几乎是仅仅观察页面图像时间的 500 倍。这就像是为了买一个苹果,花了五个小时开车去超市,结果在超市里只花了一分钟。

解决方案:超级阅读者团队

HPD-Parsing 的作者决定打破这种单列队伍。他们引入了**分层并行解码(Hierarchical Parallel Decoding)**的概念。想象一个建筑工地,一名领班(“布局分支”)站在脚手架上俯瞰整栋建筑。领班并不负责砌每一块砖,而是指着墙的不同部分说:“你,去盖厨房!你,去盖卧室!你,去盖浴室!”

在这个新系统中:

  1. 管理者(布局分支): 这部分 AI 首先观察整个文档图像。它理清结构:“这里是一个标题,这里是一个段落,这里是一个表格,这里是一个数学公式。”它创建了一张文档地图。
  2. 工人(内容分支): 一旦管理者识别出一个部分,它就会生成一个新的、独立的“工人”AI 来专门阅读该部分。至关重要的是,这些工人同时开始阅读他们分配到的部分。他们不需要等厨房盖好后再开始盖卧室。
  3. 共享内存: 为了节省时间,所有这些工人共享原始图像和管理者地图的“记忆”。他们不需要重新阅读整张图片,只需专注于自己的特定任务。

秘密武器:预测未来

即便有了工人团队,一个词一个词地阅读仍然有点慢。因此,研究人员加入了第二层加速机制,称为渐进式多标记预测(Progressive Multi-Token Prediction, P-MTP)

想象你在读这样一个句子:“猫坐在……”
普通的读者在读到“在”之后就会停下来,苦思冥想接下来是什么。他们可能会猜“垫子上”。然后他们再次停下来思考下一个词。
P-MTP 系统就像是一个读者,看到“猫坐在”时,就能自信地一次性猜出接下来的三个词:“垫子上,并且,睡觉”。然后它会检查这些猜测是否正确。如果正确,它就一次性写下所有词;如果不正确,它会自我纠正并重试。

在 HPD-Parsing 系统中,每一个工人(以及管理者)都使用了这个窍门。他们不再是一步一个脚印,而是大步跨越,一次预测多个单词。论文报告称,平均而言,这使得系统可以在一个步骤中接受大约 6.6 个单词,而不是仅仅一个。

结果:快速且准确

研究人员在名为 OmniDocBench V1.6 的标准基准测试上测试了这个新系统,该测试包含了各种具有复杂布局、数学公式和表格的棘手文档。

  • 速度: 新的 HPD-Parsing 系统实现了 4,752 个标记/秒 的速度。这比标准的“一个接一个”方法快了 3.06 倍,也比目前最快的现有文档解析器快了 2.62 倍
  • 准确性: 尽管速度如此之快,系统并没有变得粗糙。它保持了 94.91 的极具竞争力的准确率得分,这实际上高于许多规模更大、速度更慢的模型。
  • 错误处理: 团队展示了这种方法也更具鲁棒性。如果传统系统在早期犯了错,它往往会陷入混乱,并在剩下的文档中不断重复同样的错误。由于 HPD-Parsing 将工作拆分为独立的分支,因此一个部分(如表格)中的错误会被限制在该部分内,不会破坏文档的其他部分。

为什么这很重要

这篇论文表明,我们不必在速度和准确性之间做选择。通过意识到文档具有天然的结构——即一个可以由一个大脑管理的全局布局,而局部内容可以由许多协同工作的大脑来阅读——我们可以更高效地处理信息。

研究人员不仅构建了一个更快的计算机,他们还改变了计算机“阅读”的方式。他们没有制造一个孤独、缓慢的步行者,而是打造了一支协调一致的短跑队。他们认为,这种方法为实时处理海量文档库开辟了大门,使得 AI 在信息提取、研究和数据检索方面的规模化应用成为可能,而这在以前是无法实现的。论文总结道,这种“分层并行”的风格是文档解析领域一个强大的新方向。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →