← 最新论文
🤖 AI

Prefix-Adaptive Block Diffusion for Efficient Document Recognition

本文提出了前缀自适应块扩散模型(PA-BDM),该模型通过将固定块边界替换为动态前缀承诺与因果去噪以解决信息流不一致问题,从而提升高效文档识别能力,在实现更优准确性的同时,相较于现有模型将推理吞吐量提高了 71.6%。

原作者: Mingxu Chai, Ziyu Shen, Chenyu Liu, Kaidi Zhang, Jiazheng Zhang, Dingwei Zhu, Zhiheng Xi, Ruoyu Chen, Jun Long, Jihua Kang, Tao Gui, Qi Zhang

发布于 2026-05-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Mingxu Chai, Ziyu Shen, Chenyu Liu, Kaidi Zhang, Jiazheng Zhang, Dingwei Zhu, Zhiheng Xi, Ruoyu Chen, Jun Long, Jihua Kang, Tao Gui, Qi Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图将文档图像中复杂的手写数学公式或密集表格转录为计算机可读格式。

旧方法(“刚性区块”问题)
将当前的高效 AI 模型(称为块扩散模型)想象成一个轮班工作的抄写员团队。他们将页面划分为固定大小的块,例如每次处理 32 个词。

  • 瓶颈: 他们同时处理所有 32 个词(速度很快),但在整个 32 个词的块完成之前,无法保存进度或“锁定”其中任何一个词。
  • 混乱: 在该块内部,抄写员可以相互查看彼此从左到右以及从右到左的工作。虽然这看似有帮助,但当他们移动到下一个块时,会造成混乱。下一个块只知道其之前的内容(从左到右),但前一个块却是方向混杂的混合体。这种不一致性使得难以正确构建数学公式或表格等内容的结构。
  • 浪费: 随着他们在块内完成单词,“并行”工作会因剩余待猜测的单词减少而变慢。这就像一条工厂流水线,一旦完成了一半产品,效率就会下降。

新解决方案:PA-BDM(“自适应抄写员”)
作者提出了一种名为**前缀自适应块扩散(PA-BDM)**的新方法。以下是它如何通过简单的类比改变游戏规则:

1. “候选范围”与“固定盒子”

PA-BDM 不再将 32 个词的块视为必须在继续前进前填满的刚性盒子,而是将其视为最大候选范围

  • 类比: 想象你在用水桶装水。旧方法说:“你必须装满整个水桶,才能将水倒入储水箱。”PA-BDM 则说:“尽可能装满水桶,一旦你确定一杯水是干净安全的,就立即将其倒入储水箱。”
  • 结果: AI 无需等待整个块完成。它会抓取“可靠”的部分(前缀)并立即保存。

2. 因果流(“单行道”)

旧方法允许抄写员在块内向后和向前查看,这混淆了顺序。PA-BDM 强制所有人只向前看(从左到右),就像阅读书籍一样。

  • 类比: 在旧系统中,句子中间的抄写员可以窥视句尾来猜测中间部分。这对于随意聊天可能有效,但在处理数学公式等严格结构时却会失败,因为顺序至关重要。PA-BDM 执行严格的“单行道”规则,确保 AI 每次都学习正确的序列。

3. 渐进式前缀提交(PPC)——“信心检查”

这是新系统的核心引擎。当 AI 猜测下一批词时,它会检查自身的信心。

  • 工作原理: 如果 AI 对 32 个词块中的前 10 个词有 99% 的把握,它会立即“提交”(锁定)这 10 个词。然后,它丢弃剩余的 22 个猜测,并基于这 10 个已锁定的词开始新一轮的 32 个词猜测。
  • 优势: 这重置了“并行空间”。AI 不再处理从 22 个、10 个到 5 个逐渐缩小的列表,而是可以反复处理全新的、完整的 32 个词组。这保持了高速运行。

4. 置信度门控结构损失(CSL)——“严格教师”

在训练期间,AI 通过尝试修正错误来学习。旧方法迫使 AI 从所有错误中学习,即使句子的开头已经不稳定。

  • 修正: PA-BDM 使用“置信度门”。如果 AI 对句子的开头不确定,教师(训练算法)就会停止对句子其余部分评分。它只给 AI 确信的部分评分。
  • 类比: 想象一位老师在批改数学试卷。如果学生第一步就错了,老师就不会浪费时间批改最终答案,因为它是基于错误前提得出的。老师会等到学生第一步做对后,再批改其余部分。这防止了 AI 学习“嘈杂”或错误的模式。

结果

该论文声称,这种新方法PA-BDM是一次巨大的升级:

  • 速度: 它比之前的最佳扩散模型(MinerU-Diffusion)快71.6%,比标准自回归模型(逐个词书写)快约8 倍
  • 准确性: 由于它尊重标记的严格顺序,它在识别数学公式、表格和图表等复杂结构方面更加准确。
  • 效率: 它使用内存的效率与旧模型相当,但在相同时间内完成了更多工作。

简而言之,PA-BDM 阻止了 AI 等待“完美区块”,而是让它立即锁定“足够好”的进展,使流水线在保持准确性的同时以最高速度运转。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →