← 最新论文
💬 NLP

Unlimited OCR Works

本文介绍了 Unlimited OCR,该模型通过使用一种新颖的参考滑动窗口注意力(Reference Sliding Window Attention, R-SWA)机制取代标准的解码器注意力,从而维持恒定的 KV 缓存,进而实现对数十页内容的单次高效转录,避免了基于大语言模型的 OCR 系统在处理长输出序列时通常会出现的内存和速度退化问题。

原作者: Youyang Yin, Huanhuan Liu, YY, Qunyi Xie, Chaorun Liu, Shiqi Yang, Shaohua Wang, Zhanlong Liu, Hao Zou, Jinyue Chen, Shu Wei, Jingjing Wu, Mingxin Huang, Zhen Wu, Guibin Wang, Tengyu Du, Lei Jia

发布于 2026-06-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Youyang Yin, Huanhuan Liu, YY, Qunyi Xie, Chaorun Liu, Shiqi Yang, Shaohua Wang, Zhanlong Liu, Hao Zou, Jinyue Chen, Shu Wei, Jingjing Wu, Mingxin Huang, Zhen Wu, Guibin Wang, Tengyu Du, Lei Jia

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心问题:当前 AI 的“记忆过载”

想象一下,你正在尝试手工抄写一本 100 页的书。

  • 人类的做法: 你看着书,写下一个句子,然后瞥一眼刚刚写的最后几个字,确保自己没有跑题,接着继续写。你不需要记住从第一页开始写的每一个字;你只需要知道现在进行到哪里了。你的大脑会自然地让遥远的过去“淡出”,同时保持对近期上下文的敏锐感知。
  • 当前 AI 的做法: 现在的 AI 模型就像一个拒绝忘记任何事情的学生。每当它们写下一个新词时,它们都会试图重新阅读从第一页到当前页面的整本书,以决定下一步该写什么。
    • 结果: 随着书的内容变长,这个学生会变得越来越慢,因为他们背负着巨大的心理负担。最终,他们会耗尽内存(RAM),不得不停止、重置,并从新的一页重新开始。这就是为什么当前的 AI 在处理整本书时会遇到困难;它必须像一个陷入循环的机器人一样,一页一页地进行。

解决方案:“Unlimited OCR”与“滑动窗口”

百度研究人员提出了一种名为 Unlimited OCR 的新模型。他们想要构建一个思考方式更像人类抄写员的 AI。为此,他们发明了一种新的注意力机制,称为 参考滑动窗口注意力机制 (Reference Sliding Window Attention, R-SWA)

以下是其工作原理,使用了几个类比:

1. “参考书” vs. “滑动窗口”

想象 AI 正坐在书桌前,桌上有两样东西:

  • 参考书(图像): 这是正在被扫描的文档。AI 在整个过程中都一直开着这本书。它永远不会忘记原始图像。
  • 滑动窗口(近期过去): AI 不再去记忆它写下的全部历史,而是只保留一个关于它最近生成的 128 个词的小型“便利贴”。当它写下一个新词时,便利贴上最旧的一个词就会掉落,而新的词会被添加进去。

神奇之处在于: AI 会观察 参考书(以了解要抄写的内容)和 滑动窗口(以了解自己处于什么进度)。它忽略了其余的历史记录。这使得无论是在抄写 1 页还是 100 页内容时,它的“心理负担”(内存占用)都保持恒定。

2. “深度挤压”(高压缩编码器)

在 AI 开始写作之前,它必须先观察图像。

  • 旧方法: 如果你有一张高分辨率的书籍照片,就像试图描述每一个像素一样,这会占用巨大的空间。
  • Unlimited OCR 的方法: 他们使用了“深度挤压”(DeepEncoder)。想象一下将一张高分辨率照片压缩成一个微小且高效的摘要,且不丢失重要细节。这意味着“参考书”在桌面上占用的空间非常小,为 AI 留出了充足的工作空间。

他们取得了什么成就?

通过将“深度挤压”与“滑动窗口”相结合,研究人员实现了三个主要目标:

  1. 单次长程解析(One-Shot Long-Horizon Parsing): 该模型可以一次性处理数十页的文档。它不需要停止或重置。它可以从头到尾连续不断地读完一整本书。
  2. 恒定速度: 因为 AI 并不试图记住整个历史,所以它不会随着文档变长而变慢。无论是在第 1 页还是第 50 页,它的写作速度都保持一致。
  3. 更高的准确度: 出人意料的是,通过仅关注相关的近期上下文和原始图像,该 AI 实际上比之前的顶尖模型犯的错误更少。它不会被自己冗长的历史记录所干扰。

“现实世界”测试

研究人员在名为 OmniDocBench 的基准测试中对其进行了测试。

  • 结果: Unlimited OCR 的得分高于几乎所有其他模型,包括它所基于的模型(DeepSeek OCR)。
  • 长文本测试: 他们向它输入了超过 40 页的书籍。该模型保持了极高的准确度,证明它在书的中间部分并没有“迷失方向”。

这对未来意味着什么?

论文指出,这不仅仅是为了阅读书籍。由于“滑动窗口”逻辑非常高效,它可以应用于其他需要长时间听取或翻译而不感到疲劳或变慢的任务,例如:

  • ASR(自动语音识别): 在转录数小时音频时,系统不会变慢。
  • 翻译: 一次性完成长篇文档的翻译。

总结

可以将 Unlimited OCR 视为将 AI 从一个会被长任务压垮的“摄影式记忆”升级为一名“聪明的抄写员”,它知道什么需要记住(原始图像和最后几个词),以及什么可以安全地忘记。这使得它能够工作得更快、占用更少的内存,并能处理以往 AI 无法一次性处理的海量文档。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →