← 最新论文
🤖 AI

OvisOCR2 Technical Report

OvisOCR2 是一个 0.8B 参数量的端到端文档解析模型,它利用一种新颖的数据引擎以及包含强化学习和蒸馏的多阶段训练方案,通过直接生成文档页面的 Markdown 表示,在基准数据集上实现了最先进的性能。

原作者: Shiyin Lu, Yinglun Li, Yu Xia, Yuhui Chen, An-Yang Ji, Jun-Peng Jiang, Qing-Guo Chen, Jianshan Zhao, En Lin, Haijun Li, Cheng Qin, Zhao Xu, Weihua Luo

发布于 2026-07-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Shiyin Lu, Yinglun Li, Yu Xia, Yuhui Chen, An-Yang Ji, Jun-Peng Jiang, Qing-Guo Chen, Jianshan Zhao, En Lin, Haijun Li, Cheng Qin, Zhao Xu, Weihua Luo

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你手里拿着一本实体书、一封手写信或一张复杂的收据。对人类来说,阅读非常容易:你知道从哪一列开始读,知道如何跳过图片回到正文,也知道如何分辨出一条弯弯曲曲的线是一个数学公式而不是随手涂鸦。但对计算机而言,同一页纸仅仅是一个由彩色像素组成的平坦网格。它看到的是一堆形状的混乱堆砌,却无法理解一个表格是一个网格,一个公式是一个计算过程,或者页面底部的文字属于下一列的顶部。这就是“文档解析”(document parsing)的世界。它是将一张页面的图片转化为计算机可以真正阅读、搜索和使用的数字文件的魔术。长期以来,计算机试图通过将工作分解为微小的、独立的步骤来完成这项任务——首先寻找线条,然后识别文字,再猜测表格的位置。但这种“流水线”式的方法非常笨拙;如果第一步漏掉了表格边界,后面的机器就会陷入瘫痪。这个领域的一个重大问题一直是:我们能否构建一个单一的、聪明的“大脑”,像人类一样观察全局并一次性写出整个故事?

于是有了 OvisOCR2,这是由阿里巴巴研究人员开发的一种新型数字“阅读器”。不要把 OvisOCR2 想象成一个庞大、笨重的超级计算机,而要把它看作一个灵巧的、拥有 0.8 亿参数的“口袋型”天才。虽然其他试图解决这一问题的模型通常规模巨大且需要庞大的数据中心,但 OvisOCR2 的设计目标是小巧、快速且功能强大。研究人员使用一种巧妙的两部分训练策略构建了这个模型。首先,他们向模型喂入了一个海量的现实世界文档库——包括扫描件、收据和报告——但他们非常小心地清理了这些“答案”,确保模型是从完美的示例中学习,而不是从混乱的错误中学习。接着,他们创建了一个“合成”训练场。想象一下一款视频游戏,他们可以在其中生成无限页具有完美已知答案的文档,且专门设计得极具挑战性(例如带有潦草手写体或单元格合并方式奇特的页面)。这使得模型能够在不需要先在现实世界中寻找这些难题之前,就在这些最难的谜题上进行练习。

整个训练过程就像是一场严格的运动训练营。模型首先学习基础知识(监督微调),然后进入“强化学习”阶段,在那里它玩起了一场游戏:它尝试阅读一个页面,如果它正确识别了表格或数学公式,它就会获得高分;如果它弄错了顺序或漏掉了一行,它就会得到低分。为了确保这个微小的 0.8B 模型能向顶尖水平看齐,研究人员采用了“教师-学生”教学法。他们首先训练了一个规模更大的、拥有 40 亿参数的“教师”模型,使其成为处理这些任务的大师,然后通过让这个较小的“学生”模型(OvisOCR2)模仿教师的最佳动作来对其进行教学。这使得这个小模型能够发挥出远超其自身量级的战斗力。

结果是一个游戏规则的改变者。在测试标准基准测试集 OmniDocBench v1.6(这相当于文档阅读领域的“奥林匹克”)时,OvisOCR2 取得了令人印象深刻的 96.58 分。这意义重大,因为这意味着这个小型端到端模型实际上击败了那些一直统治该领域的庞大且复杂的“流水线”系统。它不仅在整体表现上胜出,在阅读文本、理解数学公式以及重建复杂表格方面也表现卓越。它在 PureDocBench 上也获得了 75.06 的高分。甚至在作者创建的一个包含棘手手写体和混乱表格的自定义高难度测试中,OversOCR2 也名列前茅,证明了它不仅能在干净、完美的页面上工作,也能应对现实世界的混乱情况。

然而,研究人员也诚实地指出了局限性。虽然 OvisOCR2 是一个巨大的飞跃,但与一些庞大的通用型 AI 模型相比,它在处理非常模糊、受损或在光线不佳环境下手机拍摄的图像时仍会遇到一些困难。它不是一个能解决一切问题的魔杖,但它是一个非常强大且高效的工具,证明了你不需要价值数十亿美元的计算机也能完美地阅读文档。该论文指出,通过这种方法,我们终于可以从笨重的多步机器转向优雅的单模型解决方案,并将其应用于日常应用中,使数字世界变得更加触手可及。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →