MonkeyOCRv2: A Visual-Text Foundation Model for Document AI
MonkeyOCRv2 是一种视觉-文本基础模型,通过使用图像到文本生成和像素级重建的双重策略在包含 1.13 亿张图像的海量文档语料库上进行了预训练,这使其在文档分析任务中显著优于现有的编码器,并在集成到多模态大语言模型时,能够实现高效且达到最先进水平的文档解析与理解。
原始论文根据 CC0 1.0(http://creativecommons.org/publicdomain/zero/1.0/)发布到公有领域。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
技术摘要:MonkeyOCRv2
问题陈述
主流的视觉基础模型(如 CLIP、DINO、SAM)主要在自然图像上进行预训练,侧重于高层物体语义、全局对齐和场景上下文。当应用于文档图像时,这些模型表现出表示失配(representation mismatch)。文档图像具有文本密集、字符笔画精细、布局复杂以及语义高度依赖局部视觉细节(如标点符号、上标、笔画变化)等特征。现有的模型往往为了追求语义抽象而舍弃了这些细粒度的细节,导致其不适用于文档解析、理解及相关任务。此外,现有的面向文档的预训练数据集在规模、语言多样性和标注粒度方面都存在局限性,通常仅覆盖中文和英文,或缺乏稠密监督。
方法论
1. 数据引擎:MonkeyDoc v2
为了解决数据稀缺和分布差异问题,作者构建了 MonkeyDoc v2,这是目前已知最大的面向文档的视觉-文本预训练语料库。
- 规模: 1.13 亿张图像。
- 多样性: 涵盖 17 种语言(包括简体/繁体中文、英文、阿拉伯文、德文等)以及多种文档类型(科学论文、发票、手写笔记、古籍、公式、表格)。
- 组成: 6100 万个真实样本和 5200 万个合成样本。
- 标注流水线: 利用多专家共识流水线,通过多个互补的 OCR 模型对裁剪元素进行转录;保留具有最高成对一致性的预测结果,以抑制特定模型的误差。利用布局验证和基于大语言模型的逻辑一致性检查来过滤低质量样本。
2. 预训练策略:联合生成与重建
MonkeyOCRv2 采用双重目标预训练策略,以学习文档原生视觉表示:
- 图像到文本生成: 使用标准的自回归交叉熵损失 () 将视觉表示与文本内容对齐。这为语义理解提供了稠密监督。
- 像素级文档重建: 鼓励编码器保留细粒度的视觉细节(字符笔画、字形形状、布局结构),这些细节在纯文本监督下可能会被丢弃。这是通过均方误差损失 () 以及可选的匹配边缘和距离边缘图的结构感知损失 () 来实现的。
- 组合目标: 。重建目标作为一个正则项,确保即使在语言上下文较弱或缺失的情况下,编码器也能保留视觉证据。
3. 架构
该模型家族包含三个在 MonkeyDoc v2 上从头开始训练的视觉编码器变体:
- MonkeyOCRv2-S: ViT-Small(28M 参数)。
- MonkeyOCRv2-B: ViT-Base(113M 参数)。
- MonkeyOCRv2-AS: ViTAEv2-Small(21M 参数),针对受益于多尺度归纳偏置的任务(如检测、分割)进行了优化。
核心贡献
- MonkeyOCRv2: 一个专门为文档 AI 预训练的视觉-文本基础模型,通过联合文本生成和像素级重建,解决了自然图像编码器与文档图像之间的表示失配问题。
- MonkeyDoc v2: 一个大规模、多语言(17 种语言)、多类型(1.13 亿张图像)的预训练语料库,其规模和多样性显著超过了现有的文档数据集。
- 双目标预训练: 证明了将图像到文本生成与像素级重建相结合,可以提高鲁棒性,特别是在语言上下文被移除或退化的情况下。
实验结果
下游任务性能
使用 MonkeyOCRv2 替换原始编码器后,在五项代表性的文档分析任务中均取得了持续的提升:
- 文本识别: 在具有挑战性的基准测试中,将 CRNN 的准确率从 58.7% 提升至 67.3%。使用 MonkeyOCRv2 的 PARSeq 在 Union14M 和中文基准测试上达到了 SOTA(最先进)性能。
- 公式识别: 一个 1.1 亿参数的模型(UniMERNet-T + MonkeyOCRv2)超越了 3.25 亿参数的 UniMERNet-B,证明了更强的文档导向编码器可以补偿模型容量的减少。
- 文本检测: 在 ICDAR2015、ArT、Total-Text 和 CTW1500 上实现了持续的 F-measure 增益,超越了 ImageNet 预训练编码器和 oCLIP(一种特定于文本的编码器)。
- 文档篡改检测: 在 DocTamper-Test、DocTampe-FCD 和 DocTamper-SCD 上取得了 SOTA F1 分数,展示了强大的领域迁移泛化能力。
- 重叠文本分割: 在 MOT 数据集上的 mIoU 提升了 4.3% 至 6.3%。
文档解析与理解
- 文档解析 (MDPBench): MonkeyOCRv2-B-Parsing(总参数 0.7B,视觉编码器 0.1B)在 MDPBench 上达到了 83.3%,尽管其视觉编码器规模仅为之前开源 SOTA(dots.mocr,3B 参数)的约 1/11,但仍实现了 2.8% 的绝对提升。它还在 OmniDocBench 上超越了 Qwen3-VL-235B 和 GPT-5.2 等大型通用 VLM。
- 文档理解: 在受控设置下(冻结编码器并配对相同的 Qwen3-1.7B LLM),MonkeyOCRv2-B 在八个基准测试中的平均得分达到 57.2,显著优于 CLIP、DINO、SAM 和其他面向文档的编码器。
鲁棒性分析
- 语言上下文依赖性: 一项使用乱序文本进行的受控研究表明,MonkeyOCRv2 对分辨率退化和语言上下文移除具有更强的鲁棒性。像素重建目标缩小了语义连贯文本与乱序文本之间的准确率差距,表明其对视觉证据的依赖程度更高,而非仅仅依赖语言先验。
- 幻觉: 在 CHAOS-Bench 上,MonkeyOCRv2-Parsing 在受扰动词汇上的页面平均召回率最高,展示了与 HunyuanOCR-1.5 和 PaddleOCR-VL-1.6 相比更优的视觉证据忠实度。
意义与主张
本文认为,面向文档的视觉预训练本身可以作为文档智能的基础,而不是依赖于为自然场景构建的编码器。
- 范式转变: 这项工作挑战了将通用视觉模型适配到文档领域的范式,认为文档独特的视觉统计特性(密集文本、精细笔画)需要专门的预训练目标。
- 效率: 它证明了当视觉表示针对特定领域进行优化时,一个紧凑的文档原生编码器(0.1B)可以超越大规模通用 VLM(数百亿参数)在文档特定任务上的表现。
- 视觉证据保留: 研究验证了像素级重建目标对于保留细粒度细节至关重要,从而在语言上下文模糊或缺失的情况下提高鲁棒性。
作者总结道,MonkeyOCRv2 和 MonkeyDoc v2 为多语言 OCR、文档理解及更广泛的文档智能系统提供了可复用的基础,将文本确立为一种“第一类视觉模态”。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。