← 最新论文
💻 computer science

PaddleOCR-VL-1.5: Towards a Multi-Task 0.9B VLM for Robust In-the-Wild Document Parsing

本文介绍了 PaddleOCR-VL-1.5,这是一款在 OmniDocBench v1.5 和新提出的 Real5-OmniDocBench 基准上均取得 94.5% SOTA 精度的 0.9B 超轻量多任务视觉语言模型,具备卓越的抗物理畸变鲁棒性,并扩展了印章识别与文本定位能力。

原作者: Cheng Cui, Ting Sun, Suyin Liang, Tingquan Gao, Zelun Zhang, Jiaxuan Liu, Xueqing Wang, Changda Zhou, Hongen Liu, Manhui Lin, Yue Zhang, Yubo Zhang, Yi Liu, Dianhai Yu, Yanjun Ma

发布于 2026-04-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Cheng Cui, Ting Sun, Suyin Liang, Tingquan Gao, Zelun Zhang, Jiaxuan Liu, Xueqing Wang, Changda Zhou, Hongen Liu, Manhui Lin, Yue Zhang, Yubo Zhang, Yi Liu, Dianhai Yu, Yanjun Ma

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 PaddleOCR-VL-1.5 的“超级文档阅读助手”。为了让你轻松理解,我们可以把它想象成一个拥有“透视眼”和“超级大脑”的 0.9B(9 亿参数)小精灵

虽然它个头很小(只有 0.9B 参数,比那些几百亿参数的“巨无霸”模型要轻量得多),但它却干得比那些大个子更漂亮、更聪明。

以下是用生活化的比喻对这篇论文核心内容的解读:

1. 它的核心任务:不只是“识字”,而是“读心”

以前的 OCR(文字识别)工具,就像是一个只会机械抄写的学生。你给它一张歪歪扭扭的纸,它只能勉强把字抄下来,但完全不知道这段话属于哪一部分,也不知道表格里的数据该往哪放。

PaddleOCR-VL-1.5 则像是一个经验丰富的老编辑

  • 它不仅能把字认出来,还能理解文档的结构:哪里是标题,哪里是正文,哪里是表格,哪里是公式。
  • 它能把杂乱的文档“整理”成整齐的 Markdown 或 JSON 格式,就像把一堆散乱的乐高积木,瞬间拼成了一辆完整的赛车。

2. 它的超能力:在“恶劣环境”下也能看清

这是这篇论文最厉害的地方。以前的模型就像温室里的花朵,只认得打印在 A4 纸上、平整干净的文档。一旦遇到现实生活中的“烂场景”,它们就抓瞎了。

PaddleOCR-VL-1.5 则像是一个在泥地里练出来的特种兵,专门应对以下“地狱级”挑战:

  • 歪歪扭扭(Skew):照片拍歪了,它也能把字扶正。
  • 皱皱巴巴(Warping):纸张被揉皱了,或者像贴在弯曲的瓶子上,它也能读懂。
  • 屏幕翻拍(Screen Photography):对着电脑屏幕拍照,会有摩尔纹(那种奇怪的波纹),它也能穿透干扰看清内容。
  • 光线昏暗或过曝(Illumination):光线太暗或太亮,它也能“夜视”或“抗强光”。

为了证明这一点,作者专门搞了一个叫 Real5-OmniDocBench 的“魔鬼训练营”测试,里面全是这种歪歪扭扭、皱皱巴巴的图。结果,这个小精灵在测试中拿到了 92.05% 的超高准确率,把那些几百亿参数的“大模型”都甩在了身后。

3. 它的“新技能包”:不仅会读,还会“找”和“认章”

除了读文档,它还学会了两个新绝活:

  • 印章识别(Seal Recognition):就像能一眼认出合同上的公章是真的还是假的,哪怕印章盖得歪了、模糊了,或者和文字重叠了,它也能精准识别。
  • 文字定位(Text Spotting):以前的工具只告诉你“这里有个字”,它不仅能告诉你“这里有个字”,还能告诉你这个字具体在图片的哪个坐标位置(就像给每个字贴上了 GPS 定位)。这对处理广告牌、路牌或者复杂的自然场景文字特别有用。

4. 它的“大脑”升级:从“拼凑”到“一气呵成”

  • 以前的做法(2 阶段):先让一个模型找框(哪里是字),再让另一个模型去读字。这就像先让一个人画框,再让另一个人填字,中间容易出错,效率也低。
  • 现在的做法(PP-DocLayoutV3):它升级了一个全新的“布局引擎”。它像是一个全能导演,在一个镜头(一次计算)里,同时完成了“找框”、“画多边形(甚至能画出歪歪扭扭的形状)”和“排顺序”的工作。
    • 比喻:以前是“先画个方框,再填字”;现在是“直接画出字的真实轮廓(哪怕是斜的、弯的),并直接告诉你阅读顺序”。这大大减少了出错的机会。

5. 为什么它这么强?(训练秘籍)

  • 数据量大且杂:它吃了 4600 万张“书”(图文对),而且特意挑了很多“难啃的骨头”(比如模糊的、手写的、古老的文字)。
  • 专门针对“难例”训练:它不像普通学生那样只练简单的题。它有一个“错题本”机制,专门挑那些它容易搞错的图片(比如印章盖歪了、表格很复杂)反复练习,直到学会为止。
  • 小身材,大能量:它只有 0.9B 参数,却打败了 235B 参数的 Qwen3-VL 和 Gemini-3 Pro。这说明它效率极高,就像一辆改装过的微型赛车,比那些笨重的大卡车跑得更快、更稳。

总结

PaddleOCR-VL-1.5 就是一个小巧玲珑、身手矫健的文档处理专家
它不再满足于在干净的实验室里工作,而是直接跳进了充满灰尘、褶皱和混乱的现实世界。无论是歪斜的发票、皱巴巴的合同,还是模糊的屏幕截图,它都能像变魔术一样,把它们变成清晰、有序、可编辑的数字文档。

对于普通人来说,这意味着以后用手机拍一张皱巴巴的收据,或者对着电脑屏幕拍一张复杂的表格,它都能瞬间帮你整理得井井有条,而且速度快到飞起!

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →