← 最新论文
💻 computer science

LightOnOCR: A 1B End-to-End Multilingual Vision-Language Model for State-of-the-Art OCR

本文介绍了 LightOnOCR-2-1B,这是一种紧凑的 1B 参数端到端多语言视觉语言模型,它通过将文档图像直接转换为纯净文本和局部边界框,在 OlmOCR-Bench 上实现了最先进的 OCR 性能,同时通过 RLVR 和检查点合并等先进训练策略,提供了相比以往模型显著的速度和尺寸优势。

原作者: Said Taghadouini, Adrien Cavaillès, Baptiste Aubertin

发布于 2026-07-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Said Taghadouini, Adrien Cavaillès, Baptiste Aubertin

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你拥有一个海量的文档库:有些是清晰现代的 PDF;有些则是从旧书中扫描出来的、带有褪色墨迹、歪斜文本和复杂数学公式的陈旧扫描页。几十年来,试图将这些图像转化为可编辑文本的过程,就像是试图通过先制造一台寻找边缘的机器、另一台对颜色进行分类的机器、以及第三台将碎片粘合在一起的机器,来组装一个拼图。这种旧方法(被称为“流水线”)非常脆弱、昂贵,并且经常在文档发生变化时失效。

LightOnOCR 是一个全新的、全能型的机器人,它跳过了组装流水线。它直接观察页面的图像,并瞬间“阅读”文本、理解布局并完美地将其打出来,全程一气呵成。

以下是该论文声称内容的简单拆解:

1. “小巨人”(模型)

团队构建了一个名为 LightOnOCR-2 的模型。尽管它极其微小(仅有 10 亿参数,而通常需要 80 亿或 90 亿参数的模型才能达到这种水平),但它是目前世界上最强大的阅读器。

  • 类比: 将其他顶级模型想象成庞大、耗油的卡车,虽然载重量大但运行缓慢且昂贵。LightOnOCR 则像是一辆灵巧、高速的跑车,它能承载同样的负荷,但消耗的燃料极少,且速度更快。
  • 结果: 它在标准测试(OlmOCR-Bench)中击败了最大的竞争对手,同时体积比对方小 9 倍,且速度显著提升。

2. 它是如何学习的(训练)

为了教会这个机器人阅读,团队并没有仅仅喂给它随机的书籍。他们创造了一个“超级大厨”配方:

  • 老师: 他们使用了一个规模巨大、极其聪明的 AI(“老师”)来阅读数百万份文档并写下完美的文本。LightOn-OCR 通过模仿这位老师来进行学习。
  • 食谱: 他们为模型提供了极其多样化的饮食,包含 4300 万页内容。其中包括:
    • 扫描件: 为了学习如何阅读凌乱、陈旧或模糊的页面。
    • 法语文档: 为了在欧洲语言方面表现出色。
    • 科学 PDF: 以处理复杂的数学公式和密集的文本。
    • 高分辨率: 他们让模型能够观察宽度达 1,540 像素的页面,这样它就不会错过微小的字母或符号。
  • “空白页”技巧: 他们专门教导模型在看到空白页时该做什么(即只说“无”),以免它开始产生幻觉或重复胡言乱语。

3. “第二大脑”(强化学习)

在初始训练之后,模型仍然会犯一些愚蠢的错误,比如陷入重复同一句子的循环,或者搞错数学符号。

  • 解决方法: 团队使用了一种名为 RLVR(带有可验证奖励的强化学习)的技术。想象一位严厉的教练,他不仅说“做得好”,还会进行特定的测试:“你把数学写对了吗?你在句子结束时停止说话了吗?”
  • 如果模型通过了测试,它就会获得奖励。如果失败了(例如出现循环或使用了错误的格式),它就会受到惩罚。这种“教练”机制无需人类手动纠正每一个错误,就能修正模型的坏习惯。

4. “鹰眼”(寻找图像)

通常情况下,OCR 模型只能阅读文本。但 LightOnOCR-2 还能用手指指向文档中的图片。

  • 功能: 它可以指出:“这里是文本,而这里是位于坐标 X, Y 的图片。”
  • 挑战: 通常,教一个模型做两件事(阅读文本 + 寻找图片)会使其在第一件事上的表现变差。
  • 解决方案: 他们在教模型阅读的同时(在预训练期间)教授它寻找图片,并再次使用“教练”(RLVR)来磨练它的瞄准精度。他们还使用了“混合”技巧(对不同版本的模型进行平均),从而创造出一个既擅长阅读又擅长寻找图片的最终版本,且不会牺牲质量。

5. 它能做什么,不能做什么

论文非常明确地说明了模型的局限性:

  • 擅长领域: 印刷文档、科学论文、复杂的表格、多栏布局以及使用拉丁字母的语言(如英语、法语、西班牙语)。
  • 吃力领域:
    • 手写体: 它并非为阅读草书或凌乱的手写体而设计。
    • 非拉丁语系: 它目前尚未针对中文、日语或阿拉伯语等语言进行优化。

总结

LightOnOCR-2 是一个紧凑、快速且极其聪明的工具,它能将文档图像转化为干净的文本,且表现优于任何同等规模的模型。它通过从大规模、高质量的数据集中学习,利用自动化的测试进行教练式纠错,并使用巧妙的数学技巧来融合不同的技能。该团队已经发布了模型、数据以及一套用于在文档中寻找图像的新测试,供任何人使用。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →