← 最新论文
💻 computer science

Layout-Aware Curriculum Learning for Lightweight Document OCR

该论文提出了 LACL-OCR,这是一个轻量级文档 OCR 框架,通过结合一种将训练过程从简单样本组织到困难样本的启发式课程学习策略以及一种新颖的布局感知损失函数(Layout-Aware Loss),在不增加模型参数或推理成本的情况下,在 OmniDocBench 上实现了最先进的结果。

原作者: Shunzhi Wang, Jijun Zhu, Xiaohong Yu, Jun Wu, Kai Liu, Yuan Li, Dong Qin, Liping Cong, Xiaohuai Yang, Lina Meng, Liyang Han

发布于 2026-08-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Shunzhi Wang, Jijun Zhu, Xiaohong Yu, Jun Wu, Kai Liu, Yuan Li, Dong Qin, Liping Cong, Xiaohuai Yang, Lina Meng, Liyang Han

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在数字时代,海量的信息以纸质文档图像的形式存在着:扫描的合同、手写笔记、密集的学术论文以及复杂的财务报告。为了让这些信息对计算机有用,我们必须将这些图片转化为机器可以阅读和理解的文本。这个过程被称为光学字符识别(OCR)。几十年来,实现这一任务的标准方法是将任务分解为许多细小的、独立的步骤。首先,计算机要找到文本在页面上的位置;然后,识别表格或公式;最后,读取单词。虽然这种方法行之有效,但它非常脆弱:第一步中的错误会毁掉后续所有步骤,而且运行这么多不同的程序需要庞大的计算能力。最近,一种使用大型视觉语言模型的新方法出现了。这些是强大的系统,它们可以一次性观察一张图片并写出其描述,从而跳过了那些独立的步骤。然而,这些模型通常规模巨大,需要庞大的数据中心来运行,并且在面对复杂文档的混乱现实时仍然显得力不从心。

大庆油田公司勘探开发研究院的研究人员开发了一种新的教学方式,这改变了游戏规则。他们提出了一个简单的问题:如果教学顺序正确,一个非常小、轻量级的模型能否像巨型模型一样擅长阅读文档?他们的答案是肯定的。他们创建了一种训练方法,就像一位细心的老师,从最简单的页面开始,逐渐引入更难的页面。他们还在学习过程中加入了一条特定的规则,强制计算机关注事物在页面上的精确位置,而不仅仅是单词的内容。结果是一个仅有 2 亿 5600 万参数的微型模型,其表现与规模大出数千倍的模型一样出色。

他们发现的核心在于如何组织训练数据。想象一个正在学习阅读的学生。如果你先给他一个简单的句子,然后是一个段落,最后是一个包含图表和数学题的复杂页面,他会学得更快,而不是一开始就扔给他最难的页面。研究人员将这种逻辑应用到了计算机上。他们分析了数千张文档图像,并根据页面的拥挤程度、文本复杂度以及包含的表格或公式数量,为每张页面给出了一个难度评分。然后,他们将这些文档按从易到难进行排序。他们没有一次性向计算机展示所有页面,而是先喂给它简单的页面。一旦模型掌握了简单的页面,他们就加入稍难一点的页面,并不断增加难度。这种被称为“课程学习”的循序渐进的方法,让小模型在处理通常会让机器感到困惑的杂乱、复杂的文档之前,先建立起坚实的基础。

为了使这一过程更加有效,研究人员改变了模型犯错时的纠正方式。标准的训练方法几乎完全关注计算机编写的单词是否与文档中的单词匹配,却往往忽略了计算机是否正确识别了这些单词的位置。在真实的文档中,知道一个表格位于右上角与知道其中的内容同样重要。团队引入了一条新规则,如果模型对文本、公式或表格的位置判断错误,则会对模型进行惩罚。这迫使模型学习页面的物理布局,将单词锚定在正确的位置。这种空间感知能力帮助模型理解了文档的结构,进而提高了它阅读文本本身的能力。

研究结果令人瞩目。研究人员在包含一千多张多样化文档图像(从教科书到手写笔记)的基准测试中测试了他们的新模型,并将其命名为 LACL-OCR。凭借仅有的 2 亿 5600 万个参数,该模型获得了 85.18 的评分。为了直观理解,这个微型模型的表现超越了许多规模更大的专门模型,其中包括一个拥有 30 亿参数的模型和一个拥有 70 亿参数的模型。它甚至非常接近于一个拥有 1 万亿参数的通用人工智能模型的性能,而后者比它大出数千倍。这个小模型不仅能匹配大型模型,在识别表格和数学公式等特定任务上也超越了它们。这项研究表明,模型的训练方式与模型的大小同样重要。通过以逻辑顺序进行教学并确保其理解页面布局,轻量级系统可以实现以往被认为需要大规模计算资源才能达到的效果。

这项工作挑战了“越大越好”这一人工智能领域的观念。研究人员发现,小型模型之前的挣扎并非由于规模不足,而是由于缺乏聪明的训练策略。通过将基于难度的学习路径与对空间布局的关注相结合,他们释放了紧凑型模型的全部潜力。这意味着在未来,强大的文档阅读工具可以在标准计算机甚至移动设备上运行,而不必依赖昂贵且耗能的服务器。研究结果表明,只要有正确的教学方法,小型模型处理复杂、混乱的现实世界文档的能力可以与它们的巨型对手并驾齐驱。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →