Reading or Reasoning? Format Decoupled Reinforcement Learning for Document OCR
本文提出了格式解耦强化学习(FD-RL),这是一种利用基于熵的数据过滤和特定格式奖励来解决复杂文档 OCR 中高输出不确定性的新颖方法,并在 OmniDocBench 基准测试中取得了 90.41 的新 SOTA 分数。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一个机器人阅读一份杂乱且复杂的文档。这份文档不仅仅是一封简单的信件,它融合了普通的段落、复杂的数学公式和棘手的表格。
长期以来,研究人员一直认为阅读仅仅是关于能否清晰地“看到”文字。他们试图向机器人喂入越来越多的例子(数据工程),以帮助它记住事物的样子。但本文的作者注意到一个问题:当文档具有大量结构化信息时,机器人会变得非常困惑。
以下是他们发现与解决方案的简单拆解:
1. 问题所在:机器人的“困惑度量计”
作者发现,当机器人阅读简单的文本时,它非常有信心。但当它看到数学公式或表格时,它的“信心度量计”(他们称之为熵/entropy)会大幅下降。这就像一个学生可以轻松背诵诗歌,但一旦被要求解微积分题目或整理电子表格时,就会大脑一片空白。
机器人试图预测下一个词,但由于编写公式或排列表格的方式太多,它会迷失方向。它开始随机猜测,从而导致错误。
2. 解决方案:“格式解耦强化学习”(FD-RL)
作者并没有仅仅强迫机器人去死记硬背更多的例子,而是教会了它去思考结构。他们将这种方法称为 FD-RL。
这就像是在训练一位厨师:
- 旧方法 (SFT): 你给厨师一百万份食谱,并说:“把这些背下来。”厨师学会了完美地复制食谱,但如果让你做一道食材略有变化的菜,他可能就会出错。
- 新方法 (FD-RL): 你教厨师理解为什么蛋糕会膨胀,或者为什么酱汁会变浓。你为不同类型的烹饪制定了具体的规则。
3. 他们是如何做的(两步训练法)
第一步:“SFT”(监督微调)——学习基础知识
首先,他们向机器人输入了一个庞大的文档库(书籍、PDF、合成数据),教它如何通用地阅读文本、公式和表格。这就像是机器人正在学习 ABC 和基础语法。
第二步:“RL”(强化学习)——专业化教练指导
这是见证奇迹的时刻。他们使用了两个聪明的技巧来解决机器人的困惑:
技巧 A:“困难模式”过滤器(基于熵的过滤)
他们没有在所有文档上训练机器人,而是使用一个过滤器,专门挑选出那些最难、最令人困惑的文档(即那些具有高“熵”的文档)。- 类比: 想象一位数学老师不再给学生做简单的加法题,而是只给他们复杂的微积分题。通过只专注于难题,学生学会了如何通过逻辑推理来应对困惑,而不是仅仅靠瞎猜。
技巧 B:“专业裁判”(格式解耦奖励)
在过去,机器人的评分标准只有一个: “你把词写对了吗?” 如果机器人写对了词,但把表格结构放错了,它依然会得到一个差评,但机器人并不知道原因。作者改变了评分系统。他们给了机器人三个不同的裁判:
- 文本裁判: 检查普通文字是否拼写正确。
- 数学裁判: 检查公式在数学逻辑上是否成立(即使符号看起来略有不同)。
- 表格裁判: 检查表格的行和列是否对齐正确。
类比: 如果你在盖房子,你不会只问:“房子盖好了吗?” 你会请水管工检查管道,请电工检查线路,请木工检查框架。如果框架歪了,木工会给出具体的“差评”,这样建筑师就知道该去修框架,而不是去修油漆。
4. 结果
通过使用这种方法,机器人变得能够更好地阅读复杂文档。
- 他们在一个名为 OmniDocBench 的著名基准测试(包含 1,355 页棘手的文档)上进行了测试。
- 机器人的得分达到了 90.41,击败了所有其他的“端到端”模型(即那些试图一步到位完成所有任务的模型)。
- 它在处理公式和表格中的“困惑”方面表现尤为出色,证明了教机器人理解结构比单纯让它死记硬背更多文本更为有效。
总结
本文认为,阅读复杂文档不仅仅是关于“看到”文本,更是关于通过结构进行推理。通过过滤掉简单的例子,并为文本、数学和表格提供专门且独立的反馈,他们教会了机器人停止盲目猜测,转而理解文档的规则。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。