← 最新论文
🤖 AI

ConRTF: Edge-Constrained Boundary Distribution Refinement for Realtime TransFormer Table Structure Recognition

ConRTF 是一种实时表格结构识别方法,它引入了一种边缘约束细粒度定位(EFL)损失,用于在训练期间编码行与列之间的结构不对称性,从而在不改变推理流水线的情况下,精细化边界分布并提高其在公共和私有数据集上的准确性。

原作者: Eliott Thomas, Tri-Cong Pham, Mickael Coustaty, Aurelie Joseph, Gaspar Deloin, Vincent Poulain d'Andecy, Jean-Marc Ogier, Antoine Doucet

发布于 2026-07-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Eliott Thomas, Tri-Cong Pham, Mickael Coustaty, Aurelie Joseph, Gaspar Deloin, Vincent Poulain d'Andecy, Jean-Marc Ogier, Antoine Doucet

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一台计算机去阅读一份杂乱的电子表格或财务报告。计算机需要弄清楚行在哪里结束,列从哪里开始,以及数据是如何分组的。这被称为表格结构识别(Table Structure Recognition, TSR)

把表格想象成一个由乐高积木组成的网格。如果你搭建一面积木墙,最重要的线是那些将一层积木与下一层隔开的水平线。如果这些线歪了,整面墙看起来就会出错。同样地,在表格中,水平线定义了行,垂直线定义了列。

问题:“一刀切”行不通

目前的 AI 工具在读取表格时,通常会对页面上的每一条线进行同等对待。它们看到一条水平线和一条垂直线时会说:“好吧,这两者都只是边缘;让我们尝试以同样的方式找到它们。”

本文的作者认为,这就像试图用同样多的油漆去涂抹一个长而薄的篱笆的顶部、底部和两侧一样,这是低效的。

  • 对于一行: 顶边和底边是“老板”。它们定义了这一行。左边和右边只是标记结束的“篱笆桩”。
  • 对于一列: 左边和右边是“老板”。它们定义了这一列。顶边和底边只是“篱笆桩”。

如果 AI 把“老板”边缘弄错了一点点,整个表格结构就会崩塌。但如果它把“篱笆桩”边缘弄错了一点点,表格看起来仍然基本正常。

解决方案:ConRTF(“聪明的油漆匠”)

论文介绍了一种名为 ConRTF 的新方法。把它想象成一个知道篱笆哪些部分需要更多关注的“聪明油漆匠”。

  1. 特殊的油漆(EFL 损失函数): 核心创新是一种新的 AI 训练规则,称为边缘约束细粒度定位(Edge-constrained Fine-grained Localization, EFL)

    • 当 AI 学习绘制时,EFL 规则会说:“嘿,格外注意顶边和底边!让它们变得完美。侧边线可以稍微宽松一点。”
    • 当 AI 学习绘制时,规则反转过来:“努力关注左边和右边线!顶边和底边可以更灵活一些。”
  2. 仅限训练阶段: 这种特殊规则仅在 AI 学习(训练)期间适用。一旦 AI 完成学习并准备好投入工作(推理)时,它就不再需要遵循这些额外规则。它会像以前一样快速运行。这就像一个学生在为考试使用特殊的荧光笔学习;一旦考试开始,他们就会正常书写,但他们能更好地记住重要的部分。

  3. 数据效率: 作者发现,这种方法非常擅长教会 AI 哪些部分才是重要的,因此它不需要海量的示例库来学习。即使只有相对较少的示例(大约 2,000 到 3,000 个),它也能很好地学会阅读表格,而其他方法可能需要多得多的数据才能达到同样的结果。

结果:更快、更准确

团队在包含真实世界表格(如科学论文和商业文档)的大型数据集上,将他们的“聪明油漆匠”(ConRTF)与其他顶尖 AI 模型进行了对比测试。

  • 更高的准确度: ConRTF 在绘制表格线方面的错误更少。与现有的最佳实时模型相比,它将 “GriTS” 分数(衡量表格结构理解程度的指标)提高了多达 1.6 分。
  • 速度: 因为特殊规则只发生在训练阶段,所以当 AI 实际阅读文档时,它的运行速度与标准模型一样快。它并没有降低任何处理速度。
  • 处理复杂情况的能力: 最大的进步出现在那些其他 AI 模型难以应对的“杂乱”表格上。ConRTF 能够更好地理清行与列重叠或难以区分的复杂布局。

总结

本文提出了一种教 AI 阅读表格的方法,即通过告诉它并非所有的线都是平等的来进行教学。通过告诉 AI 将精力集中在定义行或列形状的特定线条上,它学习得更快,需要的训练数据更少,并且能在不减慢处理速度的情况下,生成更加清晰、准确的表格结构。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →