LEGR: Learnable-Edge Graph Refinement for Table Structure Recognition
本文介绍了 LEGR,这是一个用于表格结构识别的端到端框架,它通过将静态几何启发式方法替换为可学习的关系边特征以及级联图注意力网络细化模块,通过通过学习全局布局推理来迭代修正预测,从而实现鲁棒且具有领域不变性的性能。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在浩瀚的数字文档领域,表格是信息的无声劳模。它们将财务报告、科学数据和行政记录组织成整齐的行与列的网格。对于人类读者而言,其结构是显而易见的;线条和间距引导着视线,使人能够轻松观察到一个单元格中的数值如何与另一个数值相关联。然而,对于计算机来说,一个表格仅仅是像素的混乱集合。要将一张表格的照片转化为有用的数据,软件必须执行一项艰巨的任务,称为表格结构识别。它必须弄清楚哪些文本属于同一行,哪些属于同一列,以及哪些单元格跨越了多个空间。这不仅仅是关于阅读文字,更是关于理解支撑起这个网格的隐形逻辑。如果没有这种理解,计算机就无法提取数据来回答问题、分析趋势或构建数据库。
多年来,研究人员一直试图通过将表格视为一张连接图谱来教计算机识别这些结构。在这种观点中,每一块文本都是地图上的一个点,而连接它们的线则代表了诸如“相邻”或“上方”之类的关系。挑战始终在于如何绘制这些线条。传统方法依赖于基于几何学的僵化、预设规则。如果两个文本框靠得很近,计算机就会假设它们是相连的;如果它们离得很远,连接就会被忽略。这种方法在处理简单、干净的表格时效果良好,但在面对布局复杂(如存在合并单元格或缺失边界)的表格时经常失效。计算机当时遵循的是一张静态地图,并未考虑到每份文档的独特语境。
来自巴基斯坦国家科学技术大学的一组研究人员提出了一种不同的前进方式。他们开发了一个名为 LEGR 的系统,全称为“可学习边缘图谱细化”(Learnable-Edge Graph Refinement)。LEGR 不再使用固定的规则来决定哪些文本段落相关联,而是学会了自行做出这些决策。想象一名正在学习看地图的学生:起初,他们可能会遵循一套简单的指令,但随着练习,他们会学会识别那些并未明确画在页面上的模式和关系。LEGR 的做法与之类似。它从对表格结构的初步猜测开始,然后通过学习哪些连接最为重要,迭代地改进这一猜测。
该系统的核心是从静态规则向动态学习的转变。在之前的系统中,计算机会观察两个文本框并测量它们之间的距离。如果距离很小,它就会画一条线。然而,LEGR 会观察文本框的内容和语境,以决定它们是否属于一体。它使用一种特殊的训练任务,尝试预测两个相连文本块之间的逻辑差异。通过这样做,系统学会了识别即使在物理空间上相距甚远,页面顶部的标题与底部的某个数据点也是相关的。这使得系统能够理解“关系基质”——即表格的底层逻辑——而不仅仅是物理布局。
一旦系统学会了这些关系,它就会通过一个两步过程来细化其理解。首先,它对每个文本块在网格中的位置做一个初步的、广泛的猜测。然后,它将此信息传递给一个网络,使表格的不同部分能够相互“交流”。这个网络会纠正微小的错误并解决歧义。如果系统最初认为两个单元格在同一行,但随后意识到它们与表格的其他部分不匹配,它就可以改变主意。这种迭代修正分为两个阶段进行,允许系统先修复大的结构性错误,然后再微调细节。
研究人员在几个来自科学论文和财务报告的大型表格集上测试了他们的系统。在标准测试中,LEGR 的表现与现有的最佳方法一样出色,在重建表格结构方面达到了极高的准确度。然而,最显著的发现出现在他们将该系统应用于一种从未见过的全新文档类型时。在没有任何额外训练的情况下,该系统在这些未见数据上的成功率达到了 98.46%。这表明该系统学习到了表格运作的一般性原则,而不仅仅是记住了训练文档中的特定布局。
为了证明其方法的真正优越性,研究人员进行了一系列实验,将他们的学习系统与传统的基于规则的方法进行替换。当他们用一套全面的手工设计几何规则替换掉学习到的连接关系时,系统的性能显著下降,下降了约四个百分点。这证实了学习连接的能力才是成功的关键。此外,他们还测试了如果使用随机连接而非逻辑图谱会发生什么。令人惊讶的是,系统的性能几乎没有变化。这表明,该系统通过文本本身学习关系的能力非常强大,以至于初始连接方式如何绘制几乎无关紧要。无论初始地图如何勾勒,系统都能理清正确的结构。
这项工作的意义不仅限于读取表格。它证明了对于涉及复杂结构化关系的任务,学习连接比设计连接更为重要。通过让计算机去发现数据的逻辑,而不是强迫它遵循预设的地图,研究人员创造了一个更稳健、更具适应性的工具。这种方法最终可以帮助计算机理解其他复杂的布局,例如表单或层级文档,在这些场景中,元素之间的关系并不总是显而易见的。这项研究表明,当一个系统被允许学习游戏的规则时,它能玩得比一个仅仅被告知如何移动的系统更好。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。