← 最新论文
🤖 machine learning

Structured Prediction for Scalable Spreadsheet Table Understanding: From Cell Types to Table Ranges (Extended Version)

本文提出了一种计算高效的两阶段流水线,该流水线结合了基于 LightGBM 的单元格类型分类模型与确定性表格检测算法,旨在通过新引入的多语言 StatSheets 基准测试验证,在实现具有竞争力的电子表格理解准确率的同时,显著降低了与基于 GPU 的 Transformer 和大语言模型(LLM)方法相比的资源需求。

原作者: Antoine Gauquier, Ioana Manolescu, Pierre Senellart

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Antoine Gauquier, Ioana Manolescu, Pierre Senellart

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在数字时代,电子表格是全球信息流动的静默功臣。政府发布经济统计数据,国际组织追踪健康指标,企业管理供应链,所有这些都存在于 XLSX 或 CSV 等文件那熟悉的行与列的网格之中。然而,尽管这些文档是为人类视觉设计的,但对于计算机而言,它们却极其难以读取。与每个数据都位于严格、可预测位置的数据库不同,电子表格是一个灵活的画布。标题可能位于表格上方,脚注可能出现在列的中间,表头也可能以违背简单规则的方式进行合并或拆分。对机器而言,电子表格往往看起来像是一堆杂乱无章的文本和数字,而非结构化的数据集。这为需要自动收集、清洗和分析这些文件中信息的现代数据系统制造了显著的瓶颈。如果计算机无法正确识别表格何时开始以及何时结束,或者哪些单元格包含实际数据而哪些仅是标签,那么整个下游分析过程都可能崩溃。

研究人员 Antoine Gauquier、Ioana Manolescu 和 Pierre Senellart 通过开发一种全新的、高效的方法来教计算机理解这些文档,从而解决了这一问题。他们的工作专注于两个特定任务:首先,识别电子表格中每一个单元格的角色,例如它是表头、数据点、标题还是空白空间;其次,利用这些识别出的角色,在隐藏于表格中的表格周围绘制出精确的边界。为了测试他们的想法,他们创建了一个全新的、由来自多个国家和语言的公共机构提供的 737 个真实世界电子表格文件组成的庞大集合,并将该资源命名为 StatSheets。这个数据集包含了以往研究在很大程度上忽略了的复杂、大规模文件,涵盖了从法国司法统计到澳大利亚经济数据的各种内容。

该团队提出了一个结合了智能学习系统和一套逻辑规则的两步走流程。在第一步中,计算机程序利用各种线索分析每个单元格。它观察单元格内的文本、数字是整数还是小数、字体样式、背景颜色,以及该单元格相对于其邻近单元格的位置。通过使用一种名为 LightGBM 的强大学习算法,系统会预测每个单元格最可能的角色。为了确保这些预测在整个表格中具有逻辑一致性,他们添加了一层逻辑检查,以确保表头行不会在某一列的中途突然变成数据。在第二步中,系统利用这张单元格角色图谱并应用一套严格的基于规则的程序来寻找表格。它寻找表头和数据构成的连通组,将明显属于同一部分的相邻部分进行合并,并过滤掉噪声,而无需通过更多示例进行“学习”。这个第二阶段是完全确定性的,这意味着它遵循一套固定的指令集,而不是基于模式进行猜测。

当研究人员将他们的系统与其他方法进行对比测试时,结果令人瞩目。他们的方案在识别单元格角色方面的准确度几乎与目前最先进、最复杂的深度学习模型(这些模型依赖于庞大的神经网络和昂贵的图形处理器)不相上下。然而,他们的系统可以在标准计算机硬件上运行,且所需的计算能力和成本仅为后者的极小部分。在寻找实际表格边界方面,他们的基于规则的方法优于那些试图检测通用形状的技术,并且在与使用大型语言模型的最新系统竞争时也保持了竞争力,但同样是以更低的成本和更快的速度实现的。这项研究表明,对于理解电子表格这一特定任务,通过精心设计的智能特征分析与逻辑规则相结合,可以达到与那些资源消耗巨大的人工智能系统同样有效、且更为实用的效果。

研究人员还强调了现有工具和数据集的局限性。许多先前的研究依赖于 21 世纪初的旧数据或无法用于公开测试的专有文件,这使得公平比较不同方法变得困难。他们推出的新数据集 StatSheets 填补了这一空白,提供了一个多样化、多语言的现代电子表格集合,其中包含了大型文件和复杂的布局。他们发现,虽然深度学习模型表现出色,但除非经过海量数据的训练,否则它们往往难以应对电子表格特定的结构细微差别,并且在训练和运行方面都伴随着高昂的价格。相比之下,该团队的方法证明,通过专注于电子表格的特定结构信号(例如表头如何与数据对齐,以及格式如何在行间变化),可以构建出一个既高度准确又具备足够扩展性、能够高效处理数百万份文档的系统。

最终,这项工作表明,通往更好数据提取的路径并不总是需要构建更大、更复杂的“黑盒”模型。通过将用于识别单元格类型的鲁棒学习系统与用于寻找表格边界的透明规则引擎相结合,可以创造出既强大又易于获取的解决方案。研究结果表明,对于速度、成本和可靠性至关重要的现实应用场景(如处理政府开放数据或商业智能报告),这种尊重电子表格独特结构的混合方法是更优的选择。研究人员已向公众开放了其数据集和代码,允许他人验证这些结果,并在一个优先考虑清晰度和效率而非单纯追求计算规模的基础上开展后续研究。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →