← 最新论文
💬 NLP

PulseBench-Tab: A Multilingual Benchmark for Table Extraction with Graph-Based Evaluation

本文介绍了 PulseBench-Tab,这是一个包含九种语言和四种脚本、共计 1,820 张人工标注表格的多语言基准测试集,并引入了一种名为 T-LAG 的新型基于图的评估指标,用于评估各种表格提取系统在复杂真实世界文档图像上的性能。

原作者: Ritvik Pandey, Sid Manchkanti, Mohammed Wazir Adain, Mohammed Hadi, Dushyanth Sekhar

发布于 2026-06-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Ritvik Pandey, Sid Manchkanti, Mohammed Wazir Adain, Mohammed Hadi, Dushyanth Sekhar

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一个海量的文档库——包含财务报告、政府表格和企业披露文件——它们以九种不同的语言印刷而成。在这些文档中,隐藏着数以千计的表格,比如填满了数字和文本的电子表格。这项研究的目标是观察计算机在多大程度上能够“阅读”这些表格,完美地复制它们,并理解每一项信息都属于什么位置。

以下是对 PulseBench-TabT-LAG 的简单化解释。

1. 问题所在:为什么表格如此棘手

阅读表格不仅仅是识别字母(像读一本书那样)。它关乎对几何结构的理解。

  • 类比: 想象表格是一个拼图游戏。如果你把一个写着“100”的碎片放错了位置,整个画面就毁了。在计算机系统中,如果一个数字落入了错误的单元格,这不仅仅是一个拼写错误;它是一场灾难,会破坏后续进行的所有计算。
  • 差距: 之前的测试大多关注英文表格,或者将表格视为长串的单词列表(将其“扁平化”),这会丢失二维结构(行和列)。此外,它们没有对足够多的右向左书写的语言(如阿拉伯语)或使用复杂字符(如中文或日文)进行充分测试。

2. 解决方案:一个新的“表格健身房”(数据集)

作者构建了一个庞大的训练场,名为 PulseBench-Tab

  • 规模: 它包含 1,820 个真实的表格。
  • 多样性: 这些表格来自 9 种语言(英语、中文、阿拉伯语、俄语等)的 380 份不同文档,并使用了 4 种不同的书写系统
  • 难度: 有些表格很小(仅 2 个单元格),而另一些则是拥有超过 1,000 个单元格的“巨兽”。大约一半的表格具有“合并”单元格(即一个大单元格覆盖了两个或三个较小单元格的空间),这就像是一个覆盖了棋盘上多个位置的拼图碎片。
  • 金标准: 每一个表格都由精通特定语言的人类专家进行了检查,以确保“答案解析”是 100% 正确的。

3. 新的标尺:T-LAG(图度量指标)

为了给计算机评分,作者发明了一种新的评分系统,称为 T-LAG

  • 旧方法: 之前的方法通常只检查计算机是否得到了正确的单词,但并不太在意这些单词是否放在了正确的“邻居”位置。这就像是在给学生批改拼写测试时,只看单词拼得对不对,却忽略了他们是否把单词放进了正确的句子中。
  • 新方法 (T-LAG): 将表格想象成一张由道路连接城市的地图。
    • 节点 (城市): 单个单元格。
    • 边 (道路): 单元格之间的连接(例如,“单元格 A 在单元格 B 的右侧”或“单元格 C 在单元格 D 的下方”)。
  • 如何评分: T-LAG 观察的是“道路”。它会问:“计算机构建的道路地图是否与真实的地图一致?”
    • 如果计算机文字正确但放错了列,那么“道路”就断了,分数也会下降。
    • 它使用了一种特殊的数学技巧(匈牙利算法)来寻找真实表格与计算机生成的表格之间的最佳匹配,确保它不会只是随机猜测。
    • “严格度”旋钮: 作者将评分设定得非常严格(“k=7”设置)。在现实世界中,如果一份财务报告写的是“100 万美元”而不是“1000 万美元”,那这就是一次失败,而不是一次“接近成功”的尝试。该指标将微小的错误视为重大的失败,以反映现实世界的需求。

4. 竞赛:谁赢了?

作者在这一数据集上测试了 9 种不同的计算机系统(包括大型科技公司的 API、开源工具以及他们自己的系统)。

  • 获胜者: Pulse Ultra 2(作者自己的系统)以 93.5% 的得分位居第一。它是唯一一个在超过一半的表格上获得“完美”得分的系统。
  • 亚军: Gemini 3.181.6% 的得分排名第二。
  • 差距: 在前两名之后出现了巨大的跌幅。排名后三分之一的系统得分低于 72%,这意味着它们遇到了显著的困难。
  • 最大的挑战: 非拉丁系文字(如阿拉伯语、韩语和中文)对所有人来说都是最难的。
    • 类比: 想象一个在平坦铺设的公路上(英语)跑得很快,但在山路(阿拉伯语/韩语)上却处处绊倒的跑步者。即使是最优秀的系统,在更换语言时,其得分也会显著下降。
  • “沉默的失败”: 一些系统不仅给出了错误的答案,甚至在约 20% 的表格面前完全无法给出任何答案。在现实业务中,这就像是一个在看到复杂文档时就直接罢工的机器人。

5. 总结

论文得出结论:虽然计算机在阅读表格方面正在变得越来越好,但在处理复杂的布局或非英语语言时,顶尖系统与该领域其他系统之间仍存在巨大差距。

他们已向公众发布了数据集评分代码结果。这就像是向所有人敞开了健身房的大门,让研究人员能够准确地看到机器在哪里失败,并尝试修复它们,而不是靠猜。

简而言之: 他们为表格阅读 AI 构建了一个充满挑战的多语言障碍赛道,发明了一把新标尺来衡量 AI 如何应对这些障碍,并发现虽然目前有一套系统处于领先地位,但大多数其他系统在面对复杂的非英语环境时,仍然难以站稳脚跟。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →