← 最新论文
💻 computer science

PubTables-v2: A new large-scale dataset for full-page and multi-page table extraction

本文提出了名为 PubTables-v2 的大规模数据集,旨在解决视觉文档理解中表格提取任务(特别是多页表格结构识别)因缺乏标注数据而难以推进的问题,并建立了相关基线模型以揭示当前多模态大模型在此领域的不足及改进方向。

原作者: Brandon Smock, Valerie Faucon-Morin, Max Sokolov, Libin Liang, Tayyibah Khanam, Amrit Ramesh, Maury Courtland

发布于 2026-03-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Brandon Smock, Valerie Faucon-Morin, Max Sokolov, Libin Liang, Tayyibah Khanam, Amrit Ramesh, Maury Courtland

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 PubTables-v2 的新项目,你可以把它想象成给人工智能(AI)准备的一份“超级表格特训教材”。

为了让你更容易理解,我们可以把表格提取(Table Extraction)这项任务想象成在图书馆里整理杂乱的书籍和笔记

1. 过去的困境:只盯着“单页”看

以前,AI 处理文档里的表格时,就像是一个近视眼且只敢看单页的图书管理员

  • 老方法:它先在一页纸上找到“这里有个表格”,然后把它像剪报一样剪下来(裁剪),单独放在桌子上研究。
  • 问题
    • 丢了上下文:它不知道这个表格是接在上一页的,还是被分成了两半跨页了。
    • 数据太少:以前用来训练 AI 的“剪报”(数据集)虽然多,但大多是那种只有几行几列的小表格,而且没有把表格和它的标题、脚注连在一起。
    • 多页表格是盲区:如果一个表格太长了,跨越了第 1 页和第 2 页,以前的 AI 就会懵圈,因为它只被训练过处理“剪下来”的碎片,没学过怎么把碎片拼回去。

2. PubTables-v2 来了:一本“全景式”的百科全书

Kensho Technologies 的团队(作者们)觉得这样不行,于是他们造了一个全新的、巨大的数据集,叫 PubTables-v2

你可以把它想象成给 AI 提供了一套全新的、包含 50 多万页真实文档的“全景训练场”。这个训练场有三个特别厉害的地方:

  • 全景视野(Full-Page Context):
    以前 AI 是看“剪报”,现在 AI 是看“整张报纸”。它能看到表格在整页纸上的位置,还能看到表格旁边的标题(Caption)和底部的注释(Footer)。就像图书管理员不再只看书名,还能看到书的腰封和封底介绍,理解得更透彻。
  • 超长表格挑战(Multi-Page Tables):
    这是这次最大的突破!以前没有专门教 AI 处理“跨页表格”的大数据。PubTables-v2 收集了近 1 万个跨越多页的表格,有的甚至跨越了 13 页!
    • 比喻:这就像以前只教学生拼 5 块的拼图,现在突然给了他们 100 块甚至 1000 块的长条拼图,而且告诉他们:“别慌,这些碎片是连在一起的,要把它们拼成一张完整的图。”
  • 高质量严选
    他们用了非常严格的“质检员”(质量控制系统),确保每一张表格的 PDF 版本和作者原本写的 HTML 版本几乎一模一样,连标点符号和换行都核对过。这保证了 AI 学到的知识是“纯正”的。

3. 实验结果:AI 学会了,但还有“偏科”

作者们用这个新教材,测试了目前市面上几种最聪明的 AI 模型(也就是那些能看图说话的“视觉语言模型”)。

  • 好消息:AI 确实进步了。特别是当它们能看到整页内容时,表现比只看“剪报”要好得多。
  • 坏消息(也是重点):
    • 跨页识别是弱项:即使是最聪明的 AI,在处理跨越多页的表格时,表现依然很糟糕(准确率只有 50% 多)。它们经常把“第 1 页的表格”和“第 2 页的表格”当成两个完全无关的东西,或者根本不知道它们其实是一家人。
    • 新的解决方案:作者们灵机一动,给 AI 加了一个“智能胶水”(一个图像分类器)。
      • 比喻:这个“胶水”就像一个老练的图书管理员,它的任务很简单:只看两页纸,判断“第 1 页的表格是不是连到了第 2 页?”
      • 如果“胶水”说“是”,AI 就把两页的表格强行拼在一起。
      • 结果惊人:加上这个“胶水”后,AI 处理跨页表格的能力大幅提升!这说明,虽然 AI 自己还不太会“联想”,但只要给个提示,它就能拼得很好。

4. 总结:为什么这很重要?

这就好比我们以前教 AI 认字,只让它认单个汉字;现在 PubTables-v2 教它认整篇文章、整本书,甚至是跨越章节的长故事

  • 对于科研:这是第一个专门针对“跨页表格”的大规模数据集,填补了空白。
  • 对于应用:在金融、医疗、法律等领域,很多重要数据都藏在那些跨越好几页的复杂表格里。PubTables-v2 让 AI 有了读懂这些“长难句”的能力。

一句话总结
作者们给 AI 造了一本包含 50 多万页真实文档的“全景字典”,专门教 AI 如何识别那些跨越多页的复杂表格。虽然 AI 现在还会“断片”(把跨页表格看散),但只要给个“智能胶水”提示一下,它的表现就能突飞猛进。这为未来让 AI 真正读懂复杂的文档打下了坚实的基础。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →