← 最新论文
🤖 AI

TDATR: Improving End-to-End Table Recognition via Table Detail-Aware Learning and Cell-Level Visual Alignment

本文提出了 TDATR 模型,通过“先感知后融合”策略,利用表细节感知学习和结构引导的单元格定位模块,实现了在无需特定数据集微调的情况下,于多个基准测试中达到端到端表格识别的领先性能。

原作者: Chunxia Qin, Chenyu Liu, Pengcheng Xia, Jun Du, Baocai Yin, Bing Yin, Cong Liu

发布于 2026-03-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Chunxia Qin, Chenyu Liu, Pengcheng Xia, Jun Du, Baocai Yin, Bing Yin, Cong Liu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个叫 TDATR 的新方法,它的目标是让电脑更聪明、更准确地“读懂”图片里的表格。

为了让你轻松理解,我们可以把表格识别想象成把一张杂乱的餐厅菜单变成一份整齐的 Excel 电子表格

1. 现在的痛点:为什么以前的方法很笨?

以前的电脑处理表格主要有两种笨办法:

  • 办法 A(分步走): 先让一个机器人专门找“格子线”(结构识别),再让另一个机器人专门“认字”(内容识别),最后把两个机器人的结果拼起来。
    • 比喻: 就像让一个人画好表格线,另一个人再往里填字。如果画线的人画歪了,填字的人就算字写得再好,整个表格也是乱的。而且这两个机器人互不沟通,经常出错。
  • 办法 B(端到端大模型): 直接用一个超级大脑(大语言模型)看图说话,直接输出表格。
    • 比喻: 就像让一个没怎么见过表格的小学生,直接看一张复杂的菜单,让他一口气把菜单变成 Excel。
    • 问题: 这种小学生需要看成千上万张菜单才能学会。但在现实中,我们很难找到那么多标注好的表格数据。而且,如果数据不够多,它就容易“瞎编”,或者虽然认出了字,但不知道哪个字属于哪个格子(比如把“价格”和“菜名”搞混了)。

2. TDATR 的绝招:“先感知,后融合”

TDATR 提出了一套新的“三步走”策略,我们可以把它想象成培养一个“表格专家”的过程

第一步:广博的“通识教育”(Table Detail-Aware Learning)

在正式学做表格之前,先让这个模型去读海量的普通文档(比如新闻、论文、网页、README 文件)。

  • 它在学什么? 它不只看表格,而是学习“怎么在一张图里找到文字”、“怎么判断文字的阅读顺序”、“怎么理解文档的排版”。
  • 比喻: 这就像让一个未来的厨师,先不去学做具体的“宫保鸡丁”,而是先去菜市场认识各种蔬菜、学习切菜、了解火候。这样,当他以后遇到任何复杂的菜单时,他都有扎实的“基本功”,不需要死记硬背每一张菜单。
  • 效果: 模型变得非常“眼尖”,能看清细节,而且不需要专门针对表格的大量数据就能练好基本功。

第二步:专门的“表格特训”(Table Detail Fusion)

有了基本功后,再给它看一些专门的表格数据,教它如何把这些“感知到的细节”融合起来,生成标准的 HTML 表格代码。

  • 比喻: 现在厨师已经认识所有食材了,这时候只要给他几本经典的菜谱,他就能迅速学会做各种复杂的菜。因为他的“味觉”和“刀工”已经练好了,学新菜谱非常快。
  • 效果: 即使表格数据很少,它也能学得很好,而且不容易出错。

第三步:给每个格子发“定位器”(Cell-Level Visual Alignment)

这是 TDATR 最厉害的地方。以前的模型只输出文字,不知道文字在图片的哪个位置。TDATR 给每个格子都装了一个“定位器”。

  • 比喻: 以前的模型只告诉你“菜单上有‘红烧肉’",但没说它在第几行第几列。TDATR 不仅能告诉你有“红烧肉”,还能精准地告诉你:“红烧肉”在图片的左上角,坐标是 (100, 200) 到 (300, 250)。
  • 怎么做到的? 它利用表格的结构(比如“这一行有三个格子”)来辅助定位。就像在迷宫里,不仅靠眼睛看路,还靠“左边是墙,右边是门”的结构线索来导航。
  • 效果: 即使表格没有边框(borderless),或者字挤在一起,它也能精准地把每个字归位到正确的格子里,不会张冠李戴。

3. 为什么这个方法很牛?

  1. 省数据: 它不需要像其他大模型那样,需要几百万张表格来训练。因为它先通过普通文档练好了“基本功”。
  2. 更聪明: 它把“认字”和“找格子”结合在一起,互相帮忙。认字的时候知道格子的边界,找格子的时候知道里面是什么字。
  3. 通用性强: 无论是在清晰的电子文档里,还是在模糊的、歪歪扭扭的拍照文件里,它都能表现得很稳定。
  4. 可解释性: 因为它能精准定位每个格子,人类可以很容易地检查它哪里做对了,哪里做错了。

总结

TDATR 就像是一个先通过阅读大量书籍(普通文档)练成“火眼金睛”和“过目不忘”的学霸,然后再花很少的时间专门学习“表格格式”

它不再死记硬背表格长什么样,而是真正理解了表格的结构和内容的关系。这使得它在处理各种复杂、模糊甚至没有边框的表格时,都能像人类专家一样,又快又准地把图片变成可编辑的 Excel 表格。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →