← 最新论文
💻 computer science

InstructTable: Improving Table Structure Recognition Through Instructions

本文提出了 InstructTable,这是一种通过指令引导的多阶段训练框架,结合表结构识别预训练与微调策略,并引入无需模板的 Table Mix Expand 数据合成方法构建 BCDSTab 基准,从而在复杂表格结构识别任务中实现了最先进的性能。

原作者: Boming Chen, Zining Wang, Zhentao Guo, Jianqiang Liu, Chen Duan, Yu Gu, Kai zhou, Pengfei Yan

发布于 2026-04-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Boming Chen, Zining Wang, Zhentao Guo, Jianqiang Liu, Chen Duan, Yu Gu, Kai zhou, Pengfei Yan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 InstructTable 的新系统,它的核心任务是把图片里的表格“翻译”成电脑能读懂的结构化数据(比如 HTML 代码)。

想象一下,你手里有一张拍得歪歪扭扭、甚至被撕了一角的财务报表照片。电脑通常很难看懂:哪一行是标题?哪个格子是空的?哪几个格子其实是合并在一起的?

以前的方法要么太“死板”(只看图,不懂逻辑),要么太“飘渺”(太懂语言,却看不清格子的边界)。InstructTable 就像是一个既懂看图又懂“听指挥”的超级表格翻译官

下面我用几个生活中的比喻来拆解它的三大核心创新:

1. 核心痛点:以前的“翻译官”都有什么毛病?

  • 传统视觉模型(VCTSR):像是一个“近视眼”的绘图员。
    它只盯着图片看,能画出格子的边框,但不懂内容。如果两个格子合并了,或者有个格子是空的,它经常搞错,因为它缺乏“语义”理解(不知道这里为什么是空的)。
  • 视觉语言模型(VLM):像是一个“博学但近视”的教授。
    它读过很多书,懂语言逻辑,能猜出表格大概讲什么。但让它去精准定位每个格子的像素坐标时,它容易“手抖”,把格子画歪,或者把合并的格子画散。

InstructTable 的解决方案: 它把“看图”和“听指挥”完美结合了。


2. 三大创新法宝

法宝一:指令引导训练(Instruction-Guided Training)

比喻:给翻译官发“任务清单”

以前的模型是“盲猜”:给你一张图,你随便输出个表格吧。
InstructTable 则会给模型发具体的指令(Instructions),就像给员工发任务单:

  • “请找出所有合并的单元格。”
  • “请找出所有空白的单元格。”
  • “请只关注第 2 行的格子。”

效果: 通过这种“针对性训练”,模型学会了像侦探一样,根据不同的指令,把注意力聚焦在表格的不同细节上。它不再是一个只会死记硬背的机器,而是一个能灵活应对各种复杂问题的专家。

法宝二:TME(表格混合扩展)—— 无模板的“乐高”造表法

比喻:用真实的“积木块”拼出新房子

训练这种 AI 需要海量的表格数据。以前的方法是“套模板”(像填字游戏),造出来的表格很假,而且容易出错(比如生成了一些看不见的空行,导致数据对不上)。

InstructTable 发明了一种叫 TME 的新方法:

  1. 拆解: 把真实的表格(比如真实的财报)拆成一个个最小的“原子单元格”(就像把乐高房子拆成一块块积木)。
  2. 混合: 把这些真实的积木打乱,随机拼凑成新的表格结构。
  3. 填充: 用大语言模型(LLM)给这些新拼好的表格填上合理的内容。
  4. 检查: 再让另一个 AI 检查这个新表格合不合理。

效果: 这样造出来的表格,既有真实世界的“灵魂”(因为积木是真实的),又有无限的“花样”(因为拼法无限)。它解决了“数据不够用”和“数据太假”的两大难题。

法宝三:BCDSTab 基准测试 —— 真正的“魔鬼训练营”

比喻:从“考卷”升级为“实战演习”

为了证明自己的厉害,作者自己造了一个包含 900 张复杂表格的测试集(BCDSTab)。
以前的测试集大多是简单的小表格,像小学生做的算术题。而这个新测试集充满了长表格、合并单元格、复杂布局,就像给翻译官出了一套“高难度实战演习”。

结果: 在普通试卷上,InstructTable 已经考得最好;在这个“魔鬼训练营”里,它更是把其他所有对手(包括 GPT-4o 等顶级大模型)都甩在了身后。


3. 总结:它为什么这么强?

你可以把 InstructTable 想象成一个经过特殊训练的“表格特种兵”

  1. 装备升级(多阶段训练): 它先学基础(认识所有格子),再学特种技能(专门识别合并格、空单元格),最后进行实战演练。
  2. 弹药充足(TME 数据): 它通过“乐高积木”法,拥有了取之不尽的高质量训练素材,见识过各种奇形怪状的表格。
  3. 战术灵活(指令系统): 无论任务多刁钻(“只看空行”、“只看合并区”),它都能瞬间切换注意力,精准打击。

一句话总结:
InstructTable 通过让 AI 学会“听指挥”来理解表格细节,并用“乐高积木”法制造海量真实数据,成功解决了复杂表格识别的难题,让电脑看表格的能力达到了前所未有的高度。

这对未来的意义是:无论是处理堆积如山的财务报表,还是从旧文档中提取数据,AI 都能更准确、更智能地帮你完成,不再需要人工一个个去核对格子了。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →