← 最新论文
💬 NLP

Orthogonal Hierarchical Decomposition for Structure-Aware Table Understanding with Large Language Models

本文提出了正交层级分解(Orthogonal Hierarchical Decomposition, OHD)框架,该框架利用正交树归纳方法将复杂表格分解为列树和行树以保留结构层级,从而显著增强了大语言模型理解和推理不规则表格布局的能力。

原作者: Bin Cao, Huixian Lu, Chenwen Ma, Ting Wang, Ruizhe Li, Jing Fan

发布于 2026-06-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Bin Cao, Huixian Lu, Chenwen Ma, Ting Wang, Ruizhe Li, Jing Fan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

问题所在:“平地论”错误

想象一下,你正在向一位从未见过家谱的朋友解释一个复杂的家族树。如果你只是按从上到下的顺序读出一个名单(就像读购物清单一样),你的朋友会感到迷失。他们不知道谁是祖父,谁是叔叔,或者哪一个分支属于哪一边。

这就是大语言模型(LLM)在阅读复杂表格时发生的情况。

  • 问题在于: 现实世界的表格(如财务报告或科学数据)是非常杂乱的。它们有跨列的表头、合并在一起的单元格,以及嵌套在其他信息中的信息。
  • 旧方法: 现有的 AI 方法通常试图将这些表格“扁平化”。它们把二维网格变成一条长长的、笔直的文本线(就像一句话)。
  • 结果: 当 AI 扁平化表格时,它会丢失“家族树”的逻辑。它可能会认为某个数字属于错误的类别,因为视觉线索(比如单元格所处的位置)与文本顺序不匹配。这就像是在读一本章节被随机打乱的小说;故事完全失去了逻辑。

解决方案:“正交分解”框架

作者提出了一种名为 OHD(正交分层分解) 的新方法。与其将表格扁平化成混乱的一行,不如将其分解为两个独立的、清晰的“树”协同工作。

不要把复杂的表格看作一个单一的网格,而要把它看作两张独立的地图:

  1. 列树(Column Tree): 一张关于垂直表头如何相互关联的地图。
  2. 行树(Row Tree): 一张关于水平表头如何相互关联的地图。

通过分离这两个方向,AI 可以在不被混乱布局干扰的情况下理解结构。

它是如何工作的:三个步骤

1. 构建树结构(正交树归纳)

想象你是一名试图弄清公司层级结构的侦探。

  • 规则: 你观察表格并询问:“这个单元格是‘老板’(表头)还是‘员工’(数据)?”
  • 神奇之处: AI 使用了一种特殊的规则,称为**“空间-语义协同作用”(Spatial-Semantic Synergy)**。它不仅看单元格在哪里(几何结构),还会阅读单元格的内容(语义)。
    • 类比: 如果一个表头写着“2007年详情”,并且它物理位置上位于一个“2016”表头之下,一个简单的机器人可能会认为它们是相关的。但 OHD AI 会阅读文本,意识到“2007”和“2016”是不同的年份,从而判定:“不,尽管它们挨在一起,但它们并不相关。”它构建了两棵独立的树:一棵用于行,一棵用于列,确保在进行下一步之前逻辑是完美的。

2. 重新连接点位(双路径关联)

现在,既然 AI 已经构建了行树和列树,它需要讲述一个特定数据点(例如某个特定的金额)的故事。

  • 方法: 它通过沿着两条不同的路径为每个数字创建一个句子:
    • 路径 A(前提): “这个数字位于‘销售额’列下……”
    • 路径 B(属性): “……而该列位于‘第三季度’行中……”
  • 结果: 它将这些路径结合起来,说:“在‘第三季度’行的‘销售额’列中,数值为 500 美元。”这确保了 AI 准确知道这个数字在复杂结构中的确切来源。

3. 裁判(语义仲裁)

有时,两条路径(行树和列树)讲述故事的方式可能会略有不同。

  • 角色: AI 会请来一位“裁判”(大语言模型)来审视这两个版本的叙述。
  • 决策: 裁判会选择最清晰、最符合逻辑的版本呈现给用户。它就像一名编辑,确保最终的故事易于理解且没有矛盾。

为什么这很重要(结果)

作者在两个充满杂乱、复杂表格的困难数据集(AITQA 和 HiTab)上测试了这种新方法。

  • 结果: OHD 一贯优于目前的最佳方法。
  • 类比: 如果说其他方法像是试图用一张 3D 建筑物的扁平地图来进行导航(其中 2 楼被压在了 1 楼上面),那么 OHD 就像是给了 AI 一个建筑物的 3D 模型。它清楚地知道哪一层是哪一层,以及房间是如何连接的。
  • 具体胜利: 在一个测试案例中,其他方法被隐藏在“2016”表头下的“2007”详情所迷惑,并给出了错误答案。OHD 正确识别出它们是独立的,计算出了正确答案,并避开了这个陷阱。

总结

这篇论文介绍了一种教 AI 如何阅读杂乱复杂表格的方法:通过将它们**“解开”**成两个逻辑树(行和列),而不是将它们挤压成一条线。通过尊重原始结构并使用“裁判”来选择最佳解释,AI 终于可以在不迷失方向的情况下理解复杂的数据。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →