← 最新论文
🤖 AI

DOSA: A Tree-Guided, Self-Regressive Framework for Long Document Structure Analysis

该论文提出了 DOSA,一种树引导的自回归框架,通过逐块处理多页文档来增量式地重建文档级语义树,从而有效地捕捉长距离依赖关系和异构布局,在文档结构分析基准测试中实现了最先进的性能。

原作者: Bohou Li, Benjamin Sowell, Mehul Shah, Mark Lindblad, Henry Lindeman

发布于 2026-07-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Bohou Li, Benjamin Sowell, Mehul Shah, Mark Lindblad, Henry Lindeman

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图理解一部由散落在巨大地板上的松散纸页组成的、体量巨大的多卷本百科全书。有些页面有图片,有些是列表,有些则是粗大的标题。为了理清这一团乱麻,你不仅仅是在阅读文字;你必须弄清楚这些碎片是如何组合在一起的。那张图片是属于上方段落的一部分吗?那个列表是该标题下的子级,还是一个完全独立的章节?这就是“视觉丰富型文档”(visually-rich documents)的世界——在这里,信息不仅仅是文本流,而是一个由形状、位置和样式构成的复杂拼图。为了让计算机真正“读懂”这些文档——无论是法律合同、科学论文还是幻灯片演示文稿——它们需要解决一个被称为“文档结构分析”(Document Structure Analysis)的特定谜题。它们需要构建一棵“语义树”(semantic tree),这就像是文档各部分的一份“家谱”,展示了谁是谁的父级、谁是谁的子级,以及大家应该以什么样的顺序被阅读。如果没有这个,计算机可能会将一个标题和一个段落视为两个互不相关的陌生人,而忽略了它们实际上是父级与子级的关系。

于是,由 Glean Technologies 的研究人员提出的新方法 DOSA(文档结构分析器)登场了,旨在为长篇多页文档解决这一难题。想象一下尝试一次性搭建一座由 1,000 块乐高积木组成的城堡;这会让人感到不知所措,而且如果你在早期犯了错,整个建筑都可能坍塌。以往的方法试图一次性观察整个文档,这就像是试图在搭建时把整座城堡都握在手里——它太重了,会导致计算机感到困惑。DOSA 采取了不同的方法:它通过“分块”的方式来构建城堡,就像在移动到下一个房间之前先组装好一个房间一样。但这里有一个巧妙的转折:在构建每个新房间时,它不仅看手里的积木,还会观察已经建好的城堡中最右侧的“分支”。这就像是一个向导,告诉计算机之前那些房间中的哪些部分与当前的新部分相关。通过使用这种“树引导”的地图,DOSA 避免了在庞大的文档规模中迷失方向。

研究人员发现,这种循序渐进、自我引导的方法效果极佳。当他们在包括名为 DocHieNet 的充满复杂多页布局的棘手数据集在内的五个不同数据集上测试 DOSA 时,它的表现优于现有的最佳方法。在这个具有挑战性的基准测试中,DOSA 在 F1 分数(一种衡量准确度的指标)上提升了高达 4 个点,并在 TEDS 分数(衡量计算机生成的树与真实树相似度的指标)上提升了近 20 个点。更令人印象深刻的是,它击败了像 Gemini-2.5-Pro 和 GPT-5.2 这样强大的通用 AI 模型,这表明对于构建文档树这一特定任务,一种专门的、结构化的方法比仅仅要求一个庞大的 AI 去“猜测”结构要更好。论文指出,通过融合视觉线索(如方框在页面上的位置)、文本内容和物体的大小,DOSA 即使不需要一次性记住整个文档,也能高精度地重建文档的逻辑。然而,作者也指出,虽然这种方法很健壮,但并非完美;它目前专注于树状结构,尚未处理更复杂的网状连接(如引用),并且如果它在早期犯了错误,目前还无法进行后期修正。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →