← 最新论文
🤖 AI

LongDocBench: Benchmarking TOC Hierarchy and Contextual Relationship Recovery in Long Documents

本文介绍了 LongDocBench,这是一个包含 85 份具有人工验证的目录层级结构和上下文关系恢复标注的真实世界长文档的新基准,旨在解决现有基准在评估文档级结构方面的局限性,并证明恢复这些结构能显著提升下游长文档问答性能。

原作者: Yuefeng Zou, Yichen Lu, Jingxiao Yang, Bingtao Fu, Gaoyang Zhang, Xiongfei Bai, Tian Chen, Xiang Qi

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Yuefeng Zou, Yichen Lu, Jingxiao Yang, Bingtao Fu, Gaoyang Zhang, Xiongfei Bai, Tian Chen, Xiang Qi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,试图通过一次只看一个书架来理解一座巨大的图书馆。你可以读完那个单一书架上的每一个字,识别出书名,甚至理解眼前书籍的布局。但如果你需要寻找一个跨越三个不同章节的具体论点,或者追踪第50页的一个图表如何与第200页的一个脚注相关联,那么仅观察孤立的书架会让你迷失方向。这就是当前文档智能领域面临的挑战,即如何教计算机去阅读并理解视觉文档,如报告、教科书和学术论文。多年来,研究人员一直致力于教机器高精度地识别单个页面上的文本、公式和表格。他们在这些局部工作中做得非常出色。然而,现实世界的文档不仅仅是孤立页面的集合;它们是复杂的结构,信息通过深层的标题层级以及图表与其说明之间的联系,交织在数百页之中。

一项新研究介绍了一种测试计算机是否能真正理解这些长篇且具有连贯性的文档的方法。研究人员构建了一个名为 LongDocBench 的基准测试,其中包含85份真实的文档,包括财务报告、教科书和学术论文。这些文档总计超过两千五百页,其中一些单独的报告长度甚至超过了一百页。团队不仅收集了这些文件,还呕心沥血地为每一份文档创建了一张“金标准”地图。人类专家手动追踪了整个结构,识别出每一个标题及其如何融入父子层级关系中,就像是一个贯穿全书的目录。他们还绘制了数千个特定的关系,记录了图表或图像何时与远在另一页的说明、注释或来源相关联。这种精细的人工工作为衡量当前计算机系统能否完成同样的工作提供了参考基准。

当研究人员将现有的最佳文档解析器与这张人工制作的地图进行对比测试时,结果揭示了一个显著的差距。计算机在页面层面表现得异常出色,能够高精度地正确识别文本和局部布局。然而,当被要求重建完整的文档结构时,它们却显得力不从心。这些系统无法正确组织深层的标题层级,往往会将复杂的章节与子章节树状结构坍缩成一个扁平的列表。同样,它们在将图表与其遥远的注释或来源联系起来时也遇到了困难,遗漏了那些赋予数据上下文意义的类型化链接。即使是最先进的模型,也只能恢复大约一半的正确结构关系,这与它们在单页任务上的近乎完美的表现形成了鲜明对比。这表明,能够阅读一个页面并不自动意味着机器能够理解整份文档。

该研究还探讨了这种结构化理解的重要性。研究人员利用经过人类验证的地图来回答有关文档的问题,并将结果与一个没有任何结构图的系统进行了比较。当系统使用正确的、经由人类验证的层级和关系时,其回答问题的能力得到了显著提升。这不仅仅是小幅度的改进;准确率大幅跳升,表明了解文档是如何组织的有助于计算机进行复杂的推理。然而,当系统依赖于其自身恢复出的结构时,这种提升却微乎其微。计算机自行构建地图的尝试还不够准确,不足以释放信息的全部潜力。

最终,这项工作强调了文档智能的下一个前沿领域不仅是阅读文字,更是理解信息的架构。研究人员已向公众发布了该基准测试及经过人类验证的地图,为未来的发展提供了一个明确的目标。他们已经证明,虽然机器擅长观察“树木”,但它们仍需学习如何观察“森林”。在计算机能够可靠地重建人类视为理所当然的深层层级和跨页连接之前,它们理解长篇复杂文档的能力仍将受到限制。未来的路径要求我们超越简单的页面识别,转向掌握定义现实世界中知识组织与检索方式的复杂多页关系。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →