← 最新论文
💻 computer science

How Far Is Document Parsing from Solved? PureDocBench: A Source-TraceableBenchmark across Clean, Degraded, and Real-World Settings

本文介绍了 PureDocBench,这是一个可溯源的基准测试,涵盖干净、退化和真实世界的文档图像,揭示了饱和的 OmniDocBench 排名中存在显著缺陷,并表明文档解析仍是一个未解决的挑战,模型之间存在显著的性能差距,且公式识别存在持续瓶颈。

原作者: Zhiheng Li, Zongyang Ma, Jiaxian Chen, Jianing Zhang, Zhaolong Su, Yutong Zhang, Zhiyin Yu, Ruiqi Liu, Xiaolei Lv, Bo Li, Jun Gao, Ziqi Zhang, Chunfeng Yuan, Bing Li, Weiming Hu

发布于 2026-05-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhiheng Li, Zongyang Ma, Jiaxian Chen, Jianing Zhang, Zhaolong Su, Yutong Zhang, Zhiyin Yu, Ruiqi Liu, Xiaolei Lv, Bo Li, Jun Gao, Ziqi Zhang, Chunfeng Yuan, Bing Li, Weiming Hu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在评判谁是世界上最好的厨师。过去一年里,所有人都在一个名为OmniDocBench的狭小厨房里竞争。这个厨房只有 1,355 道菜,而评委(评分系统)过于慷慨,几乎每位顶级厨师都获得了 90% 或更高的分数。这就像一场所有选手在同一时刻冲过终点的比赛;你无法分辨谁实际上更快或更优秀。

此外,评委们犯了一些错误。他们数错了食材,遗漏了步骤,甚至幻觉出根本不存在的味道。由于“食谱”(真实标签)存在缺陷,排行榜的排名不可靠。而且,既然所有人都在这个厨房里烹饪了一年,厨师们可能只是死记硬背了菜品,而非真正学会了烹饪。

现在,PureDocBench登场了,这是本文介绍的全新、庞大且组织完美的厨房。

新厨房:PureDocBench

PureDocBench 的创建者没有使用旧而混乱的食谱,而是从零开始,利用**数字蓝图(HTML/CSS)**建造了他们的厨房。

  • 蓝图:他们首先编写了文档的代码。
  • 菜品:他们利用该代码生成了文档的图像。
  • 答案键:由于他们先编写了代码,因此确切知道文本、表格和公式应该呈现的样子。无需猜测。

这个厨房规模宏大。它拥有10 种不同类型的餐厅(学术、法律、医疗、金融等)和66 道具体的菜单项(如发票、文凭或实验报告)。

每道菜的三个版本

为了测试厨师们究竟有多强,厨房以三种不同条件提供每一道菜:

  1. 清洁版:刚从烤箱端出的完美、新鲜的盘子。
  2. 数字退化版:盘子被劣质扫描仪扫描,或照片被压缩,导致看起来模糊或泛黄(像旧传真)。
  3. 现实世界退化版:盘子被打印出来,然后有人在昏暗的光线下手抖着拍下了照片,或者它可能是复印件的复印件。

这至关重要,因为一位厨师可能擅长摆盘完美的菜肴,却在端出杂乱的菜肴时表现糟糕。

结果:谁真正获胜了?

研究人员在这个新厨房里测试了40 位不同的厨师(AI 模型)。以下是他们的发现:

1. 比赛远未结束
在旧厨房里,顶级厨师的得分超过 90%。而在 PureDocBench 中,绝对最好的厨师仅获得了100 分中的 74 分。最佳与最差之间存在巨大差距(44 分)。这意味着文档解析尚未解决;仍有大量改进空间。

2. 小型专家 vs. 巨型通才
有两种类型的厨师:

  • 专家:只懂得烹饪文档的厨师。他们体型小且高效。
  • 通才:体型巨大、多才多艺的厨师,能烹饪任何事物,但在文档方面并不专精。

论文发现,小型专家(有些“脑细胞”少于 40 亿)与巨型通才(可能大 100 倍)一样优秀,甚至更胜一筹。这就像一位小型的专业寿司厨师在制作寿司时击败了一位巨大的、自助式自助餐厨师。

3. 公式瓶颈
无论厨师多么聪明,数学公式都是最难的部分。即使是最好的模型,在公式方面的正确率也仅为**67%**左右。这是一个普遍的弱点。

4. “杂乱盘子”的惊喜
这是最有趣的发现。

  • 当盘子变得杂乱(现实世界退化)时,专家厨师崩溃了。他们的得分显著下降。
  • 通才厨师则出人意料地坚韧。他们更好地处理了杂乱、模糊的现实世界照片。

这意味着,如果你只在完美、清洁的盘子上测试厨师,你会对谁能在现实世界中真正成功产生错误的判断。一旦加入现实世界的噪声,排名就会反转!

结论

该论文认为,我们需要停止使用旧而有缺陷的厨房(OmniDocBench)来评判 AI。我们需要使用PureDocBench,它:

  • 拥有完美、可追溯的答案键(不再有评委错误)。
  • 在杂乱、现实世界的条件下测试厨师,而不仅仅是完美条件。
  • 揭示出虽然 AI 正在进步,但仍有很长的路要走,特别是在数学公式和处理现实世界的杂乱方面。

研究人员已经向这个新厨房敞开了大门,让每个人都能获得蓝图、菜品和答案键,以便社区能够共同构建更好的厨师。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →