How Far Is Document Parsing from Solved? PureDocBench: A Source-TraceableBenchmark across Clean, Degraded, and Real-World Settings
本文介绍了 PureDocBench,这是一个可溯源的基准测试,涵盖干净、退化和真实世界的文档图像,揭示了饱和的 OmniDocBench 排名中存在显著缺陷,并表明文档解析仍是一个未解决的挑战,模型之间存在显著的性能差距,且公式识别存在持续瓶颈。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在评判谁是世界上最好的厨师。过去一年里,所有人都在一个名为OmniDocBench的狭小厨房里竞争。这个厨房只有 1,355 道菜,而评委(评分系统)过于慷慨,几乎每位顶级厨师都获得了 90% 或更高的分数。这就像一场所有选手在同一时刻冲过终点的比赛;你无法分辨谁实际上更快或更优秀。
此外,评委们犯了一些错误。他们数错了食材,遗漏了步骤,甚至幻觉出根本不存在的味道。由于“食谱”(真实标签)存在缺陷,排行榜的排名不可靠。而且,既然所有人都在这个厨房里烹饪了一年,厨师们可能只是死记硬背了菜品,而非真正学会了烹饪。
现在,PureDocBench登场了,这是本文介绍的全新、庞大且组织完美的厨房。
新厨房:PureDocBench
PureDocBench 的创建者没有使用旧而混乱的食谱,而是从零开始,利用**数字蓝图(HTML/CSS)**建造了他们的厨房。
- 蓝图:他们首先编写了文档的代码。
- 菜品:他们利用该代码生成了文档的图像。
- 答案键:由于他们先编写了代码,因此确切知道文本、表格和公式应该呈现的样子。无需猜测。
这个厨房规模宏大。它拥有10 种不同类型的餐厅(学术、法律、医疗、金融等)和66 道具体的菜单项(如发票、文凭或实验报告)。
每道菜的三个版本
为了测试厨师们究竟有多强,厨房以三种不同条件提供每一道菜:
- 清洁版:刚从烤箱端出的完美、新鲜的盘子。
- 数字退化版:盘子被劣质扫描仪扫描,或照片被压缩,导致看起来模糊或泛黄(像旧传真)。
- 现实世界退化版:盘子被打印出来,然后有人在昏暗的光线下手抖着拍下了照片,或者它可能是复印件的复印件。
这至关重要,因为一位厨师可能擅长摆盘完美的菜肴,却在端出杂乱的菜肴时表现糟糕。
结果:谁真正获胜了?
研究人员在这个新厨房里测试了40 位不同的厨师(AI 模型)。以下是他们的发现:
1. 比赛远未结束
在旧厨房里,顶级厨师的得分超过 90%。而在 PureDocBench 中,绝对最好的厨师仅获得了100 分中的 74 分。最佳与最差之间存在巨大差距(44 分)。这意味着文档解析尚未解决;仍有大量改进空间。
2. 小型专家 vs. 巨型通才
有两种类型的厨师:
- 专家:只懂得烹饪文档的厨师。他们体型小且高效。
- 通才:体型巨大、多才多艺的厨师,能烹饪任何事物,但在文档方面并不专精。
论文发现,小型专家(有些“脑细胞”少于 40 亿)与巨型通才(可能大 100 倍)一样优秀,甚至更胜一筹。这就像一位小型的专业寿司厨师在制作寿司时击败了一位巨大的、自助式自助餐厨师。
3. 公式瓶颈
无论厨师多么聪明,数学公式都是最难的部分。即使是最好的模型,在公式方面的正确率也仅为**67%**左右。这是一个普遍的弱点。
4. “杂乱盘子”的惊喜
这是最有趣的发现。
- 当盘子变得杂乱(现实世界退化)时,专家厨师崩溃了。他们的得分显著下降。
- 通才厨师则出人意料地坚韧。他们更好地处理了杂乱、模糊的现实世界照片。
这意味着,如果你只在完美、清洁的盘子上测试厨师,你会对谁能在现实世界中真正成功产生错误的判断。一旦加入现实世界的噪声,排名就会反转!
结论
该论文认为,我们需要停止使用旧而有缺陷的厨房(OmniDocBench)来评判 AI。我们需要使用PureDocBench,它:
- 拥有完美、可追溯的答案键(不再有评委错误)。
- 在杂乱、现实世界的条件下测试厨师,而不仅仅是完美条件。
- 揭示出虽然 AI 正在进步,但仍有很长的路要走,特别是在数学公式和处理现实世界的杂乱方面。
研究人员已经向这个新厨房敞开了大门,让每个人都能获得蓝图、菜品和答案键,以便社区能够共同构建更好的厨师。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。