ExtractBench: A Benchmark for Schema-Guided Enterprise Document Extraction
本文介绍了 ExtractBench,这是一个用于评估模式引导的企业级文档提取的全面基准测试,涵盖了 370 份文档和 67 种类型,研究表明 LlamaExtract Agentic Plus 实现了最先进的准确率和落地能力,且与编码智能体相比成本显著降低。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你是一名试图破解谜团的侦探,但你的犯罪现场不是犯罪现场,而是一堆乱七八糟的文书资料。其中一些纸张平整且打印整齐,另一些则是写着潦草手写字的皱巴巴收据,还有一些长得甚至横跨了整个书架。在人工智能的世界里,有一种特殊的机器人被称为“智能体”(agent),它正在学习阅读这些文档。它的任务是寻找特定的线索——比如日期、金额或姓名——并将它们写成一份整洁、有序的清单,这种清单被称为“模式”(schema)。把“模式”想象成一个严格的食谱:无论食材(文档)看起来多么凌乱,机器人都必须严格遵守它。
但棘手的地方在于,仅仅因为机器人写下了正确的数字,并不意味着它真的“看到”了它们。它可能是在瞎猜,或者可能漏掉了整整一页的线索。对于企业来说,这是一件大事。如果一个机器人被要求阅读成千上万份保险理赔单或银行账单,它不仅需要准确,还需要能够用手指着页面上的确切位置,指出它是在哪里找到答案的。如果它错了,人类需要能够快速核查证据。这就是“模式引导提取”(schema-guided extraction)的挑战:让机器人即使面对凌乱、冗长或用蜡笔书写的“食材”时,也能完美地遵循食谱。
于是,ExtractBench 登场了——这是一个全新的、超级硬核的测试,旨在观察哪些 AI 机器人真正为现实世界做好了准备。这项研究背后的研究人员并不只是想知道机器人是否能阅读;他们想知道机器人是否能正确阅读所有内容、能否展示其推导过程,以及能否在不耗费巨资的情况下完成任务。他们建立了一个巨大的“考场”,其中包含 3 70 种不同类型的文档——从短小的收据到 50 页的政府报告——涵盖了金融、能源和医疗保健等 8 个不同的行业。他们甚至加入了那些经过扫描、手写或拥有跨越多页奇怪表格的文档。
大惊喜来了?看起来最“聪明”的机器人并不总是赢家。研究发现,虽然一些强大的 AI 模型擅长阅读短小、整洁的文档,但它们经常会感到“疲劳”,在阅读长文档的过程中读到一半就停了下来,从而漏掉了大量数据。另一方面,一些通过编写代码来解决问题的机器人虽然非常准确,但运行成本很高。研究人员发现了一个名为 LlamaExtract Agentic Plus 的系统,它找到了一个“甜点区”(平衡点)。它能以接近那些昂贵的写代码机器人的准确率获取正确答案,但成本却仅为后者的极小部分。
然而,这项研究也揭示了一个主要的盲点。即使是最优秀的机器人,在“落地”(grounding)能力——即指向页面上给出答案的确切单词的能力——方面也表现挣扎。虽然有些系统可以告诉你答案在第几页,但能指出确切单词的系统不足一半。论文表明,虽然我们在获取正确数字方面做得越来越好,但教机器人可靠地展示其“作业过程”仍然是一个尚在进行中的课题。简而言之,ExtractBench 证明了对于企业级工作,你需要的不仅仅是一个聪明的机器人;你需要一个细致、诚实地交代线索来源,且不会让你破产的机器人。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。