← 最新论文
💻 computer science

DiligenceProv: A Truth-Ledger Benchmark for Verifiable Financial Due-Diligence Answers from Large Language Models

本文介绍了 DiligenceProv,这是一种利用带有注册缺陷的合成交易室(synthetic deal rooms)进行构建的新型基准测试方法,旨在评估并提升大语言模型在高风险金融尽职调查中的可验证性、证据检索能力以及定义准确性。

原作者: Yunguo Yu

发布于 2026-09-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Yunguo Yu

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

当一家公司被收购或出售时,其过程依赖于对其财务健康状况的严格检查,这一阶段被称为尽职调查。顾问们会花费数周时间钻研一个“交易室”(deal room),其中包含从审计财务报表、收益报告到合同草案和管理层演示文稿等一系列文件。他们的职责是回答关键问题:这家企业的真实盈利能力是多少?其最大客户承担了哪些风险?在这种高风险的环境中,一个答案的价值仅取决于其背后的证据。审查者必须不仅能够验证最终的数字,还要能够验证计算该数字所使用的具体定义,以及支持该主张的确切文件。如果一个答案看起来很自信但却是错误的,它比没有答案更危险地误导投资决策。

人工智能,特别是大语言模型,正开始进入这一领域,承诺加速这些复杂文件的阅读与分析。然而,一个重大的障碍仍然存在。目前的 AI 系统可以流利地阅读文本,但在处理金融领域所需的特定验证类型时却显得力不从心。它们可能会产生一个看似合理但实际上错误的数字,或者引用的文件并不能支持其结论。核心挑战不在于 AI 是否能读懂文字,而在于它能否在混乱且相互冲突的信息集中,找到人类专家所认可的唯一真相。

为了解决这个问题,研究人员创建了一个新的测试场,名为 DiligenceProv。这并非基于干净、公开且数据已达成一致的财务报告的标准测试。相反,研究人员构建了一家虚构的公司,并生成了一套真实的三十份文件,包括财务报表、债务明细表和管理层演示文稿。他们刻意引入了现实交易中存在的各种混乱情况:同一个收益指标有三种不同的定义方式、看起来很新但实际上已过时的数字,以及文档中根本无法回答的问题。其目标是观察 AI 系统是否能提供一个人类审查者可以验证的答案,即同时检查数字、定义和证据。

研究人员发现,仅仅让文档看起来真实并不足以挑战最先进的 AI 系统。在一次使用真实但完全一致的文档进行的初步测试中,顶尖的商业模型即使面对棘手的问题也能正确回答每一个问题。系统之所以毫无困难,是因为文档中并不包含现实谈判中存在的那些陷ole(陷阱)。研究人员意识到,要真正测试这些系统,他们必须人为设计难度。他们创建了一个“真相账本”(truth ledger)——一份记录了所有事实的总账,然后编写了包含“注册缺陷”的文档。这些缺陷包括不同文档之间的冲突、看起来像是正确答案实则错误的干扰项,以及信息缺失但从未明确说明缺失的沉默空白。

当他们在这些经过设计的混乱数据中测试 AI 模型时,结果发生了剧烈变化。那些此前得分完美的先进模型,在面对这些“注册缺陷”时开始表现失常。更令人惊讶的是,研究人员发现,对于许多中端模型而言,给 AI 提供完整的三十份文档,其实际表现反而不如只给它六页精心挑选的页面。当 AI 拥有整个交易室的访问权时,它经常会被额外的文本中的过时数字或伪造的引用所干扰。它会抓取错误的数字版本,或者编造一个并不存在的文档。然而,当研究人员仅提供最相关的段落时,AI 的表现显著提升。在这种情况下,检索过程充当了一个保护性过滤器,屏蔽了完整文档集中的噪音和混乱。

研究还表明,对于这些 AI 系统而言,最难的部分不是寻找证据,而是理解如何使用证据。即使研究人员提供了完全正确的文档和正确的数字,模型仍然会犯错。它们经常无法应用正确的财务指标定义,或者无法区分合同草案与最终版本。错误并非源于缺乏信息,而是源于在应用交易规则时缺乏严谨性。研究人员将这些失败归类为特定的类型,例如“自信的错误答案”(即 AI 肯定地陈述一个错误的事实)或“干扰捕获”(即 AI 粘附于一个具有误导性的数字)。

一个特别令人担忧的发现是,AI 无法承认自己不知道某些事情。在现实世界中,如果一份文档没有特定的预测,正确的做法是说明信息缺失。在测试中,AI 模型很少拒绝回答。相反,当面临数据缺失时,它们往往试图进行猜测或推断,从而创造出一个看起来结构完整且专业的伪造数字。这在金融领域是一种危险的行为,因为一个听起来很自信的错误数字比明确承认信息缺失更具危害性。

研究人员得出结论,金融尽职调查的难度不仅在于文本的复杂性,还在于证据是如何被获取和管理的。对于最强大的 AI 系统,拥有所有文档的完整上下文可以让它们达到接近完美的得分,这表明它们的主要局限性仅仅是相关信息是否可用。对于其他模型,信息过多反而是一种负担。这项研究表明,要让这些系统在实际交易中获得信任,需要建立优先考虑“验证”和“定义”而非单纯“检索”的工作流。该基准测试现已向其他研究人员开放,旨在为衡量和改进这些系统提供手段,以便在它们被用于处理真实资金之前进行评估。这项工作证明,对于高风险的金融任务,实现可靠性的路径不在于让 AI 变得更聪明,而在于构建能够根据一套严格的规则和证据来验证自身答案的系统。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →