← 最新论文
💬 NLP

FinBalance: A Multi-Document Accounting Reconciliation Benchmark

该论文介绍了 FinBalance,这是一个基于不同行业和难度级别的源文档构建的多文档会计对账基准,研究表明当前的大型语言模型难以将源材料准确地对账为一致的资产负债表,且其报告的财务报表与根据其自身生成的条目所推导出的报表之间往往存在显著差异。

原作者: Sasank Tumpati, Devansh Agarwal, Ayush Kedia, Arjun Neekhra, Murari Mandal, Krishna Garg, Yash Sinha, Suman Gupta, Dhruv Kumar

发布于 2026-06-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Sasank Tumpati, Devansh Agarwal, Ayush Kedia, Arjun Neekhra, Murari Mandal, Krishna Garg, Yash Sinha, Suman Gupta, Dhruv Kumar

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你是一名正在试图破解财务谜题的侦探。你面前有一堆杂乱无章的线索:发票、银行对账单、合同和收据。你的工作不仅仅是阅读它们,而是要弄清楚到底发生了什么,为每一笔交易写下正式的报告(即“会计分录”),然后将它们全部汇总,创建一个最终的“资产负债表”(公司财务状况的快照)。

如果你发现一个线索与另一个线索相矛盾(例如,发票显示你支付了 100 美元,但银行对账单显示你支付了 120 美元),你必须立即标记这个错误。你不能视而不见,也不能靠猜测来得出答案。

这正是 FinBalance 所关注的内容。它引入了一种全新的“考试”形式,旨在测试人工智能(AI)是否具备这种现实世界的会计侦探能力。

问题所在:AI 擅长阅读,但不擅长对账

作者指出,目前大多数 AI 测试就像是给学生一本已经写好的教科书章节,然后问:“这篇文章的主旨是什么?”答案已经写在那里了,AI 只需要把它找出来即可。

但真正的会计工作要难得多。这就像是给学生一个装满皱巴巴收据、一张银行对账单和一份合同的鞋盒,然后对他们说:“理清其中的数学逻辑,写出正式报告,并告诉我是否有任何地方对不上。”

解决方案:FinBalance 基准测试

研究人员构建了一个庞大的、合成的“训练场”,名为 FinBalance

  • 设置: 他们创建了一个程序来扮演一名严谨的会计师。该程序生成了数千个虚构但真实的商业场景,涵盖 8 个不同的行业(如零售、医疗保健和科技)。
  • 文档: 对于每个场景,它会生成一组包含文本内容的文档(模拟扫描后的 PDF)。其中一些是真实的证据,一些是“干扰项”(旨在误导你的假文件),还有一些则包含刻意的矛盾之处。
  • 标准答案(Ground Truth): 由于场景是由计算机生成的,因此 AI 知道确切的正确答案。它知道正确的会计分录、正确的最终资产负债表,以及哪些文档支撑了哪些数字。

测试过程:AI 的表现如何?

研究人员在 710 个此类会计谜题上,测试了目前最智能的六个 AI 模型。结果令人惊讶且令人汗颜:

  1. “数学 vs. 报告”的差距:
    想象一个学生能在脑海中完美地进行计算,但在试卷上写下的最终答案却是错误的。

    • AI 模型在处理单个交易(“会计分录”)方面表现得相当出色。
    • 然而,当它们尝试将这些数字汇总并编写最终的“资产负债表”时,往往会失败。
    • 数据统计: 在六个模型中有四个出现了巨大的差距。它们可以根据自己的笔记重构出正确的财务图景,但提交的报告却是错误的。这就像一位厨师做出了完美的菜肴,却把它盛错了盘子,还贴错了标签。
  2. “丢失收据”问题:
    最大的失败并非在于数学计算,而在于将答案与证据联系起来

    • 当 AI 得出一个正确的数字时,它往往无法指出证明该数字的具体文档。
    • 即使研究人员要求 AI “必须引用来源”,其表现也几乎没有改善。AI 难以在草堆中寻找针头,这并非因为它不想做,而是因为它无法区分真实的证据与干扰项。
  3. “第二意见”策略:
    研究人员尝试了一个聪明的解决方法。在 AI 提交答案后,他们运行了一个严格的计算器(“分类账”)来核对 AI 的数字,并将 AI 所陈述的内容与其自身数字所暗示的内容之间的差异展示给 AI。

    • 结果: 这种“反馈”显著帮助 AI 修正了其最终报告。这就像老师说:“你说总额是 100 美元,但如果你把自己的清单加起来,应该是 120 美元。检查一下你的数学。”
    • 代价: 这种修复也有副作用。当 AI 试图发现文档中的矛盾(错误)时,这种反馈有时反而会让它在识别错误方面表现得更差,因为它过于专注于修正数学计算,而忽略了意识到文档本身存在问题。

结论

论文得出结论:虽然 AI 在理解财务文本方面正在进步,但它尚未准备好成为一名可靠的会计师。它在以下方面表现挣扎:

  • 将不同文档中的信息联系起来。
  • 将其发现的内容汇总(相加)成一份一致的最终报告。
  • 区分真实证据与虚假干扰项。

作者强调,这个基准测试是一个“压力测试”。如果一个 AI 无法完美解决这些干净的、由计算机生成的谜题,那么它肯定无法被信任去处理那些收据模糊、页面缺失且规则更加复杂的现实世界会计工作。

简而言之: 目前的 AI 是优秀的财务文档“阅读者”,但却是拙劣的“对账员”。它可以找到数字,但经常会丢失证据链,并且无法正确编写最终报告。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →