AUDITFLOW: Executable Symbolic Environments for Structured Financial Reporting Verification
AuditFlow 是一个基于图谱驱动的多智能体框架,它通过将符号环境与自适应搜索及确定性验证相结合,将报告的事实与分类法概念相链接并进行数值重算,从而显著提高了结构化财务审计的准确性,在基准数据集上达到了 82.09% 的准确率。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在试图核实白板上的一道复杂的数学题,但数字散落在不同的房间里,而解题规则则写在一本厚重的、落满灰尘的百科全书里。
这正是 AUDITFLOW 所要解决的挑战,只不过它核实的不是数学题,而是财务报告(例如上市公司向政府提交的文件)。
以下是该论文对这一概念的解释,通过简单的概念进行了拆解:
问题所在:为什么 AI 在处理金钱问题时会力不从心
目前的 AI 模型(例如那些能写文章或与你聊天的模型)非常擅长阅读文本。但财务审计不仅仅是关于“阅读”,它更多是关于数学和规则。
- 问题在于: 为了检查一个数字是否正确,AI 不能仅仅根据上下文进行“猜测”。它必须在申报文件中找到特定的数字,在庞大的会计百科全书(称为“分类法/Taxonomy”)中查找规则,亲自进行计算,然后对比结果。
- 失败的原因: 如果你要求标准的 AI 做这件事,它经常会产生“幻觉”(编造数字)或者因为试图通过文本进行“推理”而非实际计算,从而忽略了规则。论文指出,如果没有辅助,最优秀的 AI 也只能在 14% 的情况下做对。
解决方案:AUDITFLOW(“三位一体的审计团队”)
作者构建了一个名为 AUDITFLOW 的系统。他们没有要求一个 AI 完成所有工作,而是创建了一个符号化环境(数字化的工作空间)和一个由三个专业智能体组成的团队。
你可以把它想象成一个建筑工地:
环境(蓝图与工具):
该系统构建了一个数字地图。一部分是静态地图(会计规则/百科全书),另一部分是动态地图(公司实际的财务报告)。
至关重要的一点是,AI 不会“猜测”数学运算。它使用类型化工具(例如计算器或尺子),这些工具是硬编码的,能够完美运行。AI 决定使用哪种工具,但实际的数学运算是由工具完成的。团队(智能体):
- 初级审计员 A(规则检查员): 这个智能体首先查看规则。它会问:“会计百科全书说这个数字应该是多少?”它使用的是静态地图。
- 初级审计员 B(证据猎人): 这个智能体首先查看事实。它深入挖掘公司的实际申报文件,以查找数字、检查是否与去年一致,并查看单位是否合理。它使用的是动态地图。
- 高级审计师(裁判): 这个智能体倾听两名初级审计员的意见。如果两人达成一致,任务完成。如果两人意见不一(例如,一个说“违规”,另一个说“合规”),高级审计师会要求他们针对冲突的具体领域进行更深入的调查。
他们如何得出结论
该系统并不只是询问 AI:“你觉得怎么样?”
相反,它使用了一个叫做**证据聚合(Evidential Aggation)**的过程。
- 想象一下,两名初级审计员手里拿着证据卡。
- 如果两张卡都显示“违规”,系统就 100% 确定。
- 如果一张卡显示“违规”,而另一张卡表示“不确定”,系统会根据他们实际找到的证据计算出一个“信任分数”。
- 最终答案是判定结果(通过/失败)、期望值(数字应该是多少)以及信任分数的结合体。
结果:为什么这很重要
论文在真实财务申报数据集上对该系统进行了测试。
- 胜出者: AUDITFLOW 在 82% 的情况下回答正确。
- 失败者: 下一种最好的方法(尝试独自完成所有工作的单一 AI 智能体)仅有 67% 的正确率。
- “神奇”的要素: 最重要的发现是,如果你移除确定性工具(硬编码的数学检查器)并让 AI 去“猜测”数学运算,其准确率会骤降至 17%。
核心结论
论文声称,对于像财务审计这样高风险的任务,你不能仅仅依赖 AI 的“直觉”或基于文本的推理。你需要将搜索(寻找信息)与计算(执行数学运算)分开。
AUDITFLOW 之所以奏效,是因为它将 AI 视为一名聪明的管理者——他知道如何使用计算器和规则手册,而不是试图让自己成为计算器本身。它迫使 AI 使用一个“符号化环境”,在这里,数学是由代码完成的,而不是由 AI 的大脑完成。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。