Machine learning reduces audit detection risk in 3.3 million public sector general ledger transactions
本研究表明,一种经过 330 万笔真实世界公共部门交易及官方审计报告验证的新型四层机器学习框架,通过将审计风险检测率从 38% 以上降低至 2.01%,同时将处理时间缩减 98.7%,显著优于传统的货币单位抽样法。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你是一名侦探,正试图在一袋由 330 万枚真钱组成的巨大钱袋中,寻找一枚隐藏其中的假币。在财务审计的世界里,这就是日常挑战:在海量的资金记录中寻找错误或欺诈。传统上,审计师使用一种被称为“货币单元抽样”(Monetary Unit Sampling, MUS)的方法。你可以把这想象成一个寻宝者,他只在那些最大、最显眼的土堆里挖掘,因为他假设金子一定在那里。他忽略了那些微小的、安静的沙坑,认为那里是安全的。但如果假币就藏在其中一个被忽视的小口袋里呢?这就是风险所在:因为你只看了大的部分,从而错过了坏事。
为了解决这个问题,科学家们转向了“机器学习”,这就像是给侦探配备了一个超级聪明、不知疲倦的机器人助手。这个助手可以阅读袋子里的每一条记录,而不仅仅是那些大的记录。它能发现人类肉眼可能忽略的模式,比如数字中奇怪的节奏,或者感觉“不合常理”的交易。其目标是降低“探测风险”(detection risk),这简单来说就是侦探错过犯罪的可能性。如果机器人能在那个小口袋里发现假币,审计就会变得更加安全和快速。这篇论文提出了一个大问题:这个机器人助手是否真的能比旧的“挖掘大土堆”方法更好地发现政府资金记录中的错误,并且它能否以人类审计师信任的方式解释它为什么发现了这些错误?
超级扫描仪:AI 如何在草堆中找到针头
在这项研究中,来自蒙古的研究团队构建了一个四层的“超级扫描仪”,用于检查一家公共能源企业的财务记录。他们不仅是在用虚构的数字进行测试;他们还向系统输入了一个包含三年的(2023年、2024年和2025年)3,329,189 笔个人资金交易的庞大真实世界数据集。这是一座总计达 16.34 万亿图格里克(MNT)的数据大山!
旧方法 vs 新方法
研究人员将他们的新型机器学习系统与旧的标准(即前面提到的“挖掘大土堆”的方法)进行了对比。在旧方法中,审计师会随机抽取 20% 的账户进行检查。研究发现,这种旧方法留下了巨大的缺口:它的“探测风险”(即错过错误的概率)在 38.05% 到 52.7% 之间。用通俗的话说,这意味着在近一半的情况下,旧方法可能会完全错过欺诈或错误。
然而,新的机器学习系统就像一张能捕捉到“一切”的网。它在短短 4.5 小时 内就处理完了全部 330 万 笔交易。为了让你有个直观的概念,如果用旧方法,人类审计师完成同样的工作需要 310 到 357 小时。这意味着效率提升了 98.7%!
机器人是如何在没有老师的情况下学习的?
通常,教机器人识别欺诈需要先给它展示数千个“好”记录和“坏”记录的例子。但在现实生活中,审计师直到完成审计后才知道哪些记录是坏的。这是一个“先有鸡还是先有蛋”的问题。
作者通过一个被称为“自标注”(self-labeling)的巧妙技巧解决了这个问题。想象一下有三位不同的侦探(孤立森林 Isolation Forest、Z-score 和 转换率分析 Turn-ratio analysis)在独立观察数据。如果其中至少两位侦探都认为某条记录看起来可疑,系统就会将其标记为“异常”。这凭空创造出了一套训练数据,使得主机器人(随机森林模型 Random Forest)能够在不需要预设答案的情况下,学会如何识别坏人。
结果:19 倍的提升
当他们测试这个系统时,结果令人震惊。随机森林模型的 F1 分数达到了 0.966,AUC 达到了 0.999,同时将“探测风险”降低到了仅 2.01%。这比旧方法有了 19 倍的改进。为了证明这并非运气,他们运行了一个统计检验(麦克尼马检验 McNemar's test),结果显示,对于旧方法捕捉到的每一个错误,新的机器学习模型捕捉到了旧方法漏掉的 107 个 错误。数学逻辑如此清晰,以至于这种情况纯属巧合的概率小于 0.001。
“聚合掩盖”之谜
论文中最引人入胜的发现之一是作者称之为“聚合掩盖效应”(aggregation masking effect)的现象。他们测试了一个经典的规则——本福特定律(Benford's Law),该定律预测了数字应该如何开头(例如,在现实生活中,数字开头的 1、2 或 3 出现的频率应该是多少)。
当他们查看 330 万笔单笔交易 时,数字显得非常诡异,违反了本福特定律(这是潜在操纵的迹象)。但是,当他们将这些相同的交易归类为账户摘要(例如,汇总一个银行账户的所有交易)时,这种诡异感消失了!数字看起来完全正常。
这就像如果你观察人群中的个体,你可能会看到有些人戴着红帽子,有些人戴着蓝帽子。但如果你从远处拍摄整个人群的照片,颜色就会融合在一起,变成一种单调的灰色。研究发现,如果审计师只看“灰色的照片”(账户摘要),他们就会错过“红帽子”(交易层面的欺诈)。这表明,为了真正抓获欺诈,审计师需要深入观察单笔交易,而不仅仅是看大的汇总数据。
机器人能解释自己吗?
AI 的一个主要担忧是它是一个“黑匣子”——它给出答案但不会说明原因。研究人员通过增加一个将机器人的数学语言转化为“审计师语言”的层级来解决了这个问题。系统不再说“特征 X 的权重很高”,而是说:“该账户被标记是因为其余额在一年内跳升了 847%,这违反了 ISA 520 标准。”
当国家审计署的真实审计师审查这些解释时,94% 的人认为这些解释非常完美,可以直接用于官方报告而无需修改任何文字。这证明了机器人不仅仅是在瞎猜,它正在以人类专业人士能够理解的方式进行推理。
它在其他数据上有效吗?
团队还测试了他们的机器人是否可以在无需重新训练的情况下处理来自其他部门(如不同政府部门)的数据。虽然它在接受过训练的能源企业表现最好,但在其他领域仍然明显优于旧的“20% 抽样”方法,即使没有针对这些新组别的专门训练,也能捕捉到大部分错误。
总结
这篇论文表明,机器学习不仅仅是一个未来的概念;它是一个实用的工具,可以扫描 330 万 笔交易,仅需 4.5 小时,实现近乎完美的区分度(AUC=0.999)和高准确率(F1=0.966),并能用通俗易懂的英语解释其发现。它还警告我们,仅仅观察宏观摘要是不够的——我们需要深入细节,才能捕捉到隐藏在噪音中的欺诈。作者甚至已将他们的系统作为免费的开源软件发布,以便其他审计师可以使用这个“超级扫描仪”,让公共资金的世界变得更加安全。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。