Audit Detection Risk Reduction Using Machine Learning: Evidence from 3.3 million Transactions
本研究引入并验证了一个四层机器学习框架,该框架通过对来自一家蒙古能源公用事业部门的 330 万笔真实交易利用无监督和有监督模型,与传统方法相比显著降低了审计检测风险和处理时间,同时还揭示了本福特法则异常中的一种新型“聚合掩盖效应”。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你是一名侦探,正试图在一座拥有超过 330 万 本书(交易记录)的巨大图书馆中寻找几名行踪诡秘的小偷。在旧时代,审计师们通过一种被称为**货币单位抽样(Monetary Unit Sampling, MUS)**的方法来玩一场“寻找小偷”的游戏。你可以把这想象成侦探只检查书架上那些最大、最重的书,因为他们假设大书更有可能藏匿坏蛋。他们大约会检查 20% 的书籍。
问题在于,这种旧方法留下了一个巨大的漏洞。研究表明,由于仅仅检查那些“重型”书籍,旧方法漏掉了 38% 到 52% 的坏蛋。这就像是只搜查了半个图书馆,并寄希望于小偷不会躲在那些较轻、较小的书里。
全新的超级扫描仪
研究人员利用机器学习构建了一个全新的、具有四层结构的“超级扫描仪”,用以检查图书馆里的每一本书,而不仅仅是那些沉重的书。他们并没有用于训练的已知小偷名单(这通常是 AI 面临的问题),而是通过一个由三种不同检测工具组成的团队协作,教会了扫描仪如何自主识别“异常性”:
- 孤立森林 (Isolation Forest): 一种能发现那些在人群中显得格格不入、极其突出的项的工具。
- Z 分数 (Z-score): 一把测量数值偏离平均值程度的尺子。
- 借贷比 (Debit-Credit Ratio): 一个检查资金流入是否与资金流出相匹配的平衡秤。
如果这些工具一致认为某个账户看起来可疑,系统就会将其标记出来。随后,一位“老师”(监督学习模型,如随机森林)会从这些标记中学习,从而变得更加擅长发现麻烦。
结果:巨大的飞跃
当他们使用这个新扫描仪对比旧有的“20% 检查”法,对一家蒙古能源公司的 3,329,189 笔交易 进行测试时,结果令人震惊:
- 速度: 旧方法需要人类花费 310 到 357 小时 来完成工作。而新扫描仪仅需 4.5 小时。这意味着减少了 98.7% 的时间!
- 准确度: 旧方法的“检测风险”(即错过小偷的概率)为 38.05% 至 52.7%。而新的随机森林模型将这一风险降至仅为 2.01%。
- “遗漏”比例: 在一项名为 McNemar 的统计检验中,对于旧方法抓获的每一个账户,新模型抓获了 107 个 被旧方法完全忽略的账户。
该模型的表现如此出色,以至于当他们用它测试一套全新的数据(FY2025,模型从未见过的数据)时,它仍然获得了 0.955 的准确度得分 (F1)。此外,当尝试将其应用于其他行业时,它也表现出了相当不错的水平,尽管在训练数据所在的领域表现最佳。
“聚合掩盖效应”的神奇魔术
论文中一个非常酷的发现是作者称之为**“聚合掩盖效应”(Aggregation Masking Effect)**的内容。
想象你有一袋弹珠。如果你逐一观察每颗弹珠,你可能会发现上面涂着的数字遵循着一种奇怪且可疑的模式(违反了预测数字自然呈现方式的本福特定律/Benford's Law)。但如果你把这些弹珠全部压碎,揉成一个巨大的、光滑的粘土球(将它们聚合为账户总额),这种奇怪的模式就会消失!数字看起来会变得完全正常。
研究发现,当他们观察 330 万笔单笔交易 时,数字表现得非常可疑(p < 0.05)。但当他们观察 9,909 个账户摘要(即那个“粘土球”)时,这种怪异感消失了,数字看起来非常完美(MAD < 0.006)。
这意味着标准的审计软件(通常只检查“粘土球”,即账户总额)正在错过隐藏在单个“弹珠”中的欺诈行为。论文建议审计师需要同时检查这两个层面才能捕捉到一切。
为什么审计师真的喜欢它
通常,AI 是一个只会说“我发现了一个问题,相信我”的黑箱。但这个系统包含了一个特殊的层级,能将它的发现转化为审计师已有的语言(国际审计准则,即 ISA)。它不会说“特征 X 过高”,而是会说:“该账户被标记是因为其余额同比上升了 847%,这违反了 ISA 520 的规定。”
当来自国家审计署的真实审计师审查这些解释时,94% 的人表示这些内容可以直接用于他们的官方报告,无需进行任何修改。
这并不代表什么
论文谨慎地指出,这目前还不是适用于所有情况的万能药。
- 它是在一家特定的蒙古能源公司进行的测试。虽然在其他行业的测试中表现良好,但作者表示,在我们可以断言它是一个通用解决方案之前,我们需要看到它在更多不同类型的组织中发挥作用。
- 它目前仅针对结构化数字(如电子表格)。它还无法阅读凌乱的手写笔记、PDF 合同或故事。
- “地面真值”(即确定谁是小偷)来自于 FY2023 和 FY2024 的官方审计报告。模型是基于这些报告进行验证的,但作者指出,还需要在更多国家和会计风格下进行更多测试。
底线
研究人员开发了一个名为 Audit AI v10.0 的免费开源工具,它可以几分钟内扫描数百万笔交易,发现比旧有的“检查大额账本”方法多出 19 倍 的欺诈风险。它证明了通过检查全部内容而非仅仅进行抽样,并且通过在细节被平滑处理成大额摘要之前进行观察,我们可以更快、更自信地抓住坏蛋。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。