AI foundation model choice and false positive variation in Anti Money Laundering transaction screening
本研究表明,在反洗钱交易筛查中选择不同的大语言模型会导致误报率和运营工作量发生剧烈变化,从而确立了模型选择是一个需要进行明确治理与监控的关键运营风险参数。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
每年,巨额资金在全求金融系统中流动,其中一部分旨在掩盖非法利润的来源。为了阻止这种行为,银行和其他金融机构被要求密切监控其客户的交易,寻找可能暗示洗钱的模式。几十年来,他们一直依赖计算机系统来进行这种初步监控。这些系统就像筛子一样,捕捉任何看起来哪怕只有一点可疑之处的事物,并将其标记出来供人类调查员审查。问题在于,这些筛子往往过于粗糙。它们在捕捉真实威胁的同时,也捕捉了大量的无害活动,从而制造了大量的虚假警报。这迫使分析师花费大量时间去调查无辜的人,既浪费了资源,又给客户造成了不必要的压力。
最近,一种新型的计算机智能进入了人们的视野。这些是大型语言模型,它们是在海量文本上训练出的强大工具,能够理解和推理复杂的情况,而无需针对每种场景教授特定的规则。由于它们能够阅读交易历史并理解数字背后的故事,许多专家希望它们能解决虚假警报的问题。其核心理念是,这些模型可以比旧有的基于规则的系统更聪明,能够更准确地分辨出合法的商业支付与可疑的转账。然而,一个关键问题仍悬而未决:如果一家银行在这些新模型中进行选择,这真的重要吗?或者它们都只是同一种工具的不同版本,是可互换且可预测的?
一组独立研究人员试图通过将模型的选择视为银行运营的一项基本风险,而非简单的软件决策,来寻找答案。他们收集了来自两家主要技术供应商的五种不同的商用大型语言模型。他们没有在银行数据上训练这些模型,也没有调整它们的设置;相反,他们要求每个模型都作为一个全新的、“零样本”(zero-shot)筛选器来运行,这意味着模型必须仅凭其现有的知识做出判断。为了确保测试公平,研究人员创建了一组由六百个合成交易案例组成的受控数据集。其中三百个案例被设计成看起来完全符合已知的洗钱方案,而另外三百个则是完美的合法交易,这些交易经过精心设计,足以让不够细心的系统误以为是可疑交易。这些就是“硬负例”(hard negatives),即那些经常被误报的无辜交易。
随后,研究人员将这六百个案例中的每一个都输入到所有五个模型中,要求每个模型判断该交易是否可疑。结果令人震惊。当模型观察那三百个合法交易时,它们的表现差异巨大。一个模型仅将其中极小比例的交易标记为可疑,而另一个模型则将绝大多数标记为可疑。事实上,表现最好和最差的模型在虚假警报率上的差异是巨大的。对于同一组无辜交易,一个模型的错误率不到百分之一,而另一个模型的错误率则超过了百分之八十。这些模型不仅仅是在一些棘手的案例上产生分歧,它们在近百分之九十的合法交易上都存在分歧。一个特定的无辜客户是否会被标记为接受调查,几乎完全取决于执行筛选工作的具体是哪一个计算机模型。
研究还揭示了提供给各家公司的模型家族内部存在的清晰模式。在两种情况下,规模较小、成本较低的模型都表现得更为激进,比功能更强大、更昂贵的对应模型更容易将无害活动标记为可疑。研究人员发现,这些模型并不只是在同一任务上表现得更好或更差,它们实际上是在谨慎程度的光谱上处于完全不同的位置。一个模型为了捕捉罪犯而如此急切,以至于几乎指控了所有人;而另一个模型则如此谨慎,以避免骚扰无辜人士,从而让一些可疑活动溜掉了。这种权衡意味着,选择模型不仅是一个技术选择,更是一种关于银行员工每天要处理多少虚假警报的选择。
为了理解这对现实中的银行意味着什么,研究人员设想了一个场景:一家机构每天处理一百万笔交易,其中可疑交易的比例非常小。在这种条件下,模型的选择会转化为工作量的巨大差异。最谨慎的模型会产生数量可控的警报供调查员审查。然而,最激进的模型会产生几乎两百倍于此的警报队列。在这种情况下,最激进的模型会产生海量的虚假警报,其中几乎每一个警报最终都被证明是错误,从而淹没了真正的威胁。这表明,模型的选择可以从根本上改变合规团队的日常现状,使他们从专注的调查状态转变为被噪音淹没的状态。
研究人员还检查了这些模型是否会以同样的方式失败,即所谓的“算法单调性”(algorithmic monoculture)问题——即所有人依赖相同的工具,从而犯下同样的错误。他们发现情况并非如此。这些模型漏掉的可疑交易并不相同;相反,它们漏掉的是不同的交易。真正的危险不在于它们是否会共同放走某个罪犯,而在于它们会对谁是清白的产生分歧。这种分歧意味着,使用不同模型的两家银行可能会对同一客户的行为持有完全不同的看法。一家银行可能认为这是一种正常的商业模式,而另一家银行则可能认为这是一起犯罪。
研究结论指出,将这些大型语言模型视为可互换组件是一个危险的错误。与用户拥有固定且受控代码的传统软件不同,这些商业模型可以由供应商进行更新、更换或更改,而无需银行直接知晓。今天表现良好的模型,明天可能会被替换为一个行为完全不同的版本,从而在银行自身系统没有任何变化的情况下,将整个运营状态从高度精准转变为陷入混乱。研究人员认为,银行必须将特定模型的身份视为风险管理的重要组成部分。他们需要明确知道自己使用的是哪个版本,定期监测其行为,并理解更换模型是一件重大事件,可能会剧烈改变他们在抓捕犯罪的同时不骚扰客户的能力。模型的选择不仅仅是一个采购细节;它正是决定系统如何看待世界的那个设定。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。