Rethinking LLMOps for Fraud and AML: Building a Compliance-Grade LLM Serving Stack
本文提出了一种专为欺诈和反洗钱合规设计的工作负载感知型 LLMOps 技术栈,该栈利用开放权重模型、PagedAttention 和前缀缓存等高级服务优化技术以及严格的质量门控机制,相较于通用的大语言模型服务方法,在吞吐量、延迟和 GPU 利用率方面实现了显著提升。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在运营一座庞大且高速运转的图书馆,其目标不仅仅是阅读书籍,而是要在数百万页金融交易记录中找出特定的危险模式,以抓获洗钱者。这就是**欺诈与反洗钱(AML)**的世界。
本文作者认为,我们通常用于与朋友聊天的标准“图书馆”(即人工智能系统),在这项特定工作上表现糟糕。这就像试图用一辆通用送货卡车来运输易碎、沉重且预先打包好的货箱。你需要一辆专用车辆。
以下是他们解决方案的分解,采用简单的类比:
1. 问题:“一刀切”的卡车
大多数人工智能系统是为聊天而构建的。在聊天中,每一次对话都是独特的、冗长的且不可预测的。
- 欺诈检测的现实:欺诈检测则截然不同。发送给人工智能的每一个请求看起来几乎都一样。这就像填写一份表格,页面顶部 80% 的内容始终是相同的法律规则和说明(即“前缀”),只有底部 20% 会发生变化(即具体的交易详情)。
- 结果:标准人工智能系统会浪费大量时间反复重读相同的法律规则,就像学生在回答每一道作业题之前都要重读教科书的同一章节。这导致它们既缓慢又昂贵。
2. 解决方案:智能“服务栈”
作者构建了一个专门针对这些重复性高、规则繁多的任务而设计的专用“服务栈”(即运行人工智能的引擎)。将其想象为从标准送货卡车升级为高速自动化分拣中心。
以下是他们进行的关键升级:
“小抄”(前缀缓存):
系统不再每次都要重读 2000 字的法律说明,而是将其记住。这就像在墙上贴了一张小抄。当新案件到来时,人工智能只需瞥一眼小抄(它已加载在内存中),然后仅专注于新的交易详情。这节省了海量时间。“智能文件柜”(PagedAttention):
标准人工智能的内存就像一张凌乱的办公桌,如果不把文件全部重新整理,就无法放入新纸张。作者使用了一种“分页”系统,这就像一个井井有条的文件柜。它将内存划分为小块、易于管理的区块,使人工智能能够在其工作空间中容纳数千个案件,而不会变得杂乱无章或导致崩溃。“分组策略”(多适配器批处理):
想象一个邮局,你需要为 10 个不同的城镇分拣邮件。一个天真的系统会先分拣一封寄往 A 镇的信,然后一封寄往 B 镇的信,然后再回到 A 镇。
作者的系统将所有“寄往 A 镇”的信件归为一组,然后将所有“寄往 B 镇”的信件归为一组。在人工智能术语中,他们将需要相同特定“适配器”(针对特定任务的专用工具)的请求分组,并在单个批次中处理它们。这比旧方法快 3.9 倍。“睡眠模式”(生命周期管理):
有时,一项欺诈调查需要三个不同的人工智能模型按顺序工作:一个用于寻找证据,一个用于分类,另一个用于撰写报告。让这三个模型全天候以全速运行是对电力(和资金)的浪费。
作者的系统将未使用的模型置于睡眠状态(释放内存),并在需要时立即唤醒它们。这就像一辆混合动力汽车,在红灯时关闭引擎,但在绿灯亮起时能瞬间加速。这将“唤醒”时间从近一分钟缩短至几秒钟。“速度提升”(推测解码):
对于简短的回答(如简单的“是/否”或 JSON 代码),人工智能有时思考时间过长。作者添加了一个“起草”步骤,由一个更小、更快的人工智能猜测答案,然后由大型人工智能进行检查。这就像有一位速读员,他快速浏览文本并高亮显示答案,供教授核实。
3. “质量关卡”(法官)
如果人工智能犯错,速度就毫无意义。在欺诈检测中,一个错误的答案可能意味着漏掉罪犯或冤枉无辜者。
- 作者创建了一个**“法官”系统**。在任何人工智能更新上线之前,由一组人工智能法官(以及人类专家)检查工作成果。
- 他们不仅检查人工智能是否快速,还检查输出是否有效(例如:是否是正确的 JSON?是否遵循了规则?)。
- 这就像工厂里的安全检查员。如果产品速度快但已损坏,它就不能离开厂房。
4. 结果:“魔法”数字
他们使用公开的虚假数据(以免泄露真实的银行机密)测试了这个新系统。结果非常显著:
- 速度:他们从每小时处理约600 个请求提升至每小时 3,600 个请求(提升了 5.5 倍至 6 倍)。
- 等待时间:获取答案的时间从31–38 秒降至6–8 秒。
- 效率:计算机硬件(GPU)的闲置时间从 88% 变为忙碌时间达到78%。
- 成本:由于他们使用相同的硬件完成了更多工作,因此完成相同工作所需的计算机数量减少了一半以上。
结论
该论文总结道,对于抓获洗钱者这样的高风险工作,不能仅仅使用“最佳”的人工智能模型。你必须构建一个专用的交付系统,该系统理解工作是重复的、规则繁多的,并且需要严格的准确性。通过将“前缀”(规则)视为可重用资源,并将工作流程组织得像智能工厂一样,你可以在不改变底层人工智能大脑的情况下,使系统更快、更便宜、更可靠。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。