← 最新论文
🤖 AI

Rethinking LLMOps for Fraud and AML: Building a Compliance-Grade LLM Serving Stack

本文提出了一种专为欺诈和反洗钱合规设计的工作负载感知型 LLMOps 技术栈,该栈利用开放权重模型、PagedAttention 和前缀缓存等高级服务优化技术以及严格的质量门控机制,相较于通用的大语言模型服务方法,在吞吐量、延迟和 GPU 利用率方面实现了显著提升。

原作者: Prathamesh Vasudeo Naik, Naresh Dintakurthi, Yue Wang

发布于 2026-05-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Prathamesh Vasudeo Naik, Naresh Dintakurthi, Yue Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在运营一座庞大且高速运转的图书馆,其目标不仅仅是阅读书籍,而是要在数百万页金融交易记录中找出特定的危险模式,以抓获洗钱者。这就是**欺诈与反洗钱(AML)**的世界。

本文作者认为,我们通常用于与朋友聊天的标准“图书馆”(即人工智能系统),在这项特定工作上表现糟糕。这就像试图用一辆通用送货卡车来运输易碎、沉重且预先打包好的货箱。你需要一辆专用车辆。

以下是他们解决方案的分解,采用简单的类比:

1. 问题:“一刀切”的卡车

大多数人工智能系统是为聊天而构建的。在聊天中,每一次对话都是独特的、冗长的且不可预测的。

  • 欺诈检测的现实:欺诈检测则截然不同。发送给人工智能的每一个请求看起来几乎都一样。这就像填写一份表格,页面顶部 80% 的内容始终是相同的法律规则和说明(即“前缀”),只有底部 20% 会发生变化(即具体的交易详情)。
  • 结果:标准人工智能系统会浪费大量时间反复重读相同的法律规则,就像学生在回答每一道作业题之前都要重读教科书的同一章节。这导致它们既缓慢又昂贵。

2. 解决方案:智能“服务栈”

作者构建了一个专门针对这些重复性高、规则繁多的任务而设计的专用“服务栈”(即运行人工智能的引擎)。将其想象为从标准送货卡车升级为高速自动化分拣中心

以下是他们进行的关键升级:

  • “小抄”(前缀缓存)
    系统不再每次都要重读 2000 字的法律说明,而是将其记住。这就像在墙上贴了一张小抄。当新案件到来时,人工智能只需瞥一眼小抄(它已加载在内存中),然后仅专注于新的交易详情。这节省了海量时间。

  • “智能文件柜”(PagedAttention)
    标准人工智能的内存就像一张凌乱的办公桌,如果不把文件全部重新整理,就无法放入新纸张。作者使用了一种“分页”系统,这就像一个井井有条的文件柜。它将内存划分为小块、易于管理的区块,使人工智能能够在其工作空间中容纳数千个案件,而不会变得杂乱无章或导致崩溃。

  • “分组策略”(多适配器批处理)
    想象一个邮局,你需要为 10 个不同的城镇分拣邮件。一个天真的系统会先分拣一封寄往 A 镇的信,然后一封寄往 B 镇的信,然后再回到 A 镇。
    作者的系统将所有“寄往 A 镇”的信件归为一组,然后将所有“寄往 B 镇”的信件归为一组。在人工智能术语中,他们将需要相同特定“适配器”(针对特定任务的专用工具)的请求分组,并在单个批次中处理它们。这比旧方法快 3.9 倍

  • “睡眠模式”(生命周期管理)
    有时,一项欺诈调查需要三个不同的人工智能模型按顺序工作:一个用于寻找证据,一个用于分类,另一个用于撰写报告。让这三个模型全天候以全速运行是对电力(和资金)的浪费。
    作者的系统将未使用的模型置于睡眠状态(释放内存),并在需要时立即唤醒它们。这就像一辆混合动力汽车,在红灯时关闭引擎,但在绿灯亮起时能瞬间加速。这将“唤醒”时间从近一分钟缩短至几秒钟。

  • “速度提升”(推测解码)
    对于简短的回答(如简单的“是/否”或 JSON 代码),人工智能有时思考时间过长。作者添加了一个“起草”步骤,由一个更小、更快的人工智能猜测答案,然后由大型人工智能进行检查。这就像有一位速读员,他快速浏览文本并高亮显示答案,供教授核实。

3. “质量关卡”(法官)

如果人工智能犯错,速度就毫无意义。在欺诈检测中,一个错误的答案可能意味着漏掉罪犯或冤枉无辜者。

  • 作者创建了一个**“法官”系统**。在任何人工智能更新上线之前,由一组人工智能法官(以及人类专家)检查工作成果。
  • 他们不仅检查人工智能是否快速,还检查输出是否有效(例如:是否是正确的 JSON?是否遵循了规则?)。
  • 这就像工厂里的安全检查员。如果产品速度快但已损坏,它就不能离开厂房。

4. 结果:“魔法”数字

他们使用公开的虚假数据(以免泄露真实的银行机密)测试了这个新系统。结果非常显著:

  • 速度:他们从每小时处理约600 个请求提升至每小时 3,600 个请求(提升了 5.5 倍至 6 倍)。
  • 等待时间:获取答案的时间从31–38 秒降至6–8 秒
  • 效率:计算机硬件(GPU)的闲置时间从 88% 变为忙碌时间达到78%
  • 成本:由于他们使用相同的硬件完成了更多工作,因此完成相同工作所需的计算机数量减少了一半以上

结论

该论文总结道,对于抓获洗钱者这样的高风险工作,不能仅仅使用“最佳”的人工智能模型。你必须构建一个专用的交付系统,该系统理解工作是重复的、规则繁多的,并且需要严格的准确性。通过将“前缀”(规则)视为可重用资源,并将工作流程组织得像智能工厂一样,你可以在不改变底层人工智能大脑的情况下,使系统更快、更便宜、更可靠。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →