← 最新论文
💬 NLP

CTRAG: An In-Context Retrieval-based Framework for Automated Compliance Checking using LLMs

本文介绍了 CTRAG,这是一种新型的检索增强生成框架,它利用自适应分块、动态检索和上下文学习,通过将控制问题与公司文档进行交叉引用,实现了监管合规性验证的自动化并显著提高了准确性,该框架已通过在一家四大专业服务机构的成功实际部署得到了验证。

原作者: Muhammad Roman, Karen Rafferty, Barry Devereux

发布于 2026-08-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Muhammad Roman, Karen Rafferty, Barry Devereux

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一名正在试图破解谜团的侦探,但你的“犯罪现场”不是犯罪现场,而是公司违反规则。在商业世界中,存在着成千上万条规则——就像一本巨大的、隐形的规则手册,规定了如何处理资金、保护秘密或确保数据安全。检查一家公司是否遵守这些规则被称为“合规性”(Compliance)。传统上,这项工作由人类审计师完成,他们必须阅读大量杂乱的文书资料,寻找能够证明公司守规矩的微小线索。这既缓慢又枯燥,而且人类会疲劳,这意味着他们有时会错过线索或产生困惑。

欢迎来到人工智能的世界,特别是被称为“大语言模型”(LLM)的一种智能计算机大脑。把 LLM 想象成一个超级快速的阅读者,它几乎读过了世界上所有的东西,并且可以像人类一样交谈。然而,这里有一个问题:这些聪明的脑袋有时会编造事实(称为“幻觉”),或者因为它们依赖于记忆而非眼前的资料而忘记特定事实。为了解决这个问题,科学家们使用了一种叫做“检索增强生成”(RAG)的技巧。想象一下,在侦探写报告之前,先给他们一把手电筒和一叠特定的文件进行搜索。AI 会先在文档中查找事实,然后利用自己的大脑来编写答案。本文探讨了如何让那个“手电筒搜索”过程以及最终生成的报告尽可能完美,以用于检查公司是否遵守规则。


侦探的新工具包:CTRAG

这篇论文背后的研究人员与一家大型专业服务公司合作,构建了一个名为 CTRAG 的新系统。把 CTRAG 想象成一名高科技合规侦探,旨在将检查公司是否守规的枯燥、耗时的工作自动化。CTRAG 不再需要人类花费数小时翻阅 PDF,而是将规则(以问题的形式呈现)作为输入,并在公司的文档中搜寻答案。

该论文的主要目标是确定教导这个 AI 侦探如何搜索的最佳方式。他们测试了不同的策略,以观察哪种策略能帮助 AI 找到正确的线索,而不被无关的噪音干扰。

“分块”谜题:如何切分饼干

其中一个最大的挑战是如何切割公司文档。想象你有一本 500 页的小说,你需要找到其中的一个特定句子。如果你把书切成极小的 200 字符碎片(就像把一页纸切成邮票大小),你可能会丢失故事的上下文。如果你把它切成巨大的 3000 字符块(就像把整本书对半切开),你可能会得到太多额外的文本,导致特定的线索淹没在字海之中。

团队测试了不同的“分块大小”(即文本块的大小):

  • 极小碎片(200 字符): 这些碎片太小且过于破碎。AI 会感到困惑,因为它无法看到全貌。
  • 巨大块(3000 字符): 这些块太混乱了。AI 会被过多的信息淹没,就像试图在一堆着火的干草堆里找一根针。
  • 黄金分割点: 他们发现 较小的分块(约 800 字符) 效果最好。这就像把书切成易于处理的段落。这个尺寸恰到好处,既保持了上下文清晰,又不会让 AI 淹没在噪音中。

他们还尝试了一种被称为“元分块”(Meta-chunking)的高级方法,这种方法试图根据逻辑上的故事断点而非仅仅根据字符数来切割文本。虽然这听起来很聪明,但事实证明对于这项特定工作来说,它太慢且计算成本过高,因此他们坚持使用更简单的固定大小切割。

“手电筒”设置:要检查多少个文件?

当 AI 提出问题时,它需要决定提取多少个文档片段来回答问题。这被称为 K 值(或 top-K)。

  • 如果 AI 只看 1 个片段,如果答案藏在第二个文件中,它可能会错过答案。
  • 如果它看 5 个片段,它可能会被额外的、无关的细节所干扰。
  • 研究人员发现,查看 4 个片段(K=4)是最完美的平衡。它为 AI 提供了足够的证据来做出判断,同时不会让其分心。

教 AI 像人类一样思考

最大的突破来自于一种被称为**上下文学习(ICL)**的技术。想象你在教一名新实习生如何破案。你不仅仅是说“寻找规则”;你会展示例子:“这是一个公司使用了云服务提供商的案例,以及为什么即使公司没有亲自操作,这也算作‘通过’。”

AI 在处理“间接合规”方面表现挣扎——即公司因为其供应商(如云服务商)遵守规则而间接符合规则的情况。如果没有帮助,AI 会判定为“失败”,因为公司没有直接执行该操作。但通过喂给 AI 几个精心挑选的例子(例如过去案例的参考表),AI 学会了模仿人类的判断。它意识到:“啊,如果供应商是合规的,那对我们也算数!”

结果:更快、更聪明、更准确

当他们在一家“四大”专业服务事务所的真实场景中测试 CTRAG 时,结果令人印象深刻:

  • 准确率: 系统实现了 78% 的 F1 分数85% 的召回率。用侦探的话说,这意味着它找到了 85% 的实际违规案例,且没有遗漏太多。
  • 效率: 该系统将人类审核员的手动工作量减少了约 60%
  • “无证据”修复方案: 一个棘手的问题是当 AI 在文档中找不到任何信息时。与其猜测,系统被编程为将“无证据”视为“不合规”。逻辑很简单:如果你无法在文档中证明你遵守了规则,那么你可能就没有遵守。通过将这些“无证据”案例重新分类为失败,系统抓住了许多原本会被遗漏的潜在违规行为。这一关键步骤使得系统在无需重新训练 AI 的情况下,实现了高达 85% 的召回率。

他们排除了哪些方案

论文非常明确地说明了哪些做法是行不通的:

  • 极小分块(200 字符) 是个坏主意;它们过度破坏了上下文。
  • 巨大分块(3000 字符) 以及 元分块 对于这项特定任务来说要么太嘈杂,要么运行太慢,不够实用。
  • 直接提示(Direct prompting)(即只提问而不给例子)在涉及第三方供应商的复杂案例中是不够的。

底线

作者建议 CTRAG 是简化合规检查的强大工具,但他们谨慎地表示这并非一个“已解决的问题”。他们指出,他们的测试是基于单一机构的 240 条规则和 45 份文档。虽然结果令人鼓舞,并表明这种方法可以扩展到其他公司和任务(如检查合同),但仍需要跨行业的更多测试,以确保它在任何地方都有效。

简而言之,CTRAG 表明,通过给 AI 提供合适大小的“信息块”、正确数量的“手电筒”光束以及一些“参考表”示例,我们可以构建出一个帮助人类更快、更少出错地检查规则的系统。它不是魔法,但它是使用技术来维护企业界诚信的一种非常聪明的方式。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →