← 最新论文
🤖 AI

Citation-Closure Retrieval and Per-Rule Attribution for Real-World Regulatory Compliance Question Answering

本文介绍了 RefWalk,这是一个旨在通过实施逐条规则归因和结构化程序查询来增强监管合规问答的统一框架,并经由新颖的 RegOps-Bench 基准测试和美国医疗合规数据集进行了验证。

原作者: Yeong-Joon Ju, Seong-Whan Lee

发布于 2026-05-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Yeong-Joon Ju, Seong-Whan Lee

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图穿越一座巨大的多层图书馆,这里的书籍并非仅仅陈列在书架上,而是由无形的丝线相互串联。如果你拿起一本名为《如何建造桥梁》的书,书中可能有一则注释写着:“参见《安全规则》一书第 4 章”,而该章节又指向《城市许可》一书中的特定段落,最终引用了《施工手册》中的一条微小脚注。

这就是企业所感受到的监管合规(Regulatory Compliance)的样貌。它们必须遵守严格且层层嵌套的规则(法律、法令、手册),这些规则彼此不断相互引用。一旦出错,它们将面临巨额罚款。

该论文指出,当前的人工智能工具(大型语言模型)在这项特定任务上表现糟糕。它们就像一名学生,读完第一本书后便猜测答案,然后编造一个虚假的页码作为引用依据。它们速度很快,但却危险重重,因为它们会就规则的来源产生“幻觉”(即撒谎)。

以下是该论文提出的解决方案,将其拆解为简单的概念:

1. 问题所在:“平面”地图与“三维”迷宫

大多数人工智能系统将这座图书馆视为一份平面列表。它们看到“桥梁”和“安全”这两个词,便认为:“好的,这两件事是相关的。”它们忽略了结构

  • 现实情况:在法律中,一条规则不仅仅是“关联”另一条规则;它是向另一条规则委托(delegates)。一条规则规定:“执行 X,除非《安全法令》规定 Y。”
  • 失败之处:当前的人工智能试图通过寻找相似词汇来寻找答案。它忽略了连接规则的具体“丝线”。此外,它将最终答案与引用视为两件独立的事,往往在句子写完后,再强行附加一个虚假的引用。

2. 新工具:"RefWalk"(引导式游览)

作者构建了一个名为RefWalk的新系统。把它想象成一位超级有条理的导游,它不仅阅读书籍,还实际沿着连接它们的丝线行走。

  • “主题锚点”:当你提出一个问题(例如:“我可以在海外研究上额外花费资金吗?”)时,RefWalk 不仅仅是搜索关键词。它将问题拆解为一张“地图密钥”:谁在提问?涉及多少资金?何时?在何种情况下?
  • “三视图”搜索:导游并非仅以一种方式寻找答案,而是从三个角度审视这座图书馆:
    1. 窄视角:寻找你使用的确切词汇。
    2. 宽视角:寻找通用概念,忽略具体词汇(以防你的措辞怪异)。
    3. 中视角:上述两者的混合。
    • 原因何在? 有时,确切的词汇会将你引向错误的书籍,但通用概念却能指引你找到正确的那一本。RefWalk 使用一种特殊的“投票系统”(称为RRM),从这三种视角中挑选最佳结果,而不是将它们平均化(平均化会稀释正确答案)。

3. “知识图谱”(丝线地图)

该论文创建了一张名为运营知识图谱(Operational Knowledge Graph, OKG)的图书馆特殊地图。

  • 这张地图并非仅按主题链接书籍,而是按法律逻辑进行链接。它知道“规则 A"委托给“规则 B",而“规则 B"定义了“规则 C"。
  • RefWalk 沿着这些丝线行进。如果你询问预算问题,它会从预算规则开始,沿着丝线追踪到安全规则,再到手册,确保不会遗漏链条中的任何一个环节。

4. “严格 JSON"(不撒谎规则)

这是最关键的部分。在普通人工智能中,模型先写一段文字,然后试图在末尾添加引用。这就像写了一篇论文,然后编造一个脚注来显得博学。

  • RefWalk 的方法:人工智能被迫穿上“紧身衣”(严格的 JSON 格式)。在选定具体规则(即“键”,Key)并将主张作为附加在该规则上的“值”(Value)写出之前,它无法写出任何句子。
  • 隐喻:想象一个法庭,律师除非手持其所引用的法律具体页码,否则不得说一个字。他们不能说:“法律规定了 X",然后稍后说:“哦,顺便提一下,那是在第 42 页。”他们必须说:“第 42 页规定了 X。”这迫使人工智能保持诚实。如果它找不到该页码,它就不能提出该主张。

5. 测试:"RegOps-Bench"

为了证明这行之有效,作者建立了一项名为RegOps-Bench的新测试。

  • 他们采用了真实的、复杂的韩国政府法规(这些法规以极其复杂和层层嵌套而闻名)。
  • 他们创建了 250 个难题,这些问题需要跨越不同书籍追踪多条“丝线”。
  • 结果:旧的人工智能系统要么陷入困境,要么提供虚假引用。RefWalk 成功追踪了丝线,找到了确切的页码,并将答案附加到了正确的规则上。它在找到所有必要规则(召回率)以及确保引用真实(精确率)方面表现优异。

总结

该论文指出:“人工智能擅长聊天,但不擅长遵循严格的法律链条。”
他们构建了RefWalk,这是一个系统,能够:

  1. 绘制规则间的丝线(而不仅仅是词汇)。
  2. 从三个角度进行搜索,以确保不会遗漏任何内容。
  3. 强制人工智能在发言前先进行引用,确保每个主张都与其来源紧密相连。

这使得人工智能足以安全地用于高风险工作,例如检查公司是否遵守法律,因为在这些领域,虚假的引用可能导致诉讼。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →