Citation Grounding: Detecting and Reducing LLM Citation Hallucinations via Legal Citation Graphs
本文介绍了“引用锚定”(Citation Grounding),这是一种用于检测和减少大语言模型中法律引用幻觉的新型指标和框架,该框架通过利用大规模乌克兰法院判决图谱来评估引用准确性,并采用偏好学习方法(CG-DPO)来训练模型以区分有效引用与损坏的引用。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在雇佣一位非常聪明、说话很快的法律助理来为你撰写报告。这位助理读过数百万本书,博学多才。然而,这里有一个陷aw:当被要求引用特定法律来支持其论点时,这位助理有时会编造法律。他们可能会发明一个不存在的法律,或者引用一个多年前就被废止的法律,又或者是引用来自另一个国家的法律。在法律界,这被称为“幻觉”(Hallucination),而这可能会让人们陷入严重的麻烦。
这篇论文介绍了一种捕捉这些谎言的新方法,以及一种教导助手不再撒谎的方法。
问题所在:“假法”生成器
作者发现,即使是最先进的 AI 模型,在被要求编写关于乌克兰法律的内容时,也会有 13% 到 21% 的概率编造虚假的法律引用。这就像一个学生在写论文时,编造了一个并不存在的教科书页码。
解决方案:“引用落地”(Citation Grounding)测试
为了解决这个问题,研究人员构建了一个巨大的数字地图,称为引用图谱(Citation Graph)。你可以把这个图谱想象成一个由 1 亿个真实法院判决书构建的、极其精确的超级图书馆目录。它包含了每一位真实的法官在真实案件中引用特定法律的所有记录。
他们创建了一个名为**引用落地(CG)**的测试。其工作原理如下:
- 地图: 他们拥有“真相地图”(即真实案例的图谱)。
- 测试: 他们要求 AI 写出一个法律答案。
- 检查: 他们检查 AI 提到的每一项法律,并对照地图进行核实:
- 该法律是否存在?(准确性/Precision)
- 该法律是否适用于这一特定情况?(相关性/Relevance)
- 该法律在那个特定日期是否仍然有效?(时效性/Temporality)
如果 AI 引用的法律不在地图上,或者引用的上下文不符,测试就会将其标记为“幻觉”。
他们的发现
他们针对 100 个法律问题测试了五种不同的 AI 系统。
- 结果: 大多数 AI 的引用准确率约为 80%。剩下的部分是虚假的。
- “RAG”胜出者: 其中一个系统使用了名为 RAG(检索增强生成) 的特殊技巧。想象一下,这个 AI 不仅仅依赖于记忆;它实际上会去图书馆,找到真实的图书,并在回答之前先阅读它们。这个系统犯错最少,且引用的法律总数也最少,这证明了当你真正查阅事实时,“少即是多”。
- 令人惊讶的模式: 他们原以为引用法律越多的 AI 模型,出错也会越多。但事实并非如此。有些模型引用了大量法律却依然准确;而有些模型引用较少却依然错误。这完全取决于 AI 是如何构建的,而不仅仅是它说了多少话。
“自我教学”方法 (CG-DPO)
这篇论文最大的突破在于,他们计划如何在不雇佣一支昂贵的资深律师团队来检查每一个答案的情况下,去纠正 AI。
通常,要教 AI 变得诚实,人类必须阅读它的答案并评价“这是好的”或“这是坏的”。这既缓慢又昂贵。
研究人员意识到,他们的引用图谱可以胜任人类的工作。他们创造了一个游戏:
- 选取一个带有正确引用的真实法院判决书。
- 破坏它: 他们使用计算机程序来替换法律、发明虚假的条款,或使用过时的法律(例如将 2020 年的法律改为一个当时并不存在的 2025 年法律)。
- 教学: 他们向 AI 展示两个版本:一个是“真实的”,一个是“被破坏的”。AI 学习去偏好“真实的”版本。
因为“真相”已经存在于图谱中,所以他们不需要人类来标注数据。他们只需让图谱来进行评分。他们使用这种方法训练了一个模型,使其在识别真实引用与虚假引用之间的差异时,准确率达到了 98.5%。
核心结论
这篇论文表明:
- AI 经常在法律问题上撒谎,但我们可以通过将其答案与庞大的真实法庭历史地图进行对比来捕捉它。
- RAG 系统(即在回答前先查阅事实的系统)目前是避免这些谎言的最佳选择。
- 我们可以教 AI 停止撒谎,通过利用地图本身来生成“正确 vs 错误”的示例,从而无需人类律师去做那些枯燥乏味的逐条检查工作。
作者们已将其“地图”、测试工具和训练数据开放给所有人使用,希望让法律 AI 对每个人来说都更加可靠。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。