Beyond Probabilistic Similarity: Structural, Temporal, and Causal Limitations of Retrieval-Augmented Generation in the Legal Domain
本文认为,检索增强生成在法律领域反复出现的失败源于概率性检索与法律知识的层级性、时序性和因果性之间根本性的架构错配,并据此提出了一种以本体优先性、事件具象化、双时态正确性和确定性交互协议为核心的新型确定性框架,以解决这些结构性局限。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
大问题:那个“流利的骗子”
想象一位才华横溢的法学院学生,他能写出完美的论文,说话也极具自信。然而,这个学生有一个危险的习惯:当他不知道答案时,他会编造一些听起来很真实的各种事实。他可能会引用一个从未发生过的判例,或者引用一条十年前就被废止的法律。
在法律领域,这正是目前的 AI 系统正在做的事情。它们在进行“虚构”(confabulating)。本文认为,仅仅让 AI 变得更“聪明”或给它更多的数据并不能解决这个问题。问题不在于 AI 的智能程度,而在于它所调用的**“图书馆”**。
核心论点:错位的图书馆
本文指出,法律知识并不像普通的图书馆(比如维基百科或新闻网站)。它更像是一个有生命的、呼吸着的机器,有着严格的规则。
为了理解为什么目前的 AI 会失败,作者将法律知识与三个具体概念进行了对比:
俄罗斯套娃(结构):
- 现实情况: 法律的构建就像俄罗斯套娃。一个具体的规则(小娃娃)只有在你了解它所属的段落(中号娃娃)时才有意义,而该段落只有在你了解它所属的“条”(大号娃娃)时才有意义。如果你把小娃娃单独拿出来展示,它会产生误导。
- AI 的失败: 目前的 AI 将法律视为一堆散乱的纸张。它抓取一个看似相关的句子,却忘记了赋予该句子意义的“父级”规则。论文称之为**“部分-整体盲视”**(Mereological Blindness,即对部分与整体关系的盲目)。
时光机(时间):
- 现实情况: 法律在不断变化。一项法律可能写于 2020 年,但直到 2022 年才正式生效。或者,一位法官可能会以一种新的方式解读旧法,而无需修改文本本身。
- AI 的失败: 目前的 AI 通常只向你展示法律的“当前”版本,即使你询问的是 2021 年时的法律状况。它不理解法律在当时可能与现在不同。它也无法察觉到法官的判决如何在不改变文字的情况下改变了法律的含义。论文称之为**“历时性盲视”**(Diachronic Blindness,即对时间的盲目)。
纸质足迹(因果关系):
- 现实情况: 在法律中,你不能只说“这就是规则”。你必须证明是谁制定的规则、何时制定的,以及哪项官方行为改变了它。每一项法律都有其“出生证明”和“手术史”。
- AI 的失败: 目前的 AI 会给出答案,但隐藏了历史。它说:“这是规则”,但它没有展示证明该规则有效的官方文件链。论文称之为**“因果不透明”**(Causal Opacity,即隐藏原因)。
解决方案:构建一个“确定性”引擎
作者认为,我们不应该试图通过让 AI 更好地“猜测”来解决问题。相反,我们需要改变系统的架构(蓝图)。
他们提出了一种名为**“设计即确定性”**(Deterministic-by-Design)的新方法。
你可以将其想象为占卜师与 GPS 之间的区别:
- 占卜师(当前的 AI): 观察云朵(文本模式)并猜测你的位置。它通常是对的,但有时会幻觉出一座并不存在的山。
- GPS(新方法): 使用带有精确坐标的严格地图。它不靠猜。如果道路封闭,它会显示“道路封闭”;如果道路正在施工,它会显示绕行路线。它遵循一套严谨的规则,以确保绝不会在地图上撒谎。
为了构建这个“法律 GPS”,论文提出了四条严格规则:
- 本体优先(地图先行): 不要从文本开始,要从结构开始。系统必须在阅读任何文字之前,先知道“第五条”是“第二节”的父级。
- 事件具象化(历史日志): 每当法律发生变化时,系统必须记录导致该变化的特定“事件”(例如在文件上的签名)。它将变化视为一个真实存在的对象,而不仅仅是一个时间戳。
- 双时态正确性(两个时钟): 系统必须追踪两个时间:
- 法律被记录下来的时间(事务时间/Transaction Time)。
- 法律实际生效的时间(有效时间/Valid Time)。
- 示例: 一项在 1 月签署的法律可能要到 3 月才开始生效。系统必须能够区分这两者。
- 确定性协议(交通规则): AI 不应被允许进行“即兴发挥”式的搜索。它必须使用特定的、经过预先批准的工具来查找法律。如果它无法通过这些严格的规则找到答案,它必须回答“我不知道”,而不是编造内容。
这对你意味着什么
论文总结道,对于高风险的法律工作(如法庭辩论),我们不能依赖于基于“相似性”进行“猜测”的 AI。我们需要构建类似于严谨、可审计数据库的系统。
- 好消息: 我们拥有构建这种技术的手段(使用结合了“智能猜测”与“严格规则”的“神经符号 AI”)。
- 难点: 这既昂贵又难以构建。它需要人类律师协助,在 AI 接触数据之前,完美地绘制出规则并构建好数据结构。
- 目标: 从一个“流利但危险”的系统转向一个“枯燥但安全”的系统。如果系统无法在严格的规则中找到答案,它会承认这一点,而不是向法官撒谎。
简而言之: 论文认为,我们不应再把法律当作一场对话,而应将其视为一个精确的工程项目。我们需要在让 AI 驾驶汽车之前,先建好那张“地图”。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。