← 最新论文
💬 NLP

Temporal Misgrounding in Legal RAG: A Versioned-Corpus Benchmark for French Tax Law

本文介绍了 FiscalQA Pro,这是一个证明了标准的法律检索增强生成(RAG)系统因仅检索条款的当前版本而无法处理法国税法中时间性误导问题的基准测试,并展示了一个版本感知型检索系统如何实现 98.3% 的准确率,而静态方法的效果几乎为零。

原作者: Rose Cymbler, Daniel Guez, Laurent Fabre

发布于 2026-08-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Rose Cymbler, Daniel Guez, Laurent Fabre

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图破解一个谜团,但你所搜寻的图书馆有一个非常奇怪的规则:每当一本书增加新页面或修改句子时,图书管理员并不会把新书放在书架上。相反,他们会擦除旧页面并重写现有的书,只留下最新的版本可见。如果你问:“这本书在1995年是怎么说的?”而图书管理员只递给你2025年的版本,你得到的将是错误的答案,尽管这本书的封面看起来完全一样。这就是**法律人工智能(Legal AI)的世界,在这个领域,计算机试图阅读法律并像律师一样回答问题。为了做到这一点,它们使用了一种名为RAG(检索增强生成)**的技术,这就像是一个非常聪明的学生,在回答测试题之前被允许查阅教科书中的事实。问题在于,大多数这些教科书都被视为是不变的。但法律确实会改变,而且通常每年都在变化。如果一台计算机没有意识到2018年的法律与今天的法律不同,它就会自信地给你错误的建议,这对于缴纳税款或了解你的权利等事情来说可能是一场灾难。

这篇题为《法律RAG中的时间性误定位》(Temporal Misgrounding in Legal RAG)的论文,调查了正是这个问题,并以法国税法为例。作者发现了一种他们称之为时间性误定位(temporal misgrounding)的特定失效模式。当计算机被问及过去的某项法律时,它会忽略问题中的日期,并仅仅抓取当前版本的法律,因为那是它唯一能轻易找到的版本。他们构建了一个庞大的、具有“穿越时空”能力的法国税法图书馆,其中包含32,436个不同版本的条款,跨越了93年(从1938年到2031年)。随后,他们创建了一个名为 FiscalQA Pro 的困难测试,包含 209个经过专家评审的问题,这些问题专门要求知晓过去某个特定日期的法律,而非今天的法律。

结果令人震惊。当他们测试 11种不同的AI模型(包括目前最先进的模型)时,当计算机无法查找到正确的版本时,表现得极其糟糕。在没有帮助的情况下,AI只有 3.0% 的概率得到正确答案。当他们给AI一本只包含当前法律的标准“教科书”时,它的表现甚至更差,正确率仅为 2.7%。事实上,标准系统检索到正确历史版本的概率为 0%;它会自信地引用当前的法律,仿佛那就是过去的法律。然而,当作者构建了一个能够真正搜索他们的“穿越时空”图书馆,以找到与问题中日期相匹配的特定版本法律的系统时,AI的准确率飙升至 98.3%

这篇论文证明了问题不在于AI不够聪明,无法理解法律;而在于它所搜索的“图书馆”是破碎的。作者认为,我们不能再将法律文件视为静态对象,而应开始将其视为具有时间敏感性的对象。他们展示了,一旦你修复了检索系统使其能够寻找正确的日期,AI几乎可以完美地解决这些问题。他们还发布了这个庞大的数据集和用于构建时间感知搜索系统的代码,希望能帮助其他研究人员构建出不会自信地给你过时法律建议的AI。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →