← 最新论文
💬 NLP

From Judgments to Issues: Structured Extraction of Legal Reasoning with Citation-Hallucination Control

本文提出了一种具有成本效益的自动化流水线,该流水线利用 IRAC 框架和通用大语言模型将意大利税务法院判决书分解为结构化的法律议题,同时采用专门的基于解析器的过滤器来检测并控制引用幻觉,从而实现对法律推理可靠的大规模分析。

原作者: Giovanni Piccioli, Alessia Fidelangeli, Piera Santin, Pierpaolo Vivo

发布于 2026-07-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Giovanni Piccioli, Alessia Fidelangeli, Piera Santin, Pierpaolo Vivo

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

大局观:将“纸山”变为数字图书馆

想象一下,意大利税务法院系统就像一个庞大而混乱的图书馆。每年,它都会产生数十万本新的“书”(判决书)。这些书是用一种非常特定、有时甚至有些混乱的法律语言编写的。律师和研究人员希望能在这些书中找到特定的答案,但要阅读每一本书的每一页是不可能的。

本文的作者构建了一个机器人图书管理员(自动化流水线),旨在完成三件事:

  1. 阅读这些成千上万本法律书籍。
  2. 将其拆解为最重要的问与答。
  3. 检查自己的工作,以确保它没有捏造任何虚假的法律引用或法律。

核心问题:“一刀切”的错误

通常情况下,当计算机尝试阅读一份法律判决书时,会将整个文档视为一个巨大的文本块。作者认为,这就像试图通过从头到尾读完一整本食谱,来寻找其中某一个特定的菜谱一样。

一份单一的税务判决书通常包含几个不同的“故事”或法律议题。例如,法官可能会先决定案件是否具备受理资格(可受理性),然后决定税收计算是否正确(实体问题),最后决定谁来支付诉讼费用。

作者的机器人不仅仅是阅读整本书,它还会将书切成独立的章节。它将每个法律问题视为一个独立的、自包含的单元。

蓝图:使用“IRAC”配方

为了组织这些切片,机器人使用了一个著名的法律配方,称为 IRAC(议题 Issue、规则 Rule、应用 Application、结论 Conclusion)。你可以把它想象成一个标准化的表格,每个法律答案都必须填写此表:

  • 问题 (Issue): “这位农民是否必须为他购买但尚未使用的拖拉机缴纳税款?”
  • 规则 (Rule): 关于拖拉机和税收的法律规定。
  • 应用 (Application): 法官如何将这些法律应用于这位农民的具体情况。
  • 结论 (Conclusion): 最终裁决(例如:“无需缴税”)。

机器人将这种凌乱的、类似手写风格的法律文本转化为干净、结构化的 XML 格式(一种数字归档系统),完美遵循这一配方。

“幻觉”问题:机器人的白日梦

大语言模型(机器人背后的“大脑”)擅长写作,但它们有一个坏习惯:幻觉。有时,当被要求列出法官引用的法律引用时,机器人可能会自信满满地编造一个并不存在的法律引用,仅仅因为它听起来很像那么回事。这就像一个学生在写历史论文时,因为忘记了真实的条约,便随手编造了一个虚假的条约。

在法律世界中,这是非常危险的。如果律师依赖于一条虚假的法律引用,他们可能会输掉官司。

解决方案:“事实检查器”过滤器
为了解决这个问题,作者增加了第二层安全保障,即一个**“幻觉过滤器”**。

  1. 机器人提取它认为被使用的法律引用
  2. 一个独立的、严格的工具(称为 Linkoln)扫描原始判决书文本,以寻找其中实际提到的法律引用
  3. 系统将这两个列表进行对比。如果机器人列出的法律引用并不在原始文本中,过滤器会立即将其删除。

这就像老师批改学生的作文:“你引用了一个不在阅读清单上的来源?那是虚假引用。把它划掉。”

测试:机器人通过考试了吗?

作者并没有仅仅信任机器人;他们对其进行了测试。

  • 语料库: 他们处理了大约 330,000 份真实的意大利税务法院判决书。
  • 成本: 他们选择了一个特定的 AI 模型(DeepSeek V3),因为它足够便宜,可以处理这么多文档而不至于入不敷出(每份文档约 0.35 美元)。
  • 人工检查: 他们抽取了 50 份判决书,交给两位真正的专家(博士级税务律师)进行评分。

结果:

  • 寻找议题: 机器人在寻找正确问题方面表现出色(高精确度),尽管有时会遗漏一些次要问题(中等召回率)。它很少捏造虚假问题。
  • 寻找法律引用: 机器人找到了大约 75% 的相关法律引用
  • 过滤器的成功: “幻觉过滤器”表现得非常出色。在加入过滤器之前,约有 12% 的法律引用是虚假的。加入过滤器后,这个数字降至不足 1%。过滤器捕捉到了几乎所有的虚假法律引用,同时仅误删了 3% 的真实法律引用
  • 质量: 与人类专家相比,机器人撰写的摘要和推理得分非常高(约为 4.7 分,满分 5 分)。

总结

本文展示了一个高效且可靠的流水线,它能将成千上万份凌乱的意大利税务法院判决书转化为干净、结构化的论证数据库。

它证明了:

  1. 你可以自动将复杂的法律文件拆分为独立的“议题”。
  2. 如果你增加一个严格的“事实检查”步骤来阻止 AI 在法律问题上撒谎,你就可以使用更便宜的 AI 模型。
  3. 其结果是一个随时可以供计算机搜索、分析并用于构建更好法律工具的数据集,同时将虚假法律引用的风险降至极低。

作者强调,这是首次专门针对意大利税务法院构建并经过严格测试的此类系统,为未来的法律技术奠定了坚实的基础。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →