← 最新论文
💻 computer science

NormDef-FR: an annotated corpus of normative definitions for the automatic processing of French legal codes

本文介绍了 NormDef-FR,这是一个包含 693 条法语规范性定义的高质量、开源标注语料库,旨在支持并基准测试自动化法律自然语言处理任务,如知识提取、信息检索和检索增强生成。

原作者: Aboudourazakou Tetereou, Tarik Boudaa, Dadi El Wardani

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Aboudourazakou Tetereou, Tarik Boudaa, Dadi El Wardani

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

法律常被想象成一座庞大的规则图书馆,但对于计算机而言,它却是一片混乱的文本海洋。在法国,法律体系建立在法典之上——这些大规模的法律集合中,每一个词都承载着特定的分量。在这数以千计的页面中,立法者经常停下来定义他们自己的术语。他们可能会写道:“‘个人数据’是指与已识别人员相关的任何信息,”或者“就本条而言,‘车辆’包括自行车。”这些不仅仅是友好的解释;它们是决定权利和义务如何运作的法律引擎。如果没有这些精确的定义,法律的其他部分就无法正常运作。然而,寻找这些定义非常困难,因为它们散落在超过 16.1 万条活跃条款中,埋藏在从卫生到税务等不同的法典里,且没有组织的地图来引导搜索。

这种结构的缺失给技术带来了显著的问题。如果律师或数字系统想要准确知道某个特定术语在法律眼中的含义,他们往往必须手动阅读无数页面,且无法保证已经找到了所有实例。自然语言处理(计算机科学的一个领域,旨在教机器理解人类语言)在分析法律文本方面取得了长足进步,但在处理这项特定任务时却遇到了困难。大多数现有工具是为英语或字典中的通用定义而设计的,而不是为了法国立法中那种严格、具有约束力的定义。为了弥补这一差距,研究人员创建了一个名为 NormDef-FR 的新资源,这是一个经过精心策划的法律定义集合,旨在教计算机如何自动查找并理解它们。

来自摩洛哥阿卜杜勒·马莱克·埃萨迪大学的研究人员通过在人类专业知识与机器自动化之间搭建桥梁的方法来解决这个问题。他们首先从官方法国法律数据库中收集当前的活跃法律。他们并没有尝试让计算机一次性阅读整个图书馆,而是首先使用简单的基于规则的模式来识别可能的候选对象。他们寻找法国法律中用于引入定义的特定短语,例如“定义为”或“被视为”,或者使用冒号将术语与其含义分隔开。这种初步扫描生成了一个潜在定义列表,但远非完美。许多这些候选对象是误报,捕捉到了看起来像定义但实际上是其他内容的句子,比如提交文件的清单或法律效力的描述。

为了将这个粗略的列表转化为可靠的训练工具,团队引入了人类专家。他们手动审查了数千个此类候选对象,决定哪些是真实的、可用的法律定义,哪些应该被丢弃。他们还修正了文本的边界,确保被定义的“术语”和“定义”本身被精确地截取。这个过程非常严谨。研究人员让两名独立的专家对样本数据进行标注,以确保他们在什么是定义上达成一致。结果显示了高度的一致性,证实了识别这些定义的规则是清晰且一致的。最终产品 NormDef-FR 1.0.0 版本包含了从 363 个不同条款中提取的 693 个经过验证的定义。每个条目都将定义的术语与其含义相连,包含关于其来源的元数据,并注明了定义的具体类型。

有了这个金标准集合,研究人员测试了计算机学习的效果如何。他们设置了三个不同的挑战,以观察机器在哪里成功,以及在哪里跌跤。第一个任务是简单的提取:系统能否识别出定义并提取出术型和含义?第二个任务更广泛:系统能否查看整个条款并判断其中是否包含定义?第三个任务是最困难的:系统能否根据一个由计算机生成的候选定义,判断其是否足够好,还是一个应该被丢弃的错误?

结果揭示了一个清晰的难度等级。机器在第二个任务中表现得非常出色。当被要求识别哪些条款包含定义时,模型表现出了近乎完美的准确率,尤其是在它们接受过一组“真负例”(即经过人工检查确保不包含任何定义的条款)训练之后。这一发现至关重要,因为它表明早期的假设——即认为不在定义列表中的任何文章都是“负例”——是存在缺陷的;其中许多文章实际上包含隐藏的定义。一旦研究人员清理了负面示例,计算机就能轻松区分定义密集的文章和普通文章。

然而,第三个任务证明了这才是真正的瓶颈。当计算机需要验证特定的“术语-定义”对时,它们的表现显著下降。虽然它们可以轻松识别出定义可能存在的概略区域,但很难判断它们提取出的特定配对在法律上是否有效。它们经常将一系列要求或程序性指令误认为是一个定义。表现最好的模型能正确处理大约 71% 的这些困难决策,这与在文章检测任务中看到的近乎完美的得分相去甚远。这表明,虽然计算机可以找到正确的社区,但它们仍需要人类的帮助来核实具体的房屋。

该研究还强调了先进人工智能在这一特定背景下的一个令人惊讶的局限性。研究人员将一种类似于用于通用对话的复杂语言模型,与一种基于词汇模式的更简单、更传统的法进行对比。对于验证候选对象的困难任务,复杂模型并没有胜过较简单的模型。事实上,较简单的方法更加稳定和可靠。这表明,对于规则严苛且模式特定的高度专业化法律文本,一种依赖于清晰语言标记的直接方法比试图“理解”文本的复杂系统更为有效。

NormDef-FR 的创建不仅仅是一个数据集;它是如何构建可靠法律技术资源的示范。研究人员表明,仅仅假设数据的缺失是不够的;你必须主动验证那些不存在的数据。通过手动检查负面示例,他们防止了系统学到错误的教训。这种方法确保了该资源对于未来的开发者来说是稳健且值得信赖的。该数据集现在已向公众开放,并附带了文档和脚本,允许他人复现这项工作。它为构建更好的法律研究工具奠定了基础,帮助自动化寻找定义的繁琐工作,从而使律师和系统能够专注于解释法律,而不是寻找其含义。虽然这项工作尚未完成——未来的版本需要涵盖更多类型的法律,并追踪定义随时间变化的情况——但它为将清晰度引入复杂的法国法典世界提供了一个坚实的起点。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →