The Saudi Legal Corpus for AI: An Auditable, Official-Source-Grounded, Article-Level Corpus of Saudi Arabian Legislation
本文介绍了“沙特人工智能法律语料库”,这是一个包含 290 部沙特立法工具的、全面的、官方来源且可审计的文章级数据集,其特点是具备独特的溯源追踪、如引用图谱和定义术语表等结构化分析层,以及一个证明了元数据增强搜索在阿拉伯语法律自然语言处理领域优于标准基准的检索基准测试。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在现代世界中,计算机越来越多地被要求回答有关法律的问题。为了准确地做到这一点,它们依赖于一种被称为“检索增强生成”(retrieval-augmented generation)的技术。这个过程就像一位图书管理员,在回答问题之前,首先会在一个庞大的信任文档库中进行搜索,以找到包含答案的准确段落。如果计算机能够找到正确的文本,它就可以为用户总结内容,而不会凭空捏造。然而,只有当这个“图书馆”以计算机可以读取和理解的格式存在时,该系统才能发挥作用。对于许多语言和法律体系,尤其是阿拉伯世界,这个图书馆一直处于缺失状态。沙特阿拉伯作为一个主要的全球经济体,其法律发布在官方公报和政府网站上,但它们是以人类可读的页面和文档形式存在的,而不是软件可以轻松搜索的结构化数据。如果没有机器可读版本的法律,人工智能就无法可靠地协助处理沙特王国的法律问题,这在技术和获取正义方面都留下了显著的空白。
为了弥补这一差距,研究人员阿卜杜拉·阿尔莫哈迈迪(Abdullah Almohammedi)构建了“沙特人工智能法律语料库”(Saudi Legal Legal Corpus for AI),这是一个大规模、结构化的沙特王国法律数字化集合。这不仅仅是一个简单的链接列表或扫描版 PDF 的集合。相反,它是一个精心组织的数据库,包含 290 个不同的立法工具,涵盖了从主要法定法律到详细的执行条例和程序性规则。该集合覆盖了十二个不同的法律领域,包括商业业务、刑事司法、劳动权利和税务等。这项工作的核心是将 290 部法律转化为 15,689 条独立的条文级记录。每条记录都是一段自包含的文本,例如法律中的某一个特定条款,总计约 120 万个阿拉伯语单词。整个集合的设计是可审计的,这意味着每一段文本都可以追溯到其确切的官方来源,从而确保计算机阅读的是真实的法律,而不是摘要或猜测。
该语料库的构建遵循一套严格的规则,以确保准确性和可信度。最重要的规则是官方阿拉伯语文本是唯一有效的版本。虽然该集合包含了英文和中文翻译,但这些都被明确标记为非权威性参考,仅供理解使用,不具法律约束力。数据库中的每一条法律都带有标签,解释了其来源以及如何进行验证。研究人员使用了一个四级系统来对每个来源的可靠性进行分级,区分了那些经过多个官方文件交叉核对的法律与那些仅来自单一来源的法律。这种细致程度允许用户根据所需的证据程度来过滤数据。例如,一个旨在提供高风险法律建议的系统可能只会使用经过最严格验证的来源,而一个研究项目则可能接受更广泛的范围。数据库还包含一个“新鲜度清单”(freshness manifest),列出了 16 个特定的追踪路径,在这些路径中,官方政府门户网站可能尚未发布最新的修正案,从而确保用户意识到潜在的过时信息,而不是被误导。
除了存储文本之外,研究人员还添加了几个此前在沙特法律中从未存在过的分析层。该语料库包含了一张法律如何相互引用的地图,展示了哪些条款引用了其他条款。这个引用图谱包含超过 3,600 个引用,揭示了哪些法律在法律体系中充当了中心枢纽,例如《劳动法》和《公司法》,它们经常被其他法规所引用。此外,还有一个手工分类的地图,显示了哪些法律取代或废止了旧有的法律,有助于追踪法律变更的历史。此外,该项目还创建了一个包含近 2,000 个术语的词汇表,这些术语是在法律内部专门定义的,并附带了 3,300 多个定义。这有助于澄清同一个词在不同语境下可能具有的不同含义。为了使数据能够适配现代 AI 工具,文本也被分解成更小的、易于处理的块(chunks),使得计算机可以处理法律的特定部分,而不至于在数千页的文本中迷失方向。
为了测试这一新资源的效果如何,研究人员创建了一个基准测试,其中包含 519 个关于沙特法律的具体问题,每个问题都配有包含正确答案的对应条款。这些问题的编写方法是先阅读实际法律,然后构思出一个人可能会提出的查询语句。当研究人员将标准搜索方法与这个拥有丰富元数据的系统进行对比测试时,结果发人深省。新系统正确识别出正确条款的概率为 93.3%,而标准方法为 90.4%。这种差异在涉及定义类问题时最为明显,例如“什么是销售合同?”在这种情况下,新系统的准确性显著提高,找到了正确定义 90.9% 的情况,而标准方法仅为 74.5%。这一差距证明,在组织数据和添加详细标签方面所付出的额外工作是值得的,它使得计算机即使在搜索词与文本不完全匹配的情况下,也能更容易地找到正确信息。
该语料库的发布是该地区法律技术迈出的重要一步,但也带有明确的边界和局限性。该集合并非穷尽式的;它涵盖了主要法律,但不包括每一项部长决定或市政规则。研究人员对此保持透明,记录了集合的范围以及与每项数据相关的特定风险。该工作明确不是官方政府出版物,且英文和中文层并非官方译本。唯一的约束性文本仍然是按官方公报发布的原始阿拉伯语文本。通过提供这样一个结构化、经过验证且可审计的资源,该项目为构建可靠的法律助手和开展对沙特法律结构的深入研究提供了基础。它为那些缺乏机器可读官方公报的国家如何为数字时代的法律进行组织提供了模板,确保法律保持可访问、可理解并植根于事实之中。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。