The Saudi Legal Corpus for AI: An Auditable, Official-Source-Grounded, Article-Level Corpus of Saudi Arabian Legislation
本論文は、独自のプロベナンス・トラッキング、引用グラフや定義語集といった構造化された分析レイヤー、および標準的なベースラインと比較してメタデータ強化型検索がアラビア語の法的自然言語処理において優れた性能を示すことを実証したリトリーバル・ベンチマークを備えた、290のサウジアラビアの立法手段からなる包括的で公式なソースに基づいた監査可能な記事レベルのデータセットである「Saudi Legal Corpus for AI」を紹介するものである。
原論文は CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
現代の世界において、コンピュータは法律に関する質問に答えることをますます求められるようになっています。これを正確に行うために、コンピュータは「検索拡張生成(RAG)」と呼ばれる技術に依存しています。このプロセスは、コンピュータが質問に答える前に、まず信頼できる膨大な文書のライブラリを検索し、答えが含まれている正確な一節を見つけ出す司書のような働きをします。もしコンピュータが正しいテキストを見つけることができれば、作り話をすることなく、その内容をユーザーのために要約することができます。しかし、このシステムは、そのライブラリがコンピュータにとって読み取り可能で理解可能な形式で存在している場合にのみ機能します。多くの言語や法制度、特にアラブ世界においては、このライブラリが欠落していました。主要な世界的経済圏であるサウジアラビアの法律は、官報や政府のウェブサイトに掲載されていますが、それらは人間が読み取れるページや文書として存在しており、ソフトウェアが容易に検索できるような構造化されたデータとしては存在していません。機械が読み取り可能な形式の法律がなければ、人工知能は王国における法的質問に対して信頼性のある支援を行うことができず、テクノロジーと司法へのアクセスの両面において重大な空白を残すことになります。
この溝を埋めるために、アブドゥッラー・アルモハンメディという研究者が、AIのための「サウジ・リーガル・コーパス(Saudi Legal-Corcus for AI)」、すなわちサウジアラビア王国の法律を網羅した大規模で構造化されたデジタル・コレクションを構築しました。これは単なるリンクのリストやスキャンされたPDFの集まりではありません。むしろ、主要な制定法から詳細な施行規則や手続き規則に至るまで、290の異なる立法手段を含む、注意深く整理されたデータベースです。このコレクションは、商業、刑事司法、労働権利、税務を含む12の異なる法分野をカバーしています。この取り組みの核心は、290の法律を15,689個の個別の条文レベルのレコードへと変換したことにあります。各レコードは、ある法律の特定の条文といった、一つの自己完結したテキストであり、合計で約120万語のアラビア語に及びます。コレクション全体は「監査可能」であるように設計されており、つまり、すべてのテキストが正確な公式ソースまで遡ることができるため、コンピュータが要約や推測ではなく、実際の法律を読んでいることが保証されています。
このコーパスの構築は、正確性と信頼性を確保するために厳格なルールに従って行われています。最も重要なルールは、公式のアラビア語テキストのみが正当なバージョンであるということです。このコレクションには英語と中国語の翻訳も含まれていますが、これらは非権威的な参照資料として明確にマークされており、理解には役立ちますが、法的拘束力はありません。データベース内のすべての条文には、それがどこから来たのか、どのように検証されたのかを正確に説明するラベルが付与されています。研究者は、複数の公式文書と照合された法律と、単一のソースから得られた法律を区別するために、ソースの信頼性を格付けする4段階のシステムを使用しました。この詳細なレベルにより、ユーザーは必要な証拠の度合いに基づいてデータをフィルタリングできます。例えば、重大な法的助言を目的としたシステムであれば、最も厳格に検証されたソースのみを使用し、研究プロジェクトであればより幅広い範囲を受け入れるといった使い分けが可能です。また、データベースには「鮮度マニフェスト(freshness manifest)」が含まれており、政府のポータルサイトが最新の改正をまだ反映していない可能性のある16の特定のトラックをフラグ立てすることで、ユーザーが古い情報によって誤解されることがないよう配慮されています。
単にテキストを保存するだけでなく、研究者はサウジの法律にはこれまで存在しなかったいくつかの分析レイヤーを追加しました。コーパスには、法律が互いにどのように参照し合っているかを示す、条文間の引用マップが含まれており、どの条文が他の条文を引用しているかを示しています。この引用グラフには3,600以上の参照が含まれており、労働法や会社法のように、他の規制によって頻繁に引用される「中心的なハブ」となる法律を明らかにしています。また、どの法律が古い法律を置き換えたり廃止したりしたかを追跡するための、手作業による分類マップも作成されており、法的変更の歴史を追跡するのに役立ちます。さらに、法律内で定義されている約2,000の用語の用語集と、3,300以上の定義も作成されました。これにより、同じ言葉が文脈によってどのように異なる意味を持つのかを明確にできます。現代のAIツールに対応するため、テキストはより小さく管理しやすい「チャンク」に分割されており、コンピュータが数千ページに及ぶテキストの中で迷うことなく、法律の特定の部分を処理できるようにしています。
この新しいリソースがどれほど効果的かをテストするために、研究者はサウジ法に関する519の具体的な質問を作成し、それぞれに正解となる条文をペアリングしました。これらの質問は、実際の法律を読み、人間が問いかけるであろうクエリを定式化することによって作成されました。研究者が、標準的な検索手法をこの新しいメタデータ豊富なシステムと比較したところ、結果は明白でした。新システムは、正解となる条文を93.3パーセントの確率で正しく特定しましたが、標準的な手法では90.4パーセントでした。この差は、「売買契約とは何か?」といった定義を問う質問において最も顕著に現れました。これらのケースでは、新システムは正解の定義を90.9パーセントの確率で見つけ出し、標準的な手法の74.5パーセントと比較して大幅に高い精度を示しました。この差は、データの整理と詳細なラベル付けに注がれた追加の作業が報われ、検索用語がテキストと完全に一致しない場合でも、コンピュータが正しい情報を見つけ出すことをはるかに容易にしていることを証明しています。
このコーパスの公開は、この地域におけるリーガルテクノロジーの大きな前進ですが、明確な境界と限界も伴います。このコレクションは網羅的なものではなく、主要な法律をカバーしていますが、すべての閣僚決定や自治体の規則を含んでいるわけではありません。研究者は、コレクションの範囲と各データに関連する特定のリスクを文書化することで、この点について透明性を保っています。この著作物は公式の政府刊行物ではなく、英語および中国語のレイヤーも公式な翻訳ではありません。唯一の拘束力を持つテキストは、官報に掲載された原文のアラビア語です。構造化され、検証され、監査可能なリソースを提供することで、このプロジェクトは、信頼できる法的アシスタントの構築や、サウジ法の構造に関するより深い研究のための基盤を提供しています。これは、機械が読み取り可能な官報を持たない他の国々が、デジタル時代に向けて自国の法制度をどのように整理できるかというテンプレートを提供しており、法律がアクセス可能で理解しやすく、事実に裏付けられたものであることを保証するものです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。