← Derniers articles
💻 computer science

The Saudi Legal Corpus for AI: An Auditable, Official-Source-Grounded, Article-Level Corpus of Saudi Arabian Legislation

Cet article présente le Corpus Juridique Saoudien pour l'IA, un ensemble de données exhaustif, de source officielle et auditable, composé de 290 instruments législatifs saoudiens présentant un suivi de provenance unique, des couches analytiques structurées telles que des graphes de citations et des glossaires de termes définis, ainsi qu'un benchmark de recherche démontrant la performance supérieure de la recherche enrichie par métadonnées par rapport aux bases de référence standards pour le traitement du langage naturel juridique en arabe.

Auteurs originaux : Abdullah Almohammedi

Publié 2026-09-01
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Abdullah Almohammedi

Article original sous licence CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Dans le monde moderne, on demande de plus en plus aux ordinateurs de répondre à des questions sur le droit. Pour y parvenir avec précision, ils s'appuient sur une technique appelée la génération augmentée par récupération. Ce processus fonctionne comme un bibliothécaire qui, avant de répondre à une question, recherche d'abord dans une vaste bibliothèque de documents de confiance pour trouver le passage exact qui contient la réponse. Si l'ordinateur peut trouver le texte approprié, il peut le résumer pour l'utilisateur sans rien inventer. Cependant, ce système ne fonctionne que si la bibliothèque existe dans un format que l'ordinateur peut lire et comprendre. Pour de nombreuses langues et de nombreux systèmes juridiques, particulièrement dans le monde arabe, cette bibliothèque a été absente. Les lois de l'Arabie saoudite, une économie mondiale majeure, sont publiées dans des gazettes officielles et sur des sites web gouvernementaux, mais elles existent sous forme de pages et de documents lisibles par l'homme, et non sous forme de données structurées que les logiciels peuvent facilement parcourir. Sans une version lisible par machine de ces lois, l'intelligence artificielle ne peut pas assister de manière fiable les questions juridiques dans le Royaume, laissant un fossé important tant au niveau de la technologie que de l'accès à la justice.

Pour combler ce fossé, un chercheur nommé Abdullah Almohammedi a construit le Corpus Juridique Saoudien pour l'IA, une vaste collection numérique structurée des lois du Royaume. Il ne s'agit pas d'une simple liste de liens ou d'une collection de PDF numérisés. Il s'agit plutôt d'une base de données soigneusement organisée contenant 290 instruments législatifs distincts, allant des lois statutaires majeures aux règlements d'exécution détaillés et aux règles de procédure. La collection couvre douze domaines différents du droit, notamment le commerce, la justice pénale, le droit du travail et la fiscalité. Le cœur de ce travail est la transformation de 290 lois en 15 689 enregistrements individuels au niveau de l'article. Chaque enregistrement est un fragment de texte autonome, tel qu'un article spécifique d'une loi, totalisant environ 1,2 million de mots en arabe. L'ensemble de la collection est conçu pour être auditable, ce qui signifie que chaque morceau de texte peut être retracé jusqu'à sa source officielle exacte, garantissant ainsi que l'ordinateur lit la véritable loi et non un résumé ou une supposition.

La construction de ce corpus suit un ensemble de règles strictes pour garantir l'exactitude et la fiabilité. La règle la plus importante est que le texte arabe officiel est la seule version qui compte. Bien que la collection comprenne des traductions en anglais et en chinois, celles-ci sont clairement marquées comme des références non faisant autorité, utiles pour la compréhension mais non juridiquement contraignantes. Chaque article de la base de données porte une étiquette qui explique exactement d'où il provient et comment il a été vérifié. Le cherchenaire a utilisé un système à quatre niveaux pour évaluer la fiabilité de chaque source, distinguant les lois qui ont été recoupées avec plusieurs documents officiels de celles qui proviennent d'une source unique. Ce niveau de détail permet aux utilisateurs de filtrer les données en fonction du degré de preuve dont ils ont besoin. Par exemple, un système conçu pour des conseils juridiques à enjeux élevés pourrait n'utiliser que les sources les plus rigoureusement vérifiées, tandis qu'un projet de recherche pourrait accepter une gamme plus large. La base de données comprend également un « manifeste de fraîcheur », une liste qui signale 16 pistes spécifiques où le portail gouvernemental officiel pourrait ne pas encore présenter les dernières amendements, garantissant ainsi que les utilisateurs sont informés d'éventuelles informations obsolètes plutôt que d'être induits en erreur.

Au-delà du simple stockage du texte, le chercheur a ajouté plusieurs couches d'analyse qui n'avaient jamais existé pour le droit saoudien auparavant. Le corpus comprend une carte de la manière dont les lois se référencent entre elles, montrant quels articles citent d'autres articles. Ce graphe de citations contient plus de 3 600 références, révélant quelles lois agissent comme des pivots centraux dans le système juridique, telles que la loi sur le travail et la loi sur les sociétés, qui sont fréquemment citées par d'autres réglementations. Il existe également une carte classée manuellement montrant quelles lois ont remplacé ou abrogé des lois plus anciennes, aidant ainsi à suivre l'histoire des changements juridiques. De plus, le projet a créé un glossaire de près de 2 000 termes qui sont spécifiquement définis au sein même des lois, ainsi que plus de 3 300 définitions. Cela aide à clarifier comment un même mot peut signifier des choses différentes selon les contextes. Pour rendre les données prêtes pour les outils d'IA modernes, le texte a également été découpé en segments plus petits et gérables, permettant aux ordinateurs de traiter des sections spécifiques d'une loi sans se perdre dans des milliers de pages de texte.

Pour tester l'efficacité de cette nouvelle ressource, le chercheur a créé un benchmark utilisant 519 questions spécifiques sur le droit saoudien, chacune étant associée à l'article correct qui contient la réponse. Ces questions ont été rédigées en lisant les lois réelles, puis en formulant des requêtes qu'une personne pourrait poser. Lorsque les chercheurs ont testé une méthode de recherche standard contre ce nouveau système riche en métadonnées, les résultats ont été éloquents. Le nouveau système a identifié correctement le bon article 93,3 % du temps, contre 90,4 % pour la méthode standard. La différence était la plus notable lorsque les questions portaient sur des définitions, telles que « qu'est-ce qu'un contrat de vente ? ». Dans ces cas, le nouveau système était nettement plus précis, trouvant la définition correcte 90,9 % du temps contre 74,5 % pour la méthode standard. Cet écart démontre que le travail supplémentaire investi dans l'organisation des données et l'ajout d'étiquettes détaillées porte ses fruits, rendant beaucoup plus facile pour les ordinateurs de trouver l'information pertinente, même lorsque les termes de recherche ne correspondent pas parfaitement au texte.

La publication de ce corpus est une étape importante pour la technologie juridique dans la région, mais elle comporte des frontières et des limites claires. La collection n'est pas exhaustive ; elle couvre les lois principales mais n'inclut pas toutes les décisions ministérielles ou les règles municipales. Le chercheur est transparent à ce sujet, documentant le champ d'application de la collection et les risques spécifiques associés à chaque donnée. Ce travail n'est explicitement pas une publication gouvernementale officielle, et les couches anglaise et chinoise ne sont pas des traductions officielles. Le seul texte contraignant reste l'original en arabe tel que publié dans la gazette officielle. En fournissant cette ressource structurée, vérifiée et auditable, le projet offre une base pour construire des assistants juridiques fiables et mener des études plus approfondies sur la structure du droit saoudien. Il fournit un modèle pour la manière dont d'autres pays ne possédant pas de gazettes officielles lisibles par machine peuvent organiser leurs propres systèmes juridiques pour l'ère numérique, garantissant que la loi reste accessible, compréhensible et ancrée dans les faits.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →