The Saudi Legal Corpus for AI: An Auditable, Official-Source-Grounded, Article-Level Corpus of Saudi Arabian Legislation
Dieses Paper stellt das Saudi Legal Corpus für KI vor, einen umfassenden, offiziell quellbasierten und auditierbaren Datensatz auf Artikelebene mit 290 saudischen Rechtsinstrumenten, der eine einzigartige Herkunftsnachverfolgung, strukturierte analytische Ebenen wie Zitiergraphen und Glossare für definierte Begriffe sowie einen Retrieval-Benchmark aufweist, der die überlegene Leistung der metadaten-gestützten Suche gegenüber Standard-Baselines für arabisches juristisches NLP demonstriert.
Originalarbeit lizenziert unter CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
In der modernen Welt werden Computer zunehmend gebeten, Fragen zum Recht zu beantworten. Um dies präzise zu tun, verlassen sie sich auf eine Technik namens Retrieval-Augmented Generation. Dieser Prozess funktioniert wie ein Bibliothekar, der, bevor er eine Frage beantwortet, zuerst eine riesige Bibliothek vertrauenswürdiger Dokumente durchsucht, um die exakte Passage zu finden, die die Antwort enthält. Wenn der Computer den richtigen Text finden kann, kann er ihn für den Nutzer zusammenfassen, ohne Dinge zu erfinden. Dieses System funktioniert jedoch nur, wenn die Bibliothek in einem Format existiert, das der Computer lesen und verstehen kann. Für viele Sprachen und Rechtssysteme, insbesondere in der arabischen Welt, hat diese Bibliothek gefehlt. Die Gesetze von Saudi-Arabien, einer bedeutenden Weltwirtschaft, werden in offiziellen Amtsblättern und auf Regierungswebsites veröffentlicht, existieren jedoch als für Menschen lesbare Seiten und Dokumente, nicht als strukturierte Daten, die eine Software leicht durchsuchen kann. Oh ohne eine maschinenlesbare Version dieser Gesetze kann künstliche Intelligenz im Königreich nicht zuverlässig bei Rechtsfragen assistieren, was eine erhebliche Lücke sowohl in der Technologie als auch beim Zugang zur Justiz hinterlässt.
Um diese Lücke zu schließen, hat ein Forscher namens Abdullah Almohammedi den „Saudi Legal Corpus for AI“ aufgebaut, eine massive, strukturierte digitale Sammlung der Gesetze des Königreichs. Dies ist keine einfache Liste von Links oder eine Sammlung gescannter PDFs. Stattdessen handelt es sich um eine sorgfältig organisierte Datenbank, die 290 verschiedene Rechtsinstrumente enthält, die von bedeutenden gesetzlichen Statuten bis hin zu detaillierten Durchführungsverordnungen und Verfahrensregeln reichen. Die Sammlung deckt zwölf verschiedene Rechtsbereiche ab, darunter Handelswesen, Strafrecht, Arbeitsrechte und Besteuerung. Der Kern dieser Arbeit ist die Transformation von 290 Gesetzen in 15.689 einzelne Datensätze auf Artikelebene. Jeder Datensatz ist ein einzelnes, in sich geschlossenes Textstück, wie etwa ein spezifischer Artikel aus einem Gesetz, was insgesamt etwa 1,2 Millionen Wörter in arabischer Sprache ausmacht. Die gesamte Sammlung ist so konzipiert, dass sie prüfbar ist, was bedeutet, dass jeder einzelne Textabschnitt auf seine exakte offizielle Quelle zurückverfolgt werden kann, wodurch sichergestellt wird, dass der Computer das echte Gesetz liest und nicht eine Zusammenfassung oder eine Vermutung.
Der Aufbau dieses Korpus folgt einem strengen Regelwerk, um Genauigkeit und Vertrauenswürdigkeit zu gewährleisten. Die wichtigste Regel ist, dass der offizielle arabische Text die einzige maßgebliche Version ist. Während die Sammlung auch englische und chinesische Übersetzungen enthält, sind diese deutlich als nicht autoritative Referenzen gekennzeichnet, die zwar zum Verständnis nützlich, aber rechtlich nicht bindend sind. Jeder einzelne Artikel in der Datenbank trägt ein Label, das erklärt, woher er stammt und wie er verifiziert wurde. Der Forscher verwendete ein vierstufiges System, um die Zuverlässigkeit jeder Quelle zu bewerten, wobei zwischen Gesetzen unterschieden wird, die gegen mehrere offizielle Dokumente abgeglichen wurden, und solchen, die aus einer einzigen Quelle stammen. Diese Detailtiefe ermöglicht es den Nutzern, die Daten basierend darauf zu filtern, wie viel Evidenz sie benötigen. Beispielsweise könnte ein System, das für hochsensible Rechtsberatung konzipiert ist, nur die am strengsten verifizierten Quellen verwenden, während ein Forschungsprojekt einen breiteren Bereich akzeptieren könnte. Die Datenbank enthält zudem ein „Freshness Manifest“, eine Liste, die 16 spezifische Pfade markiert, bei denen das offizielle Regierungsportal möglicherweise noch nicht die neuesten Änderungen enthält, um sicherzustellen, dass Nutzer sich der potenziell veralteten Informationen bewusst sind, anstatt in die Irre geführt zu werden.
Über die bloße Speicherung des Textes hinaus fügte der Forscher mehrere Analyseebenen hinzu, die es für das saudische Recht bisher nicht gab. Der Korpus enthält eine Karte darüber, wie Gesetze einander referenzieren, und zeigt auf, welche Artikel auf andere Artikel verweisen. Dieser Zitationsgraph enthält über 3.600 Referenzen und offenbart, welche Gesetze als zentrale Knotenpunkte im Rechtssystem fungieren, wie etwa das Arbeitsrecht und das Gesellschaftsrecht, die häufig von anderen Verordnungen zitiert werden. Es gibt auch eine manuell klassifizierte Karte, die zeigt, welche Gesetze ältere ersetzt oder aufgehoben haben, was hilft, die Geschichte der Rechtsänderungen nachzuverfolgen. Zusätzlich erstellte das Projekt ein Glossar von fast 2.000 Begriffen, die spezifisch innerhalb der Gesetze definiert sind, zusammen mit über 3.300 Definitionen. Dies hilft zu klären, wie dasselbe Wort in verschiedenen Kontexten unterschiedliche Bedeutungen haben kann. Um die Daten für moderne KI-Werkzeuge bereit zu machen, wurde der Text zudem in kleinere, handhabbare Stücke unterteilt, was es Computern ermöglicht, spezifische Abschnitte eines Gesetzes zu verarbeiten, ohne sich in tausenden von Seiten Text zu verlieren.
Um zu testen, wie gut diese neue Ressource funktioniert, erstellte der Forscher einen Benchmark mit 519 spezifischen Fragen über saudisches Recht, von denen jede mit dem korrekten Artikel gepaart ist, der die Antwort enthält. Diese Fragen wurden formuliert, indem die tatsächlichen Gesetze gelesen und dann Abfragen erstellt wurden, die eine Person stellen könnte. Als die Forscher eine Standard-Suchmethode gegen dieses neue, reich an Metadaten bereicherte System testeten, waren die Ergebnisse aufschlussreich. Das neue System identifizierte den richtigen Artikel in 93,3 Prozent der Fälle korrekt, verglichen mit 90,4 Prozent bei der Standardmethode. Der Unterschied war am deutlichsten, wenn die Fragen nach Definitionen fragten, wie etwa „Was ist ein Kaufvertrag?“. In diesen Fällen war das neue System signifikant genauer und fand die korrekte Definition in 90,9 Prozent der Fälle, gegenüber 74,5 Prozent bei der Standardmethode. Diese Lücke zeigt, dass sich die zusätzliche Arbeit bei der Organisation der Daten und dem Hinzufügen detaillierter Labels auszahlt, da es Computern viel leichter macht, die richtigen Informationen zu finden, selbst wenn die Suchbegriffe nicht perfekt mit dem Text übereinstimmen.
Die Veröffentlichung dieses Korpus ist ein bedeutender Schritt nach vorn für die Rechtstechnologie in der Region, bringt jedoch klare Grenzen und Einschränkungen mit sich. Die Sammlung ist nicht erschöpfend; sie deckt die Hauptgesetze ab, beinhaltet aber nicht jede einzelne ministerielle Entscheidung oder kommunale Regelung. Der Forscher ist hierbei transparent und dokumentiert den Umfang der Sammlung sowie die spezifischen Risiken, die mit jedem Datensatz verbunden sind. Die Arbeit ist explizit keine offizielle Regierungspublikation, und die englischen sowie chinesischen Ebenen sind keine offiziellen Übersetzungen. Der einzige bindende Text bleibt das ursprüngliche Arabisch, wie es im offiziellen Amtsblatt veröffentlicht wurde. Durch die Bereitstellung dieser strukturierten, verifizierten und prüfbaren Ressource bietet das Projekt ein Fundament für den Aufbau zuverlässiger Rechtsassistenten und für tiefere Studien zur Struktur des saudischen Rechts. Es dient als Vorbild dafür, wie andere Länder ohne maschinenlesbare Amtsblätter ihre eigenen Rechtssysteme für das digitale Zeitalter organisieren können, um sicherzustellen, dass das Recht zugänglich, verständlich und an der Tatsache orientiert bleibt.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.