The Saudi Legal Corpus for AI: An Auditable, Official-Source-Grounded, Article-Level Corpus of Saudi Arabian Legislation
Dit artikel introduceert de Saudi Legal Corpus voor AI, een uitgebreide, officieel bronverifieerde en controleerbare dataset op artikelniveau bestaande uit 290 Saoedische wetgevende instrumenten met unieke herkomsttracking, gestructureerde analytische lagen zoals citatiegrafieken en glossaria van gedefinieerde termen, en een retrieval-benchmark die de superieure prestaties van metadata-verrijkt zoeken ten opzichte van standaard baselines voor Arabische juridische NLP aantoont.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
In de moderne wereld wordt er steeds vaker van computers gevraagd om vragen over het recht te beantwoorden. Om dit accuraat te doen, vertrouwen ze op een techniek die retrieval-augmented generation wordt genoemd. Dit proces werkt als een bibliothecaris die, voordat hij een vraag beantwoordt, eerst een enorme bibliotheek met vertrouwde documenten doorzoekt om de exacte passage te vinden die het antwoord bevat. Als de computer de juiste tekst kan vinden, kan hij deze voor de gebruiker samenvatten zonder dingen te verzinnen. Dit systeem werkt echter alleen als de bibliotheek bestaat in een formaat dat de computer kan lezen en begrijpen. Voor veel talen en rechtssystemen, vooral in de Arabische wereld, heeft deze bibliotheek ontbroken. De wetten van Saoedi-Arabië, een belangrijke wereldwijde economie, worden gepubliceerd in officiële staatsbladen en op overheidswebsites, maar ze bestaan uit menselijk leesbare pagina's en documenten, niet als gestructureerde gegevens die software gemakkelijk kan doorzoeken. Zonder een machineleesbare versie van deze wetten kan kunstmatige intelligentie niet betrouwbaar helpen bij juridische vragen in het Koninkrijk, wat een aanzienlijke kloof laat zien in zowel technologie als toegang tot het recht.
Om deze kloof te overbruggen, heeft een onderzoeker genaamd Abdullah Almohammedi de Saudi Legal Corpus for AI gebouwd, een enorme, gestructureerde digitale collectie van de wetten van het Koninkrijk. Dit is geen eenvoudige lijst met links of een verzameling gescande PDF's. In plaats daarvan is het een zorgvuldig georganiseerde database die 290 verschillende wetgevende instrumenten bevat, variërend van belangrijke statutaire wetten tot gedetailleerde uitvoeringsvoorschriften en procedurele regels. De collectie beslaat twaalf verschillende rechtsgebieden, waaronder commerciële zaken, strafrecht, arbeidsrechten en belastingen. De kern van dit werk is de transformatie van 290 wetten naar 15.689 individuele records op artikelniveau. Elk record is een enkel, op zichzelf staand tekstfragment, zoals één specifiek artikel uit een wet, wat in totaal ongeveer 1,2 miljoen woorden in het Arabisch beslaat. De gehele collectie is zo ontworpen dat deze controleerbaar is, wat betekent dat elk stuk tekst kan worden teruggevoerd naar de exacte officiële bron, zodat wordt gewaarborgd dat de computer de echte wet leest en niet een samenvatting of een gok.
De constructie van deze corpus volgt een strikte set regels om nauwkeurigheid en betrouwbaarheid te garanderen. De belangrijkste regel is dat de officiële Arabische tekst de enige versie is die telt. Hoewel de collectie Engelse en Chinese vertalingen bevat, zijn deze duidelijk gemarkeerd als niet-bindende referentieversies, nuttig voor begrip maar niet juridisch bindend. Elk artikel in de database draagt een label dat precies uitlegt waar het vandaan komt en hoe het is geverifieerd. De onderzoeker gebruikte een vierfasig systeem om de betrouwbaarheid van elke bron te graderen, waarbij onderscheid werd gemaakt tussen wetten die zijn gecontroleerd tegen meerdere officiële documenten en wetten die afkomstig waren van een enkele bron. Dit niveau van detail stelt gebruikers in staat om de gegevens te filteren op basis van hoeveel bewijs ze nodig hebben. Zo zou een systeem dat bedoeld is voor juridisch advies met een hoge inzet bijvoorbeeld alleen de meest rigoureus geverifieerde bronnen kunnen gebruiken, terwijl een onderzoeksproject een breder bereik zou kunnen accepteren. De database bevat ook een "freshness manifest", een lijst die 16 specifieke trajecten markeert waar het officiële overheidsportaal mogelijk nog niet de nieuwste wijzigingen bevat, zodat gebruikers zich bewust zijn van potentieel verouderde informatie in plaats van misleid te worden.
Naast het louter opslaan van de tekst, heeft de onderzoeker verschillende lagen van analyse toegevoegd die nog nooit eerder voor het Saoedische recht hebben bestaan. De corpus bevat een kaart van hoe wetten naar elkaar verwijzen, die laat zien welke artikelen andere artikelen citeren. Deze citatiegrafiek bevat meer dan 3.600 verwijzingen en onthult welke wetten fungeren als centrale knooppunten in het rechtssysteem, zoals de Arbeidswet en de Vennootschapswet, die frequent worden geciteerd door andere regelgeving. Er is ook een handmatig geclassificeerde kaart die laat zien welke wetten oudere wetten hebben vervangen of ingetrokken, wat helpt bij het volgen van de geschiedenis van juridische veranderingen. Daarnaast heeft het project een woordenlijst gemaakt van bijna 2.000 termen die specifiek binnen de wetten zelf worden gedefieerd, samen met meer dan 3.300 definities. Dit helpt te verduidelijken hoe hetzelfde woord in verschillende contexten een andere betekenis kan hebben. Om de gegevens klaar te maken voor moderne AI-tools, werd de tekst ook opgedeeld in kleinere, beheersbare fragmenten, waardoor computers specifieke secties van een wet kunnen verwerken zonder de weg kwijt te raken in duizenden pagina's tekst.
Om te testen hoe goed deze nieuwe bron werkt, heeft de onderzoeker een benchmark ontwikkeld met 519 specifieke vragen over het Saoedische recht, elk gekoppeld aan het juiste artikel dat het antwoord bevat. Deze vragen werden opgesteld door de werkelijke wetten te lezen en vervolgens queries te formuleren die een persoon zou kunnen stellen. Toen de onderzoekers een standaard zoekmethode testten tegen dit nieuwe, rijke systeem met metadata, waren de resultaten veelzeggend. Het nieuwe systeem identificeerde de juiste artikel in 93,3 procent van de gevallen, vergeleken met 90,4 procent voor de standaardmethode. Het verschil was het meest merkbaar bij vragen die vroegen naar definities, zoals "wat is een koopovereenkomst?". In deze gevallen was het nieuwe systeem aanzienlijk nauwkeuriger en vond het de juiste definitie in 90,9 procent van de gevallen, tegenover 74,5 procent voor de standaardmethode. Deze kloof bewijst dat de extra inspanning die is geleverd bij het organiseren van de gegevens en het toevoegen van gedetailleerde labels vruchten afwerpt, waardoor het voor computers veel gemakkelijker wordt om de juiste informatie te vinden, zelfs wanneer de zoektermen niet perfect overeenkomen met de tekst.
De release van deze corpus is een belangrijke stap voorwaarts voor de juridische technologie in de regio, maar brengt ook duidelijke grenzen en beperkingen met zich mee. De collectie is niet uitputtend; het dekt de belangrijkste wetten, maar bevat niet elke ministeriële beslissing of gemeentelijke regel. De onderzoeker is transparant over de reikwijdte van de collectie en de specifieke risico's die verbonden zijn aan elk onderdeel. Het werk is expliciet geen officiële overheidspublicatie, en de Engelse en Chinese lagen zijn geen officiële vertalingen. De enige bindende tekst blijft de originele Arabische tekst zoals gepubliceerd in het officiële staatsblad. Door dit gestructureerde, geverifieerde en controleerbare hulpmiddel te bieden, biedt het project een fundament voor het bouwen van betrouwbare juridische assistenten en het uitvoeren van diepere studies naar de structuur van het Saoedische recht. Het biedt een blauwdruk voor hoe andere landen zonder machineleesbare staatsbladen hun eigen rechtssystemen kunnen organiseren voor het digitale tijdperk, zodat het recht toegankelijk, begrijpelijk en geworteld in de feiten blijft.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.