← Nieuwste papers
💬 NLP

Retrieval Augmented Generation Framework for the Nepali Legal Domain Question Answering

Deze studie introduceert het eerste Retrieval Augmented Generation-framework voor het beantwoorden van juridische vragen in het Nepalees, waarbij gebruik wordt gemaakt van het Nepal Kanun Patrika-archief om hoge precisie- en betrouwbaarheidsscores te behalen, waardoor de uitdagingen van gegevensschaarste in juridische domeinen met weinig middelen worden aangepakt.

Oorspronkelijke auteurs: Samir Wagle, Abiral Adhikari, Reewaj Khanal, Batsal Bhandari, Prashant Manandhar, Praveen Acharya, Bal Krishna Bal

Gepubliceerd 2026-06-09
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Samir Wagle, Abiral Adhikari, Reewaj Khanal, Batsal Bhandari, Prashant Manandhar, Praveen Acharya, Bal Krishna Bal

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je het rechtssysteem van Nepal voor als een enorme, eeuwenoude bibliotheek. Deze bibliotheek bevat duizenden gerechtelijke uitspraken (jurisprudentie) geschreven in het Nepalees. Echter, er zijn twee grote problemen:

  1. De boeken zijn een rommeltje: Ze zijn geschreven in een ouderwetse taal, verspreid over verschillende plekken, en niet allemaal goed gedigitaliseerd.
  2. De bibliothecaris is nieuw: Kunstmatige intelligentie (AI)-modellen worden meestal getraind op Engelse boeken. Wanneer je hen naar Nepalese wetten vraagt, raken ze vaak in de war of verzinnen ze dingen omdat ze niet genoeg Nepalese juridische teksten hebben "gelezen" om de regels te leren.

Dit artikel introduceert een nieuwe manier om dit op te lossen met behulp van een systeem genaamd RAG (Retrieval-Augmented Generation). Denk aan RAG niet als een student die probeert een tekstboek uit het hoofd te leren, maar als een slimme onderzoeksassistent die de ruimte krijgt om antwoorden in een bibliotheek op te zoeken voordat hij spreekt.

Zo hebben de onderzoekers deze assistent gebouwd en getest:

1. De Bibliotheek (De Data)

Het team ging naar het officiële digitale archief van het Hooggerechtshof van Nepal (genaamd Nepal Kanun Patrika). Ze hebben 10.320 juridische documenten gescraped en opgeschoond.

  • De Uitdaging: Ze konden deze enorme documenten niet zomaar aan de AI voeren. Het is alsof je een specifieke zin in een boek van 500 pagina's probeert te vinden door het hele boek in één keer te lezen.
  • De Oplossing: Ze hakten de documenten in kleinere "stukjes" (chunks) (zoals het opdelen van een lang verhaal in korte paragrafen), zodat de AI ze beter kon verwerken.

2. De Zoekmachine (De juiste pagina vinden)

Voordat de AI een vraag kan beantwoorden, moet hij de juiste pagina in de bibliotheek vinden. De onderzoekers testten twee verschillende manieren om te zoeken:

  • Methode A: De "Zoektermjager" (BM25)

    • Hoe het werkt: Dit is als een traditionele bibliothecaris die zoekt naar exacte woorden. Als je vraagt: "Wat is de straf voor diefstal?", scant de bibliothecaris op de exacte woorden "straf", "diefstal" en "wet".
    • Het Resultaat: Deze methode was de kampioen. Hij vond het juiste document in 91% van de gevallen bij het kijken naar kleine stukjes, en in 88% van de gevallen bij het kijken naar hele documenten. Het was zeer precies omdat juridische taal vaak zeer specifiek en repetitief is.
  • Methode B: De "Betekenis-Matcher" (Dense Retrieval)

    • Hoe het werkt: Dit is als een bibliothecaris die de vibe of de betekenis van een vraag begrijpt, zelfs als de woorden anders zijn. Het gebruikt geavanceerde wiskunde (embeddings) om te raden dat "stelen" en "diefstal" hetzelfde zijn.
    • Het Resultaat: Deze methode was goed, maar niet geweldig voor deze specifieke taak. Het vond het juiste document slechts in 75% van de gevallen. De onderzoekers kwamen tot de conclusie dat voor het Nepalees exacte woordovereenkomst beter werkt dan het raden van de betekenis, waarschijnlijk omdat juridische termen erg rigide zijn.

De Snelheidsval:
De "Zoektermjager" (BM25) had een addertje onder het gras. Wanneer ze de documenten in piepkleine stukjes hakten om het nauwkeuriger te maken, werd de zoekopdracht zeer traag (alsof je door 110.000 kleine indexkaarten zoekt in plaats van 10.000 boeken). Om het systeem snel genoeg bruikbaar te houden, kozen ze voor de "Volledige Document"-versie van de Zoektermjager. Het was iets minder nauwkeurig, maar veel sneller.

3. De Antwoordschrijver (Het genereren van de reactie)

Zod matter de AI het juiste document had gevonden, moest hij het antwoord schrijven.

  • De Regel: De AI kreeg de strikte instructie: "Verzin niets."
  • De Strategie: De onderzoekers gebruikten een tweestaps-proces. Eerst moest de AI naar de exacte zin in het document wijzen die het antwoord bewijst. Ten tweede schreef hij het antwoord uitsluitend op basis van die zin. Als hij geen bewijs kon vinden, kreeg hij de opdracht om te zeggen: "Ik weet het niet", in plaats van te gokken.

4. De Resultaten (Werkt het?)

Het team testte dit systeem met 100 vragen geschreven door juridische experts. Hier is hoe de beste versie (Zoektermjager + Volledige Documenten) presteerde:

  • Succespercentage: Het genereerde succesvol een antwoord voor 92% van de vragen.
  • Waarheidsgetrouwheid: Bij controle door een andere AI en door menselijke juristen waren de antwoorden voor 85% waarheidsgetrouw (wat betekent dat ze geen feiten verzinnen of hallucineren).
  • Gegrondheid: 74% van de antwoorden werd direct ondersteund door de tekst die in de bibliotheek is gevonden.

De Kern van het Verhaal

Dit artikel bewijst dat je voor een taal met weinig middelen, zoals het Nepalees, niet een superintelligente AI nodig hebt die alles uit het hoofd kent. In plaats daarvan heb je een betrouwbare zoektool nodig die de exacte juridische tekst vindt en een strikte AI die weigert te spreken tenzij hij de tekst voor zich heeft.

Door een eenvoudige, snelle zoekmethode (BM25) te combineren met een zorgvuldig schrijfproces, hebben zij het eerste systeem gecreëerd dat betrouwbaar juridische vragen in het Nepalees kan beantwoorden zonder feiten te verzinnen. Het is een fundament dat uiteindelijk gewone mensen kan helpen hun juridische rechten te begrijpen zonder dat zij een juridische graad nodig hebben.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →