Citation Grounding: Detecting and Reducing LLM Citation Hallucinations via Legal Citation Graphs
Dit artikel introduceert "Citation Grounding", een nieuwe metriek en een raamwerk voor het detecteren en verminderen van hallucinaties in juridische citaties in grote taalmodellen door gebruik te maken van een massieve Oekraïense grafiek van gerechtelijke uitspraken om de nauwkeurigheid van citaten te evalueren en een preferentieleermethode (CG-DPO) toe te passen om modellen te trainen om geldige citaten te onderscheiden van gecorrumpeerde citaten.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een zeer intelligente, snel pratende juridische assistent inhuurt om een rapport voor je te schrijven. Deze assistent heeft miljoenen boeken gelezen en weet heel veel feiten. Maar er is een addertje onder het gras: wanneer de assistent wordt gevraagd om specifieke wetten aan te voeren om hun argumenten te onderbouwen, verzint de assistent soms ook wel eens wat. Ze verzinnen een wet die niet bestaat, citeren een wet die jaren geleden al is ingetrokken, of citeren een wet uit een ander land. In de juridische wereld wordt dit een "hallucinatie" genoemd.
Dit artikel introduceert een nieuwe manier om deze leugens te betrappen en een methode om de assistent te leren ze niet te vertellen.
Het Probleem: De "Nepwet"-generator
De auteurs ontdekten dat zelfs de meest geavanceerde AI-modellen, wanneer ze gevraagd worden over de Oekraïense wetgeving te schrijven, 13% tot 21% van de tijd nep juridische citaties verzinnen. Het is alsof een student een essay schrijft en paginanummers opzoekt voor een tekstboek dat niet bestaat.
De Oplossing: De "Citation Grounding" Test
Om dit op te lossen, hebben de onderzoekers een enorme digitale kaart gebouwd die een Citation Graph wordt genoemd. Denk aan deze grafiek als een gigantische, supernauwkeurige bibliotheekcatalogus, gebouwd op basis van 100 miljoen echte rechtszaken. Het bevat elke keer dat een echte rechter een specifieke wet heeft geciteerd in een echte zaak.
Ze hebben een test ontwikkeld genaamd Citation Grounding (CG). Zo werkt het:
- De Kaart: Ze hebben de "waarheidskaart" (de grafiek van echte rechtszaken).
- De Test: Ze vragen een AI om een juridisch antwoord te schrijven.
- De Controle: Ze controleren elke wet die de AI noemt via de kaart.
- Bestond de wet? (Precisie)
- Was het de juiste wet voor deze specifieke situatie? (Relevantie)
- Was de wet op die specifieke datum daadwerkelijk van kracht? (Temporaliteit)
Als de AI een wet citeert die niet op de kaart staat, of de wet in de verkeerde context citeert, markeert de test dit als een hallucinatie.
Wat ze vonden
Ze testten vijf verschillende AI-systemen op 100 juridische vragen.
- De Resultaten: De meeste AI's hadden ongeveer 80% van hun citaties correct. De rest waren nep.
- De "RAG"-winnaar: Eén systeem gebruikte een speciale truc genaamd RAG (Retrieval-Augmented Generation). Stel je voor dat deze AI niet alleen vertrouwt op zijn geheugen; hij gaat daadwerkelijk naar de bibliotheek, zoekt de echte boeken op en leest ze voordat hij antwoordt. Dit systeem maakte de minste fouten en citeerde de minste wetten in totaal, wat bewees dat "minder meer is" wanneer je daadwerkelijk de feiten opzoekt.
- Het Verrassende Patroon: Ze verwachtten dat AI-modellen die méér wetten citeren, ook méér fouten zouden maken. Dat was echter niet het geval. Sommige modellen citeerden veel wetten en waren nog steeds accuraat; andere citeerden minder wetten en waren nog steeds fout. Het hangt volledig af van hoe de AI is gebouwd, en niet alleen van hoeveel hij praat.
De "Zelfleer"-methode (CG-DPO)
De grootste doorbraak in het artikel is hoe ze van plan zijn de AI te verbeteren zonder een team van dure menselijke advocaten in te huren om elk antwoord te controleren.
Normaal gesproken moeten mensen de antwoorden van een AI lezen en zeggen: "Dit is goed" of "Dit is slecht" om de AI te leren eerlijk te zijn. Dit is traag en duur.
De onderzoekers realiseerden zich dat hun Citation Graph het werk van de mens kon overnemen. Ze creëerden een spel:
- Neem een echte rechtszaak met correcte citaties.
- Corrumpeer het: Ze gebruikten een computerprogramma om wetten te vervangen, nep artikelen te verzinnen of verouderde wetten te gebruiken (zoals een wet uit 2020 te veranderen in een wet uit 2025 die nog niet bestond).
- De Les: Ze lieten de AI twee versies zien: de "Echte" versie en de "Gecorrumpeerde" versie. De AI leerde de voorkeur te geven aan de Echte versie.
Omdat de "waarheid" al in de grafiek zat, hadden ze geen mensen nodig om de data te labelen. Ze lieten de grafiek simpelweg de beoordeling doen. Ze trainden een model met deze methode, en dat model werd 98,5% accuraat in het herkennen van het verschil tussen een echte citatie en een nep citatie.
De Kern van het Verhaal
Dit artikel laat zien dat:
- AI liegt vaak over wetten, maar we kunnen dit betrappen door de antwoorden te vergelijken met een enorme kaart van de echte rechtsgeschiedenis.
- RAG-systemen (die feiten opzoeken voordat ze antwoorden) momenteel het beste zijn in het vermijden van deze leugens.
- We AI kunnen leren om niet te liegen door de kaart zelf te gebruiken om "correcte versus incorrecte" voorbeelden te genereren, waardoor het saaie werk van menselijke juristen om elke enkele citatie te controleren, overbodig wordt.
De auteurs hebben hun "kaart", hun testinstrumenten en hun trainingsdata beschikbaar gesteld voor iedereen, in de hoop de juridische AI betrouwbaarder te maken voor iedereen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.