Asking For An Old Friend: Diagnosing and Mitigating Temporal Failure Modes in LLM-based Statutory Question Answering
Dit artikel introduceert een benchmark voor tijdgevoelige juridische vraag-antwoordtaken in het Duits en toont aan dat hoewel retrieval-augmented generation met temporele filtering effectief veroudering na de cut-off-datum en recency-bias in juridische LLM's mitigeert, standaardmodellen en webzoekbenaderingen lijden aan ernstige temporele tekortkomingen, wat de noodzaak onderstreept om temporele geldigheid als een harde beperking af te dwingen voor betrouwbare juridische AI.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een briljante juridische assistent hebt die tot een specifieke datum elk wetboek in Duitsland heeft gelezen — laten we zeggen, november 2024. Deze assistent is ongelooflijk slim, maar heeft een groot blinde vlek: hij weet niet dat de wereld is veranderd sinds hij stopte met lezen.
Dit artikel gaat over het testen van die assistent op twee specifieke manieren waarop hij door de tijd wordt verward, en vervolgens proberen die verwarringen op te lossen.
De twee tijdwispingen
De onderzoekers ontdekten dat deze AI-assistent bij het stellen van vragen over wetten twee onderscheiden soorten fouten maakt:
Het probleem van de "verouderde kaart" (Post-cutoff-veroudering):
Stel je voor dat je in 2025 rijdt, maar je GPS een kaart uit 2020 gebruikt. De GPS zegt je linksaf te slaan waar nu een nieuwe snelweg de weg blokkeert.- De glitch: Als een wet is gewijzigd nadat de AI stopte met leren, past de AI met vertrouwen de oude, vervangen regel toe. Hij weet niet dat de nieuwe wet bestaat.
- Het resultaat: De AI geeft een verkeerd antwoord, maar klinkt er zeer zeker van.
Het probleem van het "nieuwste glimmende speeltje" (Recency-bias):
Stel je voor dat je je assistent vraagt: "Wat was de maximumsnelheid op deze straat in 1995?" Hoewel je een tijdmachine (de oude wet) direct op het bureau hebt, pakt de assistent het huidige maximumsnelheidbord omdat het er frisser uitziet en meer "relevant" is.- De glitch: De AI geeft de voorkeur aan de meest recente versie van een wet, zelfs wanneer de specifieke situatie waar je naar vraagt in het verleden heeft plaatsgevonden en de oude versie vereist.
- Het resultaat: De AI past de verkeerde (te nieuwe) wet toe op een oude situatie.
Het experiment: Een juridische "stress-test"
Om dit te testen, creëerden de onderzoekers een speciale examen met 312 vragen gebaseerd op echte Duitse wetten. Ze zorgden ervoor dat de vragen lastig waren:
- Sommige vereisten kennis van een wet die na de "verjaardag" van de AI (zijn trainingscutoff) was gewijzigd.
- Sommige vereisten het toepassen van een wet uit 2017 op een zaak die in 2017 plaatsvond, zelfs al was de wet in 2024 gewijzigd.
Ze testten vijf verschillende AI-modellen (zoals ChatGPT, Claude en DeepSeek) op vier verschillende manieren:
- De "alleen hersenen"-modus: De AI beantwoordt vragen uitsluitend met wat hij tijdens de training heeft gememoriseerd.
- De "Google-zoekopdracht"-modus: De AI mag de live internetpagina's doorzoeken.
- De "tijdwandelende bibliotheek" (RAG-kNN): De AI krijgt een digitale bibliotheek, maar een strenge bibliothecaris (een filter) geeft alleen boeken die op de specifieke datum van de vraag geldig waren.
- De "inhoudsopgave"-modus: Vergelijkbaar met de bibliotheek, maar de AI kiest hoofdstukken uit een lijst voordat hij de volledige tekst leest.
Wat ze ontdekten
1. De "alleen hersenen"-modus faalde jammerlijk
Wanneer de AI alleen op zijn geheugen moest vertrouwen, was hij vreselijk in het omgaan met tijd.
- Voor vragen over wetten die na zijn training waren gewijzigd, had hij de redenering bijna volledig verkeerd (met een score dicht bij 0%). Hij paste met vertrouwen oude regels toe op nieuwe situaties.
- Hij gaf zelden toe: "Ik weet het niet." In plaats daarvan raakte hij gewoon verkeerd.
2. De "tijdwandelende bibliotheek" loste het op
Wanneer de onderzoekers de RAG-methoden gebruikten (de bibliotheek met het strenge datumfilter), steeg de prestatie van de AI enorm.
- Door de AI te dwingen uitsluitend te kijken naar de wetten die op het tijdstip van het gebeurtenis geldig waren, werden de antwoorden accuraat.
- Het maakte niet uit of de AI keek naar een wet uit 2017 of 2025; zolang de "bibliothecaris" de boeken correct filterde, gaf de AI het juiste antwoord.
- Belangrijkste les: De AI hoeft geen nieuwe wetten te "leren"; hij moet alleen worden gedwongen om naar de juiste versie van de wet op het juiste moment te kijken.
3. De "Google-zoekopdracht"-modus was onbetrouwbaar
Het toestaan aan de AI om de live internetpagina's te doorzoeken hielp iets in vergelijking met de "alleen hersenen"-modus, maar introduceerde een nieuw probleem.
- De AI begon een sterke recency-bias te vertonen. Bij vragen over oude zaken haalde de zoekmachine vaak de huidige wet op omdat deze "vers" en populair is online.
- De AI paste vervolgens de huidige wet toe op de oude zaak, waardoor hij het antwoord weer verkeerd kreeg. Hij kon niet weerstaan aan het "glimmende nieuwe speeltje".
Het oordeel
Het artikel concludeert dat voor juridische vragen tijd een harde regel is, geen suggestie.
Je kunt een AI niet gewoon vragen: "Wat is de wet?" en een correct antwoord verwachten. Je moet hem vertellen: "Wat was de wet op deze specifieke datum?" en je moet zijn toegang fysiek beperken tot alleen de documenten uit die tijd.
- Zonder filters: De AI is als een advocaat die alleen de krant van gisteren leest en denkt dat het vandaag is.
- Met filters (RAG): De AI wordt een advocaat die een perfect, georganiseerd archief heeft en precies weet welk boek hij uit de kast moet halen op basis van de datum van het gebeurtenis.
De studie bewijst dat hoewel AI krachtig is, het een "tijdmachine" (een streng datumfilter) nodig heeft om betrouwbaar te zijn in de juridische wereld. Zonder dat is het vatbaar voor het met vertrouwen geven van verouderd of historisch onjuist advies.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.