← Nieuwste papers
🤖 AI

Time Present and Time Past: Benchmarking Large Language Models on Temporally Evolving Document Understanding

Dit artikel introduceert TIDE, een nieuwe door experts geverifieerde benchmark voor het evalueren van grote taalmodellen op het gebied van tijdelijk evoluerend documentbegrip, wat onthult dat huidige modellen aanzienlijk moeite hebben met versieresolutie en vaak de voorkeur geven aan zelfverzekerde parametrische kennis boven autoritatieve, tijdspecifieke tekst.

Oorspronkelijke auteurs: Mahbub E Sobhani, Md. Faiyaz Abdullah Sayeedi, Fahmid Hasan Chowdhury, Md Adnan Arefeen, Farig Sadeque, Md. Faizul Bari, Swakkhar Shatabda

Gepubliceerd 2026-08-11
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Mahbub E Sobhani, Md. Faiyaz Abdullah Sayeedi, Fahmid Hasan Chowdhury, Md Adnan Arefeen, Farig Sadeque, Md. Faizul Bari, Swakkhar Shatabda

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je op zoek bent naar de juiste regel voor een spel, maar het regelboek is een levend wezen dat elke dag verandert. In de wereld van kunstmatige intelligentie zijn er twee belangrijke manieren waarop kennis gewoonlijk wordt beheerd. De eerste manier is als een enorme encyclopedie: als een feit verandert, wordt het oude simpelweg gewist en vervangen door het nieuwe. Als je vraagt naar de hoofdstad van een land dat van naam is veranderd, laat de encyclopedie gewoon de nieuwe naam zien. De tweede manier, die veel lastiger is, is als een stapel juridische contracten of een videogame met patches. Hier verdwijnt een oude regel niet; deze blijft perfect correct voor de periode waarin deze actief was, terwijl een nieuwe regel later het stokje overneemt. Als je vraagt: "Wat was de maximumsnelheid in 2015?", heb je de regel uit 2015 nodig, niet die uit 2025. Als de computer dit fout doet, is het niet zomaar een stomme fout; het kan zijn dat iemand wordt geadviseerd de verkeerde belasting te betalen of een medische richtlijn te volgen die jaren geleden al is ingetrokken. Dit is de uitdaging van "versie-resolutie": uitzoeken welke versie van een regel op een specifieke datum aan de macht was.

Een team van onderzoekers heeft een nieuwe test ontwikkeld genaamd TIDE (Temporal Information Drift in Evolving Documents) om te zien of de slimste AI-computers van vandaag deze lastige tijdreis-logica aankunnen. Ze hebben niet zomaar nepvragen bedacht; ze hebben onderzoek gedaan naar 644 echte, officiële documenten van de overheid van Bangladesh, variërend van douanewetten, belastingwetten en regelgeving van 1969 tot en met 2025. Deze documenten zijn rommelig, mengen Engels en Bengaals, en bevatten een web van amendementen waarbij de ene regel de andere opheft, wat vervolgens weer door een derde wordt opgeheven. De onderzoekers creëerden 3.050 vragen op basis van deze documenten, waarbij ze de AI vroegen te fungeren als een tijdreizende advocaat. Ze testten negen van de krachtigste beschikbare AI-modellen en gaven hen drie verschillende manieren om antwoorden te vinden: vertrouwen op wat ze tijdens hun training hebben onthouden (zoals bij een examen zonder open boek), het lezen van de exacte juiste documenten die aan hen worden verstrekt, of het doorzoeken van een database om de juiste pagina's te vinden.

De resultaten waren een beetje een waarschuwing. Zelfs de beste AI-modellen, wanneer ze de perfecte documenten om te lezen kregen, hadden slechts ongeveer 68,5% van de antwoorden goed. Dat betekent dat ze nog steeds in meer dan één op de drie gevallen faalden, zelfs wanneer het antwoord recht voor hun "ogen" lag. De studie toonde aan dat deze modellen verrassend goed zijn in het vinden van de juiste tekst wanneer ze precies weten waar ze moeten zoeken, maar dat ze er vreselijk slecht in zijn om te beseffen dat een tekst die ze lezen eigenlijk de verkeerde versie is voor de betreffende datum. Bijvoorbeeld, als je een AI een document geeft dat zegt "De belasting is 10%", maar de vraag gaat over een tijd waarin de belasting 5% was, negeert de AI de documentatie vaak vol vertrouwen en houdt hij vast aan zijn geheugen of de verkeerde tekst. Sterker nog, wanneer de onderzoekers probeerden de AI te misleiden met een zelfverzekerde maar onjuiste bewering, waren de modellen erg goed in het signaleren dat er iets mis was (het detecteren van fouten gebeurde in 79% van de gevallen), maar ze waren vreselijk in het precies aanwijzen van wat er precies mis was (het identificeren van de specifieke fout gebeurde slechts in ongeveer 19% van de gevallen). Dit betekent dat ze vaak wel aanvoelen dat er een probleem is, maar dan vol vertrouwen de verkeerde details de schuld geven.

Het paper suggereert dat het simpelweg geven van meer tekst om te lezen of betere zoekinstrumenten aan AI niet genoeg is om dit probleem op te lossen. De modellen worstelen het meest met taken die vereisen dat ze een tijdlijn in elkaar zetten, zoals het sorteren van gebeurtenissen in volgorde of het berekenen wat de regel "drie jaar later" was. Ze hebben de neiging ervan uit te gaan dat regels alleen maar strenger worden of in één richting veranderen, waarbij ze de nuance missen dat wetten ook kunnen worden ingetrokken of terugkeren naar oude versies. Hoewel de onderzoekers lieten zien dat het hebben van de juiste documenten helpt, garandeert het geen succes. De studie concludeert dat "versie-resolutie" een grote, onopgeloste hindernis blijft voor AI. Totdat deze modellen werkelijk het verloop van de tijd in juridische documenten kunnen begrijpen, kunnen ze te riskant zijn om te vertrouwen voor taken in de echte wereld, zoals belastingaangifte of douaneafhandeling, waarbij het fout doen van de datum tot ernstige financiële of juridische problemen kan leiden.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →