CTRAG: An In-Context Retrieval-based Framework for Automated Compliance Checking using LLMs
Dit artikel introduceert CTRAG, een nieuw Retrieval-Augmented Generation-framework dat adaptieve chunking, dynamische retrieval en in-context learning benut om de nauwkeurigheid van verificatie van naleving van regelgeving door het kruisverwijzen van controlevragen met bedrijfsdocumentatie te automatiseren en aanzienlijk te verbeteren, zoals gevalideerd door een succesvolle real-world implementatie bij een Big Four professioneel dienstverleningsbedrijf.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een detective bent die een mysterie probeert op te lossen, maar in plaats van een plaats delict, is je "misdaad" een bedrijf dat de regels overtreedt. In de zakenwereld zijn er duizenden regels—zoals een gigantisch, onzichtbaar regelboek over hoe men met geld moet omgaan, geheimen moet beschermen of data veilig moet houden. Controleren of een bedrijf zich aan deze regels houdt, wordt "compliance" genoemd. Traditioneel valt deze taak toe aan menselijke auditors die door bergen rommelige papierwerk moeten bladeren, op zoek naar kleine aanwijzingen die bewijzen dat het bedrijf zich aan de regels houdt. Het is traag, saai en mensen worden moe, wat betekent dat ze soms aanwijzingen missen of in de war raken.
Betreed de wereld van Kunstmatige Intelligentie, specificaal een type slimme computerbrein genaamd een Large Language Model (LLM). Denk aan een LLM als een supersnelle lezer die bijna alles in de wereld heeft gelezen en kan praten als een mens. Er is echter een addertje onder het gras: deze slimme breinen verzinnen soms dingen (dit wordt "hallucinaties" genoemd) of vergeten specifieke feiten omdat ze vertrouwen op wat ze hebben onthouden in plaats van op wat er direct voor hen ligt. Om dit op te lossen, gebruiken wetenschappers een truc genaamd "Retrieval-Augmented Generation" (RAG). Stel je voor dat je de detective een zaklamp geeft en een stapel specifieke bestanden om doorheen te zoeken voordat hij zijn rapport schrijft. De AI zoekt eerst de feiten op in de documenten en gebruikt vervolgens zijn brein om het antwoord te schrijven. Dit paper onderzoekt hoe je die zoekopdracht met de zaklamp en het uiteindelijke rapport zo perfect mogelijk kunt maken voor het controleren of bedrijven de regels volgen.
De Nieuwe Gereedschapskist van de Detective: CTRAG
De onderzoekers achter dit paper, werkend samen met een groot professioneel dienstverleningsbedrijf, hebben een nieuw systeem gebouwd genaamd CTRAG. Zie CTRAG als een hoogtechnologische compliance-detective, ontworpen om de saaie, tijdrovende taak te automatiseren van het controleren of een bedrijf de regels volgt. In plaats van een mens die urenlang door PDF's bladert, neemt CTRAG de regels (die als vragen zijn geformuleerd) en zoekt door de documenten van het bedrijf om de antwoorden te vinden.
Het hoofddoel van het paper was om uit te zoeken wat de beste manier is om deze AI-detective te leren zoeken. Ze testten verschillende strategieën om te zien welke de AI hielp om de juiste aanwijzingen te vinden zonder afgeleid te worden door irrelevante ruis.
De "Chunking" Puzzel: Hoe snijd je de taart?
Een van de grootste uitdagingen was hoe de bedrijfsdocumenten op te knippen. Stel je voor dat je een roman van 500 pagina's hebt en je moet een specifieke zin vinden. Als je het boek in kleine stukjes van 200 tekens snijdt (zoals een pagina in postzegels snijden), verlies je misschien de context van het verhaal. Als je het in enorme stukken van 3000 tekens snijdt (zoals het hele boek in tweeën snijden), krijg je misschien zoveel extra tekst dat de specifieke aanwijzing verloren gaat in een zee van woorden.
Het team testte verschillende "chunk sizes" (hoe groot de stukjes tekst zijn):
- Hele kleine stukjes (200 tekens): Deze waren te klein en gefragmenteerd. De AI raakte in de war omdat het niet het hele plaatje kon zien.
- Enorme stukken (3000 tekens): Deze waren te rommelig. De AI raakte overweldigd door te veel informatie, alsof je een naald in een hooiberg probeert te vinden waarbij de hooiberg in brand staat.
- De Sweet Spot: Ze ontdekten dat kleine stukjes (rond de 800 tekens) het beste werkten. Het was alsof je het boek in beheersbare paragrafen sneed. Deze grootte was precies goed om de context helder te houden zonder de AI te verdrinken in ruis.
Ze probeerden ook een geavanceerde methode genaamd "Meta-chunking", die probeert de tekst te snijden op basis van logische verhaalsprongen in plaats van alleen maar te snijden op een specifiek aantal tekens. Hoewel dit slim klonk, bleek het te traag en computationeel te duur voor deze specifieke taak, dus ze hielden vast aan de simpelere, vaste grootte van de stukken.
De "Zaklamp" Instelling: Hoeveel bestanden te controleren?
Wanneer de AI een vraag stelt, moet hij beslissen hoeveel documentfragmenten hij moet ophalen om het antwoord te geven. Dit wordt de K-waarde (of top-K) genoemd.
- Als de AI slechts 1 fragment bekijkt, mist hij misschien het antwoord als het in het tweede bestand verborgen zit.
- Als hij naar 5 fragmenten kijkt, kan hij in de war raken door extra, irrelevante details.
- De onderzoekers ontdekten dat het bekijken van 4 fragmenten (K=4) de perfecte balans was. Het gaf de AI genoeg bewijs om een beslissing te nemen zonder afgeleid te worden.
De AI leren denken als een mens
De grootste doorbraak kwam van een techniek genaamd In-Context Learning (ICL). Stel je voor dat je een nieuwe stagiair leert hoe hij een zaak moet oplossen. Je zegt niet alleen "zoek de regel"; je laat voorbeelden zien: "Hier is een geval waarbij een bedrijf een cloudprovider gebruikte, en hier is waarom dat telt als 'Pass' zelfs al heeft het bedrijf het werk niet zelf gedaan."
De AI had moeite met "indirecte compliance"—situaties waarin een bedrijf een regel volgt omdat hun leverancier (zoals een cloudprovider) dat doet. Zonder hulp zou de AI "Fail" zeggen omdat het bedrijf de actie niet direct heeft uitgevoerd. Maar door de AI een paar zorgvuldig gekozen voorbeelden te voeden (zoals een referentieblad met eerdere gevallen), leerde de AI menselijk oordeel na te bootsen. De AI realiseerde zich: "Ah, als de leverancier voldoet aan de regels, dan telt dat ook voor ons!"
De Resultaten: Sneller, Slimmer en Nauwkeuriger
Toen ze CTRAG testten in een real-world scenario met een "Big Four" professioneel dienstverleningsbedrijf, waren de resultaten indrukwekkend:
- Nauwkeurigheid: Het systeem behaalde een F1-score van 78% en een recall van 85%. In detective-termen betekent dit dat het 85% van de werkelijke overtredingen vond en niet veel miste.
- Efficiëntie: Het systeem verminderde het handmatige werk voor menselijke beoordelaars met ongeveer 60%.
- De "Geen Bewijs" Fix: Een lastig probleem was wanneer de AI geen informatie in de documenten kon vinden. In plaats van te gokken, werd het systeem geprogrammeerd om "Geen Bewijs" te behandelen als "Niet-Compliant". De logica is simpel: als je in je documenten niet kunt bewijzen dat je de regel hebt gevolgd, heb je de regel waarschijnlijk niet nageleefd. Door deze "Geen Bewijs"-gevallen te herclassificeren als fouten, ving het systeem veel potentiële overtreders die het anders gemist zou hebben. Deze cruciale stap stelde het systeem in staat om die hoge recall van 85% te bereiken zonder de AI opnieuw te hoeven trainen.
Wat ze hebben uitgesloten
Het paper was heel duidelijk over wat niet werkte:
- Kleine stukjes (200 tekens) waren een slecht idee; ze braken de context te veel af.
- Enorme stukken (3000 tekens) en Meta-chunking waren te luidruchtig of te traag om praktisch bruikbaar te zijn voor deze specifieke taak.
- Direct prompting (gewoon de AI vragen zonder voorbeelden) was niet voldoende voor lastige gevallen waarbij externe leveranciers betrokken waren.
De Conclusie
De auteurs suggereren dat CTRAG een krachtig hulpmiddel is om compliance-controles te stroomlijnen, maar ze zijn voorzichtig om het geen "opgelost probleem" te noemen. Ze merken op dat hun tests gebaseerd waren op 240 regels en 45 documenten van één enkele organisatie. Hoewel de resultaten veelbelovend zijn en suggereren dat deze aanpak kan worden opgeschaald naar andere bedrijven en taken (zoals het controleren van contracten), is er meer testen nodig in verschillende sectoren om te verzekeren dat het overal werkt.
Kortom, CTRAG laat zien dat door AI de juiste grootte van de "stukjes" informatie te geven, de juiste aantal "zaklamp"-stralen, en een paar "referentiebladen" met voorbeelden, we een systeem kunnen bouwen dat mensen helpt de regels sneller en met minder fouten te controleren. Het is geen magie, maar een zeer slimme manier om technologie te gebruiken om de bedrijfswereld eerlijk te houden.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.