← Nieuwste papers
💬 NLP

Traceable by Design: An LLM Pipeline and Dashboard for EU Regulatory Consultation Analysis

Dit artikel presenteert een traceerbare, op LLM gebaseerde pijplijn en een interactief dashboard die de analyse van grootschalige consultatiebijdragen over regelgeving automatiseert door gegrondeerde onderwerpannotaties met letterlijke bewijsvoering te extraheren, aangetoond door middel van een casestudy over de Digital Fairness Act van de Europese Commissie die inzichten onthulde die verder gingen dan vooraf gedefinieerde taxonomieën.

Oorspronkelijke auteurs: Thales Bertaglia, Haoyang Gui, Catalina Goanta, Gerasimos Spanakis

Gepubliceerd 2026-06-01
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Thales Bertaglia, Haoyang Gui, Catalina Goanta, Gerasimos Spanakis

Oorspronkelijk artikel vrijgegeven aan het publieke domein onder CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat de Europese Unie een enorme nieuwe set regels voor het internet plant, genaamd de Digital Fairness Act. Voordat ze de definitieve regels schrijven, vragen ze het publiek: "Wat vindt u hiervan?" Dit wordt een "publieke consultatie" genoemd.

Het probleem? Mensen hebben 4.322 reacties ingestuurd. Sommige waren korte notities getypt in een webformulier; andere waren lange, meer pagina's tellende PDF-documenten. Al deze reacties handmatig proberen te lezen en te begrijpen, is alsof je uit een brandslang probeert te drinken—het is voor een mens onmogelijk zonder dingen te missen of overweldigd te raken.

Dit artikel introduceert een slimme digitale assistent (een AI-pipeline en een dashboard) die is ontworpen om al die reacties te lezen, te begrijpen waar mensen het over hebben en precies te bewijzen waar het die informatie heeft gevonden.

Zo werkt het systeem, eenvoudig uitgelegd:

1. De "Slimme Bibliothecaris" Pipeline

Beschouw het systeem als een zeer georganiseerde, supersnelle bibliothecaris die nooit moe wordt.

  • De Input: De bibliothecaris neemt twee soorten boeken in ontvangst: de rommelige, gescande PDF's (die "gelezen" moeten worden met een speciale camera genaamd OCR) en de schone, getypte webformulieren.
  • Het Schoonmaken: Voordat er gelezen wordt, veegt de bibliothecaris de vloer schoon. Ze verwijderen paginanummers, koppen, voetteksten en onzintekst die vaak voorkomt bij het scannen van documenten. Ze controleren ook of een pagina daadwerkelijk leesbaar is. Als een pagina te rommelig is, markeren ze deze, maar proberen ze toch de rest te verwerken.
  • Het Hakken: De bibliothecaris snijdt de lange documenten in kleine, hanteerbare "paragraaf-chunks". Ze houden alleen de stukjes over die zinvol zijn en genoeg woorden bevatten om nuttig te zijn.
  • Het Lezen (Het AI-gedeelte): Dit is waar het "Large Language Model" (de hersenen van de operatie) in beeld komt. Het leest elke schone paragraaf en stelt twee vragen:
    1. Waar gaat dit onderwerp over? (bijv. "Gaat dit over oneerlijke abonnementen?")
    2. Wat is de exacte zin die dit bewijst?

2. De Gouden Regel: "Laat je werk zien"

De meeste AI-tools vatten zaken samen. Als je hen vraagt: "Wat zeiden mensen over wachtwoorden?", kunnen ze zeggen: "Mensen maken zich zorgen over beveiliging."

Dit systeem weigert te samenvatten. Het volgt een strikte regel genaamd Verbatim Grounding (letterlijke onderbouwing).

  • De Analogie: Stel je een detective voor in een rechtszaal. Als de detective zegt: "De verdachte was op de plaats delict," eist de rechter fotobewijs te zien. De detective kan niet alleen zeggen: "Ik denk het maar zo."
  • Hoe het hier werkt: Elke keer dat de AI een onderwerp vindt, moet deze de exacte zin uit het originele document kopiëren en plakken die het bewijst. De AI mag geen samenvatting verzinnen. Als de AI geen exacte quote kan vinden, maakt hij geen bewering. Dit zorgt ervoor dat als een beleidsmaker het werk wil controleren, hij op een knop kan klikken om de originele zin in het originele document te zien.

3. Het Dashboard: De "Controlekamer"

De resultaten worden weergegeven op een website (het dashboard) die fungeert als een controlekamer voor beleidsmakers.

  • Het Grote Plaatje: Je kunt een kaart zien van alle onderwerpen. Sommige zijn "Predefined" (onderwerpen waar de EU al van wist, zoals "Dark Patterns"). Anderen zijn "Emergent" (nieuwe onderwerpen die de AI heeft gevonden en waar de EU niet expliciet naar heeft gevraagd, zoals "Leeftijdsverificatie" of "Digitaal Eigendom").
  • De Drill-Down: Je kunt op een specifiek onderwerp klikken (zoals "Censuur door betalingsverwerkers") en precies zien welke bedrijven of landen dit hebben genoemd.
  • De Traceerbaarheid: Als je een statistiek op het scherm ziet, kun je deze via het systeem terugleiden naar de specifieke paragraaf in het originele PDF-document waar het vandaan komt. Niets is verborgen.

4. Waarom dit belangrijk is

De auteurs hebben dit getest op de gegevens van de Digital Fairness Act.

  • Het Resultaat: Het systeem verwerkte 4.322 documenten en vond 15.368 specifieke onderwerpen, ondersteund door 20.951 exacte citaten.
  • De Verrassing: Omdat het systeem niet werd gedwongen om zich aan een rigide lijst van onderwerpen te houden, vond het nieuwe zorgen die een mens met een simpele checklist over het hoofd zou hebben gezien. Bijvoorbeeld merkte het systeem op dat mensen bezorgd waren over "Censuur door betalingsverwerkers" (banken die betalingen naar bepaalde sites blokkeren) en "Digitaal Eigendom" (wie bezit hun digitale items eigenlijk).
  • De Flexibiliteit: Het systeem is "domein-generiek". Dit betekent dat als de EU volgend jaar over een ander wetboek wil vragen, ze de machine niet opnieuw hoeven op te bouwen. Ze hoeven alleen de "gebruiksaanwijzing" (de prompt) te veranderen en nieuwe documenten in te voeren.

Samenvatting

Dit artikel beschrijft een hulpmiddel dat een chaotische berg publieke feedback verandert in een heldere, georganiseerde en bewijsbare lijst van zorgen. Het vertelt je niet alleen wat mensen vinden; het laat je precies zien waar ze het zeiden, wat ervoor zorgt dat de besluitvormers de bewijzen kunnen vertrouwen omdat ze de broncode van het gesprek kunnen inzien.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →