← Nieuwste papers
💬 NLP

DecomposeRL: Learning to Ask Useful, Informative, and Diverse Questions for Semi-Supervised, Traceable Claim Verification

DecomposeRL is een semi-supervisieerbaar, traceerbaar framework voor claimverificatie dat gebruikmaakt van een data-curatiefunnel en GRPO-gebaseerde versterkende leeromgeving om een compact 7B-model te trainen, waarbij prestaties worden behaald die vergelijkbaar zijn met veel grotere basismodellen, terwijl tegelijkertijd interpreteerbare redeneersporen worden gegenereerd.

Oorspronkelijke auteurs: Shubhashis Roy Dipta, Ankur Padia, Francis Ferraro

Gepubliceerd 2026-05-28
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Shubhashis Roy Dipta, Ankur Padia, Francis Ferraro

Oorspronkelijk artikel vrijgegeven aan het publieke domein onder CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Probleem: De "Zwarte Doos" versus de "Langzame Detective"

Stel je voor dat je een wilde gerucht wilt controleren, zoals: "De auteur van '1984' won de Nobelprijs."

Momenteel zijn er twee manieren waarop computers proberen dit op te lossen:

  1. De "Zwarte Doos" Classificatie: Dit is als een supersnelle bewaker die naar het gerucht kijkt en direct roept: "Onwaar!" Het is snel en meestal juist, maar als je vraagt: "Waarom?" haalt het alleen maar met de schouders. Het geeft je geen bewijs. In situaties met hoge inzet (zoals geneeskunde of politiek) kun je een vonnis niet vertrouwen zonder het bewijs te zien.
  2. De "Langzame Detective" (Decompositie): Dit is als een detective die het gerucht opbreekt in kleine vragen: "Wie schreef 1984?" -> "Heeft die persoon een Nobelprijs gewonnen?" Het schrijft elke stap op, zodat je het bewijs kunt zien. Deze detectives zijn echter vaak traag, maken fouten en hebben moeite om te leren van nieuwe gevallen zonder dat een menselijke leraar hen de hand houdt.

DECOMPOSERL is een nieuw systeem dat probeert het beste van twee werelden te zijn: een snelle, nauwkeurige detective die een duidelijk, controleerbaar spoor van bewijs achterlaat voor elk antwoord.


Hoe Het Werkt: De "Slimme Vraager"

In plaats van gewoon het antwoord te raden, wordt DECOMPOSERL getraind om een Meester Verhoorder te zijn. De taak is niet om de bewering direct te beantwoorden; de taak is om de perfecte set vragen te stellen om de waarheid te achterhalen.

Denk eraan als een spel van 20 Vragen, maar de computer speelt tegen zichzelf om het meest efficiënte pad naar de waarheid te vinden.

1. Het "Beloningssysteem" (De Coach)

Om deze AI te leren goede vragen te stellen, zeiden de onderzoekers niet zomaar "Goed gedaan" of "Slecht gedaan". Ze bouwden een veelzijdig beloningssysteem (zoals een strenge coach met een checklist). De AI krijgt punten alleen als haar vragen aan drie specifieke criteria voldoen:

  • Nuttig (De "Spelveranderer"): Als je deze vraag verwijdert, verandert het uiteindelijke antwoord dan?
    • Analogie: Stel je een jury voor. Als een jurylid vraagt: "Bezat de verdachte een rode auto?" en het vonnis blijft hetzelfde, was die vraag nutteloos. Maar als ze vragen: "Was de verdachte ter plaatse?" en dat verandert het vonnis, dan was die vraag nuttig. DECOMPOSERL houdt alleen vragen die het resultaat daadwerkelijk veranderen.
  • Informatief (De "Alleen Feiten" Regel): De vraag moet beantwoordbaar zijn met alleen de verstrekte bewijslast, en het moet een enkel, duidelijk feit zijn.
    • Analogie: Vragen "Is deze bewering waar?" is een slechte vraag omdat het het probleem alleen maar herhaalt. Vragen "Hoeveel pagina's heeft het boek?" is slecht als de lengte van het boek niet uitmaakt. De AI leert dingen te vragen zoals: "Wie schreef het boek?", wat een specifiek, onderbouwd feit is.
  • Verscheiden (De "Geen Herhaling" Regel): De vragen mogen niet redundant zijn.
    • Analogie: Als je vraagt "Wie schreef het boek?" en vervolgens "Wie is de auteur van het boek?", heb je tijd verspild. De AI leert verschillende vragen te stellen die verschillende delen van de puzzel bestrijken.

2. De "Data Trechter" (De Filter)

Het trainen van een slimme AI vereist meestal miljoenen voorbeelden, wat duur en traag is. De onderzoekers hadden een slimme truc: De Data Trechter.

  • Ze begonnen met een enorme stapel van 155.000 fact-checking voorbeelden van het internet.
  • Ze voerden ze door een reeks filters (zoals een koffiefilter):
    • Filter 1: Gooi beweringen weg die te kort of te lang zijn.
    • Filter 2: Gooi beweringen weg die te makkelijk zijn (zelfs een simpele AI kan ze oplossen) of te rommelig.
    • Filter 3: Verwijder duplicaten.
  • Het Resultaat: Ze destilleerden die enorme stapel tot een kleine, hoogwaardige "essentie" van slechts 5.000 beweringen.
  • Analogie: Stel je voor dat je probeert koken te leren door 155.000 willekeurige gerechten te proeven, waarvan de meeste verbrand of smaakloos zijn. In plaats daarvan filterden de makers van DECOMPOSERL dat naar 5.000 perfecte, chef-kok-achtige recepten. De AI leerde sneller en beter van deze kleine, hoogwaardige set dan van de enorme, rommelige stapel.

3. De "Semi-supervised" Truc (Leren Zonder Leraar)

Normaal gesproken heb je voor het trainen van een AI een mens nodig om elk enkel antwoord te beoordelen (Gouden Labels). Maar mensen zijn traag en duur.

DECOMPOSERL heeft een speciale modus waarin het kan leren zelfs als 90% van de antwoorden niet beoordeeld is.

  • Hoe? Het gebruikt een techniek genaamd Zelf-consistentie. De AI genereert meerdere verschillende "paden" (sets van vragen) voor dezelfde bewering. Als 7 van de 8 paden het eens zijn over het uiteindelijke vonnis, gaat de AI ervan uit dat dat vonnis correct is en gebruikt het het als een "pseudo-label" om zichzelf te leren.
  • Analogie: Stel je een student voor die een toets maakt zonder antwoordmodel. Als de student het probleem op vijf verschillende manieren oplost en elke keer hetzelfde antwoord krijgt, krijgt hij vertrouwen dat hij gelijk heeft, zelfs zonder dat een leraar het controleert.

De Resultaten: Klein maar Krachtig

De onderzoekers testten hun model met 7 miljard parameters (wat relatief klein is in de wereld van AI) tegen veel grotere modellen (32 miljard parameters) en zelfs top-tier propriëtaire systemen zoals GPT-4.

  • Nauwkeurigheid: DECOMPOSERL kwam overeen met de prestaties van modellen 4 keer groter dan zichzelf.
  • Efficiëntie: Het bereikte dit met alleen de kleine, gecureerde dataset van 5.000 beweringen.
  • Succes met Semi-supervised: Zelfs wanneer getraind met slechts 10% gelabelde data (en 90% zelf-beoordeeld), presteerde het nog steeds beter dan alle andere modellen van dezelfde grootte.

De "Trace" (Het Documentatiepad)

Het belangrijkste kenmerk van DECOMPOSERL is dat het je niet zomaar een "Waar/Onwaar" antwoord geeft. Het geeft je een Trace.

  • Analogie: Als een reguliere AI een tovenaar is die een konijn uit een hoed trekt (je ziet het resultaat, maar niet de truc), dan is DECOMPOSERL een tovenaar die je de lege hoed, het konijn en het exacte moment waarop ze het konijn erin deden, stap voor stap laat zien.
  • De output ziet eruit als een gesprek:
    1. Vraag: "Wie schreef 1984?" -> Antwoord: "George Orwell."
    2. Vraag: "Heeft George Orwell de Nobelprijs gewonnen?" -> Antwoord: "Nee, het document zegt dat hij dat niet heeft gedaan."
    3. Vonnis: WEERLEGD (De bewering is onwaar).

Dit stelt mensen in staat het werk te auditeren. Als de AI een fout maakt, kun je naar de "Trace" kijken en precies zien welke vraag of welk antwoord leidde tot de fout.

Samenvatting

DECOMPOSERL is een slim, efficiënt AI-factchecker die leert de juiste vragen te stellen om een puzzel op te lossen. Het gebruikt een "filter" om te leren van een kleine, hoogwaardige dataset en een "zelfcontrole"-systeem om te leren zelfs als het geen leraar heeft. Het resultaat is een systeem dat even nauwkeurig is als enorme supercomputers, maar een duidelijke, stap-voor-stap uitleg produceert van hoe het tot zijn conclusie is gekomen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →