← Nieuwste papers
💬 NLP

DynaKRAG: A Unified Framework for Learnable Evidence Control in Multi-Hop Retrieval-Augmented Generation

DynaKRAG is een uniform framework dat multi-hop retrieval-augmented generatie formuleert als een toestandsgeconditioneerd controleprobleem, waarbij een geleerd beleid wordt gebruikt om dynamisch te selecteren uit geldige bewijsoperaties zoals retrieval en query-herformulering, waardoor het bestaande methoden op benchmarks zoals HotpotQA, 2Wiki en MuSiQue overtreft.

Oorspronkelijke auteurs: Yaqi Wu, Xiaolei Guo, Chenyu Zhou, Jiaqi Huang, Xianfa Zhang, Junxu Zhang, Zhuo Yu, Zhubo Shi, Jianghao Lin, Dongdong Ge

Gepubliceerd 2026-07-08
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Yaqi Wu, Xiaolei Guo, Chenyu Zhou, Jiaqi Huang, Xianfa Zhang, Junxu Zhang, Zhuo Yu, Zhubo Shi, Jianghao Lin, Dongdong Ge

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een detective bent die een complexe mystery probeert op te lossen, zoals: "Wie heeft de kroonjuwelen gestolen en waar zijn ze verborgen?"

In de oude manier van werken (standaard AI-systemen) zou de detective een strikt regelboek krijgen: "Bekijk de eerste drie dossiers in de archiefkast. Als je het antwoord niet vindt, kijk dan naar de volgende drie. Stop na vijf dossiers, ongeacht wat er gebeurt." Dit is rigide. Soms geeft het eerste dossier een aanwijzing die de hele richting van het onderzoek verandert, maar het regelboek dwingt je om door te gaan met het bekijken van de verkeerde dossiers.

DynaKRAG is een nieuwe, slimmere manier voor de detective om te werken. In plaats van een vast regelboek te volgen, gebruikt het een flexibele, lerende manager die beslist wat de volgende stap is op basis van wat er tot nu toe is gevonden.

Hier is hoe het werkt, onderverdeeld in eenvoudige concepten:

1. Het Notitieblok van de Detective (De "State")

Elke keer dat de detective een nieuw stuk papier (bewijs) vindt, schrijft hij dit op in een notitieblok. Dit notitieblok is niet zomaar een stapel papieren; het is een levende kaart. Het houdt bij:

  • Wat de oorspronkelijke vraag was.
  • Welke papieren er al zijn gelezen.
  • Welke aanwijzingen er ontbreken (bijv. "Ik ken de naam van de dief, maar ik weet niet waar hij woont").
  • Welke acties er tot nu toe zijn ondernomen.

2. Het Menu van Acties (De "Actions")

Op elk gewenst moment heeft de detective een menu met mogelijke zetten, maar niet alle zetten zijn altijd beschikbaar.

  • De planken doorzoeken: Zoeken naar meer documenten.
  • De vraag herschrijven: Misschien was de oorspronkelijke vraag verwarrend; laten we het anders stellen.
  • Een spoor volgen: Als een document een specifiek persoon vermeldt (een "bridge entity"), zoek dan meer informatie over die persoon.
  • De gaten controleren: Vragen: "Hebben we genoeg informatie om dit nu op te lossen? Zo niet, wat ontbreekt er?"
  • Stoppen en oplossen: Als het bewijs compleet is, schrijf het definitieve antwoord op.

3. Het Tweestaps-Besluitvormingsproces

Dit is het geheime ingrediënt van DynaKRAG. Voordat de detective een zet kiest, gebeuren er twee dingen:

  • Stap A: De Bouncer (Validiteitslaag): Stel je een bouncer voor bij een club. De bouncer kijkt naar de huidige situatie en zegt: "Dat kun je nu niet doen." Bijvoorbeeld, je kunt niet "de vraag herschrijven" als je nog geen documenten hebt gelezen. Je kunt niet "een spoor volgen" als je nog geen spoor hebt gevonden. De bouncer filtert de onmogelijke zetten eruit, waardoor een lijst van geldige opties overblijft.
  • Stap B: De Coach (Learned Controller): Nu de bouncer de lijst met geldige zetten aan de detective heeft overhandigd, komt de Coach in beeld. De Coach heeft geleerd van duizenden eerdere detectivezaken. De Coach kijkt naar het huidige notitieblok en zegt: "Van deze geldige opties is de optie die ons op dit moment het meest efficiënt bij het oplossen van de mystery helpt, om het spoor van het adres van de verdachte te volgen."

4. Waarom dit beter is

  • Geen verspilde inspanning: Oude systemen zoeken misschien door naar antwoorden terwijl ze er al genoeg hebben, of ze blijven steeds weer dezelfde vraag stellen. DynaKRAG weet wanneer het moet stoien.
  • Aanpassen aan de Mystery: Als de eerste aanwijzing een compleet nieuwe invalshoek onthult, schakelt het systeem onmiddellijk van tactiek (zoals het herschrijven van de vraag) in plaats van blind een vooraf ingesteld plan te volgen.
  • Energie besparen: Het systeem is "token-efficiënt". In AI-termen zijn "tokens" woorden of stukjes data die geld en tijd kosten om te verwerken. DynaKRAG stopt met het verzamelen van bewijs op het moment dat het genoeg heeft om de puzzel op te lossen, wat tijd en geld bespaart vergeleken met systemen die gewoon door blijven graven.

De Resultaten

De auteurs hebben deze "slimme detective" getest op drie zeer moeilijke puzzel-datasets (HotpotQA, 2Wiki en MuSiQue).

  • Betere Antwoorden: Het loste meer puzzels correct op dan de vorige beste methoden.
  • Slimmer Besteden: Het gebruikte minder middelen (minder "token"-gebruik) om die betere antwoorden te krijgen.
  • Proof of Concept: Toen ze de "Coach" (de lerende beslisser) verwijderden en het systeem simpelweg willekeurige zetten lieten kiezen uit de geldige lijst, daalde de prestatie aanzienlijk. Dit bewijst dat de keuze van de volgende stap net zo belangrijk is als het vermogen om de stap te kunnen zetten.

Kortom: DynaKRAG verandert de AI van een robot die een rigide script volgt in een flexibele detective die precies weet welk gereedschap hij nu moet gebruiken, gebaseerd op wat hij tot nu toe heeft ontdekt, waardoor hij de mystery oplost met de minste hoeveelheid verspilde inspanning.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →