← Nieuwste papers
💬 NLP

W-RAG: Source-Aware Retrieval for Enterprise Document Generation from Heterogeneous Knowledge Bases

Dit artikel introduceert W-RAG, een bronbewuste retrieval-framework dat de beperkingen van globale rangschikking in heterogene enterprise kennisbanken aanpakt door middel van ontologiegestuurde retrieval en bronniveau-weging om de documentdekking en generatiekwaliteit te verbeteren.

Oorspronkelijke auteurs: Hridya Dhulipala, Rajesh Ombase, Michael Wang, Tien N. Nguyen

Gepubliceerd 2026-08-25
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Hridya Dhulipala, Rajesh Ombase, Michael Wang, Tien N. Nguyen

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

In de moderne werkomgeving vereist het schrijven van complexe documenten, zoals beleidsmanuals, fusierapporten of productlanceringplannen, vaak het samenbrengen van informatie uit veel verschillende bronnen. Een team moet bijvoorbeeld tegelijkertijd interne bedrijfsregels, wetenschappelijke onderzoeksartikelen, overheidsvoorschriften en marktnieuws raadplegen. Om dit te vergemakkelijken, hebben computerwetenschappers systemen ontwikkeld waarmee kunstmatige intelligentie feiten kan opzoeken voordat het een zin schrijft. Deze aanpak, bekend als retrieval-augmented generation (verrijkte generatie door middel van gegevensopvraging), werkt als een digitale assistent die een bibliotheek aan documenten leest en die aantekeningen gebruikt om een reactie op te stellen. Het doel is om de AI nauwkeuriger en steviger verankerd in de realiteit te maken, om te voorkomen dat het feiten verzint. Er ontstaat echter een aanzienlijk probleem wanneer deze systemen proberen informatie te verzamelen uit verschillende soorten bibliotheken tegelijkertijd.

De uitdaging is dat niet alle informatiebronnen gelijk zijn en dat ze niet allemaal dezelfde rol spelen in een enkel document. Een standaard systeem behandelt elke tekst die het vindt vaak alsof deze deelneemt aan één enkele race, waarbij de beste resultaten worden gekozen op basis van hoe nauw de woorden overeenkomen met de vraag van de gebruiker. In een zakelijke omgeving schiet deze methode vaak tekort. Het kan honderden pagina's aan algemeen nieuws ophalen omdat ze de juiste trefwoorden bevatten, terwijl het een enkele, cruciale paragraaf uit een specifieke overheidsverordening of een technische veiligheidsrichtlijn volledig negeert. Het resultaat is een concept dat vloeiend klinkt, maar de essentiële, gespecialiseerde details mist die nodig zijn om het document juridisch of technisch geldig te maken. De context van de AI wordt gedomineerd door één type bron, waardoor de diverse bewijslast die nodig is om een compleet beeld te vormen, wordt weggelaten.

Onderzoekers Hridya Dhulipala, Rajesh Ombase, Michael Wang en Tien N. Nguyen zetten zich in om dit specifieke probleem op te lossen. Ze stelden een nieuw framework voor genaamd W-RAG, wat staat voor source-aware retrieval (bronbewuste gegevensopvraging). In plaats van alle documenten uit alle bibliotheken tegen elkaar te laten strijden in één grote vijver, organiseert dit nieuwe systeem het zoekproces. Het identificeert eerst de specifieke thema's die voor het document vereist zijn, zoals "gegevensprivacy" of "financiële naleving", en gebruikt een gestructureerde kaart van concepten om relevante passages te vinden. Vervolgens, in plaats van alles gezamenlijk te rangschikken, rangschikt het de beste documenten binnen elke specifieke bibliotheek afzonderlijk. Ten slotte wijst het een specifiek budget toe aan elke bibliotheek, waarbij wordt bepaald hoeveel ruimte in het definitieve document precies moet worden ingevuld door bedrijfsrapporten, hoeveel door wetenschappelijke artikelen en hoeveel door juridische teksten. Dit zorgt ervoor dat het definitieve concept een gebalanceerde compositie van bewijs is, die de werkelijke behoeften van de taak weerspiegelt in plaats van alleen het volume van de beschikbare tekst.

Om te testen of deze aanpak daadwerkelijk werkte, creëerde het team een nieuwe dataset die specifiek is ontworpen voor dit soort zakelijk schrijven. Ze construeerden honderd realistische scenario's, variërend van het opstellen van gezondheidsbeleid tot het voorbereiden van fusie- en overnameverslagen. Voor elk scenario bouwden ze vier afzonderlijke bibliotheken met informatie: één met bedrijfsverslagen en operationele handleidingen, een andere met wetenschappelijk onderzoek, een derde met juridische en regelgevende teksten, en een vierde met marktnieuws en sectorrapporten. Vervolgens lieten ze de AI documenten schrijven op basis van deze gemengde bronnen. De onderzoekers ontdekten dat standaard systemen, die simpelweg de topresultaten uit een globale lijst selecteren, aanzienlijk moeite hadden. Deze systemen produceerden vaak documenten die weliswaar vloeiend waren, maar incompleet, omdat ze de verplichtingen van de taak niet hadden voldaan omdat ze de kleinere, gespecialiseerde bibliotheken hadden genegeerd.

De resultaten toonden een duidelijk verschil wanneer de nieuwe bronbewuste methode werd gebruikt. Door het systeem te dwingen de onderscheidende rollen van elke kennisbank te respecteren, verbeterde de kwaliteit van de gegenereerde documenten drastisch. De nieuwe aanpak verhoogde de voldoening van de documentvereisten met meer dan vijftig procent vergeleken met de voorheen beste methoden, en met meer dan honderd procent vergeleken met standaard systemen. Het zorgde er ook voor dat de informatie die werd gebruikt om het document te schrijven, afkomstig was uit de juiste mix van bronnen, in plaats van scheef getrokken te worden naar de grootste of meest tekstrijke bibliotheek. De studie suggereert dat voor complexe, real-world schrijftaken de manier waarop informatie wordt geselecteerd en gebalanceerd net zo belangrijk is als het vermogen om het te vinden. Door de compositie van bewijsmateriaal zorgvuldig te beheren, kan het systeem concepten produceren die niet alleen feitelijk onderbouwd zijn, maar ook structureel compleet zijn, en zo voldoen aan de diverse behoeften van het moderne zakelijke schrijven.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →