← Nieuwste papers
🤖 AI

One Retrieval to Cover Them All: Co-occurrence-Aware Knowledge Base Reorganization for Session-Level RAG

Dit artikel stelt een methode voor voor de reorganisatie van kennisbases die rekening houdt met co-occurrentie, wat de dekking en efficiëntie op sessieniveau voor enterprise RAG-systemen aanzienlijk verbetert door gerelateerde documenten te clusteren en query-kandidaten uit te breiden, waarbij wordt beargumenteerd dat dekking op sessieniveau de primaire evaluatiemethode moet vervangen voor recall op enkelvoudige queries.

Oorspronkelijke auteurs: Shivam Ratnakar, Yixuan Zhu, Cecilia Cheng, Chaya Vijayakumar

Gepubliceerd 2026-07-01
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Shivam Ratnakar, Yixuan Zhu, Cecilia Cheng, Chaya Vijayakumar

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een complex probleem met je website probeert op te lossen, zoals het opzetten van een nieuwe webshop. Je moet vier dingen doen: je domeinnaam koppelen, een designtemplate kiezen, betalingen instellen en e-mail configureren.

In een standaard AI-systeem (genaamd RAG) gedraagt de computer zich als een bibliothecaris die alleen boeken kan vinden die precies lijken op de vraag die je stelt.

  • Je vraagt: "Hoe koppel ik mijn domein?"
  • De bibliothecaris vindt drie artikelen over domeinen.
  • Het Probleem: De bibliothecaris beseft niet dat je op dit moment ook de artikelen over templates en betalingen nodig hebt. Die artikelen staan op volledig andere planken in de bibliotheek. Om die te krijgen, moet je vier aparte vragen stellen, wachten tot de bibliothecaris ze telkens opnieuw heeft gevonden, en hopen dat hij het elke keer goed doet.

De auteurs van dit artikel noemen dit een "blind spot" (blinde vlek). Ze ontdekten dat een standaard systeem slechts ongeveer 41% van de informatie die je daadwerkelijk nodig hebt, in één keer vindt.

De Oplossing: Een Nieuwe Manier om de Bibliotheek te Organiseren

De onderzoekers stellen een slimme truc voor: reorganiseer de bibliotheek op basis van wat mensen samen doen, niet alleen op hoe de boeken eruitzien.

Denk aan een supermarkt.

  • Standaard Systeem: Het plaatst "Melk" naast "Kaas" omdat ze beide witte zuivelproducten zijn (semantische gelijkenis).
  • Dit Nieuwe Systeem: Het merkt op dat mensen die "Melk" kopen, ook bijna altijd "Ontbijtgranen" en "Aardbeien" kopen (co-occurrence), ook al lijken melk en aardbeien niet op elkaar. Daarom verplaatst het de Ontbijtgranen en de Aardbeien naar dezelfde gang als de Melk.

Hoe het werkt (De Eenvoudige Stappen)

  1. Offline Reorganisatie (De "Nachtdienst"): Voordat er iemand een vraag stelt, bekijkt het systeem duizenden eerdere gebruikerssessies. Het ziet dat wanneer mensen vragen over domeinen, ze vaak ook hulp nodig hebben bij templates en betalingen. Het groepeert deze ongerelateerde onderwerpen samen in "clusters" of "buurten".
  2. Online Retrieval (De "Dagdienst"): Wanneer jij je vraag stelt, doet het systeem twee dingen:
    • Het vindt het meest voor de hand liggende antwoord (zoals de standaard bibliothecaris).
    • De Magische Stap: Het kijkt onmiddellijk naar de "buurt" waar dat antwoord leeft en pakt de andere items uit die cluster (de templates en betalingen), zelfs als ze niet op je vraag lijken.
  3. Het Resultaat: In plaats van je alleen de artikelen over het domein te geven, geeft het je de artikelen over het domein plus de artikelen over de template en de betalingen in één enkel antwoord.

Waarom dit Belangrijk is

De onderzoekers hebben dit getest op een echte enterprise kennisbank met meer dan 6.000 artikelen. Dit is wat ze vonden:

  • Eén oproep, meer antwoorden: In plaats van vier aparte vragen nodig te hebben om alle informatie te krijgen, dekt een enkele vraag nu 58% van de behoeften van de gebruiker (omhoog van 41%).
  • Minder stappen: Om 70% van de informatie die je nodig hebt te verkrijgen, hebben gebruikers nu 34% minder vragen nodig. Het is alsolijk je boodschappenronde in één keer afronden in plaats van in vier.
  • Kleinere Bibliotheek: Omdat het systeem zaken efficiënt groepeert, kan het de effectieve grootte van de kennisbank verkleinen tot 20% van de oorspronkelijke grootte, terwijl het nog steeds de juiste antwoorden vindt.
  • Werkt Overal: Deze truc werkte ongeacht welk "brein" (AI-model) ze gebruikten om de woorden te begrijpen, en het werkte over zes verschillende soorten onderwerpen heen (zoals betalingen, e-mail en design).

De Afweging

De auteurs geven toe dat er een kleine prijs aan verbonden is. Omdat ze een breder net uitwerpen, is het soms zo dat het allereerste antwoord iets minder perfect is dan voorheen (een daling in precisie van 96% naar 93%). Ze argumenteren echter dat dit een goede afweging is. Het is veel beter om 58% van de oplossing direct voor je te hebben, dan het "perfecte" enkele antwoord te hebben en vervolgens nog drie vragen te moeten stellen om de rest te krijgen.

Wat Ze Niet Beweren

  • Ze beweren niet dat dit werkt voor eenmalige vragen waarbij geen vervolg volgt (zoals een quizvraag).
  • Ze beweren niet dat dit het uiteindelijke geschreven antwoord van de AI perfect maakt; ze hebben alleen gemeten of de juiste documenten werden gevonden.
  • Ze hebben geen echte gebruikerslogs gebruikt voor de training (vanwege privacy), maar in plaats daarvan expert-gelabelde data en gesimuleerde gebruikerspaden gebruikt om het systeem te leren hoe het dingen moet groeperen.

Kortom: dit paper suggereert dat we voor complexe, echte problemen niet alleen de AI moeten vragen om het "meest gelijkaardige" document te vinden. We moeten de AI leren om de "meest behulpzame groep" documenten te vinden op basis van hoe mensen ze samen gebruiken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →