Don't Retrieve, Navigate: Distilling Enterprise Knowledge into Navigable Agent Skills for QA and RAG
Dit paper introduceert Corpus2Skill, een methode die een documentcorpus omzet in een hiërarchische structuur van navigeerbare vaardigheden, waardoor een LLM-agent in plaats van passief te zoeken actief door de kennis kan navigeren en zo superieure prestaties behaalt op enterprise QA-benchmarks.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een enorme bibliotheek binnenstapt, maar in plaats van boeken op een plank te vinden, liggen er miljoenen losse bladzijden door elkaar op de vloer. Als je vraagt: "Hoe verander ik mijn bedrijf van eenmanszaak naar een BV?", gooit de bibliothecaris (de traditionele AI) je een handvol bladzijden toe die de woorden "BV" en "bedrijf" bevatten.
Het probleem? Die bladzijden vertellen je misschien niet dat je überhaupt geen BV kunt worden zonder eerst contact op te nemen met de klantenservice. De AI ziet de losse bladen, maar niet de indeling van de bibliotheek. Ze weet niet welke afdeling waar ligt, en ze kan niet terugkrabbelen als ze op een doodlopende weg zit.
Dit artikel introduceert CORPUS2SKILL, een slimme nieuwe manier om kennis te vinden. In plaats van te zoeken (retrieval), laat het de AI navigeren (navigeren).
Hier is hoe het werkt, vertaald naar alledaagse taal:
1. De Oude Manier: "De Blinden"
Stel je voor dat je een zoekmachine gebruikt die alleen kijkt naar de titel van een boek. Als je zoekt op "recept voor taart", krijg je misschien een recept voor een cake, maar mist het boek dat uitlegt dat je eerst eieren moet kopen. De AI is als een blinde die in het donker naar muren tikt. Het ziet de structuur van de bibliotheek niet, alleen de muren waar het tegenaan loopt.
2. De Nieuwe Manier: De "Digitale Wegwijzer"
CORPUS2SKILL doet iets heel anders. Voordat de AI überhaupt een vraag krijgt, wordt er een groot, digitaal navigatiesysteem gebouwd.
- De Bibliotheek wordt een Boom: De duizenden documenten worden niet meer als losse bladen behandeld. Ze worden in groepjes geplaatst, net als in een goed georganiseerd archief.
- Bovenste laag: Grote vakken zoals "Verkoop", "Marketing" en "Betalingen".
- Middenlaag: Sub-vakken zoals "Creditcards" of "Facturatie".
- Onderste laag: De specifieke documenten zelf.
- Samenvattingen als Wegwijzers: Bij elke stap in deze boom hangt er een bordje (een samenvatting) dat precies zegt: "Hier vind je alles over betalingen" of "Hier gaan we over terugbetalingen".
3. De AI als Verkenner (De "Agent")
Nu komt de AI niet meer als een blinde, maar als een verkenner met een kaart.
- De Vogelperspectief: De AI kijkt eerst naar de grote indeling (de "boom"). Ze ziet direct: "Ah, mijn vraag gaat over het veranderen van een bedrijfstype. Dat zit waarschijnlijk in het vak 'Betalingen' of 'Bedrijfsvoering', niet in 'Marketing'."
- Het Afdalen: Ze loopt niet blindelings. Ze leest het bordje bij "Betalingen". "O, hier staan 87 documenten, waaronder één over 'Bedrijfsstructuur veranderen'."
- Terugkrabbelen: Als ze merkt dat ze in het verkeerde vakje zit (bijvoorbeeld bij 'Verkoop' in plaats van 'Betalingen'), kan ze direct terugkrabbelen en een andere tak van de boom kiezen. Traditionele systemen kunnen dit niet; ze blijven vastzitten in de eerste fout.
- De Schat vinden: Pas als ze precies weet waar ze moet zijn, pakt ze het specifieke document eruit en leest het.
Waarom is dit zo slim?
- Geen gokken: De AI hoeft niet te raden welke zoektermen ze moet gebruiken. Ze volgt gewoon de logische indeling van de kennis.
- Het grote plaatje: Omdat de AI de hele structuur ziet, kan ze dingen combineren. Als een vraag twee onderwerpen combineert (bijv. "Hoe betaal ik voor mijn online cursus?"), ziet de AI dat dit twee verschillende takken van de boom raakt en zoekt ze in beide.
- Geen vector-database nodig: Je hoeft geen ingewikkelde, dure databases te onderhouden om dit te laten werken. Het is gewoon een slimme manier van bestanden ordenen, zoals een mens dat zou doen in een goed georganiseerd bureaublad.
Het Resultaat
In tests (met vragen van klanten van Wix) bleek deze methode veel beter te zijn dan de oude zoekmethodes. De AI gaf nauwkeurigere antwoorden, maakte minder fouten en vond de juiste informatie sneller, omdat ze wist waar ze moest kijken in plaats van alleen te zoeken.
Kortom:
In plaats van de AI een zak met losse puzzelstukjes te geven en te hopen dat ze het plaatje ziet, geven we haar de puzzelkist met de afbeelding op de deksel. Ze kan nu zelf beslissen welk stukje ze eerst pakt, en als ze ziet dat het niet past, legt ze het terug en probeert een ander stukje. Dat is de kracht van navigeren in plaats van zoeken.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.