← Nieuwste papers
💬 NLP

Tokengeist: Multi-Turn Attribution Tracing in Agentic Conversations

Dit artikel introduceert Tokengeist, een schaalbaar framework dat de beperkingen van single-pass attributiemethoden in meerdaagse conversaties aanpakt door recursief token-niveau afhankelijkheden over conversatierondes heen te traceren, waarbij het een aanzienlijk hogere nauwkeurigheid bereikt in het herstellen van complexe herkomstgrafieken vergeleken met bestaande benaderingen.

Oorspronkelijke auteurs: Jessica Tang, Shraddha Barke, Sharad Agarwal

Gepubliceerd 2026-07-28
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Jessica Tang, Shraddha Barke, Sharad Agarwal

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je probeert uit te zoeken waarom je favoriete detective in een tv-serie plotseling besloot een zaak op een specifieke manier op te lossen. Je kent het uiteindelijke antwoord, maar de serie springt door de tijd heen: ze laat de detective zien die met een getuige praat, dan een kaart bekijkt, dan een vriend belt, en tot slot een beslissing neemt. Als je alleen naar de allerlaatste scène zou kijken, zou je denken dat de beslissing voortkwam uit de vriend. Maar wat als de vriend slechts iets herhaalde wat de getuige zei, die de informatie weer van de kaart kreeg? Om de verhalen echt te begrijpen, kun je niet alleen naar het laatste moment kijken; je moet het spoor van aanwijzingen stap voor stap achteruit volgen, door elke conversatie en elke handeling die hiertoe leidde. Dit is het soort puzzel dat wetenschappers proberen op te lossen met Kunstmatige Intelligentie (AI).

In de wereld van AI, specifiek bij Large Language Models (de superintelligente chatbots die we vandaag de dag gebruiken), is er een groeiend probleem. Deze modellen hebben vaak lange gesprekken met ons, waarbij ze vragen stellen, wij antwoorden, zij een database controleren, en dan een definitief antwoord geven. Soms hangt dat uiteindelijke antwoord af van een klein detail dat we vijf beurten geleden noemden, dat het model vervolgens samenvatte, dat het model vervolgens gebruikte om een tool aan te roepen, wat uiteindelijk leidde tot het antwoord. De grote vraag is: hoe kunnen we precies zien welke delen van dat lange gesprek de vorm gaven aan het uiteindelijke antwoord? Momenteel werken de meeste hulpmiddelen die deze vraag proberen te beantwoorden als een zaklamp die slechts op de onmiddellijke kamer schijnt. Ze kunnen je vertellen welke woorden in de hele chat belangrijk lijken, maar ze missen de "verhaallijn" van hoe informatie van het begin naar het einde reisde. Dit is van belang omdat als we niet kunnen traceren waar een AI zijn feiten vandaan heeft gekregen, we het niet kunnen vertrouwen, de fouten niet kunnen herstellen of kunnen begrijpen waarom de AI tegen ons liegt.

Maak kennis met Tokengeist, een nieuwe methode geïntroduceerd door onderzoekers Jessica Tang, Shraddha Barke en Sharad Agarwal. Denk aan de oude manier om de gedachten van AI te traceren als een "platte" kaart. Als je een platte kaart vraagt om de bron van een gerucht te vinden, wijst hij misschien naar de persoon die het gerucht als laatste aan jou vertelde, maar het zal je niet vertellen wie hen het vertelde. De onderzoekers noemen dit falen "provenance collapse" (herkomstinstorting). Het is als een spelletje telefoontje waarbij de laatste speler de schuld krijgt van de boodschap, ook al werd de boodschap drie mensen eerder al vervormd. De platte methode reduceert de hele geschiedenis tot één enkele laag, waardoor de diepe, meerstaps reis van de informatie wordt gemist.

Om dit op te lossen, bouwde het team Tokengeist, dat fungeert als een recursieve detective. In plaats van alleen naar het uiteindelijke antwoord te kijken en te vragen: "Met wie heb je gesproken?", vraagt Tokengeist: "Met wie heb je gesproken?" en vervolgens, voor elke persoon die je noemde: "En met wie hebben zij gesproken?". Het blijft stap voor stap achteruit graven door de beurten van het gesprek. Het behandelt het gesprek als een vertakkende boom (of een stamboom van ideeën), waarbij het de takken terug volgt naar de allereerste bladeren—de oorspronkelijke gebruikersinputs of toolresultaten.

De onderzoekers testten dit idee met behulp van een nieuwe benchmark die zij zelf hebben ontwikkeld, genaamd MTCABENCH, die 3.845 specifieke onderdelen van antwoorden bevat uit 665 verschillende meerbeurtige conversaties. Deze conversaties waren lastig en involveerden tools zoals het boeken van vluchten of het controleren van bankrekeningen, waarbij de AI informatie uit vele stappen moest samenvoegen. Ze ontdekten dat de oude "platte" methoden verschrikkelijk waren. Wanneer gevraagd werd om de oorspronkelijke bron van informatie te vinden, slaagden de platte methoden er minder dan 20% van de tijd in. Ze bleven telkens steken in het midden van het verhaal.

In contrast hiermee was Tokengeist een game-changer. Door recursief het pad achteruit te volgen, vond het de oorspronkelijke bron van de informatie in meer dan 90% van de gevallen. Het gokte niet alleen; het bracht de volledige reis in kaart. Bijvoorbeeld, als een AI zegt: "U kunt uw vlucht annuleren omdat u een verzekering heeft", zou een platte methode misschien alleen naar de bevestiging van de annulering wijzen. Tokengeist daarentegen traceerde het terug naar het toolresultaat dat de verzekering toonde, en vervolgens terug naar de gebruikers-ID die dat toolresultaat ontsloot, en uiteindelijk terug naar de oorspronkelijke aanvraag van de gebruiker.

Het paper suggereert dat deze recursieve aanpak de sleutel is tot transparante AI. Het laat zien dat het simpelweg bekijken van het hele gesprek tegelijkertijd niet genoeg is; we moeten de structuur van het gesprek begrijpen, hoe de ene beurt afhankelijk is van de andere. Hoewel de methode het beste werkt met de specifieke AI-modellen die zij hebben getest (die open-source en relatief klein zijn), suggereren de resultaten sterk dat voor complexe, meerstaps AI-agenten, we de gesprekken niet langer als een platte lijst van woorden moeten behandelen, maar als een verbonden web van afhankelijkheden. Tokengeist vertelt ons niet alleen wat de AI heeft gezegd; het helpt ons het hele verhaal te begrijpen van hoe het tot die uitspraak kwam.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →