← Nieuwste papers
💬 NLP

Reasoning Graphs: Deterministic Agent Accuracy through Evidence-Centric Chain-of-Thought Feedback

Dit paper introduceert 'reasoning graphs', een structurele methode die de nauwkeurigheid en consistentie van taalmodel-agenten verbetert door ketens van redenering te koppelen aan specifieke bewijsstukken in plaats van aan vragen, waardoor een zelflerend feedbacksysteem ontstaat dat zonder hertraining de prestaties op multi-hop vraagbeantwoording aanzienlijk verhoogt.

Oorspronkelijke auteurs: Matthew Penaroza

Gepubliceerd 2026-04-10
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Matthew Penaroza

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een slimme assistent hebt die antwoorden zoekt voor je. Tot nu toe werkte deze assistent als een amnesiërt: elke keer als je een vraag stelde, vergeet hij alles wat hij eerder had geleerd. Hij pakt een boek, bladert erdoorheen, probeert een antwoord te vinden, en als hij klaar is, gooit hij zijn notities in de prullenbak. De volgende keer dat je een soortgelijke vraag stelt, begint hij weer helemaal bij nul, alsof hij de vorige keer nooit heeft bestaan.

Dit leidt tot twee grote problemen:

  1. Hij maakt dezelfde fouten steeds opnieuw.
  2. Hij is onvoorspelbaar: soms geeft hij het juiste antwoord, soms niet, zelfs bij exact dezelfde vraag.

De auteurs van dit paper, Matthew Penaroza en collega's, hebben een oplossing bedacht die ze "Reasoning Graphs" (Redeneer-Graphs) noemen. Laten we dit uitleggen met een paar creatieve vergelijkingen.

De Grote Verandering: Van Amnesiërt naar De Slimme Bibliothecaris

In plaats van dat de assistent zijn notities weggooit, bouwen ze een levendige, digitale bibliotheek op.

1. De "Reasoning Graph": Het Geheugen van de Documenten

Stel je voor dat elke stukje tekst (een document, een passage) in de bibliotheek een levendige persoon is.

  • Hoe het nu werkt: De assistent leest een document, denkt na, en vergeet het weer.
  • Hoe het nieuwe systeem werkt: Elke keer als de assistent een document leest, hangt hij een etiket op dat document. Op dat etiket staat: "Ik heb dit document gebruikt om het antwoord te vinden" of "Ik heb dit document verworpen omdat het over een andere film ging."

De Magie (De Achterwaartse Reis):
Wanneer de assistent een nieuwe vraag krijgt en een lijst met mogelijke documenten ziet, kijkt hij niet eerst naar de vraag, maar naar de documenten zelf.

  • Hij loopt naar document A en vraagt: "Heb je al eerder iemand geholpen?"
  • Het document toont zijn etiketten: "Ja! In 10 vorige keren werd ik gebruikt om het juiste antwoord te geven. Maar in 1 keer werd ik verworpen omdat ik verwarrend was."

Dit is evidence-centric feedback (feedback gebaseerd op het bewijs). Het maakt niet uit of de vraag anders is; als het document hetzelfde is, weet de assistent direct hoe hij erover moet denken. Het is alsof je een gereedschap pakt en direct op de handgreep ziet staan: "Dit werkt goed voor hout, maar niet voor metaal." Je hoeft niet te raden; het gereedschap vertelt het je.

2. De "Retrieval Graph": De Slimme Portier

Naast de bibliotheek hebben ze ook een Portier (de Retrieval Graph).

  • Hoe het nu werkt: De portier laat elke keer 10 documenten binnen, ongeacht of ze nuttig zijn.
  • Hoe het nieuwe systeem werkt: De portier kijkt in zijn logboek. Als hij ziet dat document X in de afgelopen 50 keer altijd is verworpen omdat het verwarrend was, zegt hij: "Nee, die laat ik deze keer niet binnen."

Dit maakt de lijst met mogelijke antwoorden korter en schoner. De assistent hoeft minder te lezen, wat tijd en geld bespaart.

Waarom is dit zo cool? (De Voordelen)

  1. Hij wordt steeds slimmer zonder te studeren: De assistent hoeft niet opnieuw getraind te worden (geen dure computerlessen). Hij wordt gewoon slimmer door zijn ervaringen in de bibliotheek te bewaren. Het is alsof je een speler bent die elke wedstrijd zijn tactieken opschrijft; de volgende wedstrijd speelt hij beter omdat hij zijn fouten kent.
  2. Hij wordt betrouwbaar: Omdat hij altijd kijkt naar wat er met dat specifieke document is gebeurd, geeft hij steeds hetzelfde, juiste antwoord. Geen meer "soms wel, soms niet".
  3. Je kunt alles controleren: Als de assistent een fout maakt, kun je door de bibliotheek lopen en precies zien: "Ah, hij gebruikte document Y, maar op het etiket van Y stond dat dit document vaak fout leidde." Je kunt elke beslissing terugvervolgen tot de bron.

Een Dag uit het Leven van de Assistent

Stel, je vraagt: "Wie won de Oscar in 2019?"

  • Run 1 (De eerste keer): De assistent ziet een document over een film met een vergelijkbare titel. Hij twijfelt, gebruikt het, en raadt het antwoord. Hij schrijft op het document: "Ik heb dit gebruikt, maar het was een gok."
  • Run 2: Hij ziet weer dat document. Hij kijkt op het etiket: "Oh, vorige keer was het een gok." Hij besluit het dit keer te negeren.
  • Run 10: De bibliotheek staat vol met etiketten die zeggen: "Dit document is vaak fout, gebruik het niet." De assistent ziet het document, lacht erom, en laat het direct vallen. Hij pakt het juiste document en geeft het antwoord.

Samenvattend

Dit paper introduceert een manier om AI-agenten een langdurig geheugen te geven, niet door ze te herschrijven, maar door hun ervaringen met specifieke stukjes informatie te bewaren.

  • Vroeger: Een assistent die elke dag vergeten is wat hij gisteren deed.
  • Nu: Een assistent die een levendige bibliotheek heeft waar elk document zijn eigen geschiedenis van goed en fout gebruik bijhoudt.

Het resultaat? Een assistent die sneller, slimmer, goedkoper en betrouwbaarder wordt naarmate hij meer vragen beantwoordt, zonder dat iemand hem hoeft aan te sturen. Het is een systeem dat zichzelf verbetert door simpelweg te onthouden wat het al heeft geleerd.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →