← Nieuwste papers
💻 computer science

Towards Robust Tool Use in Agents via Experience-Driven Adaptive Guidance

Het artikel introduceert ExpG, een door ervaring gestuurde adaptieve sturingsmechanisme dat de robuustheid van agenten bij het gebruik van tools verbetert door gestructureerde ervaringen uit historische executies te verwerven, te distilleren en te hergebruiken, waardoor kleinere modellen grotere kunnen overtreffen bij diverse taken.

Oorspronkelijke auteurs: Can Wang, Haoran Chen, Li Yu, Ding Hao, Bohai Zhao, Zhaoyang Liu, Zhiying Tu

Gepubliceerd 2026-08-05
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Can Wang, Haoran Chen, Li Yu, Ding Hao, Bohai Zhao, Zhaoyang Liu, Zhiying Tu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je net een superintelligente robotassistent hebt gebouwd, een die kan chatten, verhalen kan schrijven en zelfs wiskundige problemen kan oplossen. Je hebt het een brein gegeven dat bestaat uit een enorm taalmodel, en het is behoorlijk goed in praten. Maar hier komt de adder onder het gras: om daadwerkelijk dingen te doen in de echte wereld — zoals het weer opzoeken, een vlucht boeken of een bug in code repareren — moet de robot "tools" gebruiken. Denk aan deze tools als een Zwitsers zakmes of een digitale gereedschapskist. De robot moet weten welke tool hij moet pakken, hoe hij hem moet vasthouden en wanneer hij hem moet gebruiken.

Het probleem is dat de echte wereld rommelig is. Soms werkt een tool perfect, maar op andere momenten doet hij raar, geeft hij een vreemde foutmelding, of zegt hij gewoon "dat kan ik niet doen" zonder uit te leggen waarom. Als de robot een tool verkeerd gebruikt, kan hij vast komen te zitten in een lus van verwarring, waarbij hij steeds weer hetzelfde foute ding probeert. Lange tijd dachten wetenschappers dat het belangrijkste probleem het slimmer maken van het brein van de robot was. Maar dit artikel suggereert dat de echte flessenhals niet het brein is; het is het vermogen van de robot om de rommelige, onvoorspelbare aard van het gebruik van tools te hanteren zonder in paniek te raken.

Dit is waar het artikel om draait. De onderzoekers, onder leiding van Can Wang en collega's, merkten op dat robots vaak niet falen omdat ze "dom" zijn, maar omdat ze een gebrek hebben aan ervaring. Ze behandelen elke keer dat ze een tool oppakken alsof het de allereerste keer is, waarbij ze negeren wat er de vorige keer gebeurde. Om dit op te lossen, creëerden ze een systeem genaamd ExpG (Experience-Driven Adaptive Guidance).

Denk aan ExpG als een persoonlijke coach voor de robot. In plaats van de robot gewoon te laten gokken, kijkt deze coach naar hoe de robot tools gebruikt, leert van elke succeservaring en elke fout, en schrijft vervolgens een "referentieblad" dat de robot de volgende keer kan gebruiken.

Zo werkt de coach in drie eenvoudige stappen:

  1. Het Waakzame Oog (Experience Acquisition): De coach kijkt hoe de robot een tool gebruikt. Pakte hij de juiste tool? Typde hij de instructies correct? Werkte de tool wel, of crashte hij? De coach breekt dit af in een checklist. Als de robot een "moersleutel" gebruikte om een bout aan te draaien, maar de bout de verkeerde maat was, noteert de coach: "Hé, de moersleutel werkte, maar het probleem zat bij de bout." Het zet deze rommelige momenten om in duidelijke, gestructureerde lessen.

  2. De Filter en Samenvatter (Experience Distillation): De coach houdt niet simpelweg elke enkele notitie bij; dat zou te veel rommel zijn. De coach filtert de slechte notities eruit (zoals wanneer de robot iets probeerde wat duidelijk een slecht idee was) en groepeert de goede notities. De coach zoekt naar patronen. Bijvoorbeeld, de coach kan merken dat de "Hamer"-tool altijd kapot gaat als je hem op zacht deeg probeert te gebruiken. De coach schrijft dan een eenvoudige gids: "Hamer: Goed voor spijkers. Slecht voor deeg. Controleer altijd eerst de steel." Dit verandert honderden rommelige pogingen in een schoon, gemakkelijk leesbaar regelboek.

  3. Het Referentieblad (Experience Reuse): De volgende keer dat de robot een hamer nodig heeft, overhandigt de coach de gids. De robot hoeft niet te gokken of tien keer te proberen om erachter te komen hoe het moet. Hij leest gewoon de gids: "Ah juist, controleer de steel!" en gebruikt de tool correct bij de eerste poging.

Het onderzoek testte dit idee op verschillende robotbreinen (van kleine tot enorme) en ontdekte dat het toevoegen van deze coach een enorm verschil maakte. Zelfs een kleinere, minder krachtige robot met de coach kon een veel grotere, slimere robot verslaan die geen coach had. Sterker nog, in sommige lastige situaties waarin tools kapot of verwarrend waren, waren de getrainde robots veel beter in staat om uit te zoeken wat ze moesten doen.

De onderzoekers ontdekten dat dit systeem robots op zes specifieke manieren helpt:

  • Ze worden zich meer bewust van wanneer ze een tool moeten gebruiken.
  • Ze kunnen het verschil zien tussen twee tools die op elkaar lijken.
  • Ze leren precies de juiste manier om instructies voor een tool te typen.
  • Ze kunnen hun eigen fouten herstellen als ze iets verkeerds proberen.
  • Ze begrijpen of de ene tool eerst een andere tool nodig heeft om te werken.
  • Ze leren een tool te vertrouwen (of te wantrouwen) als deze bekend staat als onbetrouwbaar.

Het artikel suggereert dat door robots een manier te geven om van hun eigen geschiedenis te leren — zoals een student die zijn oude toetsen nakijkt om voor het volgende examen te studeren — we ze veel betrouwbaarder kunnen maken. Het gaat er niet om het brein van de robot groter te maken; het gaat erom de robot een betere manier te geven om te onthouden wat wel en niet werkt. De resultaten laten zien dat deze aanpak een veelbelovende weg is naar het bouwen van agenten die de rommelige, onvoorspelbare echte wereld aan kunnen zonder gefrustreerd te raken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →