← Nieuwste papers
💬 NLP

RIMRULE: Improving Tool-Using Language Agents via MDL-Guided Rule Learning

RIMRULE is een neuro-symbolische benadering die de betrouwbaarheid van het gebruik van tools door grote taalmodellen in domeinspecifieke omgevingen verbetert door dynamisch compacte, interpreteerbare regels te injecteren die via een Minimum Description Length-doelstelling zijn gedestilleerd uit foutsporen, waardoor de nauwkeurigheid over bekende en onbekende tools wordt verbeterd zonder de modelgewichten aan te passen.

Oorspronkelijke auteurs: Xiang Gao, Yuguang Yao, Qi Zhang, Kaiwen Dong, Avinash Baidya, Ruocheng Guo, Hilaf Hasson, Kamalika Das

Gepubliceerd 2026-07-09
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Xiang Gao, Yuguang Yao, Qi Zhang, Kaiwen Dong, Avinash Baidya, Ruocheng Guo, Hilaf Hasson, Kamalika Das

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer slimme, maar een beetje onhandige robotassistent leert hoe hij een nieuwe set gereedschappen moet gebruiken. Misschien zijn de gereedschappen vreemd, ontbreken de instructies, of drukt de robot steeds op de verkeerde knoppen.

In het verleden hadden we twee manieren om de robot te repareren als het misging:

  1. Het laten zien van voorbeelden: "Dit is hoe ik het een keer heb gedaan, probeer mij maar na te doen." (Dit is alsof je een leerling een tekstboekvoorbeeld laat zien).
  2. Het hersenen herbedraden: We zouden de robot vanaf nul opnieuw trainen om de nieuwe manier te onthouden. (Dit is duur, traag, en je kunt de nieuwe "hersenen" niet gemakkelijk delen met andere robots).

Het artikel introduceert een derde, slimmere manier genaamd RIMRULE. Zie dit als het leren aan de robot om zijn eigen spiekbriefje te schrijven op basis van zijn fouten.

Zo werkt het, onderverdeeld in eenvoudige stappen:

1. Het "Oeps"-moment (Leren van falen)

Eerst probeert de robot een taak uit te voeren en faalt hij. Misschien heeft hij geprobeerd een hulpmiddel onjuist aan te roepen. In plaats van alleen te zeggen "probeer het opnieuw", kijkt het systeem naar waarom het misging.

  • Analogie: Stel je voor dat je een cake probeert te bakken, maar je bakt hem aan als je vergeet de oven voor te verwarmen. In plaats van gewoon nog een cake te bakken en te hopen op het beste, schrijf je een notitie: "Als het recept zegt 'bakken', controleer dan eerst de oventemperatuur."

2. Het spiekbriefje schrijven (Regelgeneratie)

De robot (met behulp van een Large Language Model) kijkt naar zijn fout en schrijelt een eenvoudige regel om het te herstellen.

  • De twist: De robot schrijft niet zomaar een lange, rommelige paragraaf. Hij schrijft een korte, duidelijke "Als-Dan"-regel.
    • Voorbeeld: "ALS de gebruiker vraagt naar stambomen, DAN breek de vraag op in kleinere stappen (vind eerst de moeder, dan de opa) in plaats van in één keer om het hele overzicht te vragen."

3. De "Editor" (MDL-consolidatie)

In het begin schrijft de robot misschien 100 regels, die veelal repetitief of te specifiek zijn (bijv. "Als de gebruiker vraagt naar de moeder van Jan..." en "Als de gebruiker vraft naar de moeder van Sarah...").
Het systeem gebruikt een principe genaamd Minimum Description Length (MDL). Denk aan dit als een strenge redacteur die zegt: "Stop met het schrijven van 100 regels. Combineer ze tot één krachtige regel die alle gevallen dekt."

  • Het doel: Houd het spiekbriefje zo kort en simpel mogelijk terwijl het nog steeds de meeste problemen oplost. Dit maakt de regels makkelijk leesbaar en makkelijk te onthouden.

4. De "Zakgids" (Retrieval)

Wanneer de robot voor een nieuwe taak staat, leest hij niet zijn volledige 100 pagina's tellende geschiedenisboek door. In plaats daarvan zoekt hij snel de specifieke regel op die van toepassing is op de huidige situatie en stopt deze in zijn "zak" (de prompt).

  • Analogie: Het is als een monteur die, voordat hij een auto repareert, snel even in zijn zak kijkt voor de specifieke handleiding over "piepende remmen", in plaats van het hele boek over hoe auto's werken door te lezen.

Waarom is dit bijzonder?

  • Het is draagbaar: Omdat de regels in gewoon Engels (en een simpele codevormaat) zijn geschreven, kun je het spiekbriefje dat een "domme" robot heeft geschreven nemen en aan een "super-slimme" robot geven. De slimme robot hoeft niet opnieuw getraind te worden; hij leest gewoon het nieuwe spiekbriefje en wordt direct beter.
  • Het is een "Spiekbriefje", geen "Hersenchirurgie": In tegen tegenstelling tot andere methoden die vereisen dat het model opnieuw wordt getraind (wat lijkt op hersenchirurgie), voegt dit alleen een notitie toe aan de instructies. Het is snel en verandert de kernpersoonlijkheid van de robot niet.
  • Het werkt op nieuwe tools: Zelfs als de robot een specifieke tool nog nooit heeft gezien, helpt het advies "Controleer altijd eerst de vereisten van de tool" nog steeds.

De Resultaten

De onderzoekers hebben dit getest op twee grote sets van uitdagingen rondom het gebruik van tools. Ze kwamen tot de volgende bevindingen:

  1. Het geven van deze spiekbriefjes aan de robot maakte hem veel beter in het gebruiken van tools, zelfs bij taken die hij nog nooit eerder had gezien.
  2. Het werkte beter dan alleen het tonen van voorbeelden of het optimaliseren van de tekstuele prompts.
  3. Het hielp zelfs robots die al "fine-tuned" waren (specifiek getraind voor de baan), door te fungeren als een vangnet om resterende fouten op te vangen.

Kortom: RIMRULE leert AI om te leren van zijn fouten door zijn eigen eenvoudige, herbruikbare instructies te schrijven, in plaats van alleen maar voorbeelden te memoriseren of zijn hele brein te herschrijven. Het verandert "vallen en opstaan" in een permanente, deelbare les.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →