← Nieuwste papers
💬 NLP

PEARL: Plan Exploration and Adaptive Reinforcement Learning for Multihop Tool Use

PEARL is een nieuw twee-fasen raamwerk dat offline tool-exploratie combineert met online Group Relative Policy Optimization (GRPO) om de plannings- en uitvoeringscapaciteiten van grote taalmodellen voor complex multihop toolgebruik aanzienlijk te verbeteren, waarbij een nieuwe state-of-the-art succesrate van 56,5% op de ToolHop benchmark wordt bereikt.

Oorspronkelijke auteurs: Qihao Wang, Mingzhe Lu, Jiayue Wu, Yue Hu, Yanbing Liu

Gepubliceerd 2026-01-29
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Qihao Wang, Mingzhe Lu, Jiayue Wu, Yue Hu, Yanbing Liu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer intelligente, goed onderlegde assistent hebt (een Large Language Model) die veel weet over de wereld, maar nog nooit iets met haar handen heeft gedaan. Ze kan praten over hoe je een auto repareert of een taart bakt, maar als je haar vraagt om daadwerkelijk een moersleutel te gebruiken of een oven te bedienen, kan ze de verkeerde tool kiezen, de knop de verkeerde kant op draaien of proberen een gereedschap te gebruiken dat niet bestaat.

Dit artikel introduceert PEARL, een nieuwe trainingsmethode die ontworpen is om deze "alleen-pratende" assistent te veranderen in een betrouwbare "doener" wanneer zij complexe problemen moet oplossen met behulp van een keten van digitale tools (zoals API's).

Zo werkt PEARL, onderverdeeld in eenvoudige concepten:

Het Probleem: De "Dromende" Assistent

Huidige AI-assistenten worstelen vaak met taken die uit meerdere stappen bestaan. Als je hen vraagt om "Een park te vinden, dan te zoeken wie het gebouwd heeft, en vervolgens de letters in hun naam te tellen," doen ze vaak het volgende:

  1. Vergeten het plan: Ze raken de draad kwijt na de eerste stap.
  2. Hallucineren: Ze verzinnen tools die niet bestaan.
  3. Maken fouten: Ze gebruiken de juiste tool, maar met de verkeerde instellingen (zoals proberen een deur te openen met een hamer).
  4. Geven op: Als ze een fout maken, weten ze niet hoe ze het moeten herstellen en blijven ze maar in cirkels draaien.

De Oplossing: PEARL's Tweestaps-training

PEARL lost dit op door de training te splitsen in twee duidelijke fasen, zoals het trainen van een piloot voordat hij een vliegtuig mag besturen.

Fase 1: De "Speeltuin" (Offline Tool Exploratie)

Voordat de AI ooit een echt probleem van een gebruiker probeert op te lossen, gaat ze naar een veilige, gecontroleerde "speeltuin".

  • De Analogie: Stel je een chef-kok voor die nog nooit een maaltijd heeft gekookt. Voordat hij een klant bedient, brengt hij uren door in de keuken om simpelweg elke pan, steel en specerij aan te raken. Hij probeert het fornuis aan en uit te zetten, ingrediënten te mengen en te zien wat er gebeurt als hij een fout maakt.
  • Wat PEARL doet: De AI probeert proactief elke beschikbare tool te gebruiken via een proces van vallen en opstaan. De AI leert precies hoe ze de "moersleutel" (de tool) vasthoudt en wat er gebeurt als ze hem de verkeerde kant op draait. Dit boupt een "mentale gebruikershandleiding" op, zodat ze niet stuntelt of nep-tools verzint wanneer ze daadwerkelijk moet werken.

Fase 2: De "Generaal" (Strategische Planning met Reinforcement Learning)

Zodra de AI weet hoe ze de tools moet gebruiken, moet ze leren hoe ze een plan moet maken voor een opeenvolging van zetten.

  • De Analogie: Stel je een schaker voor. Weten hoe de stukken bewegen (Fase 1) is niet genoeg; je moet ook de strategie kennen om het spel te winnen.
  • De Innovatie: PEARL gebruikt een speciale trainingsmethode genaamd Reinforcement Learning (specifiek GRPO).
    • In plaats van alleen aan het einde van een taak te zeggen "Goed gedaan" of "Slecht gedaan", geeft het systeem de AI voor elke stap van het plan een "scorekaart".
    • Als de AI plant om de juiste tool voor de juiste reden te gebruiken, krijgt ze een punt. Als ze een stap overslaat of de verkeerde tool kiest, verliest ze punten.
    • Dit leert de AI om vooruit te denken en een perfect "blauwdruk" te maken voordat ze ergens aan begint.

Het Resultaat: Een Superbetrouwbare Agent

Het artikel testte dit op twee moeilijke benchmarks (ToolHop en T-Eval) waarbij de AI meerdere tools achter elkaar moest gebruiken om vragen te beantwoorden.

  • De Score: PEARL behaalde een succespercentage van 56,5%, een nieuw record (State-of-the-Art).
  • De Vergelijking: Het versloeg veel grotere, duurdere modellen (zoals GPT-4o) en modellen die alleen via standaardtraining zijn "uit het hoofd geleerd".
  • De Betrouwbaarheid: Het maakte zeer weinig fouten bij het daadwerkelijk aanroepen van de tools (slechts een foutpercentage van 3,8%), wat bewijst dat de "Speeltuin"-training werkte.

Waarom het ertoe doet

Het artikel beweert dat PEARL het "planning versus uitvoering"-probleem oplost door ze van elkaar te scheiden. Het traint een toegewijde "Planner" om strategisch na te denken en een aparte "Executor" die al een expert is in het gebruik van de tools.

De meest opwindende bevinding is dat de Planner zo goed is in het maken van plannen, dat als je deze plannen aan andere krachtige AI-modellen geeft, die andere modellen plotseling ook veel beter worden in de taak. Het is alsof je een briljante generaal hebt die gevechtsplannen kan schrijven die elke soldaat, ongeacht hoe onervaren, kan volgen om de oorlog te winnen.

Kortom: PEARL leert AI om eerst te oefenen met het gebruik van tools in een zandbak zodat ze ze niet kapot maken, en leert het vervolgens hoe het een perfect stapsgewijs actieplan moet schrijven voordat het begint te spelen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →