Reinforced Graph of Thoughts: RL-Driven Adaptive Prompting for LLMs
Dit artikel stelt Reinforced Graph of Thoughts (RGoT) voor, een geautomatiseerd kader dat gebruikmaakt van versterkend leren om het grafiek van operaties in Graph of Thoughts-prompting dynamisch aan te passen, waardoor de rigiditeit van handmatig gedefinieerde structuren wordt overwonnen om complexere probleemoplossingstaken beter aan te kunnen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een zeer slimme, maar soms wat verspreide assistent hebt (een Large Language Model, of LLM) die uitstekend is in het schrijven van verhalen, maar moeite heeft met complexe wiskunde of het organiseren van rommelige data. Als je ze gewoon vraagt "dit op te lossen", raken ze misschien in de war of maken ze fouten, vooral als het probleem enorm is.
Om hen te helpen, geven onderzoekers hen meestal een "recept" of een stap-voor-stap plan.
- Chain of Thought: Als een rechte lijn van instructies: "Doe A, dan B, dan C."
- Tree of Thoughts: Als een stamboom waarbij de assistent verschillende takken uitprobeert, kijkt welke er goed uitziet, en terugkruipt als hij op een doodlopende weg terechtkomt.
- Graph of Thoughts (GoT): De meest geavanceerde versie. Stel je een metrokaart voor. De assistent kan een probleem opsplitsen in verschillende lijnen, ze afzonderlijk oplossen en de resultaten vervolgens weer samenvoegen. Dit is geweldig voor grote problemen, maar het is moeilijk te gebruiken. Jij, de mens, moet de volledige metrokaart zelf tekenen voordat de assistent aan het werk gaat. Als je de verkeerde kaart tekent, faalt de assistent.
Het probleem: De "statische kaart"
De originele "Graph of Thoughts" is als een stijve, vooraf getekende metrokaart. Het werkt perfect als het probleem precies is wat je verwachtte. Maar als het probleem groter of ingewikkelder wordt (zoals een lijst met getallen die twee keer zo lang is als je dacht), breekt je vaste kaart. De assistent raakt in de war omdat de kaart geen rekening hield met de nieuwe grootte.
De oplossing: Reinforced Graph of Thoughts (RGoT)
De auteurs van dit artikel, Manuel Noah Riesen en Peter Alfred von Niederhäusern, bouwden een systeem genaamd RGoT. In plaats van dat jij de kaart tekent, gaven ze de assistent een GPS die leert terwijl hij rijdt.
Hier is hoe het werkt, met een eenvoudige analogie:
Het "Optellen"-spel
Stel je voor dat de taak is om een zeer lange lijst met getallen op te tellen.
- De oude manier: Je vertelt de assistent: "Tel deze getallen op." Als de lijst 5 getallen heeft, doen ze het. Als er 50 zijn, raken ze in de war en geven ze een verkeerd antwoord.
- De RGoT-methode: Het systeem heeft een gereedschapskist met basisbewegingen:
- Opsplitsen: De grote lijst in twee kleinere lijsten snijden.
- Optellen: Een kleine lijst optellen.
- Samenvoegen: Twee kleine resultaten combineren tot één groot resultaat.
In plaats van dat jij bepaalt wanneer je moet splitsen of samenvoegen, gebruikt het systeem een Reinforcement Learning (RL)-agent. Denk aan deze agent als een videospelletjespersonage dat probeert een level te verslaan.
- Het spel: Het "level" is de lijst met getallen.
- De zetten: Het personage kan kiezen voor "Opsplitsen", "Optellen", "Samenvoegen" of "Stoppen".
- De beloning: Als het eindantwoord correct is, krijgt het personage punten. Als het faalt, verliest het punten.
De magie van leren
Aan het begin is de agent nietsvermoedend. Het probeert misschien een lijst van 100 getallen in één keer op te tellen en faalt. Maar omdat het een "spel" speelt (met behulp van Reinforcement Learning), leert het van zijn fouten.
- Het beseft: "Hé, als de lijst enorm is, krijg ik een straf als ik probeer alles in één keer op te tellen. Maar als ik het eerst Opsplits, dan de kleine delen Optel, en ze uiteindelijk Samenvoeg, krijg ik een enorme beloning!"
- Na verloop van tijd leert de agent zijn eigen "metrokaart" (de Graaf van Operaties) onderweg te bouwen, perfect afgestemd op de grootte van het probleem.
Wat ze eigenlijk deden
De onderzoekers testten dit op verschillende taken:
- Lijsten optellen: Getallen bij elkaar optellen.
- Lijsten sorteren: Getallen in de juiste volgorde zetten.
- Tellen van trefwoorden: Uitzoeken hoe vaak een woord in een tekst voorkomt.
- Documenten samenvoegen: Verschillende teksten combineren tot één zonder informatie te herhalen.
Ze gebruikten niet alleen de echte AI-modellen om te trainen (wat te duur en te traag zou zijn). In plaats daarvan creëerden ze een simulatie. Ze berekenden hoe waarschijnlijk het was dat de AI een fout maakte op een lijst met 10 items, 20 items, 50 items, enzovoort, en programmeerden dat in het spel. De agent leerde in deze simulatie, en vervolgens testten ze het op de echte AI.
De resultaten
Het artikel beweert dat:
- Aanpasbaarheid: De agent leerde automatisch zijn strategie te veranderen op basis van hoe moeilijk het probleem was. Als de lijst kort was, deed hij een simpele som. Als de lijst enorm was, besloot hij automatisch om hem eerst op te splitsen.
- Beter dan de basis: De agent loste complexe problemen veel betrouwbaarder op dan door de AI gewoon te vragen het "in één keer te doen" (de "Input-Output"-methode).
- Generalisatie: Zelfs toen ze de agent een lijstgrootte gaven die hij tijdens de training nooit had gezien (zoals een lijst van 60 items terwijl hij alleen had geoefend met lijsten tot 30), bedacht hij toch een goede strategie.
De kernboodschap
Het artikel presenteert een manier om geavanceerde AI-probleemoplossing automatisch te maken. In plaats dat een menselijke expert precies moet weten hoe een complexe taak gestructureerd moet worden, gebruikt het systeem een "lerende agent" om het beste stap-voor-stap plan (de graaf) voor elke gegeven probleemgrootte uit te zoeken. Het verandert een stijf, handmatig proces in een flexibel, zelfaanpassend proces.
Opmerking: Het artikel richt zich uitsluitend op deze specifieke taken (wiskunde, sorteren, tellen, samenvoegen) en beweert niet dat deze methode werkt voor medische diagnose, juridisch advies of andere real-world toepassingen buiten deze gedefinieerde logische problemen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.