Prompting Policies for Multi-step Reasoning and Tool-Use in Black-box LLMs with Iterative Distillation of Experience
Dit artikel stelt een Reinforcement Learning-framework voor dat een lichtgewicht prompter-model optimaliseert via iteratieve distillatie van ervaring om de meerstapsredeneer- en hulpmiddelgebruikscapaciteiten van bevroren black-box LLM's aanzienlijk te verbeteren, waarbij superieure prestaties en steekproefefficiëntie worden bereikt in vergelijking met de meest geavanceerde evolutionaire baselines.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Het Grote Plaatje: Het "Black Box"-Probleem
Stel je een super slimme, biljoen-dollar robot voor (een "Black-Box" AI) die je niet kunt aanraken, openen of herschrijven. Je kunt alleen met hem praten via een walkie-talkie. In het verleden, als je wilde dat deze robot beter werd in een specifieke taak, moest je zijn hersenen opnieuw bedraden (fine-tuning). Maar omdat je het brein niet kunt aanraken, moet je zeer slim zijn met wat je tegen hem zegt. Dit heet Prompt Engineering.
Het probleem is dat het vinden van het perfecte om te zeggen, vergelijkbaar is met het raden van de winnende loterijnummers door willekeurige zinnen te roepen. Soms zorgt een kleine verandering in je woorden ervoor dat de robot volledig faalt.
De Oplossing: Een "Prompter"-Coach en een "Werkende" Robot
De auteurs stellen een nieuw systeem voor met twee personages:
- De Werknemer: De grote, bevroren, super slimme robot die het zware werk echt doet (zoals wiskunde oplossen of vluchten boeken). Deze veranderen we nooit.
- De Prompter: Een kleinere, goedkopere, trainbare "Coach" AI. Zijn enige taak is het schrijven van de perfecte instructies (de prompt) voor de Werknemer.
Denk hierbij aan een Schaakcoach (de Prompter) en een Grootmeester-speler (de Werknemer). De Coach speelt het spel niet; hij bedenkt alleen de beste openingszetten om de Grootmeester te vertellen. De Coach leert door te kijken wat er gebeurt wanneer de Grootmeester speelt.
Hoe Ze de Coach Leren: De "Ervaringsbuffer"
Normaal gesproken is het leren van een AI moeilijk omdat je aan het einde alleen een simpele "Goed" of "Fout" score krijgt. Dat is alsof je tegen een student zegt: "Je bent gezakt voor het examen", zonder hen te vertellen waarom.
Dit artikel introduceert een speciale truc genaamd de Contrastive Experience Buffer.
- De Analogie: Stel je een Sportschooltrainer voor die niet alleen zegt "Goed gedaan" of "Slecht gedaan". In plaats daarvan houdt de Trainer een notitieboekje (de Buffer) bij van elke training.
- Wanneer de atleet slaagt, schrijft de Trainer exact op wat hij goed deed.
- Wanneer hij faalt, schrijft de Trainer een gedetailleerde kritiek: "Je hebt je elleboog te hoog gehouden," of "Je bent vergeten te ademen."
- De Magie: De Coach AI leest dit notitieboekje voor elke nieuwe poging. Hij leert van de verhalen van eerdere successen en mislukkingen, niet alleen van de eindscore. Hierdoor kan de Coach veel sneller leren dan als hij alleen maar zou gissen.
De Resultaten: Van Onhandig tot Meester
De onderzoekers hebben dit getest op twee soorten moeilijke taken:
Logische Raadsels (Het "Web van Leugens"):
- De Taak: Uitzoeken wie de waarheid spreekt in een keten van verwarrende uitspraken.
- Het Resultaat: De standaard AI had het ongeveer 55% van de tijd goed. Het Coach-Werknemer-team had het 90% van de tijd goed.
- Wat de Coach Leerde: De Coach stopte met de Werknemer te vragen om "gewoon hard na te denken". In plaats daarvan leerde hij de Werknemer te handelen als een strenge "Staatrekenkamer", die elke stap controleert tegen de ruwe data en weigert te vertrouwen op zijn eigen intuïtie.
Gereedschapsgebruik (Vluchten Boeken & Winkelen):
- De Taak: Een computersysteem gebruiken om een vlucht te boeken of een shirt terug te sturen, wat het volgen van strikte regels en het klikken op specifieke knoppen in de juiste volgorde vereist.
- Het Resultaat: Het slagingspercentage steeg van 74% naar 91%.
- Wat de Coach Leerde: De Coach ontdekte dat de Werknemer vaak te veel dingen tegelijk probeerde te doen. De Coach leerde instructies te geven als een "Protocol-ingenieur", waarbij hij de Werknemer dwingt om één kleine stap te doen, het resultaat te controleren, en dan de volgende stap te doen, waardoor de Werknemer niet in de war raakt.
Waarom Dit Belangrijk Is
- Snelheid: Omdat de Coach leert van gedetailleerde notities (de buffer) in plaats van alleen scores, leert hij 2,4 keer sneller dan eerdere methoden.
- Efficiëntie: Je hoeft de enorme, dure Werknemer-robot niet opnieuw te trainen. Je traint alleen de kleine, goedkope Coach.
- Ontdekking: Het systeem vond niet alleen een betere zin; het ontdekte nieuwe strategieën. Bijvoorbeeld, bij de taak om vluchten te boeken, bedacht de Coach dat je de cabinet必须先 upgraden voordat je de vluchtdatums wijzigt, een specifieke regel die de Werknemer niet vanzelf wist te volgen.
Samenvatting
Dit artikel laat zien dat we in plaats van te proberen de enorme AI te repareren, een kleine, slimme "Prompter" kunnen trainen om te fungeren als coach. Door deze coach een notitieboekje te geven met gedetailleerde feedback (wat goed ging en wat fout ging), leert de coach instructies te schrijven die een goede AI in een geweldige AI veranderen, waardoor complexe logische en gereedschapsproblemen met veel hogere nauwkeurigheid worden opgelost.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.