SyRuP: Enhancing System-Prompt Following via Reward-Guided Prediction in LLM Decoding
Het artikel introduceert SyRuP, een raamwerk voor tijdens het decoderen dat de naleving van systeemprompts door Large Language Models verbetert door een cross-attention reward head te trainen om token-niveau nalevingsscores te genereren voor het herrangschikken van kandidaten zonder de basismodellen te hoeven afstemmen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je praat met een zeer slimme, erudiete robot die bijna elk boek in de bibliotheek heeft gelezen. Deze robot is een Large Language Model (LLM). Meestal, wanneer je het een vraag stelt, antwoordt het op basis van zijn training. Maar soms wil je het een specifieke set regels geven voordat het begint te praten. Je zou bijvoorbeeld kunnen zeggen: "Gedraag je als een chagrijnige piraat," of "Antwoord alleen in rijmpjes," of "Noem nooit geweld." Deze regels worden system prompts genoemd. Ze zijn als de functiebeschrijving of het kostuum dat de robot draagt voor een specifiek gesprek.
Het probleem is dat deze robots gewend zijn om instructies te volgen die binnen het gesprek verschijnen, niet regels die vastgelegd zijn voordat het gesprek begint. Wanneer de regels ingewikkeld worden — zoals "wees een piraat, maar gebruik ook 19e-eeuwse grammatica, vermijd de letter 'e', en houd het grappig" — vergeet de robot de regels vaak halverwege. Het kan beginnen met praten als een piraat, maar dan plotseling overschakelen naar een moderne tiener, of vergeten de letter 'e' te vermijden. Wetenschappers hebben geprobe mogelijk geprobeerd dit te oplossen door de robot opnieuw te trainen (wat duur en traag is) of door te proberen het beste antwoord te raden nadat het al is geschreven (wat lijkt op het redigeren van een roman nadat de auteur al klaar is met schrijven). De grote vraag is: Kunnen we de robot begeleiden om deze complexe regels te volgen terwijl hij schrijft, zonder zijn brein te veranderen of te wachten tot het einde?
Dit is waar een nieuwe methode genaamd SYRUP om de hoek komt kijken. Denk aan het brein van de robot als een enorme, bevroren bibliotheek waar we niet aan mogen rommelen. SYRUP is als een superintelligente, kleine bibliothecaris die vlak naast de robot staat terwijl hij schrijft. Elke keer dat de robot een woord kiest om nu te zeggen, controleert deze bibliothecaris twee dingen: "Past dit woord bij het verhaal?" en "Past dit woord bij het piratenkostuum?"
Zo werkt het in de praktijk. De robot heeft een lijst van zijn top 10 favoriete woorden om nu te zeggen. Normaal gesproken kiest hij gewoon het nummer één favoriet. Maar SYRUP grijpt in. Het kijkt naar de "system prompt" (het piratenkostuum) als een aparte, speciale geheugenkaart. Het gebruikt een speciaal hulpmiddel genaamd een cross-attention reward head om de huidige gedachten van de robot te vragen: "Hé, als je dit woord zegt, komt dat dan overeen met de piratenvibe?" De bibliothecaris geeft dan een score aan elk van de top 10 woorden. Als de robot "Hallo" wil zeggen, maar het piratenkostuum vereist "Ahoy", dan verhoogt de bibliothecaris de score voor "Ahoy" en verlaagt hij de score voor "Hallo". De robot kiest vervolgens het woord met de hoogste gecombineerde score.
Het artikel suggereert dat deze aanpak veel beter is dan de oude manieren. De onderzoekers hebben SYRUP getest op drie verschillende robotbreinen en ontdekten dat het er consequent in slaagde om deze robots beter complexe regels te laten volgen dan alleen de robot een betere prompt geven of te proberen antwoorden te herrangschikken nadat ze al zijn geschreven. Sterker nog, in één test verbeterde SYRUP de prestaties van de robot met ongeveer 5,6% vergeleken met de op één na beste methode. Dat klinkt misschien klein, maar in de wereld van AI is dat een enorme sprong.
Het artikel sluit ook een aantal andere ideeën uit. Het laat zien dat het simpelweg samenvoegen van de regels in de hoofdtekst van het gesprek (zoals de piratininstructies verstoppen in de vraag van de gebruiker) niet genoeg is; de robot heeft de regels nodig die als een aparte, onderscheidende herinnering worden behandeld om ze echt te kunnen volgen. Het stelde ook vast dat hoewel je een robot beter regels kunt laten volgen door hem vanaf nul opnieuw te trainen, dat te veel tijd en geld kost. SYRUP is een "decoding-time" methode, wat betekent dat het werkt terwijl de robot nadenkt, waarbij het oorspronkelijke brein bevroren blijft en alleen een kleine, lichtgewicht toevoeging wordt getraind.
Interessant genoeg ontdekten de onderzoekers dat SYRUP zelfs werkt op regels die het nog niet eerder heeft gezien. Ze trainden het op één set complexe instructies en testten het vervolgens op een compleet andere set regels (zoals strikte opmaak of woordtellingen), en het presteerde nog steeds goed. Dit suggereert dat de methode de robot een algemene vaardigheid leert voor "luisteren naar de baas" in plaats van alleen specifieke antwoorden te onthouden.
De auteurs merken echter voorzichtig op dat dit geen toverstaf is die alles oplost. De methode voegt een klein beetje extra tijd toe aan het denkproces van de robot omdat de bibliothecaris de woorden moet controleren. Maar de auteurs suggereren dat deze kosten zeer klein zijn vergeleken met andere complexe methoden die hetzelfde proberen te doen. Ze waarschuwen ook dat als je het "regelen volgen" te hard pusht, de robot vreemd of onnatuurlijk kan gaan klinken, dus moet er een balans zijn.
Kortom, SYRUP suggereert dat als je wilt dat een robot een complexe set regels volgt zonder zijn hele brein opnieuw te trainen, je niet gewoon moet hopen dat hij het onthoudt. In plaats daarvan moet je hem een toegewijde, realtime gids geven die elk enkel woord dat hij wil zeggen controleert tegen de regels, om ervoor te zorgen dat het uiteindelijke verhaal trouw blijft aan het kostuum dat hij vanaf het begin droeg.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.