Better, Faster, Stronger: Programmatic Skill Learning Best Reduces Agent Cost
Dit artikel betoogt dat het representeren van vaardigheden als uitvoerbare programma's de meest kosteneffectieve strategie is voor het aanpassen van LLM-agenten aan nieuwe domeinen, waarbij wordt aangetoond dat het incrementeel leren en refactoren van deze programma's uit eerdere trajecten de kosten aanzienlijk verlaagt terwijl de robuustheid in diverse omgevingen behouden blijft via de voorgestelde "SpeedRunner"-agent.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een robot leert navigeren door een enorme, rommelige speeltuin. In het begin is de robot als een nieuwsgierige peuter: hij probeert naar voren te lopen, botst tegen een muur, raakt in de war, probeert het opnieuw en leert misschien een klein beetje. Dit is hoe moderne AI-"agenten" vaak werken. Het zijn krachtige taalmodellen die instructies kunnen begrijpen en met computers kunnen communiceren, maar wanneer ze voor een nieuwe, complexe taak worden geplaatst, moeten ze vaak elke stap vanaf nul doordenken. Ze proberen misschien een deur te openen, falen, proberen het weer op een andere manier, falen opnieuw, en blijven in een lus hangen totdat ze het goed krijgen. Hoewel dit werkt, is het traag en duur. Elke keer dat de robot "denkt", kost het geld en tijd, net zoals het betalen voor elke minuut die een mens besteedt aan het oplossen van een puzzel.
De grote vraag waar onderzoekers zich mee bezighouden is: Hoe kunnen we deze robots leren om beter te worden zonder dat ze steeds hetzelfde opnieuw moeten leren? Het antwoord heeft meestal te maken met "vaardigheden". Denk aan een vaardigheid als een snelkoppeling of een kant-en-klaar recept. In plaats van telkens vanaf nul uit te zoekenken hoe je een taart bakt, volg je gewoon een recept dat je al hebt geschreven. Een tijdje probeerden wetenschappers deze recepten in gewone Engelse taal te schrijven. Maar de auteurs van dit artikel vroegen zich af: wat als we de recepten in code zouden schrijven? Code is als een superprecieze instructiehandleiding die een computer direct kan volgen zonder in de war te raken of tijd te verspillen. Het grote idee is dat als we de rommelige trial-and-error ervaringen van de robot kunnen omzetten in schone, herbruikbare code, de robot veel sneller, goedkoper en veel slimmer kan worden.
Dit is precies wat het team achter het "SpeedRunner"-project wilde testen. Ze wilden zien of een AI-agent kon leren om zijn eigen code-gebaseerde vaardigheden te schrijven terwijl hij aan het werk was, in plaats van alleen verteld te worden wat hij moest doen. Ze bouwden een systeem waarbij de AI een spel speelt, fouten maakt, en vervolgens een tweede, speciale "coderings-agent" naar de geschiedenis van de robot kijkt. Deze coderings-agent fungeert als een detective en een programmeur in één. Hij scant de eerdere pogingen van de robot, vindt patronen waar de robot steeds opnieuw faalde of steeds dezelfde lange reeks stappen herhaalde, en schrijft vervolgens een nieuwe stuk code om het te repareren. Het is alsof je een video bekijkt van iemand die probeert zijn veters te strikken, beseft dat hij steeds de veters vast laat zitten, en dan een kleine, perfecte instructiehandleiding schrijft over hoe je ze correct strikt zodat ze nooit meer vast komen te zitten.
De onderzoekers testten dit idee in drie zeer verschillende virtuele werelden: een laboratorium waar je chemicaliën moet mengen, een rasterwereld waarin je instructies moet volgen om objecten op te pakken, en een survivalgame waarin je grondstoffen moet verzamelen en je moet verdedigen tegen zombies. In al deze omgevingen leerde de "SpeedRunner"-agent om ter plekke zijn eigen code-vaardigheden te schrijven. De resultaten waren opmerkelijk. Terwijl andere methoden ofwel bleven hangen in lussen, of steeds duurder werden naarmate ze meer leerden, werd SpeedRunner juist goedkoper en sneller naarmate het meer leerde. Het veranderde lange, ingewikkelde reeksen acties in korte, herbruikbare codefuncties. In plaats van dat de robot bijvoorbeeld geld uitgeeft aan het nadenken over hoe hij een boom moet vinden, leerde hij een eenvoudige code-opdracht genaamd "find_tree" die hij direct met één klik kon gebruiken.
Het artikel suggereert dat deze aanpak een game-changer is voor de kosten. In een van de tests gebruikte de SpeedRunner-agent ongeveer een achtste van het geld (in termen van computerverwerkingskracht) dat de standaardmethode nodig had om hetzelfde probleem op te lossen. Het bespaarde niet alleen geld, maar het werd ook beter in de taken. De sleutel was dat de coderings-agent niet alleen onthield wat er gebeurde, maar analyseerde waarom dingen misgingen. Als de robot steeds faalde om een grondstof te vinden omdat hij het niet kon zien, schreef de coderings-agent een nieuwe functie om het gebied eerst te "doorzoeken" voordat hij opgaf. Dit maakte de agent robuust, wat betekent dat hij ongevoelig was voor willekeurige veranderingen in de omgeving, zoals zombies die plotseling opduiken, zonder in paniek te raken.
De auteurs merken echter voorzichtig op dat dit geen wondermiddel is voor elke situatie. Ze ontdekten dat als een robot al erg goed is in een taak, het dwingen om code te gebruiken het een beetje te rigide kan maken, zoals een robot die een recept zo strikt volgt dat hij zich niet kan aanpassen als de oven kapot gaat. Maar voor de meeste complexe, langdurige taken lijkt het omzetten van rommelige ervaringen in schone code de beste manier om AI-agenten zowel slimmer als betaalbaarder te maken. De studie laat zien dat door agenten hun eigen "geautomatiseerde snelkoppelingen" te laten schrijven terwijl ze spelen, we systemen kunnen bouwen die efficiënt leren zonder dat ze telkens opnieuw getraind hoeven te worden wanneer ze voor een nieuwe uitdaging staan.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.