GOAT: A Training Framework for Goal-Oriented Agent with Tools
Het artikel introduceert GOAT, een nieuw trainingskader dat fijnafstemming van open-source LLM-agenten voor complexe toolgebruik mogelijk maakt zonder menselijke annotatie door automatisch doelgerichte API-uitvoeringsdata te synthetiseren uit documentatie, en dat state-of-the-art prestaties bereikt op bestaande benchmarks en een nieuw voorgestelde GOATBench.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je een zeer slimme, goed gelezen bibliothecaris (de AI) voor die weet hoe je boeken leest en verhalen schrijft. Als je deze bibliothecaris echter vraagt om naar de achterkamer van de bibliotheek te gaan, een specifieke doos met oude kaarten te vinden, een specifieke pagina eruit te halen en die pagina vervolgens te gebruiken om een specifiek recept in een kookboek te vinden, raakt de bibliothecaris vaak de weg kwijt. Ze kunnen de verkeerde doos raden, het verkeerde boek openen, of vergeten de kaartpagina mee te nemen naar de keuken.
Dit is het probleem met huidige AI-agenten wanneer ze proberen "tools" te gebruiken (zoals API's, die digitale verbindingen zijn met databases, weerdiensten of filmlijsten). Ze zijn uitstekend in chatten, maar verschrikkelijk in het plannen van een meerstapsmissie waarbij één stap volledig afhankelijk is van het resultaat van de vorige stap.
Het artikel introduceert GOAT (Goal-Oriented Agent with Tools), een nieuwe trainingsmethode die bedoeld is om die verwarde bibliothecaris om te vormen tot een meester-detective. Hieronder wordt uitgelegd hoe het werkt, met behulp van eenvoudige analogieën:
Het Probleem: Het "Raadselspel"
Meestal moeten onderzoekers om een AI het gebruik van tools aan te leren, mensen inhuren om duizenden voorbeelden op te schrijven, zoals: "Vraag eerst de weather-API om regen. Neem vervolgens dat 'regen'-antwoord en vraag de clothing-API om een regenjas."
Dit is duur en traag. Zonder deze door mensen geschreven voorbeelden raden AI-modellen het gewoon. Ze falen vaak bij complexe taken die vereisen dat meerdere stappen aan elkaar worden gekoppeld.
De Oplossing: De Keuken met "Reverse Engineering"
De auteurs van GOAT beseften dat ze geen mensen nodig hadden om de instructies te schrijven. Ze hadden de "kookboeken" (de API-documentatie) al. In plaats van de AI te vragen het recept te raden aan de hand van een afgewerkt gerecht, besloten ze eerst het gerecht te bereiden en daarna het recept te beschrijven.
Ze maken gebruik van een "Call-First" strategie:
- De Keuken in kaart brengen: Eerst leest het systeem alle API-handleidingen en tekent een kaart van hoe de tools met elkaar verbonden zijn. (Bijvoorbeeld: "De output van de 'Weather'-tool past perfect in de input van de 'Umbrella'-tool").
- Het Maaltijd bereiden (De Call-First Stap): Het systeem kiest een pad op deze kaart en voert de tools daadwerkelijk uit. Het vraagt de weather-tool om data, krijgt het resultaat en gebruikt dat resultaat vervolgens direct om de umbrella-tool te raadplegen. Het raadt niet; het voert echte stappen uit en krijgt echte antwoorden.
- Het Recept schrijven (De Abstraction Stap): Nadat de tools het werk hebben gedaan, bekijkt de AI de voltooide keten van gebeurtenissen en schrijft een gebruikersvraag die daar bij past. Het zegt in feite: "Oh, ik heb zojuist al deze stappen uitgevoerd om een regenjas te vinden. Dus, een gebruiker die vraagt 'Wat moet ik dragen als het regent?', dat is wat ik zojuist heb opgelost."
Door dit omgekeerd te doen (Actie Vraag), leert de AI de juiste logica van hoe tools met elkaar verbonden zijn zonder dat een mens de instructies hoeft te schrijven. Het leert door eerst het werk te doen en daarna uit te leggen wat het heeft gedaan.
Het Resultaat: Een Super-Hulp
Het artikel testte deze nieuwe, met GOAT getrainde agenten op verschillende uitdagingen:
- RestBench & API-Bank: Dit zijn als examens waarbij de AI filmbeschouwingen of muziekadviezen moet vinden met behulp van een keten van tools.
- GOAT-Bench: De auteurs hebben een gloednieuw, groter examen gecreëerd dat specifiek is voor dit soort complexe, meerstaps taken.
De bevindingen waren duidelijk:
- Open-Source Modellen: Voor GOAT waren kleinere, open-source AI-modellen (die gratis en voor iedereen beschikbaar zijn) bijna nutteloos bij deze complexe taken. Ze faalden bijna 100% van de tijd.
- Na GOAT: Eenmaal getraind met deze nieuwe methode, werden dezezelfde open-source modellen ongelooflijk goed in de taken. In sommige gevallen presteerden ze beter dan dure, gesloten bronmodellen (zoals GPT-4) die doorgaans deze tests domineren.
- Geen Mens Nodig: De volledige trainingsdataset werd automatisch door het systeem gebouwd met behulp van de API-handleidingen. Mensen hoefden niet te gaan zitten en stap-voor-stap instructies op te schrijven.
De Conclusie
GOAT is een manier om AI-agenten te leren plannen en tools te gebruiken door ze eerst de daadwerkelijke arbeid te laten oefenen en hen daarna te leren het doel te beschrijven. Het verandert open-source AI-modellen van "radeloos gissers" in "betrouwbare planners" zonder dat er dure menselijke leraren nodig zijn. De auteurs hebben hun code en hun nieuwe testsuite (GOAT-Bench) beschikbaar gemaakt voor anderen om te gebruiken.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.