GenesisFunc: Multi-Agent Data Generation for Accurate and Generalizable Function-Calling
Het artikel introduceert GenesisFunc, een multi-agent geautomatiseerde pijplijn die hoogwaardige, diverse synthetische functieoproepdata genereert om een 8B LLM te trainen, die superieure prestaties binnen het domein en generalisatie buiten het domein bereikt in vergelijking met vergelijkbare open-source modellen, terwijl het tegelijkertijd opkomt met geavanceerde API-gebaseerde systemen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een zeer slimme maar onervaren assistent hebt (een Large Language Model, of LLM). Je wilt dat deze assistent net als een mens tools kan gebruiken—zoals het controleren van het weer, het boeken van een vlucht of het berekenen van een budget. Maar er is een probleem: om de assistent te leren hoe deze tools te gebruiken, moet je duizenden voorbeelden tonen van mensen die om hulp vragen en de assistent die de juiste tool correct kiest en de details invult.
In de echte wereld is het verzamelen van deze voorbeelden als het zoeken naar een speld in een hooiberg. Het is duur, traag, en vaak zijn de voorbeelden die je vindt rommelig of onvolledig. Eerdere pogingen om deze voorbeelden te verzinnen (te synthetiseren) leidden vaak tot "nep"-tools die niet werkten of tot gesprekken die robotachtig en repetitief aanvoelden.
Hier komt GENESISFUNC. Denk hierbij aan een high-tech, geautomatiseerd "trainingskamp" voor je AI-assistent. In plaats van een team mensen in te huren om elk enkel voorbeeld te schrijven, bouwden de auteurs een systeem waarbij een team van AI-agenten samenwerkt om perfecte trainingsdata te creëren.
Hier is hoe het GENESISFUNC "trainingskamp" werkt, opgesplitst in eenvoudige stappen:
1. De Betrouwbare Gereedschapskist (De Tool Pool)
Voordat de training begint, heeft het systeem een set tools nodig om mee te oefenen. In plaats van nep-tools te verzinnen, gaat GENESISFUNC naar een betrouwbare, openbare bibliotheek van real-world tools (de BFCL-benchmark genoemd).
- De Analogie: Stel je een chef-kok voor die wil leren koken. In plaats van nep-ingrediënten te verzinnen, gaat hij naar een hoogwaardige, geverifieerde supermarkt om verse, echte groenten te kiezen. Dit zorgt ervoor dat de training gebaseerd is op de realiteit, niet op fantasie.
2. De Regisseursversie (Multi-Agent Dialooggeneratie)
Dit is het hart van het systeem. De auteurs hebben een team van vier AI-"agenten" (gespecialiseerde programma's) opgezet die fungeren als een filmproductiecrew om de trainingsscripts (gesprekken) te schrijven:
- De Casting Director (Sample Agent): Kiest een mix van tools voor de scène. Het kiest de "hoofdrolspelers" (de tools die nodig zijn voor de taak) en "extra's" (afleidende tools die erop lijken maar niet de juiste keuze zijn) om de AI te leren ze van elkaar te onderscheiden.
- De Script Doctor (Memory Agent): Houdt toezicht op alle tot nu toe geschreven scènes. Als het team blijft schrijven over "een vlucht boeken", zegt deze agent: "Hé, we hebben dat vaak genoeg gedaan; laten we een scène schrijven over 'een reis plannen' in plaats daarvan." Dit zorgt ervoor dat de trainingsdata divers is en niet repetitief.
- De Acteur (Function Agent): Schrijft de daadwerkelijke dialoog. Het creëert een gebruiker die een vraag stelt en de assistent die reageert door de juiste tools te kiezen en de lege plekken in te vullen (zoals data of locaties). Het zorgt ervoor dat de details realistisch zijn, soms door enkele optionele details weg te laten om echt menselijk spraakgedrag na te bootsen.
- De Criticus (Judge Agent): Leest de concepten en kiest de beste. Het gooit de zwakke scripts weg en houdt die waarin de AI-assistent de taak perfect heeft uitgevoerd.
3. De Kwaliteitscontrole (Multi-Stadia Evaluatie)
Zelfs met een geweldig team gebeuren er fouten. Voordat de data wordt gebruikt om het model te trainen, doorloopt het een strenge drie-staps inspectie:
- De Grammatica Politie (Rule Checker): Een computerprogramma controleert of het formaat correct is (bijv. "Hebben ze de juiste haakjes gebruikt?").
- De Logische Rechter (Model Checker): Een slimmere AI leest het gesprek om te zien of de logica klopt (bijv. "Heeft de assistent het probleem van de gebruiker daadwerkelijk opgelost?").
- De Menselijke Redacteur (Human Validation): Een klein team mensen bekijkt de moeilijkste gevallen. Ze besteden in totaal slechts ongeveer 15 uur, omdat de computer al 95% van de fouten heeft gefilterd.
De Resultaten: Een Super-Hulp
Nadat het systeem dit enorme, hoogwaardige dataset had gegenereerd, gebruikten de auteurs het om een AI-model met 8 miljard parameters te trainen (een middelgroot model).
- Het Resultaat: Dit getrainde model werd een meester in het gebruik van tools. Het presteerde beter dan andere open-source modellen van dezelfde grootte en concurreerde zelfs met veel grotere, dure modellen van grote technologiebedrijven.
- De "Generalisatie"-Magie: Omdat de trainingsdata zo divers was (veel verschillende soorten tools en complexe gesprekken dekkend), leerde het model niet alleen de voorbeelden uit het hoofd. Het leerde de vaardigheid van toolgebruik. Wanneer getest op tools die het nog nooit had gezien, presteerde het nog steeds ongelooflijk goed.
Waarom Dit Belangrijk Is
Het artikel beweert dat deze methode de grootste bottleneck oplost bij het leren van AI om tools te gebruiken: het gebrek aan goede data. Door een team van AI-agenten te gebruiken om de data te genereren, te diversifiëren en te verifiëren, creëerden ze een pijplijn die:
- Betrouwbaar is: Gebaseerd op echte, werkende tools.
- Divers is: Dekt veel scenario's, van eenvoudige eenstapsverzoeken tot complexe, meerstaps gesprekken.
- Schaalbaar is: Het kan eenvoudig worden uitgebreid om nieuwe tools op te nemen zonder een enorm team van menselijke annotatoren nodig te hebben.
Kortom, GENESISFUNC is als een fabriek die automatisch het perfecte "handboek" bouwt voor het leren van AI-assistenten hoe ze tools moeten gebruiken, wat resulteert in een slimmere, capabelere digitale hulp.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.