← Nieuwste papers
💬 NLP

Linguistic and Argument Diversity in Synthetic Data for Function-Calling Agents

Dit artikel stelt een nieuwe methode voor voor het genereren van synthetische trainingsdata die de linguïstische en argumentatieve diversiteit optimaliseert zonder afhankelijk te zijn van handmatig ontworale regels, wat resulteert in function-calling agents die een superieure out-of-distribution prestatie leveren en een nauwkeurigheidstoename van 7,4% op de BFCL-benchmark behalen ten opzichte van de huidige state-of-the-art baselines.

Oorspronkelijke auteurs: Dan Greenstein, Zohar Karnin, Chen Amiraz, Oren Somekh

Gepubliceerd 2026-01-27
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Dan Greenstein, Zohar Karnin, Chen Amiraz, Oren Somekh

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer slimme robotassistent leert hoe hij een gigantische gereedschapskist moet gebruiken met duizenden verschillende tools (zoals weer-apps, aandelenmarkttrackers of agenda-schedulers). Om de robot te leren, moet je voorbeelden laten zien van mensen die om hulp vragen en de robot die de juiste tool correct uitkiest.

Het probleem is, volgens dit paper, dat de "leerboeken" (datasets) die worden gebruikt om deze robots te trainen, vaak te repetitief zijn. Het is alsof je een kookles volgt waarbij elke student alleen wordt geleerd om een kaaspizza met pepperoni te maken. Als een klant vraagt om een "veganistische deep-dish met extra basilicum", raakt de robot in de war omdat hij zo'n specifieke aanvraag nog nooit heeft gezien.

Zo hebben de auteurs dit opgelost, met behulp van eenvoudige analogieën:

1. Het Problek: De "Echo Chamber" van Data

Eerdere methoden om trainingsdata te creëren waren goed in het zorgen dat de robot wist dat er veel verschillende tools bestonden. Ze faalden echter op twee belangrijke punten:

  • Linguïstische Diversiteit: Ze leerden de robot alleen hoe hij moest antwoorden wanneer mensen vragen stelden op precies dezelfde stijve, formele manier. Ze leerden hem niet hoe hij moest omgaan met straattaal, informele gesprekken of vreemde zinsstructuren.
  • Argument Diversiteit: Ze leerden de robot alleen over de meest populaire opties. Bijvoorbeeld, als de tool over aandelen gaat, noemde de trainingsdata alleen maar "Apple" (AAPL) en "Microsoft" (MSFT). De robot leerde nooit wat hij moest doen als iemand vroeg naar een klein, obscuur bedrijfje.

2. De Oplossing: De "Diversiteitschef"

De auteurs bouwten een nieuwe methode om synthetische trainingsdata te genereren. Denk aan deze methode als een "Diversiteitschef" die niet alleen een receptenboek volgt. In plaats daarvan heeft deze chef een speciale regel: "Elke keer dat ik een nieuw gerecht maak, moet het anders smaken dan de laatste 100 gerechten die ik heb gemaakt."

  • Geen Rigide Regels: In tegen tegenstelling tot andere methoden die vertrouwen op een vaste lijst van "typen mensen" (bijv. "De zakenman," "De student"), heeft deze chef geen vooraf geschreven lijst nodig. Hij begrijpt automatisch hoe hij de verzoeken kan variëren.
  • De "Marginale Bijdrage" Truc: De chef kijkt naar de stapel gerechten die al gemaakt zijn. Wanneer hij een nieuw gerecht overweegt, vraagt hij zich af: "Als ik dit nieuwe gerecht aan de stapel toevoeg, maakt het de hele collectie dan interessanter?" Als het antwoord ja is, houdt hij het gerecht. Als het gerecht slechts een kopie is van iets dat er al is, gooit hij het weg.

3. Wat ze Eigenlijk Hebben Gedaan

De onderzoekers gebruikten deze "Diversiteitschef" om een nieuwe set trainingsvoorbeelden te maken voor function-calling agents. Ze richtten zich op twee hoofdingrediënten:

  • De Aanvraag (De Bestelling): Ze genereerden gebruikersvragen die enorm varieerden in de manier waarop ze geformuleerd waren (kort, lang, formeel, straattaal, verwarrend).
  • De Argumenten (De Ingrediënten): Ze zorgden ervoor dat de specifieke waarden die in de verzoeken werden gebruikt, varieerden. In plaats van altijd "New York" te gebruiken voor een stad, gebruikten ze "Nairobi," "Reykjavik" en "Buenos Aires. In plaats van altijd "USD" te gebruiken voor valuta, gebruikten ze "NOK," "RUB" en "XRP."

4. De Resultaten: Een Betere Robot

Ze testten de data van hun nieuwe "Diversiteitschef" tegen andere top-tier methoden (zoals ToolAce en APIGen).

  • De Diversiteitsscore: Hun data was aanzienlijk diverser. Het was niet zomaar een beetje anders; het was een hele nieuwe wereld van variatie.
  • De "Out-of-Distribution" Test: Dit is het belangrijkste deel. Ze trainden een robot op hun data en testten hem op nieuwe vragen die hij nog nooit had gezien (vragen van andere datasets).
    • De Analogie: Stel je voor dat je een student alleen hebt getraind op wiskundeproblemen uit 2020. Daarna heb je hem een toets gegeven met problemen uit 2025.
    • De Uitkomst: De robot die getraind was op de diverse data van de auteurs, presteerde veel beter op deze nieuwe, ongeziene tests. Hij beantwoordde ongeveer 7,4% meer vragen goed op een belangrijke benchmark (BFCL) vergeleken met robots die getraind waren op de oudere, minder diverse methoden.

Samenvatting

Het paper beweert dat door een slim, geautomatiseerd proces te gebruiken om ervoor te zorgen dat trainingsdata linguïstisch gevarieerd is (verschillende manieren van spreken) en argumentatief gevarieerd is (verschillende specifieke waarden), je een veel robuustere AI-agent kunt bouwen. Deze agent memoriseert niet alleen specifieke voorbeelden; hij leert om te gaan met de rommelige, onvoorspelbare realiteit van hoe echte mensen daadwerkelijk praten en wat ze daadwerkelijk vragen.

Wat ze NIET hebben beweerd:

  • Ze beweerden niet dat dit werkt voor gesprekken met meerdere beurten (lange heen-en-weer gesprekken); ze richtten zich strikt op verzoeken met één beurt (single-turn).
  • Ze beweerden niet dat dit werkt voor talen andere dan het Engels.
  • Ze beweerden niet dat dit een "wondermiddel" is voor alle AI-problemen, maar specifiek voor de taak om agents te leren hoe ze correct tools aanroepen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →