Small Reasoning Models are Instruction Followers in Function Calling
Dit artikel introduceert Instruction-Followed Function Calling (IFFC), een framework dat de function-calling logica delegeert aan een kleiner, instructievolgend model om een superieure nauwkeurigheid en robuustheid onder kwantisatie te bereiken vergeleken met native of op prompts gebaseerde benaderingen, met name voor redeneergerichte LLM's.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
In de snel evoluerende wereld van kunstmatige intelligentie vindt er een verschuiving plaats van computers die simpelweg tekst genereren naar systemen die in staat zijn om actie te ondernemen. Deze nieuwe systemen, vaak "agentic" modellen genoemd, zijn ontworpen om problemen op te lossen door contact te zoeken met de buitenwereld. Ze doen dit door gereedschappen te selecteren, zoals weer-apps of rekenmachines, en deze te gebruiken om informatie te verzamelen voordat ze een vraag beantwoorden. Lange tijd waren alleen de krachtigste en duurste computermodellen erop vertrouwd om deze taken uit te voeren. Ze werden gebouwd met een specifieke, rigide interne taal om met deze tools te communiceren, een methode die bekend staat als native function calling. Echter, naarmate de technologie volwassen werd, zijn onderzoekers begonnen naar veel kleinere, efficiëntere computermodellen te kijken. Deze compacte modellen zijn gemakkelijker te draaien op alledaagse apparaten zoals smartphones en laptops, wat zorgt voor betere privacy en lagere kosten, maar ze hadden historisch gezien moeite met de strikte, complexe regels die nodig zijn om externe tools correct te gebruiken.
Een team onderzoekers van universiteiten in Iran heeft de aanname uitgedaagd dat deze kleinere modellen dezelfde rigide regels moeten volgen als de grote modellen om succesvol te zijn. In hun recente werk ontdekten zij dat kleine modellen eigenlijk veel beter presteren wanneer ze wordt gevraagd om tools te gebruiken via een eenvoudige conversatie, in plaats van via een gespecialiseerde, technische commandostructuur. Ze ontdekten dat wanneer een klein model wordt behandeld als een behulpzame assistent die een duidelijke reeks instructies in gewone taal volgt, het veel minder fouten maakt dan wanneer het wordt gedwongen om een specifieke machinecode te spreken. Dit inzicht leidde hen tot de creatie van een nieuw systeem dat de taken verdeelt tussen twee verschillende modellen. Eén klein, snel model fungeert als beslisser, luistert naar de gebruiker en bepaalt of een tool nodig is. Als een tool vereist is, handelt dit kleine model het verzoek af met behulp van instructies in natuurlijke taal. Het hoofdmodel, dat groter is, neemt die informatie vervolgens en formuleert het uiteindelijke antwoord voor de gebruiker.
De onderzoekers testten deze aanpak met een verscheidenheid aan kleine modellen, waarvan sommige met slechts één miljard parameters, een maatstaf voor de grootte en complexiteit van het model. Ze vergeleken hun nieuwe methode met de standaardmanieren waarop deze modellen gewoonlijk worden aangeleerd om tools te gebruiken. De resultaten waren opmerkelijk. Het nieuwe systeem, dat zij Instruction-Followed Function Calling noemden, stelde grotere compacte modellen, zoals de 4-miljard-parameter Qwen-3, in staat om de prestaties van enorme propriëtaire baselines zoals GPT-5.2 en Claude 4.5 Sonnet te overtreffen, die doorgaans als de gouden standaard worden beschouwd. Bijvoorbeeld, het Qwen-3 4B-model dat hun nieuwe methode gebruikte, behaalde een nauwkeurigheid van 94,1% op een Non-Live evaluatiesubset van een moeilijke test voor het gebruik van tools, waarmee het de prestaties van hetzelfde model met traditionele methoden aanzienlijk overtrof. Hoewel de kleinste geteste modellen (0,6B) in bepaalde categorieën nog steeds achterliepen op de zeer grootste propriëtaire reuzen, toonde het framework aan dat gespecialiseerde, redeneer-in staat kleine modellen de prestaties van massieve systemen kunnen evenaren of overtreffen wanneer de architecturale last van rigide tooldefinities wordt weggenomen.
Een cruciaal onderdeel van hun ontdekking was het begrijpen van hoe deze modellen denken. De onderzoekers ontdekten dat modellen die ontworpen zijn om over een probleem na te "denken" voordat ze antwoorden, veel betrouwbaarder zijn dan modellen die direct een reactie genereren. Wanneer deze redeneermodellen de taak kregen om te beslissen welke tool te gebruiken, konden ze hun eigen fouten corrigeren en complexe instructies met hoge precisie opvolgen. Dit was vooral waar bij de modellen die werden gecomprimeerd om op kleinere apparaten te draaien. Normaal gesproken zorgt het kleiner maken van een model of het draaien op minder krachtige hardware ervoor dat de prestaties scherp dalen. De onderzoekers ontdekten echter dat hun nieuwe methode ongelooflijk robuust was. Zelfs wanneer de modellen werden verkleind om zeer weinig geheugen te gebruiken, behielden de modellen die de methode met natuurlijke taalinstructies gebruikten hun hoge nauwkeurigheid. Dit suggereert dat het vermogen om te redeneren en een gesprek te volgen een stabielere fundering is voor toolgebruik dan het memoriseren van een rigide technisch format.
De studie benadrukte ook een gebrek in de huidige manier waarop veel systemen worden gebouwd. Vaak wordt één groot model gevraagd om alles te doen: de gebruiker begrijpen, beslissen welke tool te gebruiken en het uiteindelijke antwoord schrijven. De onderzoekers lieten zien dat deze aanpak het model vaak in verwarring brengt, omdat de complexe details van de tools zich mengen met het gesprek. Door de taken te scheiden, houdt hun nieuwe systeem het gesprek schoon. Het kleine model doet het zware werk van het uitzoeken welke tool te gebruiken, en het hoofdmodel richt zich uitsluitend op het praten met de gebruiker. Deze scheiding voorkomt dat het systeem overweldigd raakt door te veel informatie tegelijk. De onderzoekers demonstreerden dat deze methode goed werkt in realistische scenario's waar snelheid en privacy cruciaal zijn, zoals op een dashboard van een auto of een thuisassistent, waar het verzenden van gegevens naar een verre server geen optie is.
Uiteindelijk suggereert dit werk een nieuwe weg voorwaarts voor kunstmatige intelligentie op alledaagse apparaten. Het laat zien dat we niet hoeven te vertrouwen op enorme, energieverslindende computers om complexe taken uit te voeren. In plaats daarvan, door te veranderen in hoe we kleinere modellen vragen te werken — door hen te behandelen als intelligente assistenten die instructies opvolgen in plaats van machines die code uitvoeren — kunnen we resultaten bereiken die zowel zeer accuraat als efficiënt zijn. De bevindingen wijzen erop dat de toekomst van persoonlijke, private en responsieve kunstmatige intelligentie mogelijk niet ligt in het bouwen van grotere modellen, maar in slimmere manieren om de kleinere modellen die we al hebben te gebruiken.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.