Skill Blocks: How Should an Agent Load Its Skill? A Caching-Correct Comparison of Pre-load, On-Demand Tool-Loading, Progressive Disclosure, and Hybrid
Dit artikel evalueert vier strategieën voor het laden van vaardigheden voor AI-agenten en toont aan dat hoewel geen enkele methode universeel superieur is, hybride en progressieve onthullingsbenaderingen het tokenverbruik aanzienlijk verminderen — met name voor grote, meerzetelijk taken — zonder de kwaliteit van de output in gevaar te brengen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
In de evoluerende wereld van kunstmatige intelligentie is er een groeiende behoefte om computerprogramma's te leren hoe ze zich als specialisten kunnen gedragen. In plaats van de kern van het brein van de software te herschrijven, voegen ingenieurs nu "vaardigheden" toe—gedetailleerde instructiehandleidingen die het systeem vertellen hoe het specifieke taken moet uitvoeren, zoals het zoeken naar informatie, het manipuleren van spreadsheets of het navigeren door een virtuele omgeving. Deze handleidingen worden door de AI gelezen elke keer dat er iets wordt gevraagd. Echter, er is een praktisch probleem ontstaan: deze handleidingen zijn vaak erg lang en bevatten honderden pagina's aan regels en voorbeelden. Wanneer een AI een eenvoudige vraag krijgt, moet hij vaak de hele enorme handleiding lezen, zelfs als 90 procent van de tekst volkomen irrelevant is voor de taak. Dit verspilt computermiddelen en vertraagt het proces, vergelijkbaar met een bibliothecaris die erop staat elk boek in de bibliotheek te lezen voordat hij een klant helpt bij het vinden van één specifiek feit.
Onderzoekers bij Microsoft zetten zich in om dit efficiëntieprobleem op te lossen door een eenvoudige vraag te stellen: als je een grote vaardigheidshandleiding hebt, wanneer moet je elk deel ervan aan de AI laten zien? Ze testten vier verschillende manieren om deze informatie te leveren. De eerste methode was de traditionele aanpak: het laden van de volledige handleiding bij elke gelegenheid. De tweede methode, genaamd "Skill Block", hield slechts een kleine kern van instructies zichtbaar en stond de AI toe om alleen specifieke extra secties op te vragen wanneer hij voelde dat hij ze nodig had. De derde methode, "Reference", toonde de AI een korte catalogus van de inhoud van de handleiding en liet de AI zelf kiezen welke sectie hij als volgende zou lezen. De vierde methode, "Hybrid", bood vooraf een zeer korte samenvatting van elke sectie, waardoor de AI direct kon beslissen of de volledige details nodig waren of dat de samenvatting voldoende was. Het team testte deze methoden over vijf verschillende soorten taken, variërend van enkelvoudige vragen tot complexe, meerstaps-problemen die vereisten dat de AI informatie over meerdere beurten in een gesprek onthield.
De resultaten toonden aan dat er geen enkele beste manier is om deze vaardigheden te laden; de juiste keuze hangt volledig af van de grootte van de handleiding en de aard van de taak. Voor eenvoudige, eenmalige vragen bleek de "Hybrid"-aanpak de meest efficiënte. Door een korte samenvatting van elke sectie te bieden, kon de AI meestal vinden wat hij nodig had zonder ooit de volledige tekst op te vragen, wat een aanzienlijke hoeveelheid data bespaarde. In één test met een grote set vragen verminderde deze methode de hoeveelheid informatie die de AI moest verwerken met bijna 28 procent vergeleken met het lezen van de hele handleiding. Echter, voor zeer kleine handleidingen of taken waarbij de AI herhaaldelijk dezelfde instructies nodig heeft, maakte de extra inspanning om informatie op te vragen of samenvattingen te lezen het proces juist trager en duurder, wat geen echt voordeel bood ten opzichte van het gewoon in één keer lezen van het geheel aan het begin.
De bevindingen werden nog interessanter toen de onderzoekers naar complexe, meerstaps-taken keken waarbij de AI context moet onthouden tijdens een lang gesprek. In deze scenario's blonken de "Skill Block"- en "Hybrid"-methoden uit wanneer de handleidingen groot waren en veel secties bevatten die zelden werden gebruikt. Omdat de AI alleen de specifieke delen laadde die hij nodig had voor elke stap, voorkwam hij de zware kosten van het voortdurend opnieuw verzenden van de ongebruikte handleiding. In een complexe simulatie betreffende wetenschappelijke redenering verminderden deze on-demand methoden de effectieve datalast met meer dan 60 procent vergeleken met de traditionele methode. De onderzoekers merkten op dat deze besparing zo groot was dat deze de kleine kosten van het opvragen van de informatie overtrof. Daarentegen, in taken waar de instructies kort waren en bij elke stap nodig waren, verdween het voordeel van deze slimme laadmethoden, en presteerden de systemen ongeveer hetzelfde als de traditionele aanpak.
Een cruciaal onderdeel van dit onderzoek was hoe de onderzoekers de kosten maten. Ze realiseerden zich dat het simpelweg tellen van het totaal aantal woorden dat naar de AI werd verzonden misleidend kon zijn, vooral in lange gesprekken. Moderne systemen onthouden vaak eerdere delen van het gesprek, waardoor ze niet de volledige woorden die al eerder zijn gezien, opnieuw hoeven te verwerken. Het team ontwikkelde een manier om alleen de nieuwe informatie te tellen, terwijl ze een kleine korting gaven op de herhaalde delen. Toen ze deze nauwkeurigere boekhouding toepasten, werden de voordelen van de slimme laadmethoden nog duidelijker voor grote, complexe taken. Ze ontdekten echter ook dat als de instructies te klein waren of als de AI te vaak om informatie moest vragen, de overhead van het beheren van die verzoeken de besparingen teniet kon doen.
Uiteindelijk suggereert de studie dat de beste strategie om AI-vaardigheden te onderwijzen, het afstemmen van de leveringsmethode op de taak is. Als de handleiding kort is of de taak vereist constant dezelfde instructies, is het beter om alles in één keer te laden. Maar als de handleiding lang is en de AI op elk gegeven moment slechts een klein stukje ervan nodig heeft, is een slim systeem dat informatie alleen laadt wanneer dat nodig is, superieur. De onderzoekers vonden dat een "Hybrid"-aanpak, die een snel overzicht van alle opties biedt, het beste werkt voor eenvoudige taken, terwijl een "Skill Block"-aanpak, die de AI laat dieper graven wanneer dat nodig is, het beste werkt voor complexe, langlopende projecten. Dit werk beweert geen universele regel te hebben gevonden die voor elke situatie geldt, maar het biedt een duidelijke kaart voor ingenieurs om te beslissen hoe ze de kennisbasis van hun AI moeten structureren om tijd en middelen te besparen zonder prestaties op te offeren.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.