Token Optimization and Context Window Management in Multi-Agent AI Workflows
Dit artikel presenteert een praktisch kader voor het optimaliseren van tokengebruik en het beheren van contextvensters in multi-agent AI-workflows, waarbij wordt aangetoond door middel van productiegegevens en gecontroleerde studies dat strategieën zoals contextstratificatie en "relevantie-contrast" contextcompositie de latentie en kosten aanzienlijk kunnen verlagen terwijl de modelnauwkeurigheid wordt verbeterd.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
In de snel evoluerende wereld van kunstmatige intelligentie is een nieuw type systeem ontstaan waarbij meerdere computerprogramma's, of "agenten", samenwerken om complexe problemen op te lossen. Stel je een team van digitale assistenten voor: één verzamelt informatie, een ander organiseert het, en een derde schrijft een eindrapport. Om deze teams te laten functioneren, vertrouwen ze op grote taalmodellen, die de motoren zijn die hun denken aandrijven. Deze motoren hebben echter een strikte limiet aan hoeveel informatie ze op elk gegeven moment in hun "werkgeheugen" kunnen vasthouden. Deze limiet wordt gemeten in tokens, wat kleine tekstuele eenheden zijn die woorden en zinnen vormen. Wanneer een workflow te lang of te overvol raakt met onnodige details, vertraagt het systeem, kost het meer geld om te draaien, en maakt het soms fouten omdat de belangrijke feiten verloren gaan in een zee van ruis. De uitdaging voor ingenieurs is niet alleen om slimmere agenten te bouwen, maar om hen te leren hoe ze hun geheugen efficiënt kunnen beheren, zodat ze alleen kijken naar wat werkelijk noodzakelijk is om de taak goed uit te voeren.
Een recente studie door onderzoeker Dvir Shamay pakt exact dit probleem aan, waarbij zij verder gaat dan theoretische ideeën om praktische methoden te testen in een echte productieomgeving. Het onderzoek richt zich op een dashboard dat wordt gebruikt om engineeringwerk te volgen, een systeem dat voortdurend vergadertranscripten, e-mails en chatberichten opneemt om belangrijke taken te extraheren en voortgang te samenvatten. Het team ontdekte dat door zorgvuldig te herstructureren hoe informatie naar de AI wordt gevoerd, ze de tijd die nodig is om gegevens te verwerken en de benodigde rekenkracht drastisch konden verminderen. Ze ontdekten dat de meest effectieve aanpak niet was om de AI een enorme blok tekst te voeren die alles bevat, maar om alleen het specifieke type gegevens te sturen dat nodig is voor elke stap. Door gegevens één keer op te halen en lokaal te verwerken, in plaats van het systeem herhaaldelijk om dezelfde informatie te vragen, verminderden ze de tijd die nodig is om een nieuwe set taken te laden van ongeveer drieënhalf tot tienënhalf minuut naar tussen de zesentwintig en honderdvijftien seconden. Deze verandering verlaagde ook de geschatte kosten van de verwerking met zestig tot zeventig procent, wat bewees dat betere organisatie net zo krachtig is als een krachtigere computer.
Misschien wel de meest verrassende ontdekking in de studie daagt een algemene intuïtie uit over hoe deze systemen leren. Ingenieurs gaan er vaak van uit dat ze, om de beste resultaten te krijgen, de AI alleen de meest relevante, hoogwaardige informatie moeten voeden door de rest weg te filteren. De onderzoekers testten dit door de AI te vragen om belangrijke items te identificeren uit een lijst met werkplekcommunicatie. Ze vergeleken prompts die volledig gevuld waren met hoog-relevante items met prompts die hoog-relevante items mengden met minder relevante, maar nog steeds gerelateerde, inhoud. Tegenintuïtief genoeg presteerde het systeem beter wanneer de lijst enkele "ruis"-items bevatte—items die niet cruciaal waren, maar wel tot hetzelfde onderwerp behoorden. Wanneer de AI voorbeelden zag van wat niet belangrijk was, werd het veel beter in het onderscheiden van wat wel belangrijk was. In de tests verbeterde het mengen van vijftig procent belangrijke items met vijftig procent minder belangrijke items de nauwkeurigheid van de scoring van de AI met een aanzienlijke marge vergeleken met het gebruik van alleen de belangrijke items. Dit suggereert dat de AI het contrast tussen signaal en ruis moet zien om zijn eigen oordeel te kalibreren, net zoals een persoon verschillende temperaturen moet ervaren om te begrijpen wat "warm" werkelijk betekent.
De studie onderzocht ook hoe de volgorde van informatie de prestaties beïnvloedt. Hoewel sommige theorieën suggereren dat informatie die in het midden van een lange lijst staat, genegeerd wordt, ontdekten de onderzoekers dat voor kortere lijsten de arrangement minder belangrijk was dan de ratio van belangrijke versus onbelangrijke items. Ze bevestigden echter wel dat wanneer de lijst erg lang wordt, het begraven van cruciale feiten in het midden er inderdaad toe kan leiden dat ze worden gemist. Een ander praktisch bevinding betrof de aanpak van meerdere pogingen tot dezelfde taak. Wanneer het systeem vijf keer probeerde informatie te extraheren en vervolgens een slimme AI gebruikte om de resultaten samen te voegen, presteerde het niet beter dan simpelweg de unie te nemen van alle unieke items die over de vijf pogingen heen zijn gevonden. De complexe, intelligente samenvoegingsstap voegde kosten en tijd toe zonder het eindresultaat te verbeteren, wat suggereert dat een eenvoudige mechanische combinatie vaak de meest betrouwbare methode is voor het verzamelen van informatie.
Deze bevindingen bieden een duidelijk pad vooruit voor bouwers van AI-systemen. Het onderzoek demonstreert dat efficiëntie en nauwkeurigheid niet alleen gaan over het kiezen van het meest geavanceerde model, maar over het technisch vormgeven van de informatiestroom. Door gegevens te filteren voordat ze de AI bereiken, net genoeg context toe te voegen om een duidelijke standaard te zetten, en onnodige complexiteit te vermijden in hoe resultaten worden gecombineerd, kunnen teams hun systemen sneller, goedkoper en betrouwbaarder maken. De studie beweert niet elk probleem in kunstmatige intelligentie te hebben opgelost, noch suggereert het dat deze regels voor elke enkele taak gelden. In plaats daarvan biedt het een reeks gemeten, herhaalbare patronen die bewezen hebben te werken in een live productieomgeving. Voor degenen die de toekomst van geautomatiseerd werk bouwen, is de les duidelijk: de sleutel tot betere prestaties ligt vaak niet in het toevoegen van meer, maar in het organiseren van wat je hebt met grotere precisie.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.