Towards Scalable Customization and Deployment of Multi-Agent Systems for Enterprise Applications
Dit artikel stelt een verenigd tweestaps raamwerk voor dat geavanceerde technieken voor model-customisatie combineert met inferentie-optimalisaties zoals speculative decoding en FP8-kwantisatie om een schaalbare, kostenefficiënte en robuuste implementatie van op LLM gebaseerde multi-agent systemen voor enterprise-toepassingen mogelijk te maken, waarbij een 4,48x doorvoersnelheidverbetering wordt bereikt.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een drukke, luxe autodealer runt. Je hebt een team van vijf briljante, gespecialiseerde experts (een Multi-Agent Systeem) die samenwerken om een klant te helpen bij het plannen van een proefrit.
- De Begrijper luistert naar wat de klant wil.
- De Planner bedenkt de beste stappen die genomen moeten worden.
- De Evaluator fungeert als een veiligheidsbewaker en controleert of het plan veilig en logisch is.
- De Uitvoerder boekt daadwerkelijk de afspraak.
- De Uitlegger vertelt de klant de definitieve details.
In het verleden werd dit team gerund door een "Super-Expert" (een enorm AI-model). Hoewel de Super-Expert ongelooflijk slim was, was hij traag, duur om in te huren en nam hij een enorme hoeveelheid kantoorruimte (rekenkracht) in beslag. Als een klant een complexe vraag stelde, moest het team de Super-Expert vijf keer apart aanroepen, wat leidde tot lange wachttijden en hoge rekeningen.
De auteurs van dit artikel (van Capital One) wilden de intelligentie van het team behouden, maar het sneller, goedkoper en gemakkelijker te draaien maken. Dit deden ze in twee hoofdfasen: Het Trainen van een Nieuwe Stagiair en Het Optimaliseren van de Workflow.
Fase 1: Het Trainen van een Nieuwe Stagiair (Agentic Model Customization)
In plaats van voor elke taak te vertrouwen op de trage Super-Expert, besloten ze om een kleinere, snellere "Stagiair" (een compact AI-model) het werk te laten doen. Maar ze gaven de Stagiair niet zomaar een tekstboek; ze gebruikten een slimme driestaps trainingskamp:
Stap 1: De Contextuele Crashcourse (Continual Pretraining):
Normaal gesproken, wanneer je een nieuwe werknemer een specifieke sector leert (zoals autoverkoop), kunnen ze hun normale taalvaardigheid vergeten of hun algemene slimheid verliezen. Om dit op te lossen, gaven de auteurs de Stagiair vóór elke les "contextuele aanwijzingen". Stel je voor dat je een hoofdstuk van een boek leest, maar dat je vóór je begint, eerst een korte samenvatting van het vorige hoofdstuk leest. Dit hield de Stagiair vloeiend en voorkwam dat ze hun algemene vaardigheden vergaten terwijl ze de regels van de autodealer leerden.Stap 2: Schaduwen van de Meester (Supervised Fine-Tuning):
De Stagiair keek hoe de Super-Expert duizenden echte klantgesprekken afhandelde. Echter, de Super-Expert maakte soms kleine fouten of gaf antwoorden die technisch wel correct waren, maar niet perfect. Om dit op te lossen, gebruikten ze een nog slimmere "Rechter"-AI om het werk van de Super-Expert te beoordelen en de antwoorden te herschrijven tot ze perfect waren. De Stagiair leerde vervolgens van deze perfecte herschreven antwoorden, en niet van de ruwe versies.Stap 3: Leren wat Klanten Echt Leuk Vinden (Preference Optimization):
Soms zijn er twee manieren om een vraag te beantwoorden. De ene is veilig, de andere is riskant. De Stagiair moest leren welke de voorkeur heeft van de klant. Het team liet de Staciair paren van antwoorden zien: "Deze is goed (Gekozen)" versus "Deze is slecht (Afgewezen)". De Stagiair leerde het "Gekozen" pad te kiezen, waardoor het gedrag werd afgestemd op wat het bedrijf daadwerkelijk wilde.
Het Resultaat: Ze hadden nu een kleine, snelle Stagiair die net zo goed was in het werk als de gigantische Super-Expert, maar het was veel lichter en gemakkelijker te beheren.
Fase 2: De Workflow Superchargen (Inference Optimization)
Zelfs met een snelle Stagiair was het systeem nog steeds een beetje traag vanwege de manier waarop de computer de informatie verwerkte. Ze voegden twee "turbo-boosts" toe:
De "Raad en Controleer"-truc (Speculative Decoding):
Normaal gesproken schrijft de AI één woord tegelijk, waarbij het na elke letter zijn werk controleert. Dit is als het typen van een zin letter voor letter, waarbij je na elke letter op "Enter" drukt.
De auteurs voegden een kleine "Draft Assistant" toe (een zeer klein AI-model) die de volgende paar woorden voorspelt voordat de hoofd-Stagiair ze schrijft. De hoofd-Stagiair controleert dan snel of die voorspellingen juist zijn. Als ze dat zijn, accepteert hij ze allemaal tegelijk. Het is alsoal de Draft Assistant de hele zin op een servetje schrijft, en de Stagiair er alleen maar een stempel "Goedgekeurd" op zet. Dit bespaart een enorme hoeveelheid tijd.Het "Lichtgewicht Uniform" (FP8 Quantization):
AI-modellen dragen meestal zware "kleding" (getallen met een hoge precisie) die veel geheugen in beslag nemen. De auteurs vervingen deze zware kleding door "lichtgewicht uniformen" (een specifiek type gecomprimeerde wiskunde genaamd FP8). Dit zorgde ervoor dat het model de helft minder geheugen gebruikte en twee keer zo snel liep, zonder dat de Stagiair vergat hoe hij zijn werk moest doen.
De Einduitslag
Door de Slimme Stagiair te combineren met de "Raad en Controleer"-truc en het Lichtgewicht Uniform, bereikte het team iets verbazingwekkends:
- Snelheid: Het systeem is nu 4,48 keer sneller dan de oorspronkelijke opstelling.
- Kwaliteit: Het nieuwe systeem werd niet dommer; het handelde complexe, lastige situaties (zoals lange gesprekken of ongebruikelijke verzoeken) zelfs beter af dan het oorspronkelijke gigantische model.
- Kosten: Omdat het sneller is en minder geheugen gebruikt, kost het veel minder om te draaien.
De Belangrijkste Les:
Dit artikel leert ons dat je geen gigantisch, traag brein nodig hebt om complexe problemen op te lossen. Als je een kleiner brein zorgvuldig traint (met de juiste data en methoden) en het de juiste instrumenten geeft (zoals de "Raad en Controleer"-truc), kun je een systeem bouwen dat zowel ongelooflijk snel als ongelooflijk slim is. Het gaat erom slimmer te werken, niet alleen harder.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.