Compiling Agentic Workflows into LLM Weights: Near-Frontier Quality at Two Orders of Magnitude Less Cost
Dit artikel betoogt dat het compileren van agentische workflows direct in de gewichten van kleine, fijngefineerde modellen ("ondergrondse agenten") een kosteneffectief, privé en context-efficiënt alternatief biedt voor de heersende externe orkestratiekaders, waarbij prestaties dicht bij de staat van de kunst worden bereikt voor diverse complexe taken, terwijl belangrijke adoptiebarrières worden overwonnen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Het Grote Idee: Het Recept Bakken in de Chef
Stel je voor dat je een complexe taak moet uitvoeren, zoals het boeken van een ingewikkelde reis of het repareren van een kapotte machine. Momenteel gebruiken de meeste bedrijven een "Manager en Werknemer"-systeem (zogenaamde Agent Orchestration).
- De Huidige Manier (De Manager): Je hebt een zeer slimme, dure "Manager" (een frontier AI-model). Elke keer dat de "Werknemer" (de AI die met je praat) een beslissing moet nemen, stopt de Manager, leest hij een gigantisch reglement, vertelt hij de Werknemer wat hij als volgende moet doen, en wacht hij vervolgens op het antwoord van de Werknemer. Dit gebeurt keer op keer. Het is traag, duur en de Manager moet elke keer het hele reglement opnieuw lezen.
- De Nieuwe Manier (De Ondergrondse Agent): De auteurs stellen een andere aanpak voor: Compileer de procedure in de gewichten. Stel je voor dat je dat gigantische reglement direct in het brein van de Werknemer bakt. Nu is de Werknemer de expert. Hij heeft geen Manager nodig om te vertellen wat hij als volgende moet doen; hij kent het verloop gewoon op natuurlijke wijze. Hij wordt een "Ondergrondse Agent" – een expert die van binnen naar buiten werkt.
Het paper vraagt zich af: Is het bakken van de regels in een kleinere, goedkopere AI eigenlijk net zo goed als het gebruik van een gigantische, dure Manager?
De Drie Hindernissen (En Hoe Ze Die Overwonnen)
De auteurs dachten dat mensen dit niet deden vanwege drie grote angsten. Ze testten deze angsten in drie realistische scenario's: Reisboeking, Zoom-technische ondersteuning en Schadeclaims.
1. De Kwaliteitsangst: "Is een klein brein net zo slim als een groot brein?"
- De Angst: Mensen dachten dat een kleine, goedkope AI (3 miljard of 8 miljard parameters) complexe stappen niet even goed kon uitvoeren als een enorme, dure AI (zoals die van grote technologiebedrijven).
- Het Resultaat: Verrassend genoeg deed de kleine AI bijna het net zo goed als de grote.
- Bij Reizen was de kleine AI iets minder "beleefd" of "gracieus" dan de grote, maar ze kreeg het werk wel correct gedaan.
- Bij Zoom-ondersteuning en Verzekeringen (die veel moeilijker zijn), upgraden ze de kleine AI naar een iets grotere versie (8 miljard). Deze versie kwam op bijna elke maatstaf overeen met de grote, dure AI.
- De Analogie: Het is alsof je een lokale, ervaren monteur huurt (de kleine AI) versus een wereldberoemd raceteam laten overvliegen (de grote AI). Voor het oplossen van je dagelijkse autopech is de lokale monteur 90–98% zo goed, maar kost hij een fractie van de prijs.
2. De Kostenangst: "Is het eigenlijk goedkoper om dit te draaien?"
- De Angst: Mensen dachten dat, zelfs als de kleine AI goedkoop is om te trainen, het draaien ervan toch duur zou kunnen zijn omdat je moet betalen voor de computerkracht.
- Het Resultaat: Het is enorm goedkoper.
- Het "Manager"-systeem moet voor elke zin die de AI zegt een zeer dure API aanroepen.
- Het "Ingebakken"-systeem draait op een standaard computerserver (zelf gehost).
- De Wiskunde: De nieuwe methode is 128 tot 462 keer goedkoper per gesprek.
- De Analogie: De oude manier is alsof je een taxichauffeur $50 betaalt elke keer dat je vraagt om het stuur te draaien. De nieuwe manier is alsof je een auto koopt voor $1.000 en zelf rijdt. Hoe meer je rijdt (hoe complexer de taak), hoe meer geld je bespaart.
3. De Flexibiliteitsangst: "Wat als de regels veranderen? Moet ik dan maanden opnieuw trainen?"
- De Angst: Mensen dachten dat als een verzekeringsmaatschappij een formulier verandert of een reisbureau een beleidswijziging doorvoert, je weken moet wachten om de AI opnieuw te trainen.
- Het Resultaat: Het is snel.
- Het wijzigen van de regels en het opnieuw trainen van de AI duurt 30 tot 50 minuten op standaard hardware.
- De Analogie: Het is niet alsof je een huis helemaal opnieuw moet bouwen; het is meer alsof je de software van je telefoon update. Je kunt het doen in de tijd die het kost om een pot koffie te zetten.
Hoe Het Werkt (De "Ondergrondse" Pijplijn)
Het proces is verrassend eenvoudig:
- Teken de Kaart: Je tekent een stroomdiagram van hoe het gesprek moet verlopen (bijv. "Vraag om data" -> "Controleer budget" -> "Toon opties").
- Oefenronde: Een super-slimme AI (de "Leraar") speelt dit diagram duizenden keren af en creëert nep-gesprekken.
- Bak het Brein: Je leert een kleinere AI deze nep-gesprekken. De AI leert het patroon van het gesprek, niet alleen de woorden.
- Ga Live: Je zet de kleine AI in. Hij heeft het stroomdiagram niet meer nodig; het stroomdiagram is nu onderdeel van zijn geheugen. Hij praat direct met je.
Het Oordeel
Het paper concludeert dat voor taken met duidelijke stappen (zoals boeken, ondersteuning of claims), je geen Manager nodig hebt.
- Persistente Structuur hoort in de gewichten: De regels van het spel moeten in het brein van de AI gebakken worden.
- Transiente Staat hoort in de prompt: De specifieke details van jouw reis of jouw kapotte Zoom-verbinding moeten in het gesprek aan de AI verteld worden.
Door de regels van de "Manager" naar het "brein van de Werknemer" te verplaatsen, krijg je bijna perfecte kwaliteit voor twee grootteordes (100x) lagere kosten, met de mogelijkheid om de regels in minder dan een uur bij te werken.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.