Evoflux: Inference-Time Evolution of Executable Tool Workflows for Compact Agents
Het artikel introduceert Evoflux, een tijdens de inferentie werkende evolutionaire zoekmethode die de uitvoerbaarheid van tool-workflows voor compacte taalmodellen aanzienlijk verbetert door getypeerde workflow-grafen dynamisch te herstellen en te optimaliseren via gestructureerde bewerkingen en uitvoerfeedback, waarbij het traditionele supervised fine-tuning en reinforcement learning-benaderingen in live tool-omgevingen overtreft.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Het Grote Plaatje: Het "Kleine Chef" Probleem
Stel je voor dat je een zeer kleine, budgetvriendelijke keukenrobot hebt (een compact AI-model). Je wilt dat de robot een complex gerecht bereidt door gebruik te maken van gereedschappen uit een enorme, constant veranderende voorraadkast (een live catalogus van tools).
De robot moet:
- De juiste ingrediënten (tools) vinden in de voorraadkast.
- Een recept (workflow) volgen dat de stappen correct verbindt.
- Daadwerkelijk het eten bereiden (de tools uitvoeren) en het resultaat proeven.
Het Probleem: Kleine robots zijn goedkoop en snel, maar ze zijn "broos". Ze schrijven vaak een recept dat er op papier goed uitziet, maar dat mislukt zodra ze proberen te koken. Misschien pakken ze het verkeerde gereedschap, vergeten ze een ingrediënt door te geven aan de volgende stap, of proberen ze een tool te gebruiken die niet meer bestaat.
Meestal proberen we dit op te lossen door de robot te "onderwijzen" door hem duizenden voorbeelden van perfecte recepten te laten zien (trainingsdata). Maar dit artikel stelt dat wanneer je slechts een enkele honderden voorbeelden hebt (een beperkt budget), het onderwijzen van de robot niet goed werkt. De robot onthoudt dan alleen de vorm van het recept, maar leert niet hoe hij fouten moet herstellen wanneer er in de echte keuken iets misgaat.
De Oplossing: Evoflux (De "Evolutionaire Reparatieploeg")
In plaats van te proberen de hersenen van de robot te hertrainen, geeft Evoflux de robot een "reparatieploeg" die werkt terwijl de robot daadwerkelijk aan het koken is.
Zie Evoflux als een dynamische reparatielus:
- De Eerste Poging: De robot schrijft een recept (een workflow graph).
- De Proefdraai: Het systeem probeert het recept uit te voeren. Als het breekt (bijv. "Tool niet gevonden" of "Ingrediënt ontbreken"), vangt het systeem de fout op.
- De Evolutie: In plaats van op te geven, behandelt het systeem het kapotte recept als een gemuteerd organisme. Het maakt kleine, slimme aanpassingen (bewerkingen) om de specifieke fout te herstellen.
- Pakte het het verkeerde gereedschap? Vervang het.
- Vergat het een ingrediënt? Voeg het toe.
- Vonden de stappen plaats in de verkeerde volgorde? Verander de volgorde.
- Survival of the Fittest: Het systeem voert de nieuwe versie uit. Als deze beter werkt, behoudt het deze. Als het faalt, probeert het opnieuw. Dit doet het vele malen in een korte burst, waarbij het recept evolueert totdat het er een heeft gevonden dat het maaltijd daadwerkelijk succesvol bereidt.
Belangrijke Metaforen uit het Papier
- De "Plausibele maar Kapotte" Graph: Het papier merkt op dat kleine modellen vaak workflows genereren die lijken op een geldige kaart, maar die tot aan een afgrond leiden. Evoflux kijkt niet alleen naar de kaart; het rijdt de auto om te zien of de weg echt is.
- Het Debat "Reparatie" versus "Training":
- Training (SFT/DPO): Is als het proberen uit het hoofd leren van een kookboek. Als het kookboek klein is (weinig voorbeelden), leert de robot de stijl van de recepten, maar faalt hij wanneer de ingrediënten veranderen. Het papier vond dat dit bij een klein budget de robot vaak zelfs slechter maakte dan wanneer hij gewoon zou gokken (zero-shot).
- Evoflux (Zoeken): Is als het hebben van een monteur die de auto repareert terwijl je rijdt. Het verandert de hersenen van de bestuurder niet; het fixt alleen de motor in realtime op basis van de wegcondities.
- De "Token Kosten" (Brandstof):
- ReAct (De Oude Manier): Dit is als een robot die heel lang tegen zichzelf praat om de volgende stap te bepalen. Het kan geweldige oplossingen vinden, maar het verbruikt veel brandstof (tokens) en is onvoorspelbaar.
- Evoflux: Dit is efficiënter. Het probeert een paar specifieke reparaties, controleert of ze werken, en stopt. Het behaalt betere resultaten dan training, met minder brandstof dan de langdradige "hardop nadenken"-methode.
Wat het Papier Eigenlijk Heeft Gevonden
De onderzoekers hebben dit getest op een benchmark genaamd MCP-Bench, die gebruikmaakt van echte, live tools (zoals financiële, reis- en wetenschapstools).
- Succespercentage: Voor kleine robots was de kans dat een recept bij de eerste poging werkte zeer laag (ongeveer 3%).
- De Fix: Met Evoflux steeg het succespercentage naar tussen de 17% en 24%.
- Het Falen van Training: Toen ze probeerden de robots te "onderwijzen" met dezelfde enkele honderden voorbeelden die Evoflux gebruikte voor het zoeken, werden de robots niet beter. Sterker nog, ze presteerden vaak slechter dan wanneer ze helemaal niet waren onderwezen.
- De Vergelijking: Een methode genaamd ReAct (waarbij de robot stap-voor-stap nadenkt) kon soms hogere scores halen, maar het was erg inconsistent en duur. Evoflux was betrouwbaarder en goedkoper.
De Kernboodschap
Als je een kleine, goedkope AI-agent hebt en een beperkt aantal voorbeelden om het te leren, probeer het dan niet simpelweg te trainen. Laat het in plaats daarvan proberen, falen, en gebruik vervolgens een slim, evolutionair zoekproces om de fouten in realtime te herstellen.
Het papier concludeert dat voor kleine agenten het aanpassen van het plan terwijl je het uitvoert, een veel betrouwbaardere strategie is dan het proberen te memoriseren van een paar voorbeelden van hoe je het moet uitvoeren.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.