In-the-Flow Agentic System Optimization for Effective Planning and Tool Use
Het artikel introduceert AgentFlow, een trainbaar in-the-flow agentisch framework dat een nieuw Flow-GRPO-algoritme gebruikt om een gespecialiseerde planner binnen een multi-turn loop te optimaliseren, waarbij significante prestatiewinsten worden behaald ten opzichte van bestaande baselines en grotere propriëtaire modellen over diverse redeneer- en tool-use benchmarks.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een superintelligente robot probeert te leren hoe hij een mysterie moet oplossen. Je wilt niet dat hij gewoon gokt; je wilt dat hij een kaart, een vergrootglas en een rekenmachine gebruikt om de waarheid te vinden. Dit is de wereld van Large Language Models (LLM's), die lijken op gigantische, veelgelezen breinen die kunnen praten en redeneren. Onlangs ontdekten wetenschappers een manier om deze breinen nog scherper te maken door ze te laten oefenen: ze proberen een probleem op te lossen, krijgen aan het einde een "goed gedaan" of "nog eens proberen"-signaal en leren van dat resultaat. Dit wordt Reinforcement Learning genoemd.
Er is echter een addertje onder het gras. Wanneer de problemen echt lang en ingewikkeld worden—zoals een detectiveverhaal met twintig aanwijzingen en vijf verschillende hulpmiddelen (een zoekmachine, een code-schrijver, een feitencontroleur)—wordt het aanleren aan de robot een rommeltje. Het is alsof je probeert te leren hoe je een auto bestuurt, een vliegtuig vliegt en een boot vaart, allemaal tegelijkertijd terwijl je geblinddoekt bent. De robot raakt in de war, maakt fouten in een vroeg stadium en kan niet achterhalen welke specifieke stap de crash heeft veroorzaakt. De meeste huidige systemen proberen ofwel alles in één gigantisch brein te doen (wat moeite heeft met lange taken), of ze gebruiken een team van robots die niet van elkaar leren (die vastzitten aan hun oorspronkelijke, onveranderlijke gewoontes).
Dit artikel introduceert een nieuwe manier om deze AI-teams te trainen, genaamd AGENTFLOW. Denk aan een dynamische, levende werkplaats waar een team van gespecialiseerde robots in realtime samenwerkt. In plaats van één groot brein dat alles probeert te doen, verdeelt AGENTFLOW het werk: een Planner bepaalt de volgende zet, een Executor voert de actie uit (zoals het internet afzoeken), een Verifier controleert of het resultaat logisch is, en een Generator schrijft het uiteindelijke antwoord. Ze delen allemaal een "geheugenbord" dat na elke stap wordt bijgewerkt. De magie gebeurt omdat de Planner leert terwijl het team aan het werk is, en niet pas achteraf.
De onderzoekers hebben een speciale trainingsmethode ontwikkeld, genaamd Flow-GRPO. Stel je een spelletje "Hete Aardappel" voor waarbij het team bij elke beurt een enkele "Succes" of "Falen" token teruggeeft aan elke speler. Als het team het mysterie aan het einde oplost, krijgt elke stap die ze hebben gezet een "Goed gedaan!"-signaal. Als ze falen, krijgt elke stap een "Nog eens proberen." Dit helpt de Planner begrijpen dat zelfs de kleine beslissingen die vroeg in het proces werden genomen, invloed hebben op het eindresultaat. Door op deze manier te trainen, leert het systeem direct aan te passen, zijn eigen fouten te herstellen en het juiste gereedschap voor de klus te kiezen.
De resultaten zijn indrukwekkend. Het team heeft dit systeem getest op tien verschillende soorten moeilijke puzzels, variërend van het zoeken naar obscure feiten tot het oplossen van complexe wiskundige problemen en wetenschappelijke vragen. Ondanks dat ze een relatief klein "brein" gebruikten (een model met 7 miljard parameters), versloeg AGENTFLOW veel grotere, beroemde modellen zoals GPT-4o (dat ongeveer 200 miljard parameters heeft) en andere gespecialiseerde AI-systemen. Bijvoorbeeld, bij zoekintensieve taken verbeterde de nauwkeurigheid met bijna 15%, en bij wiskundige problemen steeg het met meer dan 14%. De studie laat zien dat door het AI-team samen te laten leren in de flow van het gesprek, in plaats van in isolatie, ze veel beter worden in plannen, het gebruiken van hulpmiddelen en het oplossen van problemen die vele stappen vereisen. Het gaat niet alleen om het hebben van een groter brein; het gaat erom het team te leren hoe ze effectief kunnen samenwerken.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.