← Nieuwste papers
🤖 AI

Decoupling Planning and Control for Instructable Agents

Dit artikel introduceert Instruct-to-Act, een ontkoppeld framework dat hoogwaardige planning van vision-language modellen combineert met snelle, taal-geconditioneerde wereldmodel-controllers om robuuste, lage-latentie belichaamde controle te bereiken in diverse single- en multi-agent omgevingen.

Oorspronkelijke auteurs: Zineng Tang, Kelsey R. Allen, Sjoerd van Steenkiste, Ishita Dasgupta, Alane Suhr

Gepubliceerd 2026-08-28
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Zineng Tang, Kelsey R. Allen, Sjoerd van Steenkiste, Ishita Dasgupta, Alane Suhr

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

In de wereld van kunstmatige intelligentie bestaat er een hardnekkige kloof tussen denken en doen. Aan de ene kant hebben we grote taalmodellen, de systemen die in staat zijn een complexe instructie te lezen, een doel te begrijpen en dit op te splitsen in een logische opeenvolging van stappen. Deze modellen zijn uitstekend in hoogwaardig redeneren, vergelijkbaar met een mens die de weg wijst, maar ze zijn vaak te traag en onhandig om de fractie van een seconde durende fysieke bewegingen uit te voeren die nodig zijn om door een echte of virtuele wereld te navigeren. Aan de andere kant hebben we gespecialiseerde controlesystemen die onmiddellijk kunnen reageren op hun omgeving en met snelheid en precisie kunnen bewegen, maar die niet het vermogen hebben om abstracte doelen te begrijpen of een gesprek te volgen. Ze zijn als een zeer bekwame atleet die snel kan rennen, maar niet weet waar hij heen moet zonder dat een coach specifieke bevelen schreeuwt. Voor een robot of een digitale agent om echt nuttig te zijn in complexe, veranderende omgevingen, heeft het zowel de mogelijkheid nodig om te plannen als de mogelijkheid om te handelen, maar het combineren van deze twee verschillende capaciteiten is historisch gezien een moeilijke technische uitdaging geweest.

Een team van onderzoekers heeft deze kloof aangepakt met een nieuw systeem genaamd Instruct-to-Act, dat er succesvol in slaagt de taak van het plannen te scheiden van de taak van het aansturen. In plaats van te proberen één enkel, massief model alles tegelijk te laten doen, hebben ze een partnerschap opgebouwd tussen twee gespecialiseerde componenten. De eerste is een planner, die een voorgetraind vision-language model gebruikt om naar de omgeving en het doel van de gebruiker te kijken en vervolgens een eenvoudige, hoogwaardige instructie op te stellen. Het tweede is een controller, een lichtgewicht systeem dat specifiek is getraind om die instructies te nemen en ze om te zetten in een snelle stroom van fysieke acties. De belangrijkste innovatie is dat deze twee delen onafhankelijk van elkaar werken, maar wel synchroon lopen. De planner kan de tijd nemen om na te denken, te redeneren en zelfs met andere agenten te communiceren, terwijl de controller de noodzakelijke bewegingen met hoge snelheid uitvoert, zonder te wachten tot de planner elke gedachte heeft voltooid. Dit ontwerp stelt het systeem in staat om complexe, langdurige taken in videogames en gesimuleerde werelden uit te voeren met een niveau van snelheid en betrouwbaarheid dat eerdere pogingen niet konden evenaren.

De onderzoekers testten deze aanpak in zeven verschillende omgevingen, variërend van klassieke arcade games tot complexe coöperatieve scenario's waarin meerdere agenten moeten samenwerken. In deze tests fungeert de planner als het brein, dat de wereld observeert en beslist wat er als volgende moet gebeuren, terwijl de controller fungeert als de handen en voeten, die het plan in realtime uitvoert. Om de controller te leren hoe hij deze instructies moet volgen, vertrouwden de onderzoekers niet op menselijke experts om elke beweging te demonstreren. In plaats daarvan gebruikten ze de planner zelf om terug te kijken naar de succesvolle acties van de controller en een samenvatting te schrijven van wat er gebeurde. Dit proces stelde de controller in staat om te leren hoe hij vage, natuurlijke taalcommando's kon vertalen naar precieze, laag-niveau bewegingen. Het resultaat is een systeem dat gekoppeld kan worden aan verschillende planners zonder dat het opnieuw getraind hoeft te worden, wat het zeer flexibel maakt.

De bevindingen tonen aan dat deze taakverdeling bijzonder goed werkt. Wanneer de onderzoekers hun systeem vergeleken met andere systemen die proberen acties direct vanuit een groot taalmodel te genereren, bleek hun aanpak aanzienlijk sneller en nauwkeuriger. De directe generatiemethoden struikelden vaak, waarbij ze acties produceerden die te traag of irrelevant waren voor de onmiddellijke situatie. In contrast hiermee behield het Instruct-to-Act-systeem een hoge snelheid van uitvoering terwijl het nog steeds complexe instructies opvolgde. In multi-agent tests, waarbij twee of meer digitale personages moesten coördineren om puzzels op te lossen, stelde het systeem hen in staat om via taal te communiceren, rollen te onderhandelen en gedeelde doelen te bereiken zonder elkaar in de weg te zitten. Het systeem presteerde competitief tegen de sterkste bestaande methoden in zes van de zeven geteste omgevingen, wat bewijst dat een ontkoppelde aanpak zowel de eisen van hoogwaardig redeneren als van lage-latentie controle kan aan, de hand van de eisen van zowel hoogwaardig redeneren als lage-latentie controle.

Een van de meest opvallende aspecten van het werk is de efficiëntie ervan. Omdat de controller een klein, gespecialiseerd model is, kan het visuele informatie verwerken en acties uitvoeren duizenden keren per seconde, terwijl de planner op de achtergrond draait en de strategie alleen bijwerkt wanneer dat nodig is. Dit betekent dat het systeem niet wordt afgeremd door de trage verwerkingstijd van het grote taalmodel. De onderzoekers ontdekten dat deze asynchrone opstelling de agenten effectief liet opschalen; naarmate ze meer agenten toevoegden aan een coöperatieve taak, behield het systeem zijn prestaties zonder de communicatie-bottlenecks die andere multi-agent systemen vaak teisteren. De controller bleef betrouwbaar en volgde instructies met een nauwkeurigheidspercentage tussen de 86% en 97% over verschillende taken en planners, wat aantoont dat het systeem leerde de intentie achter de woorden te begrijpen in plaats van alleen specifieke zinsneden te memoriseren.

De studie onderzocht ook hoe de kwaliteit van de instructies het resultaat beïnvloedt. Ze ontdekten dat zelfs wanneer de instructies werden gegenereerd door verschillende planners of van variërende complexiteit waren, de controller zich kon aanpassen en goed kon presteren. Dit suggereert dat het systeem een robuuste manier heeft geleerd om taal te interpreteren, in plaats van alleen een specifieke set commando's te memoriseren. De onderzoekers merkten op dat het systeem het beste werkt wanneer de instructies duidelijk zijn en geworteld zijn in de onmiddellijke situatie, maar het kan nog steeds beter met ambiguïteit omgaan dan eerdere methoden. Door de planning- en controlelagen gescheiden te houden, creëerden de onderzoekers een raamwerk dat niet alleen krachtig is, maar ook modulair, waardoor ze verschillende planners of controllers kunnen uitwisselen afhankelijk van de specifieke behoeften van de taak.

Uiteindelijk demonstreert dit werk een praktisch pad voor het bouwen van intelligente agenten die in de echte wereld kunnen opereren. Door te erkennen dat denken en handelen verschillende snelheden en verschillende soorten intelligentie vereisen, hebben de onderzoekers een systeem gecreëerd dat de sterke punten van beide benut. De planner biedt de visie en de strategie, terwijl de controller de snelheid en precisie levert. Deze aanpak vermijdt de valkuilen van het proberen te dwingen van een enkel model om alles te doen, wat resulteert in een systeem dat zowel slim als snel is. Terwijl de onderzoekers vooruitgaan, zien ze potentieel voor het toepassen van dit raamwerk op complexere scenario's, inclusief mens-robot samenwerking en taken die langetermijnplanning vereisen in dynamische omgevingen. Het succes van Instruct-to-Act suggereert dat de toekomst van embodied AI wellicht niet ligt in het bouwen van grotere, monolithische modellen, maar in het ontwerpen van slimmere, efficiëntere partnerschappen tussen verschillende soorten intelligentie.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →