Adaptive Domain Modeling with Language Models: A Multi-Agent Approach to Task Planning
Dit artikel introduceert TAPAS, een multi-agent framework dat Large Language Models combineert met symbolische planning om automatisch domeinmodellen te genereren en aan te passen voor complexe taakplanning zonder handmatige omgevingsdefinities te vereisen, waarbij sterke prestaties worden aangetoond in zowel benchmark- als gesimuleerde real-world omgevingen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een robot probeert te leren hoe hij het avondeten moet koken. In de oude dagen moesten wetenschappers een enorme, rigide instructiehandleiding schrijven voor elk mogelijk scenario: "Als de pot rood is, doe X. Als de pot blauw is, doe Y." Als de robot een groene pot tegenkwam, of een taak die hij nog niet eerder had gezien, liep hij vast omdat de handleiding dat niet beschreef. Dit is de wereld van symbolische planning, waarbij computers strikte, vooraf geschreven regels volgen. Het is krachtig, maar het is als een GPS die alleen wegen kent die op een kaart uit 1990 staan getekend; als er een nieuwe weg wordt geopend, raakt de GPS de weg kwijt.
Aan de andere kant hebben we nu Large Language Models (LLMs), de superintelligente AI-hersenen die kunnen chatten, verhalen kunnen schrijven en menselijke taal begrijpen. Ze zijn ongelooflijk flexibel en kunnen raden wat je bedoelt, zelfs als je je dingen vreemd uitdrukt. Echter, ze zijn ook een beetje als een briljante maar slordige kunstenaar: ze kunnen een plan bedenken dat geweldig klinkt, maar fysiek onmogelijk is voor een robot om daadwerkelijk uit te voeren, of ze kunnen de wetten van de natuurkunde volledig uit het oog verliezen.
De grote vraag voor wetenschappers is: Hoe combineren we de strikte betrouwbaarheid van de oude regelvolgende robots met de flexibele, creatieve hersenen van de nieuwe AI? We hebben een systeem nodig dat een rommelige, realistische aanvraag kan begrijpen zoals "Maak een toren met het grootste blok onderop," en vervolgens kan uitzoeken hoe hij die moet bouwen, zelfs als de robot nog nooit een "grootste blok" heeft gezien. Dit is waar het papier dat je nu gaat lezen over gaat, dat een nieuwe manier biedt om robots on the fly te laten leren.
Maak kennis met TAPAS: Het team van creatieve architecten van de robot
Maak kennis met TAPAS (Task-based Adaptation and Planning using AgentS). Zie TAPAS niet als één enkel robotbrein, maar als een kleine, zeer georganiseerde bouwploeg die binnen een computer werkt. In plaats van één persoon die alles probeert te doen, verdeelt TAPAS de taak onder drie gespecialiseerde "agents" (kleine AI-werkers), elk met een specifieke rol, die met elkaar communiceren om een plan te bouwen.
Zo werkt dit team, met behulp van een eenvoudige analogie: Stel je voor dat je een toren wilt bouwen van blokken, maar je zegt tegen het team: "Ik wil het rode blok bovenop het blauwe blok."
1. De Domain Generator (De Regelboekschrijver)
Eerst luistert de Domain Generator naar jouw verzoek. In de oude dagen, als de robot niet wist wat "rood" of "blauw" betekende in zijn regelboek, zou hij gewoon zeggen: "Error! Ik ken dat woord niet!" en stoppen. Maar TAPAS is anders. Als de Domain Generator beseft: "Hé, ons huidige regelboek heeft geen manier om kleuren te beschrijven," raakt hij niet in paniek. Hij zegt: "Oké, we moeten een 'kleur'-regel aan ons regelboek toevoegen." Hij herschrijft letterlijk het interne instructieboekje van de robot ter plekke om dit nieuwe concept op te nemen.
2. De Initial State Generator (De Scènezetter)
Vervolgens kijkt de Initial State Generator naar de kamer. Hij ziet de blokken op de tafel. Als het regelboek zojuist is bijgewerkt om "kleur" te bevatten, vraagt deze agent: "Wacht even, welke kleur heeft elk blok?" Als je het hem niet hebt verteld, vraagt hij jou (of de simulatie) om deze informatie. Hij zet het toneel neer en zorgt ervoor dat de robot precies weet waar elk blok staat en welke kleur het heeft, passend bij de nieuwe regels.
3. De Goal State Generator (De Doelsteller)
Ten slotte kijkt de Goal State Generator naar jouw wens: "Rood bovenop blauw." Hij controleert het nieuwe regelboek en de scène. Hij zegt: "Begrepen. Het doel is om ze te stapelen zodat het rode blok bovenop ligt."
De magie van "Tool-Calling"
Het coolste deel is hoe ze met elkaar praten. Ze gokken niet alleen; ze gebruiken "tools" (gereedschappen). Als de Goal Generator een probleem ziet (zoals: "We kunnen blokken niet stapelen op basis van grootte omdat we nog geen 'grootte'-regel hebben"), haalt hij een tool tevoorschijn genaamd missing_fluent en zegt tegen de Domain Generator: "Hé, we hebben een regel nodig voor grootte!" De Domain Generator werkt dan het regelboek bij, en het hele team begint opnieuw met de nieuwe, betere instructies. Het is als een groep vrienden die een Lego-set bouwt waarbij, als ze merken dat ze een specifiek onderdeel missen, één vriend even naar de winkel rent om het te kopen, waarna ze allemaal samen verder bouwen.
Van "Wat" naar "Hoe": Het Executieteam
Zodra het plan is geschreven, moet TAPAS de robot daadwerkelijk laten bewegen. Dit is lastig omdat het plan kan zeggen "Plaats blok A op blok B," terwijl de fysieke arm van de robot misschien alleen weet hoe hij "Gripper naar coördinaten X, Y, Z moet bewegen."
TAPAS gebruikt een Plan Executor om deze kloof te overbruggen. Het fungeert als een vertaler.
- De Vertaler: Het neemt het chique, hoogwaardige plan en zet het om in eenvoudige, natuurlijke taalinstructies zoals "Beweeg je arm naar links" of "Pak het rode blok."
- De ReAct Agent: Dit is het "Reason and Act" (Redeneer en Handel) brein van de robot. Het kijkt naar de instructie, controleert welke tools (vaardigheden) de robot daadwerkelijk heeft, en kiest de beste. Als de robot probeert een blok te pakken en de plank misslaat, zegt de Validator Agent (de supervisor): "Oeps, dat werkte niet. Probeer het opnieuw, maar beweeg je arm misschien langzamer."
Wat hebben ze gevonden?
De auteurs hebben TAPAS op twee belangrijke manieren getest: op klassieke logische puzzels en in een gesimuleerd 3D-huis genaamd VirtualHome.
1. De Logische Puzzels (De Benchmarks)
Ze hebben TAPAS getest op zeven verschillende planningsuitdagingen, zoals de beroemde "Blocksworld" (blokken stapelen) en "Barman" (drankjes mengen).
- Het resultaat: TAPAS was ongelooflijk goed. Bij het gebruik van een topmodel (GPT-4o) loste het 97% van de "Barman"-problemen op en 100% van de "Blocksworld"-problemen.
- De vergelijking: Dit was veel beter dan het gebruik van andere AI-modellen of het simpelweg proberen te dwingen de AI alles te laten doen zonder een gestructureerd plan. In de "Blocksworld"-test loste TAPAS bijvoorbeeld 100% van de problemen op, terwijl andere methoden aanzienlijk moeite hadden.
2. De "Nieuwe Regels" Test (Aanpassingsvermogen)
Dit is waar TAPAS echt uitblinkt. De onderzoekers gaven de robot taken die hij nog nooit eerder had gezien, zoals "Stapel de blokken zodat het grootste blok onderop ligt" of "Verplaats de blokken, maar zorg ervoor dat de robot niet zonder batterij komt te zitten."
- Het resultaat: TAPAS kwam er succesvol achter dat het "grootte" of "batterij"-regels aan zijn regelboek moest toevoegen. Dit deed het automatisch.
- Voor de "grootte"-taak paste het de regels aan naar: "Je mag een blok alleen op een groter blok stapelen." Het loste 90% van deze nieuwe, lastige problemen op.
- Voor de "batterij"-taak werden regels toegevoegd over energieverbruik. Het loste 100% van de "Grippers" (robothand) batterijproblemen op.
- De keerzijde: Het was niet perfect. In de "Floortile" (vloertegels schoonmaken) test met batterijbeperkingen loste het slechts 70% van de problemen op. Het paper suggereert dat dit kwam omdat de AI soms het startbatterijniveau raadde in plaats van erom te vragen, wat aangeeft dat het systeem nog steeds voorzichtig moet zijn met het maken van aannames.
3. De VirtualHome Simulatie
Ten slotte plaatsten ze TAPAS in een 3D-simulatie van een huis. De taak was: "Haal een taart uit de koelkast en zet deze op de tafel," en "Warm wat zalm op en zet dit op de tafel."
- Het resultaat: TAPAS genereerde succesvol een plan, vertaalde dit naar acties en stuurde een virtuele robot aan om de koelkast te openen, het eten te pakken, de magnetron te gebruiken en de items op tafel te plaatsen.
- De Geheugentruc: Ze testten ook of TAPAS kon leren van fouten. Ze zeiden tegen het systeem: "De volgende keer dat je de koelkast gebruikt, zorg je ervoor dat je hem dichtdoet, zelfs als ik dat niet zeg." Later, toen de robot voor een soortgelijke taak werd geconfronteerd, herinnerde hij zich deze regel en sloot hij de koelkast automatisch. Dit toonde aan dat TAPAS "procedureel geheugen" kan opslaan om er met de tijd beter in te worden.
Waarom dit ertoe doet (En wat het niet is)
Het paper suggereert dat TAPAS een sterke stap voorwaarts is omdat het het beste van twee werelden combineert: de creativiteit van AI die taal begrijpt en de betrouwbaarheid van strikte planningsregels. Het volgt niet alleen een script; het kan het script herschrijven wanneer de situatie verandert.
De auteurs merken echter ook voorzichtig op dat dit een simulatie is. Ze hebben het getest in een computere wereld (VirtualHome) en op standaard logische puzzels, niet op een echte robot in een rommelige, echte keuken. Hoewel de resultaten veelbelovend zijn, geeft het paper toe dat implementatie in de echte wereld nog steeds uitdagingen kent, zoals het voorkomen dat de AI gaat "hallucineren" (feiten verzinnen) of het afhandelen van fouten die te complex zijn om automatisch te herstellen.
Kortom, TAPAS is als een robot die niet alleen een kaart volgt, maar ook een nieuwe kaart kan tekenen als hij een blokkade vindt, om hulp kan vragen als hij verdwaald is, en de afkorting voor de volgende keer onthoudt. Het is nog geen perfecte robot, maar het is wel een zeer slimme die leert om op zijn voeten te denken.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.