← Nieuwste papers
💻 computer science

Any House Any Task: Scalable Long-Horizon Planning for Abstract Human Tasks

Het artikel stelt AHAT voor, een schaalbaar framework voor planning op lange termijn dat een LLM gebruikt die is getraind via een nieuw reinforcement learning-algoritme (TGPO) om ambigue menselijke instructies en scene graphs te vertalen naar PDDL-subdoelen, waardoor robots optimale plannen kunnen genereren voor complexe huishoudelijke taken in grote omgevingen.

Oorspronkelijke auteurs: Zhihong Liu, Yang Li, Rengming Huang, Cewu Lu, Panpan Cai

Gepubliceerd 2026-08-04
📖 7 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Zhihong Liu, Yang Li, Rengming Huang, Cewu Lu, Panpan Cai

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een robot probeert te leren je rommelige kamer op te ruimen. Je wilt het robot niet een stapsgewijze handleiding geven zoals "pak de sok op, loop daarna twee stappen, buig dan voorover". Dat is te saai en te kwetsbaar; als de sok verplaatst, raakt de robot in de war. In plaats daarvan wil je gewoon zeggen: "Maak deze kamer netjes," en de robot de rest laten uitzoeken. Dit is de heilige graal van de robotica: een vage, menselijke wens omzetten in een perfect actieplan in de fysieke wereld.

Om dit te doen, gebruiken wetenschappers vaak twee verschillende hulpmiddelen. De eerste is een Large Language Model (LLM), wat een soort superintelligente, veelbeleste bibliothecaris is die miljoenen feiten over de wereld kent, maar soms verhalen verzint of de regels van de natuurkunde vergeet. De tweede is een Symbolic Planner, die een soort strikte, onbuigzame wiskundeleraar is die regels perfect volgt, maar geen idee heeft wat "netjes" betekent of hoe hij met mensen moet praten. De grote uitdaging is om de praatgrage bibliothecaris en de strikte wiskundeleraar samen te laten werken zonder dat de bibliothecaris de robot in een loop laat lopen of de wiskundeleraar weigert te beginnen omdat de instructies te vaag zijn.

Dit is precies het probleem dat wordt aangepakt in een nieuw artikel genaamd TGPO (Trace-Guided Policy Optimization). De onderzoekers proberen een robot te leren hoe hij grote, vage menselijke commando's kan afbreken in een reeks kleine, controleerbare stappen die een robot daadwerkelijk kan volgen. Ze ontdekten dat het simpelweg vragen aan een slimme AI om "het gewoon te doen" vaak leidt tot plannen die er op papier goed uitzien, maar in de echte wereld falen. In plaats daarvan hebben ze een slimme trainingsmethode ontwikkeld waarbij de AI leert om een "trace" (spoor) van zijn eigen denkproces te genereren, gecorrigeerd wordt door een helper wanneer hij een fout maakt, en het vervolgens opnieuw probeert. Het is also': een student niet alleen te onderwijzen door aan het einde een cijfer te geven, maar door hem door zijn huiswerk heen te begeleiden, zijn logische fouten in realtime te corrages en hem te laten oefenen totdat hij het goed doet. Het resultaat is een systeem dat veel beter is in het plannen van lange, complexe taken — zoals het voorbereiden van een heel huis voor een feestje — dan eerdere methoden, vooral wanneer de instructies vaag zijn.

Het Probleem: De "Toverstaf" die Breekt

Stel je voor dat je een robot-butler hebt. Je zegt tegen hem: "Ik organiseer een festivalbijeenkomst, dus ruim het huis op." Een mens begrijpt dit onmiddellijk: een mens weet dat er afval opgepakt, tafels afgeveegd en misschien decoraties neergezet moeten worden. Maar voor een robot is dit een nachtmerrie. Als je een standaard AI vraagt om gewoon "een plan te schrijven", kan deze gaan hallucineren. De AI kan bijvoorbeeld zeggen: "Verplaats de bank naar de keuken," zelfs als de bank te zwaar is, of "Zet het fornuis aan om de vloer schoon te maken," wat een vreselijk idee is.

Het artikel legt uit dat huidige AI-modellen erg goed zijn in het raden van het volgende woord in een zin, maar dat ze erg slecht zijn in het waarborgen dat hun plannen haalbaar zijn. Ze maken kleine fouten in een vroeg stadium — zoals het vergeten van het oppakken van een beker voordat een tafel wordt verplaatst — en die fouten stapelen zich op als een kaartenhuis totdat het hele plan instort. Aan de andere kant zijn traditionele robot-planners erg veilig; ze doen niets onmogelijks. Maar ze zijn ook erg dom; ze hebben je nodig om hen precies te vertellen wat ze moeten doen in een zeer specifieke code (genaamd PDDL), en ze begrijpen de nuance van "opruimen voor een feestje" niet.

De Oplossing: TGPO (De "Trace-Guided" Coach)

De auteurs stellen een nieuwe manier voor om robots te trainen genaamd Trace-Guided Policy Optimization (TGPO). Zie TGPO niet als een robot die gewoon gokt, maar als een student die leert met een zeer strikte, behulpzame coach.

Zo werkt de training, met een eenvoudige analogie:

  1. De Student (De AI Policy): Het brein van de robot probeert jouw commando ("Ruim op voor het feestje") af te breken in een lijst met subdoelen. Misschien zegt het: "1. Ruim afval op. 2. Was de afwas. 3. Stofzuig."
  2. De Coach (De Verifier): Een strikte controleur bekijkt deze lijst. Hij vraagt: "Wacht eens even, kun je wel de afwas doen als de gootsteen vol ligt met voedselresten? Ben je vergeten de stoelen te verplaatsen voordat je gaat stofzuigen?"
  3. De "Trace" Correctie: Als het plan van de student fout is, zegt de Coach niet simpelweg "Fout". In plaats daarvan kijkt hij naar het denkproces (de trace) en corrigeert hij de specifieke fout. De coach kan zeggen: "Je bent vergeten eerst de gootsteen leeg te maken. Hier is de gecorrigeerde lijst met stappen."
  4. De Oefenlus: De robot neemt vervolgens deze gecorrigeerde lijst en probeert de rest van het plan op basis daarvan te genereren. De robot leert van de correctie, niet alleen van het uiteindelijke "geslaagd/gezakt"-resultaat.

Dit is anders dan hoe de meeste AI tegenwoordig wordt getraind. Meestal vraag je een AI om iets te doen, en als het misgaat, zeg je alleen "slecht gedaan" en probeer je het opnieuw. Dat is alsof je een wiskundetoets maakt en een "onvoldoende" krijgt zonder te zien waar de rode aantekeningen staan die laten zien waar je de fout in ging. TGPO is alsof je de rode aantekeningen krijgt terwijl je de toets maakt, zodat je je logica kunt herstellen voordat je hem inlevert.

Wat Ze Hebben Ontdekt: De Robot Wordt Slimer

De onderzoekers hebben deze nieuwe methode getest op een enorme variëteit aan taken, van eenvoudige taken zoals "breng me een handdoek" tot ongelooflijk complexe taken zoals "bereid het huis voor op een festival", wat het verplaatsen van meubels, schoonmaken en organiseren in een specifieke volgorde met zich meebrengt.

Ze vergeleken hun robot met twee andere soorten planners:

  • De "Prompting" Robots: Dit zijn AI-modellen die simpelweg gevraagd worden een plan te schrijven. Het artikel vond dat naarmate taken moeilijker en abstracter werden, deze robots hopeloos faalden. Ze raakten in de war door de complexiteit en stelden onmogelijke acties voor.
  • De "Standard Learning" Robots: Dit zijn robots die getraind zijn met standaard reinforcement learning (trial and error). Ze deden het beter dan de prompting-robots, maar hadden nog steeds moeite wanneer de instructies vaag waren of de taken erg lang waren.

De Resultaten:
De TGPO-robot was de duidelijke winnaar.

  • Bij gemakkelijke taken slaagde hij ongeveer 88% van de tijd.
  • Bij complexe taken (lange ketens van acties) slaagde hij 77% van de tijd.
  • Bij abstracte taken (waarbij de robot moest raden wat "opruimen" betekende) slaagde hij 70% van de tijd.

Ter vergelijking: de beste "prompting" robot slaagde slechts ongeveer 22% van de tijd bij diezelfde abstracte taken. Het artikel suggereert dat het vermogen van TGPO om zijn eigen denkproces in realtime te corrigeren de sleutel is. De robot gokt niet alleen; hij redeneert, controleert, corrigeert en handelt dan pas.

Waarom Dit Belangrijk Is

Het artikel laat zien dat door robots te leren om "verifieerbare subdoelen" (kleine, controleerbare stappen) te genereren en een systeem te gebruiken dat hun denksporen (traces) corrigeert, we ze veel betrouwbaarder kunnen maken in de echte wereld. De auteurs merken op dat dit werkt, zelfs wanneer de omgeving rommelig is of de instructies vaag zijn.

Ze zijn echter voorzichtig in hun bewoordingen en wijzen erop dat dit nog geen magische oplossing is voor elk robotprobleem. Het systeem vertrouwt nog steeds op een vooraf gedefinieerde kaart van de wereld (een "scene graph") en een set regels die de robot kent. De robot leert niet om de wereld vanaf nul te zien door alleen naar een camera te kijken; hij heeft die gestructureerde kaart nodig om zijn planning te kunnen uitvoeren. Maar voor de specifieke taak om menselijke woorden om te zetten in veilige, uitvoerbare robotacties, suggereert TGPO een grote stap voorwaarts: het bewijst dat AI, met de juiste vorm van "coaching", veel beter kan plannen dan het uit zichzelf kan.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →