← Nieuwste papers
💻 computer science

Hierarchical Prompting with Dual LLM Modules for Robotic Task and Motion Planning

Dit artikel presenteert een hiërarchisch taalgestuurd framework dat een hoogwaardige LLM-planningsagent integreert met een laagwaardige ruimtelijke redeneer-submodule en objectdetectietools om een succespercentage van 86% te bereiken in robotische taak- en bewegingsplanning over diverse servicescenario's heen.

Oorspronkelijke auteurs: Karolina Źróbek, Tessa Pulli, Paweł Gajewski, Antonio Galiza Cerdeira Gonzalez, Bipin Indurkhya

Gepubliceerd 2026-06-30
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Karolina Źróbek, Tessa Pulli, Paweł Gajewski, Antonio Galiza Cerdeira Gonzalez, Bipin Indurkhya

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een robot probeert te leren hoe hij je in de keuken kan helpen. Als je alleen zegt: "Maak een fruitmand voor me," zou een standaardrobot in de war kunnen raken. Hij weet wel wat "fruit" is, maar hij weet niet waar het fruit is, hoe hij het moet pakken zonder het te pletten, of precies waar hij het naast de kom moet zetten.

Dit artikel presenteert een nieuwe manier om met robots te praten met behulp van een "twee-hersenen-systeem". In plaats van één superintelligente computer alles tegelijk te laten doen, hebben de onderzoekers de taak verdeeld tussen twee gespecialiseerde Large Language Models (LLM's), die lijken op zeer geavanceerde AI-chatbots.

Zo werkt hun systeem, met behulp van eenvoudige analogieën:

Het Twee-Hersenen-Systeem

1. De "Algemeen Manager" (High-Level Agent)
Beschouw deze AI als de projectmanager. Je geeft hem een natuurlijke opdracht zoals: "Ruim alle fruit van de tafel."

  • Wat het doet: Het breekt het grote doel af in een to-do lijst. Het besluit: "Eerst moet ik de appels vinden. Daarna moet ik ze oppakken. Daarna moet ik ze in de vuilnisbak doen."
  • Hoe het denkt: Het gebruikt een methode genaamd "ReAct" (Reason + Act / Redeneren + Handelen). Het denkt: "Ik heb een appel nodig," en vraagt vervolgens aan de ogen van de robot om naar een appel te zoeken, ziet de appel, en zegt dan: "Oké, pak hem." Het houdt een voortgangslogboek bij van wat het heeft gedaan, zodat het niet vergeet wat de bedoeling is.
  • De beperking: Hoewel deze manager uitstekend is in logica, is hij slecht in wiskunde. Als je zegt: "Zet de mok links van het bord," begrijpt hij misschien de woorden, maar hij weet niet de exacte 3D-coördinaten om de robotarm naartoe te bewegen. Hij zou kunnen gokken, en die gok zou fysiek onmogelijk kunnen zijn.

2. De "Ruimtelijk Architect" (Low-Level Sub-Module)
Dit is de gespecialiseerde ingenieur die de geometrie afhandelt. De Algemeen Manager praat niet rechtstreeks tegen de robotarm; hij praat tegen deze Architect.

  • Wat het doet: Wanneer de Manager zegt: "Plaats de mok naast het bord," neemt de Architect het over. Hij kijkt naar de 3D-vormen van de mok en het bord (met behulp van een camerasysteem genaamd YOLOX-GDRNet) en berekent de exacte wiskunde: "Het bord bevindt zich op coördinaat X, Y, Z. Om 'naast' het te staan, moet de mok op X + 5 cm staan."
  • Waarom apart? Als je de Algemeen Manager de wiskunde én de planning tegelijkertijd laat doen, raakt hij overbelast en maakt hij fouten (zoals proberen een mok in een massieve tafel te plaatsen). Door het "wat te doen" te scheiden van "precies waar het te plaatsen moet", is het systeem veel betrouwbaarder.

Hoe Ze Het Testten

De onderzoekers onderwierpen dit systeem aan 24 verschillende tests in een simulatie en op een echte robot (een PAL Robotics Tiago-arm).

  • De resultaten: Het systeem slaagde in 86% van de taken.
  • Simpel versus Moeilijk: Het was erg goed in eenvoudige opdrachten (zoals "pak de banaan op") en zelfs nog beter in het herkennen van onmogelijke taken (zoals "leg de banaan in de massieve tafel"). In die onmogelijke gevallen zei de robot 100% van de tijd correct: "Dat kan ik niet doen."
  • Menselijke feedback: Wanneer mensen naar de uiteindelijke resultaten keken, gaven ze een score van ongeveer 6,9 uit 10. Ze vonden het goed wanneer de robot duidelijke taken uitvoerde (zoals het stapelen van servies), maar ze waren minder zeker bij vage instructies (zoals "maak een zoute snack"), omdat "zoute snack" ruimte laat voor interpretatie.

De Test in de Praktijk

Ze probeerden dit ook op een echte robotarm in een echte kamer.

  • Succes: De robot was erg goed in het vinden van objecten (zoals een mosterdflesje of een appel), zelfs wanneer de tafel rommelig was. Hij bedacht het plan perfect.
  • Falen: De weinige keren dat het misging, kwam dat niet doordat de AI in de war raakte over het plan. Het faalde door fysieke hardwareproblemen, zoals een camera die iets scheef stond of een robotarm die ergens tegenaan botste. De "hersenen" werkten; het "lichaam" had slechts een kleine storing.

De Kernboodschap

Dit artikel laat zien dat door de taak te splitsen in een Manager (die de logica en het gesprek afhandelt) en een Architect (die de 3D-wiskunde en plaatsing afhandelt), robots menselijke instructies veel beter kunnen begrijpen.

De auteurs zijn echter eerlijk over de beperkingen: hoewel de robot slimmer wordt in het begrijpen van taal en ruimte, worstelt het nog steeds met de chaotische realiteit van de fysieke wereld. Het is een grote stap voorwaarts om robots te maken die ons echt thuis kunnen helpen zonder dat we in "robotcode" hoeven te spreken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →