← Neueste Arbeiten
💻 computer science

Hierarchical Prompting with Dual LLM Modules for Robotic Task and Motion Planning

Dieses Paper präsentiert ein hierarchisches, sprachgesteuertes Framework, das einen High-Level-LLM-Planungsagenten mit einem Low-Level-Submodul für räumliches Denken und Objekterkennungswerkzeugen integriert, um eine Erfolgsrate von 86 % bei der robotischen Aufgaben- und Bewegungsplanung über diverse Service-Szenarien hinweg zu erreichen.

Ursprüngliche Autoren: Karolina Źróbek, Tessa Pulli, Paweł Gajewski, Antonio Galiza Cerdeira Gonzalez, Bipin Indurkhya

Veröffentlicht 2026-06-30
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Karolina Źróbek, Tessa Pulli, Paweł Gajewski, Antonio Galiza Cerdeira Gonzalez, Bipin Indurkhya

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie versuchen einem Roboter beizubringen, Ihnen in der Küche zu helfen. Wenn Sie einfach nur sagen: „Mach mir eine Obstschale“, könnte ein Standardroboter verwirrt sein. Er weiß zwar, was „Obst“ ist, aber er weiß nicht, wo das Obst ist, wie er es greifen muss, ohne es zu zerquetschen, oder genau, wo er es neben die Schale stellen soll.

Dieses Paper präsentiert einen neuen Weg, wie man mit Robotern kommuniziert, indem man ein „Zwei-Gehirne-System“ nutzt. Anstatt einem einzelnen, superintelligenten Computer alles gleichzeitig zu überlassen, teilen die Forscher die Aufgabe auf zwei spezialisierte Large Language Models (LLMs) auf, die wie sehr fortgeschrittene KI-Chatbots funktionieren.

So funktioniert ihr System, unter Verwendung einfacher Analogien:

Das Zwei-Gehirne-System

1. Der „General Manager“ (High-Level Agent)
Betrachten Sie diese KI als Projektmanager. Sie geben ihr einen natürlichen Befehl wie: „Räume den Tisch von allem Obst leer.“

  • Was er tut: Er bricht das große Ziel in eine To-do-Liste herunter. Er entscheidet: „Zuerit muss ich die Äpfel finden. Dann muss ich sie aufheben. Dann muss ich sie in den Müll werfen.“
  • Wie er denkt: Er verwendet eine Methode namens „ReAct“ (Reason + Act / Denken + Handeln). Er denkt: „Ich brauche einen Apfel“, dann bittet er die Augen des Roboters, nach einem zu suchen, sieht den Apfel und sagt dann: „Okay, greif ihn.“ Er führt ein fortlaufendes Protokoll darüber, was er getan hat, damit er nichts vergisst.
  • Die Einschränkung: Während dieser Manager großartig in Logik ist, ist er schrecklich in Mathematik. Wenn Sie ihm sagen: „Stelle die Tasse links neben den Teller“, versteht er vielleicht die Wörter, aber er kennt nicht die exakten 3D-Koordinaten, um den Roboterarm dorthin zu bewegen. Er würde raten, und dieses Raten könnte physisch unmöglich sein.

2. Der „Spatial Architect“ (Low-Level Sub-Module)
Dies ist der spezialisierte Ingenieur, der sich um die Geometrie kümmert. Der General Manager spricht nicht direkt zum Roboterarm; er spricht zu diesem Architekten.

  • Was er tut: Wenn der Manager sagt: „Platziere die Tasse neben den Teller“, übernimmt der Architekt. Er betrachtet die 3D-Formen der Tasse und des Tellers (unter Verwendung eines Kamerasystems namens YOLOX-GDRNet) und berechnet die exakte Mathematik: „Der Teller befindet sich bei Koordinate X, Y, Z. Um ‚neben‘ ihn zu sein, muss die Tasse bei X + 5 cm liegen.“
  • Warum die Trennung? Wenn man den General Manager bittet, die Mathematik und die Planung gleichzeitig auszuführen, wird er überfordert und macht Fehler (wie etwa zu versuchen, eine Tasse in einen massiven Tisch zu stellen). Durch die Trennung von dem, was zu tun ist, und dem, wo genau es platziert werden soll, ist das System viel zuverlässiger.

Wie sie es getestet haben

Die Forscher unterzogen dieses System 24 verschiedenen Tests in einer Simulation und an einem echten Roboter (einem PAL Robotics Tiago Arm).

  • Die Ergebnisse: Das System war bei 86 % der Aufgaben erfolgreich.
  • Einfach vs. Schwer: Es war sehr gut bei einfachen Befehlen (wie „hebe die Banane auf“) und sogar noch besser darin, unmögliche Aufgaben zu erkennen (wie „lege die Banane in einen massiven Tisch“). In diesen unmöglichen Fällen sagte der Roboter zu 100 % korrekt: „Das kann ich nicht tun.“
  • Menschliches Feedback: Wenn Menschen die Endergebnisse betrachteten, gaben sie ihm eine Punktzahl von etwa 6,9 von 10. Sie fanden es gut, wenn der Roboter klare Aufgaben ausführte (wie das Stapeln von Geschirr), aber sie waren unsicherer bei vagen Anweisungen (wie „mach mir einen salzigen Snack“), da „salziger Snack“ Interpretationsspielraum lässt.

Der Realitätstest

Sie haben dies auch an einem echten Roboterarm in einem echten Raum getestet.

  • Erfolg: Der Roboter war sehr gut darin, Objekte (wie eine Senftube oder einen Apfel) zu finden, selbst wenn der Tisch unordentlich war. Er entwickelte den Plan perfekt.
  • Fehlerszenarien: Die wenigen Male, in denen er scheiterte, lag es nicht daran, dass die KI den Plan missverstanden hatte. Er scheiterte aufgrund von physischen Hardware-Problemen, wie etwa einer leicht dejustierten Kamera oder einem Roboterarm, der gegen etwas stieß. Das „Gehirn“ funktionierte; der „Körper“ hatte lediglich einen kleinen Glitch.

Das Fazit

Dieses Paper zeigt, dass Roboter die Anweisungen von Menschen viel besser verstehen können, indem man die Aufgabe in einen Manager (der Logik und Konversation handhabt) und einen Architekten (der 3D-Mathematik und Platzierung handhabt) aufteilt.

Die Autoren sind jedoch ehrlich über die Grenzen: Während der Roboter immer klüger darin wird, Sprache und Raum zu verstehen, hat er immer noch mit der chaotischen Realität der physischen Welt zu kämpfen. Es ist ein großer Schritt nach vorn, um Roboter in die Lage zu versetzen, uns tatsächlich zu Hause zu helfen, ohne dass wir „Roboter-Code“ sprechen müssen.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →