← Neueste Arbeiten
💻 computer science

Any House Any Task: Scalable Long-Horizon Planning for Abstract Human Tasks

Das Papier schlägt AHAT vor, ein skalierbares Framework für die langfristige Planung, das ein mittels eines neuartigen Reinforcement-Learning-Algorithmus (TGPO) trainiertes LLM nutzt, um mehrdeutige menschliche Anweisungen und Szenengraphen in PDDL-Subziele zu übersetzen, was es Robotern ermöglicht, optimale Pläne für komplexe Haushaltsaufgaben in großen Umgebungen zu generieren.

Ursprüngliche Autoren: Zhihong Liu, Yang Li, Rengming Huang, Cewu Lu, Panpan Cai

Veröffentlicht 2026-08-04
📖 7 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Zhihong Liu, Yang Li, Rengming Huang, Cewu Lu, Panpan Cai

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie versuchen, einem Roboter beizubringen, Ihr unordentliches Zimmer aufzuräumen. Sie wollen ihm kein Schritt-für-Schritt-Handbuch geben wie „hebe die Socke auf, dann gehe zwei Schritte, dann bücke dich“. Das wäre zu langweilig und zu fragil; wenn sich die Socke bewegt, wird der Roboter verwirrt. Stattdessen möchten Sie einfach nur sagen: „Mach dieses Zimmer ordentlich“, und der Roboter soll den Rest selbst herausfinden. Dies ist der heilige Gral der Robotik: einen vagen menschlichen Wunsch in einen perfekten, physischen Aktionsplan zu verwandeln.

Um dies zu erreichen, verwenden Wissenschaftler oft zwei verschiedene Werkzeuge. Das erste ist ein Large Language Model (LLM), das wie ein superintelligenter, sehr belesener Bibliothekar ist, der Millionen von Fakten über die Welt kennt, aber manchmal Geschichten erfindet oder die Regeln der Physik vergisst. Das zweite ist ein Symbolischer Planer, der wie ein strenger, unnachgiebiger Mathematiklehrer ist, der Regeln perfekt befolgt, aber keine Ahnung hat, was „ordentlich“ bedeutet oder wie man mit Menschen spricht. Die große Herausforderung besteht darin, den gesprächigen Bibliothekar und den strengen Mathematiklehrer dazu zu bringen, zusammenzuarbeiten, ohne dass der Bibliothekar den Roboter in einer Endlosschleife stecken lässt oder der Mathematiklehrer die Arbeit verweigert, weil die Anweisungen zu vage waren.

Genau dieses Problem wird in einem neuen Paper namens TGPO (Trace-Guided Policy Optimization) behandelt. Die Forscher versuchen, einem Roboter beizubringen, wie er große, vage menschliche Befehle in eine Serie von kleinen, überprüfbaren Schritten zerlegt, denen ein Roboter tatsächlich folgen kann. Sie haben herausgefunden, dass es oft zu Fehlern führt, wenn man eine kluge KI einfach nur bittet, „es einfach zu tun“ – dies führt zu Plänen, die auf dem Papier gut aussehen, aber in der realen Welt scheitern. Stattdessen haben sie eine clevere Trainingsmethode entwickelt, bei der die KI lernt, einen „Trace“ (einen Pfad) ihres Denkens zu generieren, von einem Helfer korrigiert wird, wenn sie einen Fehler macht, und es dann erneut versucht. Es ist wie das Lehren eines Schülers, bei dem man nicht nur am Ende eine Note gibt, sondern ihn durch seine Hausaufgaben begleitet, seine Logikfehler in Echtzeit korrigiert und ihn üben lässt, bis er es richtig macht. Das Ergebnis ist ein System, das viel besser darin ist, lange, komplexe Aufgaben zu planen – wie etwa die Vorbereitung eines ganzen Hauses für eine Party – als bisherige Methoden, insbesondere wenn die Anweisungen vage sind.

Das Problem: Der „Zauberstab“, der bricht

Stellen Sie sich vor, Sie haben einen Roboter-Butler. Sie sagen zu ihm: „Ich veranstalte ein Festival, also räume das Haus auf.“ Ein Mensch versteht dies sofort: Er weiß, dass er Müll aufheben, Tische abwschen und vielleicht Dekorationen aufstellen muss. Aber für einen Roboter ist das ein Albtraum. Wenn Sie eine Standard-KI bitten, einfach nur „einen Plan zu schreiben“, könnte sie halluzinieren. Sie könnte sagen: „Bewege das Sofa in die Küche“, selbst wenn das Sofa zu schwer ist, oder „Schalte den Herd ein, um den Boden zu reinigen“, was eine schreckliche Idee ist.

Das Paper erklärt, dass aktuelle KI-Modelle großartig darin sind, das nächste Wort in einem Satz zu erraten, aber schrecklich darin, sicherzustellen, dass ihre Pläne machbar (feasible) sind. Sie machen kleine Fehler am Anfang – wie zum Beispiel das Vergessen, einen Becher aufzuheben, bevor man einen Tisch bewegt – und diese Fehler häufen sich wie ein Kartenhaus an, bis der gesamte Plan zusammenbricht. Andererseits sind traditionelle Roboter-Planer sehr sicher; sie werden nichts Unmögliches tun. Aber sie sind auch sehr dumm; man muss ihnen genau sagen, was sie tun sollen, in einem sehr spezifischen Code (genannt PDDL), und sie können die Nuance von „für eine Party aufräumen“ nicht verstehen.

Die Lösung: TGPO (Der „Trace-Guided“ Coach)

Die Autoren schlagen eine neue Art vor, Roboter zu trainieren, die sich Trace-Guided Policy Optimization (TGPO) nennt. Betrachten Sie TGPO nicht als einen Roboter, der einfach nur rät, sondern als einen Schüler, der mit einem sehr strengen, hilfreichen Coach lernt.

So funktioniert das Training, unter Verwendung einer einfachen Analogie:

  1. Der Schüler (Die KI-Policy): Das Gehirn des Roboters versucht, Ihren Befehl („Für das Festival aufräumen“) in eine Liste von Teilzielen zu zerlegen. Vielleicht sagt er: „1. Müll aufheben. 2. Geschirr spülen. 3. Staubsaugen.“
  2. Der Coach (Der Verifizierer): Ein strenger Prüfer sieht sich diese Liste an. Er fragt: „Warte, kannst du wirklich das Geschirr spülen, wenn das Spülbecken voll mit Essensresten ist? Hast du daran gedacht, die Stühle zu bewegen, bevor du staubsaugst?“
  3. Die „Trace“-Korrektur: Wenn der Plan des Schülers falsch ist, sagt der Coach nicht einfach nur „Fehlgeschlagen“. Stattdessen schaut er sich den Denkprozess (den Trace) an und korrigiert den spezifischen Fehler. Er könnte sagen: „Du hast vergessen, zuerst das Spülbecken zu leeren. Hier ist die korrigierte Liste der Schritte.“
  4. Die Übungsschleife: Der Roboter nimmt dann diese korrigierte Liste und versucht, den Rest des Plans basierend darauf zu generieren. Er lernt aus der Korrektur, nicht nur aus der abschließenden „Bestanden/Nicht bestanden“-Bewertung.

Dies unterscheidet sich von der Art und Weise, wie die meisten heutigen KIs trainiert werden. Normalerweise fragen Sie eine KI nach etwas, und wenn sie scheitert, sagen Sie ihr einfach „schlechte Arbeit“ und versuchen es erneut. Das ist so, als würde man eine Mathearbeit schreiben, durchfallen und eine „6“ bekommen, ohne zu sehen, wo die roten Korrekturanmerkungen stehen, die zeigen, wo man einen Denkfehler gemacht hat. TGPO ist wie das Erhalten der roten Korrekturanmerkungen während man die Prüfung schreibt, damit man seine Logik korrigieren kann, bevor man sie abgibt.

Was sie herausgefunden haben: Der Roboter wird klüger

Die Forscher haben diese neue Methode an einer Vielzahl von Aufgaben getestet, von einfachen wie „Bring mir ein Handtuch“ bis hin zu unglaublich komplexen wie „Bereite das Haus für ein Festival“, was das Bewegen von Möbeln, Reinigen und Organisieren in einer bestimmten Reihenfolge beinhaltet.

Sie verglichen ihren Roboter mit zwei anderen Arten von Planern:

  • Die „Prompting“-Roboter: Dies sind KI-Modelle, die einfach nur gebeten werden, einen Plan zu schreiben. Das Paper fand heraus, dass diese Roboter kläglich versagten, sobald die Aufgaben schwieriger und abstrakter wurden. Sie wurden durch die Komplexität verwirrt und schlugen unmögliche Aktionen vor.
  • Die „Standard Learning“-Roboter: Dies sind Roboter, die mit Standard-Reinforcement-Learning (Versuch und Irrtum) trainiert wurden. Sie waren besser als die Prompting-Roboter, hatten aber dennoch Schwierigkeiten, wenn die Anweisungen vage oder die Aufgaben sehr lang waren.

Die Ergebnisse:
Der TGPO-Roboter war der klare Gewinner.

  • Bei einfachen Aufgaben war er in etwa 88 % der Fälle erfolgreich.
  • Bei komplexen Aufgaben (langen Aktionsketten) war er zu 77 % erfolgreich.
  • Bei abstrakten Aufgaben (wo der Roboter raten musste, was „aufräumen“ bedeutete) war er zu 70 % erfolgreich.

Im Vergleich dazu war der beste „Prompting“-Roboter bei denselben abstrakten Aufgaben nur zu etwa 22 % erfolgreich. Das Paper legt nahe, dass die Fähigkeit von TGPO, seinen eigenen Denkprozess in Echtzeit zu korrigieren, der Schlüssel ist. Er rät nicht nur; er plant, prüft, korrigiert und handelt dann.

Warum das wichtig ist

Das Paper zeigt, dass wir Roboter viel zuverlässiger in der realen Welt machen können, indem wir sie lehren, „verifizierbare Teilziele“ (kleine, überprüfbare Schritte) zu generieren, und ein System verwenden, das ihre Denkpfade korrigiert. Die Autoren merken an, dass dies selbst dann funktioniert, wenn die Umgebung unordentlich oder die Anweisungen vage sind.

Sie weisen jedoch vorsichtig darauf hin, dass dies noch keine magische Lösung für jedes Roboterproblem ist. Das System beruht immer noch auf einer vordefinierten Weltkarte (einem „Scene Graph“) und einem Satz von Regeln, die der Roboter kennt. Er lernt nicht, die Welt von Grund auf neu zu sehen, indem er nur eine Kamera betrachtet; er benötigt diese strukturierte Karte, um seine Planung durchzuführen. Aber für die spezifische Aufgabe, menschliche Worte in sichere, ausführbare Roboteraktionen zu verwandeln, stellt TGPO einen bedeutenden Fortschritt dar und beweist, dass KI mit der richtigen Art von „Coaching“ viel besser planen kann als sie es allein tun würde.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →