← Neueste Arbeiten
💻 computer science

LENS: LLM-guided Environment Simplification for Planning and Control in Clutter

Das Papier stellt LENS vor, ein Plug-and-Play-Framework, das Large Language Models nutzt, um automatisch aufgabenspezifische Szenenabstraktionen zu generieren und dynamisch zu aktualisieren, indem Objekte zusammengeführt oder beschnitten werden, wodurch die Leistung verschiedener Planungs- und Steuerungsverfahren in hochgradig überladenen Umgebungen der robotischen Manipulation signifikant verbessert wird.

Ursprüngliche Autoren: Aileen Liao, Rachel Holladay, Dinesh Jayaraman, Michael Posa

Veröffentlicht 2026-07-23
📖 7 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Aileen Liao, Rachel Holladay, Dinesh Jayaraman, Michael Posa

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich einen Roboter vor, der versucht, ein unordentliches Schlafzimmer aufzuräumen. Für uns ist ein unordentliches Zimmer nur ein Haufen Kleidung, Bücher und Spielzeug. Aber für das Gehirn eines Roboters ist es eine erschreckende Explosion von Mathematik. Jedes einzelne Objekt ist ein potenzielles Hindernis, ein Ding, gegen das der Roboter stoßen könnte, oder ein Ding, das der Roboter versehentlich umwerfen könnte. Der Roboter muss berechnen, wie jedes einzelne Teil mit jedem anderen interagiert, um herauszufinden, wie er sich bewegen kann. Wenn es zu viele Dinge gibt, wird die Mathematik so gewaltig, dass der Roboter einfriert, wie ein Computer, der versucht, eine Datei zu öffnen, die zu groß ist. Dies ist das „Clutter-Problem“ (Unordnungsproblem), und es ist der Hauptgrund dafür, dass Roboter in sauberen, leeren Laboren großartig sind, aber in unseren echten, unordentlichen Wohnungen schlecht darin sind, zu helfen. Wissenschaftler versuchen seit langem, Roboterem beizubringen, den Müll zu ignorieren, aber normalerweise erfordert dies, dass ein Mensch den Roboter manuell programmiert, bestimmte Dinge zu ignorieren, was jedoch nicht gut funktioniert, wenn sich die Unordnung verändert.

Hier kommt eine neue Idee namens LENS (LLM-guided Environment Simplification). Stellen Sie sich LENS wie eine superintelligente, magische Brille für den Roboter vor. Anstatt zu versuchen, die Mathematik für das ganze unordentliche Zimmer zu lösen, setzt der Roboter diese Brille auf, die ein leistungsstarkes „Gehirn“ (ein Large Language Model) nutzt, um die Szene zu betrachten und zu fragen: „Was ist für diese spezifische Aufgabe tatsächlich wichtig?“ Wenn der Robbot einen roten Becher aufheben muss, könnte die Brille ihm sagen: „Ignoriere den Wäschehaufen in der Ecke und behandle diesen Stapel aus drei Büchern als einen einzigen Block.“ Durch die Vereinfachung der Welt in Echtzeit kann der Roboter aufhören zu panikieren und anfangen zu arbeiten. Dieses Paper zeigt, dass Roboter durch diesen „magische Brille“-Ansatz viel unordentlichere Räume bewältigen können, egal ob sie klassische mathematische Planung oder brandneue KI verwenden, die durch das Anschauen von Videos lernt.

Der Albtraum des Roboters: Zu viel Zeug zum Nachdenken

Wissen Sie noch, wie es ist, wenn man einen riesigen Berg Hausaufgaben hat und es schwer ist, sich zu konzentrieren, weil man auf den ganzen Berg starrt? Roboter fühlen genauso. Wenn ein Roboter versucht, ein Objekt in einem unordentlichen Raum zu bewegen, muss er über jedes einzelne Ding im Raum nachdenken. Wird dieser Stuhl den Weg blockieren? Wird dieses Spielzeug wegrollen? Wenn es 50 Objekte gibt, muss der Roboter Millionen von Berechnungen durchführen, um sicherzustellen, dass er nicht zusammenstößt.

Lange Zeit versuchten Forscher, dies zu lösen, indem sie Roboter bauten, die nur in sehr sauberen, organisierten Räumen funktionieren. Aber das ist nicht das echte Leben. Das echte Leben ist unordentlich. Wenn Roboter in unordentliche Räume gestellt werden, werden sie verwirrt. Ihre „Sicht“ wird unübersichtlich und ihr „Gehirn“ wird überfordert. Sie versuchen vielleicht, ein Spielzeug zu bewegen, das gar nicht Teil der Aufgabe ist, oder sie frieren ein, weil die Mathematik zu schwierig ist. Das Problem ist nicht, dass der Roboter dumm ist; es ist, dass er versucht, zu viel auf einmal zu machen.

Die Lösung: Ein magischer Filter

Die Autoren dieses Papers, Aileen Liao und ihr Team von der University of Pennsylvania, haben eine clevere Lösung namens LENS entwickelt. Anstatt zu versuchen, den Roboter besser im Umgang mit allem zu machen, haben sie beschlossen, die Welt für den Roboter kleiner zu machen.

Stellen Sie sich vor, Sie spielen ein Videospiel, aber der Bildschirm ist so voll mit Charakteren und Gegenständen, dass Sie das Ziel nicht sehen können. Sie setzen einen Filter auf, der alles unscharf macht, was nicht wichtig ist. Plötzlich können Sie den Pfad klar sehen. LENS macht genau das für Roboter. Es verwendet eine spezielle Art von KI (ein sogenanntes Vision-Language Model), um die Szene zu betrachten und zu entscheiden, was behalten und was weggeworfen werden soll.

LENS tut zwei Hauptdinge, um die Szene zu vereinfachen:

  1. Pruning (Wegwerfen): Wenn ein Objekt weit entfernt ist oder nichts mit der Aufgabe zu tun hat, sagt LENS dem Roboter, er solle so tun, als existiere es nicht. Wenn der Roboter zum Beispiel ein grünes Klotz bewegen muss, könnte LENS sagen: „Ignoriere den blauen Ball in der Ecke.“
  2. Merging (Zusammenfügen): Manchmal sind Objekte aneinandergeklebt, wie ein Stapel Bücher. Anstatt jedes Buch als separates Problem zu behandeln, „klebt“ LENS sie im Geist des Roboters zusammen und behandelt sie als ein einziges, großes Objekt. Das macht die Mathematik viel einfacher.

Wie es funktioniert: Die „Versuchen, Scheitern, Fixen“-Schleife

Hier ist der wirklich coole Teil: LENS ist nicht nur ein einmaliger Filter. Es ist eine Schleife. Der Roboter versucht, die Aufgabe mit der vereinfachten Ansicht zu erledigen. Wenn er scheitert (vielleicht hat er versucht, einen Stapel Bücher zu bewegen und sie sind auseinandergefallen), sendet der Roboter eine Nachricht zurück an das „magische Gehirn“ und sagt: „Hey, das hat nicht funktioniert!“ Das Gehirn betrachtet die Szene dann erneut, erkennt, dass es einen Fehler gemacht hat (vielleicht hat es etwas weggeworfen, das es nicht hätte, oder Dinge zusammengefügt, die nicht zusammengehören), und aktualisiert den Filter. Es ist wie ein Mensch, der versucht, ein Puzzle zu lösen, merkt, dass ein Teil an der falschen Stelle ist, und es erneut versucht.

Die Forscher testeten dies auf drei verschiedene Arten:

  • Planung: Sie nutzten es mit einem klassischen Planungssystem, das Logik verwendet, um Schritte zu bestimmen.
  • Steuerung: Sie nutzten es mit einem System, das die Muskeln des Roboters in Echtzeit steuert.
  • Lernen: Sie nutzten es mit einer modernen KI, die durch das Anschauen von Videos lernt (ein Vision-Language-Action-Modell).

Was sie herausgefunden haben

Die Ergebnisse waren ziemlich beeindruckend. In ihren Experimenten waren die Roboter mit LENS viel besser darin, unordentliche Räume zu bewältigen als die ohne LENS.

  • Geschwindigkeit: Wenn die Anzahl der Objekte im Raum zunahm, wurden die Roboter ohne LENS immer langsamer. Bei 7 Objekten brauchten die Roboter ohne LENS über 4.000 Sekunden (mehr als eine Stunde!), um herauszufinden, was zu tun ist. Die Roboter mit LENS blieben schnell und brauchten unabhängig von der Anzahl der Objekte nur etwa 40 bis 135 Sekunden.
  • Erfolg: In einem unordentlichen Raum scheiterten die Roboter ohne LENS oft komplett. Mit LENS waren sie viel erfolgreicher. In einem Test, bei dem ein Roboter eine grüne Schüssel zu einer roten Platte bewegen musste, wurde der Roboter ohne LENS durch andere Schüsseln verwirrt. Der Roboter mit LENS ignorierte die zusätzlichen Schüsseln und erledigte die Aufgabe.
  • Echte Roboter: Sie haben dies sogar an echten physischen Robotern getestet, nicht nur in Computersimulationen. Die Roboter konnten Objekte durch Unordnung schieben und Stofftiere aufheben, wobei sie Ablenkungen erfolgreich ignorierten.

Warum das wichtig ist

Dieses Paper legt nahe, dass wir nicht unbedingt „schlauere“ Roboter bauen müssen, um die reale Welt zu bewältigen. Stattdessen können wir ihnen beibringen, besser darin zu werden, Dinge zu ignorieren. Indem wir Robotern eine Möglichkeit geben, ihre Welt basierend auf dem, was sie gerade tun, dynamisch zu vereinfachen, können wir sie in unseren unordentlichen, vollgestellten Häusern viel nützlicher machen. Es ist ein bisschen so, wie ein guter Lehrer einem Schüler hilft, sich auf die wichtigsten Teile einer Lektion zu konzentrieren, anstatt zu versuchen, das ganze Lehrbuch auf einmal auswendig zu lernen.

Die Autoren betonen vorsichtig, dass dies noch keine perfekte Lösung ist. Manchmal machen auch die Roboter noch Fehler, und das „magische Gehirn“ muss vielleicht ein paar Versuche brauchen, um den Filter richtig einzustellen. Aber es ist ein riesiger Schritt nach vorn. Es zeigt, dass wir durch die Kombination der Fähigkeit, Sprache zu sehen und zu verstehen, mit der Fähigkeit, eine Szene zu vereinfachen, die Lücke zwischen Robotern, die in Laboren funktionieren, und Robotern, die uns tatsächlich in unserem Alltag helfen können, schließen können.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →