← Neueste Arbeiten
💻 computer science

GraphPoint: Semantic Entity Graphs and Point Trajectories for Compositional Robot Manipulation

Dieses Paper stellt GraphPoint vor, ein Framework, das semantische Entitätsgraphen über vorhergesagte Greifer-Trajektorien mit geometrischer Steuerung verknüpft, um die instruktionsabhängige Generalisierung in der Robotermanipulation zu verbessern, validiert durch den neuen CoMani-Benchmark, der darauf ausgelegt ist, die kompositorische Wiederverwendung über Subaufgaben hinweg sowie innerhalb von Subaufgaben zu testen.

Ursprüngliche Autoren: Kang Luo, Hesheng Wang

Veröffentlicht 2026-09-17
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Kang Luo, Hesheng Wang

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Roboter, die eine Tasse aufheben oder eine Schüssel auf einen Tisch stellen können, sind in Forschungslaboren zu einem häufigen Anblick geworden, doch diese Maschinen haben oft Schwierigkeiten, wenn sich die Anweisungen leicht ändern. Ein Roboter, der darauf trainiert wurde, eine Schüssel auf einen Teller zu stellen, könnte scheitern, wenn er angewiesen wird, dieselbe Schüssel rechts neben den Teller zu stellen, oder wenn er angewiesen wird, sie dorthin zu schieben, anstatt sie anzuheben. Dies geschieht, weil viele aktuelle Systeme lernen, ein spezifisches Bild einer Szene mit einer spezifischen Bewegung abzugleichen, anstatt die Worte, die beschreiben, was zu tun ist, wirklich zu verstehen. Wenn die visuelle Szene vertraut aussieht, verlässt sich der Roboter auf diese visuelle Abkürzung und ignoriert die neue Anweisung. Um Roboter zu bauen, die wirklich anpassungsfähig sind, müssen Forscher sie lehren, die Bedeutung eines Objekts von seinem Standort zu trennen und zu verstehen, wie Aktionen auf neue Arten kombiniert und gemischt werden können.

Ein Team von Forschern der Shanghai Jiao Tong University hat einen neuen Ansatz entwickelt, um dieses Problem zu lösen, und führt ein System namens GraphPoint ein. Anstatt die Sicht des Roboters als ein einzelnes, unstrukturiertes Bild oder eine Punktwolke zu behandeln, zerlegt dieses System die Szene in eine Karte mit spezifischen Rollen. Es identifiziert die Hand des Roboters, das zu bewegende Objekt und das Zielziel als unterschiedliche Entitäten. Das System verwendet dann ein großes Sprachmodell, um die menschliche Anweisung zu lesen und sie in einen strukturierten Plan zu übersetzen, der genau definiert, wie diese Rollen miteinander interagieren sollen. Wenn eine Person beispielsweise sagt: „Stelle die Schüssel auf den Teller“, versteht das System, dass die Schüssel das zu bewegende Objekt ist, der Teller das Ziel und die Aktion das Platzieren. Entscheidend ist, dass es diese Rollen in seiner internen Logik getrennt hält, was es ihm ermöglicht, dieselbe „Platzier“-Logik auf ein anderes Objekt oder ein anderes Ziel anzuwenden, ohne die gesamte Bewegung von Grund auf neu lernen zu müssen.

Die Forscher testeten ihre Idee mit einem neuen Satz von Herausforderungen, die sie CoMani nannten. Dieser Testplatz wurde entwickelt, um spezifische Arten des Lernens zu isolieren. In einem Satz von Tests wurde der Roboter gebeten, dieselbe Aktion auszuführen, wie zum Beispiel ein Objekt abzustellen, aber mit unterschiedlichen Anweisungen darüber, wo es platziert werden soll, wie etwa „auf dem Teller“ gegenüber „rechts neben dem Teller“. In einem anderen Satz von Tests musste der Roboter verschiedene Arten von Bewegungen verwenden, wie zum Beispiel ein Objekt zu schieben anstatt es anzuheben. Schließlich testeten sie, ob der Robot in der Lage war, mehrere einfache Aufgaben zu einer längeren Sequenz zusammenzufügen, die er noch nie gesehen hatte, wie zum Beispiel eine Flasche zu bewegen, dann eine Schüssel, dann ein Stück Käse in einer bestimmten Reihenfolge. Das Ziel war es zu sehen, ob der Roboter sich auf die Worte verlassen konnte, die er hörte, anstatt nur die visuellen Muster des Raumes auswendig zu lernen.

Die Ergebnisse zeigten, dass GraphPoint in diesen Tests andere führende Methoden deutlich übertraf. Wenn sich die Anweisung in der Beziehung zwischen den Objekten änderte, wie etwa die Aufforderung an den Roboter, einen Gegenstand rechts statt oben zu platzieren, war GraphPoint in fast allen Fällen erfolgreich, während andere Systeme oft scheiterten, weil sie an dem visuellen Layout der Szene feststeckten. Das System erwies sich auch als fähig, neue Arten von Aktionen zu lernen. Als es aufgefordert wurde, einen Knopf zu drehen – eine Aufgabe, die es zuvor noch nie gezeigt bekommen hatte –, wandte es erfolgreich das Konzept der Drehung auf ein neues Objekt an. Am beeindruckendsten war, dass das System, als es mit einer dreistufigen Sequenz konfrontiert wurde, die es als Ganzes nie geübt hatte, in der Lage war, die ersten zwei Schritte in über 80 Prozent der Versuche korrekt auszuführen und alle drei Schritte in etwa der Hälfte der Versuche abzuschließen. Dies demonstrierte, dass der Roboter in der Lage ist, einfache Fähigkeiten, die er einzeln gelernt hat, zu kombinieren, um komplexe, mehrstufige Anweisungen zu befolgen.

Der Erfolg dieses Systems beruht darauf, wie es Informationen verarbeitet. Anstatt mit absoluten Positionen im Raum zu arbeiten, beschreibt das System alles relativ zur eigenen Hand des Roboters. Dies ermöglicht es dem Roboter zu verstehen, dass das Bewegen eines Objekts „nach rechts“ dasselbe bedeutet, unabhängig davon, wo das Objekt startete. Das System verwendet auch eine Technik, bei der es die detaillierte Form von Objekten während des Trainings vorübergehend verbirgt, um den Roboter zu zwingen, der Sprachentscheidung und den Rollen der Objekte Aufmerksamkeit zu schenken, anstatt nur auswendig zu lernen, wie die Objekte aussehen. Durch die Verankerung der Bewegungen des Roboters in einer semantischen Karte von Rollen und Beziehungen schufen die Forscher eine Policy, die auf Sprachänderungen reagiert, selbst wenn die visuelle Szene gleich bleibt. Diese Arbeit legt nahe, dass Roboter, um in dynamischen Umgebungen wirklich nützlich zu werden, Anweisungen als primären Leitfaden für das Handeln lernen müssen, anstatt visuelle Muster als einzige Quelle der Wahrheit zu behandeln.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →