← Neueste Arbeiten
💻 computer science

Collision-Aware Humanoid Whole-Body Control under Imperfect Tracking Targets

Dieses Paper führt RECAL ein, eine Robot–Environment Cross-Attention Layer, die bestehende Ganzkörper-Controller verbessert, indem sie externe Szenengeometrie integriert, um die Zielverfolgung dynamisch mit der Kollisionsvermeidung für humanoide Roboter unter Bedingungen unvollkommener Verfolgung auszubalancieren.

Ursprüngliche Autoren: Mohitvishnu S. Gadde, Ashish Malik, Pranay Dugar, Aayam Kumar Shrestha, Alan Fern

Veröffentlicht 2026-09-16
📖 6 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Mohitvishnu S. Gadde, Ashish Malik, Pranay Dugar, Aayam Kumar Shrestha, Alan Fern

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Humanoide Roboter sind darauf ausgelegt, sich ähnlich wie Menschen durch die Welt zu bewegen, indem sie durch unordentliche Räume navigieren, über Hindernisse steigen und nach Gegenständen in Regalen greifen. Um dies zu ermöglichen, verwenden Ingenieure ein zentrales Steuerungssystem, das als internes Gleichgewichts- und Koordinationszentrum des Roboters fungiert. Dieses System nimmt High-Level-Anweisungen entgegen – wie etwa „gehe vorwärts gehen“ oder „greife nach dieser Tasse“ – und übersetzt diese in spezifische Muskelbewegungen für die Gelenke des Roboters. Es besteht jedoch eine erhebliche Lücke darin, wie diese Roboter ihre Umgebung wahrnehmen. Während das Steuerungssystem exzellent darin ist, das Gleichgewicht zu halten und einem Pfad zu folgen, ist es oft „blind“ gegenüber der physischen Geometrie der Umgebung. Es weiß zwar, wohin es gehen soll, aber es weiß nicht von Natur aus, was im Weg steht. Wenn ein menschlicher Operator oder ein Planungsalgorithmus einen Befehl gibt, der den Roboter direkt in eine Wand führt, wird der Roboter oft versuchen, diesen Befehl wörtlich zu befolgen, was zu einer Kollision führt. Diese Einschränkung macht es schwierig, diese Maschinen in unordentlichen, realen Räumen einzusetzen, in denen perfekte Anweisungen unmöglich zu garantieren sind.

Forscher der Oregon State University haben einen neuen Ansatz entwickelt, um dieses Problem zu lösen, indem sie eine Sicherheitsebene geschaffen haben, die zwischen dem Gehirn des Roboters und seinen Muskeln sitzt. Sie nennen dieses System RECAL, was für Robot–Environment Cross-Attention Layer steht. Anstatt zu versuchen, den gesamten Roboter-Controller von Grund auf neu zu bauen, hat das Team ihr neues System um einen bestehenden, bewährten Controller herum gebaut, der bereits gut im Balancieren, aber blind gegenüber Hindernissen ist. Die neue Ebene fungiert als Echtzeitfilter. Sie nimmt den beabsichtigten Pfad des Roboters und die Rohdaten der Kameras des Roboters entgegen, welche die Welt als eine Punktwolke darstellen, die Wände, Möbel und den eigenen Körper des Roboters repräsentiert. Durch den Vergleich der Position des Roboters und der von ihm gehaltenen Objekte mit der umgebenden Geometrie kann das System erkennen, wenn eine geplante Bewegung zu einem Aufprall führen würde. Wenn eine Kollision unmittelbar bevorsteht, passt das System den Befehl subtil an, bevor er die Muskeln erreicht, und steuert den Roboter leicht von der Gefahr weg, während es dennoch versucht, das ursprüngliche Ziel zu erreichen.

Der Kern dieser Innovation ist eine Aufmerksamkeitsmethode, die es dem Roboter ermöglicht, sich auf die spezifischen Teile der Umgebung zu konzentrieren, die in einem gegebenen Moment am wichtigsten sind. Stellen Sie sich vor, der Roboter hat einen Satz virtueller Sensoren an seinen Knien, Ellbogen und an den Ecken eines von ihm getragenen Kartons platziert. Diese Sensoren fragen ständig die Umgebung: „Was ist in meiner Nähe?“ Das System verwendet dann einen mathematischen Prozess, um die Bedeutung nahegelegener Hindernisse gegenüber dem beabsichtigten Pfad des Roboters abzuwägen. Wenn der Roboter durch eine Tür geht, bemerken die Sensoren an seinen Schultern vielleicht eine Wand, die gerade noch außerhalb der Reichweite liegt, und bitten den Controller, sein Gleichgewicht leicht nach links zu verlagern. Wenn der Roboter einen großen Karton trägt, erweitert das System sein Bewusstsein auf das Volumen dieses Kartons, um sicherzustellen, dass die gesamte Last das Hindernis passiert, nicht nur der Körper des Roboters. Dies geschieht in einem Bruchteil einer Sekunde, was es dem Roboter ermöglicht, flüssige, kontinuierliche Anpassungen vorzunehmen, anstatt anzuhalten und neu zu berechnen.

Um diesem System beizubringen, wie es diese blitzschnellen Entscheidungen trifft, verwendeten die Forscher eine Technik namens Teacher-Student-Distillation. Zuerst erstellten sie eine „Lehrer“-Version des Controllers, die Zugang zu perfekten, privilegierten Informationen über die Umgebung hatte, wie etwa dem exakten Standort jedes Hindernisses in einer simulierten Welt. Dieser Lehrer konnte in die Zukunft sehen und wusste genau, wie er einen Befehl modifizieren musste, um eine Kollision zu vermeiden. Die Forscher trainierten dann eine „Schüler“-Version des Systems, die nur Zugang zu denselben begrenzten Kamera- und Sensordaten hatte, die ein echter Roboter hätte, um das Verhalten des Lehrers nachzuahmen. Der Schüler lernte, die sicheren Anpassungen vorherzusagen, die der Lehrer vornehmen würde, und lernte so effektiv, die Welt durch die Augen des Lehrers zu sehen, ohne dessen perfekte Daten zu benötigen. Dies ermöglichte es dem System, komplexe Ausweichstrategien in einer simulierten Umgebung zu erlernen und dieses Wissen dann auf einen physischen Roboter zu übertragen.

Das Team testete sein neues System in einer Vielzahl von anspruchsvollen Szenarien, darunter das Gehen durch belebte Räume, das Tragen von Kartons und das Greifen nach Gegenständen in Regalen im Stehen. Sie verglichen die Leistung ihres neuen Systems mit dem ursprünglichen „blinden“ Controller und anderen Methoden, die versuchten, die Umgebung unter Verwendung anderer Techniken zu verstehen. Die Ergebnisse zeigten, dass das neue System wesentlich erfolgreicher darin war, Kollisionen zu vermeiden. In schwierigen Tests, in denen der ursprüngliche Controller in mehr als der Hälfte der Versuche kollidierte, gelang es dem neuen System, Kollisionen in über 90 Prozent der Fälle zu vermeiden. Entscheidend war, dass es dies geschah, ohne die Fähigkeit des Roboters zu opfern, dem beabsichtigten Pfad zu folgen. Wenn der Pfad frei war, bewegte sich der Roboter exakt wie befohlen. Wenn der Pfad blockiert war, wich er gerade so weit ab, um sicher zu bleiben, und kehrte nach dem Passieren des Hindernisses auf den ursprünglichen Kurs zurück.

Die Forscher maßen auch die physische Auswirkung dieser Kollisionen. Wenn der ursprüngliche Controller kollidierte, geschah dies oft mit erheblicher Kraft, insbesondere am Torso und an den Hüften des Roboters. Das neue System hingegen reduzierte diese Aufprallkräfte drastisch. In den schwierigsten Tests eliminierte das neue System nahezu alle schweren Kollisionen mit dem Hauptkörper des Roboters und ließ nur leichte, harmlose Berührungen mit der Umgebung zurück. Dies deutet darauf hin, dass das System Kollisionen nicht nur vermeidet, sondern dies auf eine Weise tut, die natürlich und kontrolliert wirkt, anstatt ruckartig oder panisch. Das Team validierte seine Ergebnisse weiter, indem es das System an einem echten, physischen humanoiden Roboter namens Digit V3 testete. Ausgestattet mit Tiefenkameras, um die Welt zu sehen, navigierte der Roboter erfolgreich durch reale Hindernisse, trug Objekte und griff nach Gegenständen in engen Räumen, was demonstrierte, dass die in der Simulation gelernten Lektionen auf die physische Welt übertragen werden konnten.

Obwohl das System einen bedeutenden Schritt nach vorne darstellt, merken die Forscher an, dass es keine perfekte Lösung für jede Situation ist. Die aktuelle Version setzt voraus, dass der Boden eben ist und die Hindernisse stationär sind, was bedeutet, dass sie mit sich bewegenden Menschen oder unebenem Gelände Schwierigkeiten haben könnte. Zudem betrachtet sie alle Hindernisse als Dinge, die vermieden werden müssen, ohne zu verstehen, dass einige Oberflächen dazu bestimmt sind, berührt zu werden, oder dass einige Objekte bewegt werden können. Darüber hinaus hängt das System von der Qualität der Kameradaten ab; wenn der Roboter ein Hindernis nicht sehen kann, weil es sich hinter ihm oder in einem toten Winkel befindet, kann das System eine Kollision nicht verhindern. Trotz dieser Einschränkungen zeigt die Arbeit einen leistungsstarken neuen Weg auf, humanoide Roboter sicherer und anpassungsfähiger zu machen. Durch das Hinzufügen einer geometrischen Wahrnehmung zu bestehenden Controllern haben die Forscher gezeigt, dass Roboter lernen können, in der unordentlichen, unvorhersehbaren Welt menschlicher Umgebungen zu navigieren, ohne dass sie von Grund auf neu entworfen werden müssen.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →