← Neueste Arbeiten
💻 computer science

VOFA: Visual Object Goal Pushing with Force-Adaptive Control for Humanoids

Dieser Beitrag stellt VOFA vor, ein hierarchisches humanoides Loko-Manipulationssystem, das eine hochrangige, visuell zielbedingte Politik mit einem niedrigrangigen, kraftadaptiven Regler kombiniert, um schwere Objekte mit unbekannten physikalischen Eigenschaften allein mittels onboarder egozentrischer Wahrnehmung robust zu beliebigen Zielen zu schieben.

Ursprüngliche Autoren: Zichao Hu, Zifan Xu, Dongsik Chang, He Yin, Linh Tran, Roberto Martín-Martín, Peter Stone, Jingyu Qiao, Joydeep Biswas

Veröffentlicht 2026-05-06
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Zichao Hu, Zifan Xu, Dongsik Chang, He Yin, Linh Tran, Roberto Martín-Martín, Peter Stone, Jingyu Qiao, Joydeep Biswas

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich einen humanoiden Roboter namens „Booster T1" vor, der in einem Lagerhaus steht. Seine Aufgabe besteht darin, eine schwere, mysteriöse Kiste über den Boden zu einem bestimmten Punkt zu schieben. Der Haken? Der Roboter weiß nicht, wie schwer die Kiste ist, er weiß nicht, ob der Boden rutschig oder klebrig ist, und er kann die Kiste nicht perfekt sehen, da seine Kamera etwas unscharf ist.

Dieser Artikel stellt VOFA (Visual Object–Goal Pushing with Force-Adaptive Control) vor, ein „Gehirn-und-Körper"-System, das dem Roboter beibringt, diese Kisten erfolgreich zu schieben, selbst wenn etwas schiefgeht.

So funktioniert VOFA, aufgeteilt in einfache Konzepte:

1. Das Zwei-Gehirn-System (Die Hierarchie)

VOFA verwendet einen zweistufigen Teamansatz, wie ein General und ein Soldat:

  • Der General (High-Level Policy): Dies ist der „visionäre" Teil. Er betrachtet den Kamerastrom (der etwas verrauscht ist, wie ein schlechter Videoanruf) und das Ziel. Er entscheidet, wohin der Roboter gehen soll und wie er sich relativ zur Kiste positionieren muss. Er macht sich keine Sorgen um winzige Muskelzuckungen; er gibt nur große Befehle wie „Vorwärts bewegen" oder „Links abbiegen".
  • Der Soldat (Low-Level Controller): Dies ist der „Muskulatur"-Teil. Er nimmt die großen Befehle des Generals und berechnet genau, wie jeder Gelenk im Körper des Roboters bewegt werden muss. Entscheidend ist, dass dieser Teil kraftadaptiv ist. Stellen Sie sich das wie eine Person vor, die einen Einkaufswagen schiebt, der plötzlich mit Ziegelsteinen gefüllt wird. Wenn der Wagen schwerer wird, lehnt sich die Person instinktiv stärker vor und passt ihren Stand an, damit sie nicht umfällt. Der Soldat macht dasselbe automatisch, passt sich dem Gewicht der Kiste und der Reibung des Bodens an, ohne dass ihm dies gesagt werden muss.

2. Das Trainingslager (Lehrer-Schüler-Methode)

Es ist schwierig, einem Roboter dies beizubringen, da man ihm während des Trainings nicht leicht eine „perfekte Sicht" auf die Welt geben kann. Daher verwendeten die Forscher eine Lehrer-Schüler-Methode:

  • Der Lehrer: Zuerst trainierten sie einen „Lehrer"-Roboter, der Superkräfte besaß. Er konnte das exakte Gewicht der Kiste, die exakte Reibung des Bodens und die perfekte Position der Roboter-Gelenke sehen. Er lernte, die Kiste perfekt zu schieben, indem er diese „privilegierten" Informationen nutzte.
  • Der Schüler: Dann trainierten sie einen „Schüler"-Roboter, der nur eine normale Kamera und grundlegende Sensoren hatte (keine Superkräfte). Der Schüler beobachtete den Lehrer und versuchte, dessen Bewegungen zu kopieren. Um den Schüler robuster zu machen, fügten die Forscher während des Trainings „visuelles Rauschen" hinzu – etwa durch Unschärfe der Kamera oder statisches Rauschen –, damit der Schüler lernte, die Kiste auch dann zu schieben, wenn die Sicht unordentlich war, genau wie es in der realen Welt der Fall wäre.

3. Der Trick „Zuerst ausrichten"

Eine der größten Herausforderungen besteht darin, dass der Roboter scheitern wird, wenn er versucht, die Kiste zu schieben, während er auf der falschen Seite steht. Die Forscher fügten eine spezielle „Belohnung" (wie ein Goldstern) hinzu, damit der Roboter sich zuerst neu positioniert.

Stellen Sie sich vor, Sie versuchen, eine schwere Couch zu schieben. Wenn Sie an der Seite stehen, können Sie sie nicht vorwärts bewegen. Sie müssen zuerst herumgehen und sich hinter die Couch stellen. VOFA lernte diesen Trick selbstständig. Es wartet, bis es an der perfekten Stelle hinter der Kiste relativ zum Ziel steht, bevor es mit dem Schieben beginnt. Dies verhindert, dass der Roboter einen „vorzeitigen Kontakt" herstellt und stecken bleibt.

4. Ergebnisse in der realen Welt

Das Team testete dies am echten Roboter Booster T1. Hier ist, was passierte:

  • Schweres Heben: Der Roboter schaffte es erfolgreich, Kisten mit einem Gewicht von bis zu 17 kg (etwa 37 lbs) zu schieben. Das ist mehr als die Hälfte des Gewichts des Roboters selbst! Der Roboter wurde in der Simulation nicht einmal auf so schwere Kisten trainiert, doch er fand es im laufenden Betrieb heraus.
  • Verschiedene Winkel: Egal, ob das Ziel vor dem Roboter, an der Seite oder sogar hinter ihm lag, VOFA gelang es in der realen Welt in über 80 % der Fälle.
  • Wiederherstellung: Wenn jemand die Kiste während des Schiebens zur Seite kickte, geriet der Roboter nicht in Panik. Er hielt an, sah nach, wo die Kiste hingeht, ging herum, um wieder in die Linie zu kommen, und setzte das Schieben fort. Er arbeitet in einem geschlossenen Regelkreis, was bedeutet, dass er seine Umgebung ständig überprüft und seinen Pfad korrigiert, anstatt nur einem vorab geplanten Skript zu folgen.

Zusammenfassung

VOFA ist ein System, das einem humanoiden Roboter ermöglicht, schwere, unbekannte Objekte mit Hilfe einer einzigen Kamera zu bestimmten Zielen zu schieben. Es kombiniert einen intelligenten „visionären" Planer mit einer „Muskulatur", die instinktiv auf Gewicht und Reibung reagiert. Indem ein Schüler-Roboter trainiert wurde, einen superkräftigen Lehrer nachzuahmen, während er mit unordentlichen Kameradaten umgehen musste, lernte das System, schwere Kisten zu schieben, sich von Stößen zu erholen und komplexe Winkel zu navigieren, ohne umzufallen.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →