← Neueste Arbeiten
💻 computer science

FetchMan: Learning Visual Humanoid Loco-Manipulation Policies from Simulated Experiences

Das Papier stellt FetchMan vor, eine End-to-End-Sim-to-Real-Pipeline, die die Leistungsbeschränkungen von synthetischem Behavior Cloning durch die Verfeinerung von Policies mittels Flow-GRPO-Reinforcement-Learning überwindet, wodurch ein Unitree G1 Humanoid eine Zero-Shot-Erfolgsrate von 73,3 % bei Loco-Manipulation-Aufgaben in ungesehenen Szenen erreicht.

Ursprüngliche Autoren: Omar Rayyan, Zhi Li, Max Argus, Yuxin Jiang, Chang Yu, Chenfanfu Jiang, Yuchen Cui

Veröffentlicht 2026-09-01
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Omar Rayyan, Zhi Li, Max Argus, Yuxin Jiang, Chang Yu, Chenfanfu Jiang, Yuchen Cui

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Der Traum von einem Roboter, der in einen Raum gehen, ein bestimmtes Objekt entdecken und es aufheben kann, ist seit langem ein zentrales Ziel in der Robotik. Jahrzehntelang haben Forscher versucht, Maschinen diese Art von komplexem Verhalten beizubringen, da es erfordert, dass zwei schwierige Fähigkeiten gleichzeitig zusammenwirken: die Bewegung des Körpers durch den Raum und die Nutzung der Hände zur Interaktion mit der Welt. Während Roboter bereits sehr gut darin geworden sind, alleine zu laufen, erzeugt das Hinzufügen der Fähigkeit, nach Dingen zu greifen und sie zu fassen, während man auf zwei Beinen das Gleichgewicht hält, ein chaotisches Zusammenspiel der Physik, das unglaublich schwer von Hand zu programmieren ist. Auch das Sammeln der notwendigen Daten, um einen Roboter auf diese Weise zu trainieren, stellt eine massive Hürde dar; einen Menschen jeden möglichen Weg zu einer Schüssel und zum Aufheben eines Objekts in jedem erdenklichen Raum demonieren zu lassen, würde Jahre dauern und das Risiko bergen, den Roboter zu beschädigen. Um dieses Problem zu lösen, haben Wissenschaftler sich Computer-Simulationen zugewandt und digitale Welten geschaffen, in denen Roboter Millionen Male üben können, ohne Gefahr zu laufen, beschädigt zu werden. Eine wesentliche Frage blieb jedoch bestehen: Kann ein Roboter, der ausschließlich in einer digitalen Welt trainiert wurde, tatsächlich lernen, mit der unordentlichen, unvorhersehbaren Realität eines echten Hauses umzugehen?

Ein Team von Forschern der University of California, Los Angeles, zusammen mit Kooperationspartnern des Allen Institute for AI und der University of Washington, hat diese Herausforderung mit einem neuen System namens FetchMan angegangen. Ihre Arbeit konzentriert sich auf einen humanoiden Roboter, den Unitree G1, der einem Menschen in Aussehen und Bewegung sehr ähnlich ist. Das Team wollte wissen, ob sie diesem Roboter beibringen könnten, durch einen Raum zu navigieren und ein Zielobjekt zu greifen, indem sie ihm lediglich tausende Beispiele in einer Computersimulation zeigen, und ob er die Aufgabe anschließend in der realen Welt perfekt ausführen kann, ohne weiteres Training zu benötigen. Sie fanden heraus, dass es nicht ausreichte, dem Roboter einfach immer mehr Beispiele der Aufgabe zu zeigen. Selbst nachdem er an über 150.000 verschiedenen Szenen trainiert worden war, stieß die Leistung des Roboters an eine harte Grenze. Er konnte zwar den digitalen Lehrer imitieren, aber er konnte nicht das subtile Timing lernen, das für einen reibungslosen Übergang vom Gehen zum Greifen erforderlich ist. Der Roboter versuchte oft, das Objekt zu früh zu greifen oder hörte zu früh auf zu gehen, wodurch er scheiterte, weil er versuchte, einen Lehrer zu kopieren, der über geheime Informationen verfügte, die der Roboter nicht sehen konnte.

Um diese Barriere zu durchbrechen, fügten die Forscher dem Trainingsprozess eine zweite Phase hinzu. Anstatt nur den digitalen Lehrer zu kopieren, ließen sie den Roboter in der Simulation auf eigene Faust üben und belohnten ihn nur dann, wenn er die gesamte Aufgabe – das Gehen zum Objekt und das Aufheben desselben – erfolgreich abgeschlossen hatte. Diese Methode, die eine Technik namens Reinforcement Learning (bestärkendes Lernen) nutzt, ermöglichte es dem Roboter, das korrekte Timing und die Bewegungen eigenständig herauszufinden. Er lernte, näher an das Objekt heranzugehen, bevor er nach dem Greifen ausfuhr, und korrigierte die Fehler, die er gemacht hatte, als er lediglich imitierte. Als das Team diesen verfeinerten Roboter in der realen Welt testete, waren die Ergebnisse beeindruckend. Der Roboter, der während seines Trainings noch nie einen echten Raum oder ein echtes Objekt gesehen hatte, war in der Lage, in unbekannte Räume zu gehen, eine Zielschüssel zu identifizieren und sie mit einer Erfolgsquote von über 73 Prozent zu greifen. Dies war eine signifikante Verbesserung gegenüber der ursprünglichen Trainingsmethode, die in realen Tests nur etwa 57 Prozent der Zeit erfolgreich war.

Die Forscher untersuchten auch, ob dieser Ansatz für viele verschiedene Arten von Objekten funktionieren könnte, nicht nur für Schüsseln. Sie trainierten eine Version des Systems darauf, Gegenstände wie Brot, Flaschen und Bücher zu erkennen und aufzuheben, indem sie dem Roboter den Namen des Objekts als Hinweis gaben. Obwohl diese Multi-Objekt-Version nicht ganz so erfolgreich war wie die Single-Objekt-Version, bewältigte sie die Aufgabe dennoch in einer Vielzahl von Situationen, was bewies, dass die Methode skalierbar ist. Die Studie unterstreicht, dass das Kopieren eines Lehrers ein guter Ausgangspunkt ist, aber nicht ausreicht, um komplexe physische Aufgaben zu meistern. Der Roboter benötigt die Freiheit, zu explorieren und aus seinen eigenen Erfolgen und Misserfolgen zu lernen, um wirklich zu verstehen, wie er sich in der Welt bewegt. Durch die Kombination einer massiven Menge an simulierter Praxis mit einer abschließenden Phase der Selbstkorrektur hat das Team einen klaren Weg aufgezeigt, um Roboter zu erschaffen, die in der Lage sind, sich an neue Umgebungen anzupassen, ohne dass ein Mensch ihnen bei jedem Schritt die Hand halten muss.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →