← Neueste Arbeiten
💻 computer science

Vision-Force Admittance Learning for Peg Insertion into a Movable Hole

Dieses Paper schlägt ein Vision-Force Admittance Learning (VFAL)-Framework vor, das asynchrones visuelles Feedback von Foundation-Modellen mit hochfrequenter Kraftsteuerung fusioniert, um eine robuste, millimetergenaue Peg-in-Hole-Einfügung in bewegliche Löcher in dynamischen Umgebungen zu ermöglichen.

Ursprüngliche Autoren: Yuzhong Chen, Yongqing Liang, Yunzhi Xu, Irving Fang, Chase Kidder, Hui-ping Wang, Raihan Haque, Yubiao Zhang, Chen Feng

Veröffentlicht 2026-09-16
📖 6 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Yuzhong Chen, Yongqing Liang, Yunzhi Xu, Irving Fang, Chase Kidder, Hui-ping Wang, Raihan Haque, Yubiao Zhang, Chen Feng

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

In der ruhigen, kontrollierten Welt einer Fabrikhalle kann ein Roboterarm ein Wunderwerk der Präzision sein. Er kann einen Schraubendreher aufnehmen und ihn mit einer Stetigkeit in ein Loch treiben, die keine menschliche Hand erreichen kann – vorausgesetzt, das Loch bewegt sich nicht. Dies ist das Reich der statischen Manipulation, in dem das Ziel stillsteht und die Herausforderung für den Roboter lediglich darin besteht, seinen Weg zu einem festen Punkt zu finden. Doch die reale Welt ist selten so ruhig. Stellen Sie sich ein Autoteil vor, das auf einem Förderband fährt, oder einen Roboter, der auf einem Fahrzeug montiert ist, das über unebenes Gelände fährt. In diesen dynamischen Umgebungen ist das Ziel in Bewegung, und der Roboter muss das Loch nicht nur finden, sondern ihm auch nachjagen, während er gleichzeitig die Millimeterpräzision beibehält, die erforderlich ist, um einen Stift in eine enge Öffnung einzuführen. Dies ist ein grundlegender Konflikt: Das Bedürfnis nach extremer Präzision kollidiert mit dem Chaos eines beweglichen Ziels. Traditionelle Roboter haben hier Schwierigkeiten, da sie entweder auf eine langsame, hochgradige Bildverarbeitung angewiesen sind, um zu sehen, wo sich das Loch befindet, oder auf schnelle, lokale Berührungssensoren, um den Moment des Kontakts zu spüren. Die Bildverarbeitung ist zu langsam, um auf plötzliche Verschiebungen zu reagieren, während das bloße Tasten nicht weit genug voraussehen kann, um einen reibungslosen Pfad zu planen.

Forscher der New York University und General Motors haben einen neuen Weg entwickelt, um dieses Problem zu lösen, indem sie ein System geschaffen haben, das es einem Roboter ermöglicht, einen Stift mit bemerkenswertem Erfolg in ein bewegliches Loch einzuführen. Sie nennen ihre Methode Vision-Force Admittance Learning (Visuelle Kraft-Admittanz-Lernverfahren). Anstatt den Roboter dazu zu zwingen, sich zwischen Sehen und Fühlen zu entscheiden, lässt dieses System die beiden Sinne in einem spezifischen, asynchronen Rhythmus zusammenarbeiten. Der Roboter verwendet eine Kamera, um abzuschätzen, wo sich das Loch befindet, aber da Kameras langsam sind, werden diese Informationen eher als allgemeine Orientierung denn als strikte Anweisung behandelt. Gleichzeitig verlässt sich der Roboter auf einen Kraftsensor an seinem Handgelenk, der hunderte Male pro Sekunde auf den physischen Druck reagiert, wenn der Stift das Loch berührt. Die Innovation liegt darin, wie diese beiden Datenströme kombiniert werden. Der schnelle Kraftsensor nimmt die unmittelbaren, blitzschnellen Anpassungen vor, die erforderlich sind, um den Stift auszurichten, während die langsamere Kamera das Verständnis des Roboters über die Gesamtposition des Lochs aktualisiert. Dieses visuelle Update wirkt wie eine sanfte Korrektur oder ein Regularisator, der den Roboter davon abhält, zu weit vom Kurs abzuweichen, selbst wenn der Kraftsensor die schnellen, chaotischen Vibrationen beim Einführen bewältigt.

Um dies zu testen, baute das Team ein reales Experiment auf, das einen Roboterarm bestand, der einen Stift hält, und eine Basis mit einem Loch, das sich bewegen konnte. Sie verwendeten eine spezielle Art von Befestigungselement, eine Pushnut mit flexiblen Flanschen, wie sie in der industriellen Montage üblich ist. Der Aufbau beinhaltete eine Kamera, um die Szene zu beobachten, und einen Kraftsensor, um den Kontakt zu fühlen. Sie testeten den Roboter in drei verschiedenen Szenarien: ein Loch, das stillstand, ein Loch, das sich in einer geraden Linie bewegte, und ein Loch, das sich in drei Dimensionen auf einem motorisierten Schlitten bewegte. Die Ergebnisse waren beeindruckend. Wenn das Loch in Bewegung war, schaffte es ein Roboter, der sich nur auf die Bildverarbeitung verließ, meist nicht, den Stift einzuführen, während ein Roboter, der sich nur auf Kraftsensoren verließ, ebenfalls Schwierigkeiten hatte und oft die Orientierung verlor oder zu viel Kraft aufwand. Das neue System jedoch, das beide Sinne fusionierte, erreichte eine Erfolgsquote von 80 Prozent im schwierigsten dreidimensionalen Bewegungsszenario. Im Szenario der geradlinigen Bewegung war es jedes einzelne Mal erfolgreich.

Die Forscher fanden heraus, dass der Schlüssel zu diesem Erfolg nicht nur das Vorhandensein beider Sensoren war, sondern wie sie zeitlich abgestimmt waren. Sie verglichen ihre Methode mit einer Version, bei der die Bild- und Kraftdaten gezwungen wurden, aufeinander zu warten – ein Prozess, der alles verlangsamte. Indem sie den schnellen Kraftsensor die Bewegung steuern ließen, während das langsamere Bildsystem das Ziel im Hintergrund aktualisierte, konnte der Roboter sofort auf physischen Kontakt reagieren, ohne seinen globalen Orientierungssinn zu verlieren. Sie entdeckten auch, dass das System in der Lage war, Fehler zu korrigieren. Wenn die Kamera das Loch aus den Augen verlor, zog sich der Roboter sicher zurück und wartete, bis die Bildverarbeitung wieder einsetzte. Wenn der Stift stecken blieb oder die Kraftmesswerte auf einen schlechten Winkel hindeuteten, konnte der Roboter den Stift anheben und es erneut versuchen. Diese Fähigkeit zur Anpassung und Erholung machte das System robust genug, um die unvorhersehbare Natur eines beweglichen Ziels zu bewältigen.

Die Studie untersuchte auch, wie verschiedene Einstellungen das Ergebnis beeinflussten. Sie fanden heraus, dass das Gleichgewicht zwischen dem Vertrauen in die Kameraposition und der Rückmeldung des Kraftsensors entscheidend war. Wenn der Roboter der Kamera zu sehr vertraute, ignorierte er die physische Realität, dass der Stift gegen die Seite des Lochs stieß. Wenn er dem Kraftsensor zu sehr vertraute, driftete er ziellos umher, wenn sich das Loch bewegte. Durch das Finden eines Mittelwegs lernte der Roboter, die Kamera zu nutzen, um auf dem richtigen Weg zu bleiben, und den Kraftsensor für die Feinabstimmungen, die nötig sind, um den Stift einzuführen. Dieser Ansatz funktionierte selbst dann, wenn sich das Ziel auf komplexe, nicht-lineare Weise bewegte, was bewies, dass das System mehr als nur einfache, vorhersehbare Bewegungen bewältigen kann.

Letztendlich zeigt diese Arbeit, dass Roboter darauf trainiert werden können, feinfühlige Aufgaben in Umgebungen auszuführen, die nicht perfekt statisch sind. Durch die Kombination der langsamen, breiten Sicht einer Kamera mit dem schnellen, sensiblen Tasten eines Kraftsensors haben die Forscher eine Methode geschaffen, die der Art und Weise nachempfunden ist, wie Menschen ein bewegliches Objekt handhaben könnten: indem wir unsere Augen benutzen, um zu wissen, wohin wir gehen müssen, und unsere Hände, um den Weg zu fühlen. Das System setzt nicht voraus, dass der Roboter von Anfang an perfekt ist; es erlaubt Fehler und korrigiert sie in Echtzeit. Während das aktuelle System davon ausgeht, dass der Roboter den Stift bereits aufgenommen hat, ist die Fähigkeit, ihn in ein bewegliches Loch einzuführen, ein bedeutender Schritt hin zu Robotern, die neben Menschen in dynamischen, realen Umgebungen arbeiten können – von Montagelinien bis hin zu mobilen Fahrzeugen –, ohne dass die Umgebung für sie anhalten muss.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →