← Neueste Arbeiten
💻 computer science

UniReflex: Plug-and-Play Force Control for Pretrained Generative Policies via Fast-Slow Reflex

UniReflex ist ein universelles Plug-and-Play-Framework, das vortrainierte generative Policies durch eine geschlossene Regelung der variablen Impedanz mittels eines Fast-Slow-Reflexmechanismus erweitert und so eine robuste Kontaktregulierung sowie nahtlose Übergänge zwischen Positions- und Kraftausführung ermöglicht, ohne dass ein erneutes Training des Netzwerks erforderlich ist.

Ursprüngliche Autoren: Yan Huang, Shoujie Li, Ziwu Song, Wenbo Ding

Veröffentlicht 2026-08-19
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Yan Huang, Shoujie Li, Ziwu Song, Wenbo Ding

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Roboter sind bemerkenswert gut darin geworden, menschliche Bewegungen zu beobachten und zu kopieren. Durch das Studium tausender Videodemonstrationen können moderne Systeme der künstlichen Intelligenz lernen, Objekte aufzuheben, Blöcke zu stapeln oder Werkzeuge mit beeindruckender Präzision über einen Tisch zu bewegen. Diese Systeme, die oft als generative Policies bezeichnet werden, agieren wie ein langsamer, nachdenklicher Planer, der entscheidet, wohin die Hand eines Roboters als Nächstes führen soll. Es gibt jedoch eine erhebliche Lücke zwischen der Bewegung durch leere Luft und der Interaktion mit der physischen Welt. Wenn ein Roboter eine Oberfläche abwischen, einen Knopf drücken oder etwas einschrauben muss, muss er die Kräfte steuern, die er ausübt. Wenn der Roboter zu fest drückt, könnte er das Objekt beschädigen oder abrutschen; wenn er zu schwach drückt, wird die Aufgabe nicht erfolgreich abgeschlossen. Aktuelle Roboter haben hier oft Schwierigkeiten, da sie darauf ausgelegt sind, einem visuellen Pfad perfekt zu folgen, wobei sie die Welt so behandeln, als bestünde sie aus Glas, das sich niemals biegt oder Widerstand leistet. Ihnen fehlt die Fähigkeit, Widerstand zu spüren und den Griff oder den Druck in Echtzeit anzupassen – eine Fähigkeit, die dem Menschen ganz natürlich in die Finger kommt, aber schwer beizubringen ist Maschinen, die nur sehen können.

Forscher der Tsinghua University und der Nanyang Technological University haben einen neuen Ansatz namens UniReflex entwickelt, um diese Lücke zu schließen, ohne das gesamte „Robotergehirn“ neu aufbauen zu müssen. Anstatt zu versuchen, die massiven, komplexen KI-Modelle, die bereits wissen, wie man sich bewegt, neu zu trainieren, haben sie eine leichte, schnell reagierende Schicht obenauf gesetzt. Stellen Sie sich die Haupt-KI wie einen Fahrer vor, der die Route und das Ziel kennt, während diese neue Ergänzung wie ein Reflex wirkt, der das Lenkrad sofort anpasst, wenn das Auto auf eine Bodenwelle stößt. Das System arbeitet, indem es auf die internen Gedanken des Roboters hört, wohin er gehen möchte, während es gleichzeitig die Kräfte überwacht, die auf das Handgelenk des Roboters treffen. Wenn der Roboter auf unerwarteten Widerstand stößt, übernimmt diese schnelle Schicht für einen Sekundenbruchteil, um den Kontakt abzumildern oder den Winkel zu ändern, wodurch sichergestellt wird, dass der Kontakt stabil bleibt. Entscheidend ist, dass diese neue Schicht nicht erfordert, dass die ursprüngliche KI neu trainiert oder modifiziert wird, was es ermöglicht, sie sofort in verschiedene bestehende Robotergehirne einzubinden.

Das Team testete diese Methode bei einer Vielzahl schwieriger Aufgaben, die einen ständigen physischen Kontakt erfordern, wie etwa das Wischen über eine gekrümmte Oberfläche, das Abziehen eines Aufklebers von einem Notizzettel oder das Einstecken eines Ladegeräts in eine Buchse. In diesen Experimenten verwendeten sie drei verschiedene Arten von vortrainierten Robotergehirnen, die von kleineren Modellen bis hin zu massiven Modellen mit Milliarden von Parametern reichten. Wenn die Roboter nur mit ihren ursprünglichen Planungsfähigkeiten betrieben wurden, scheiterten sie oft, sobald sie ein Objekt berührten, indem sie abrutschten oder zu viel Druck ausübten. Als die UniRefelf-Schicht jedoch aktiviert wurde, stieg die Erfolgsquote für diese kontaktintensiven Aufgaben dramatisch an. Beispielsweise verbesserte sich bei einer Aufgabe, die das Abziehen eines Aufklebers beinhaltete, die Erfolgsquote von einem niedrigen Basiswert auf fast neunzig Prozent. Das System war besonders effektiv darin, den richtigen Druck aufrechtzuerhalten und die Hand des Roboters stabil zu halten, selbst wenn sich das Objekt bewegte oder die Oberfläche uneben war.

Eine zentrale Erkenntnis der Forschung ist, dass diese Verbesserung erfolgt, ohne die ursprüngliche Fähigkeit des Roboters, präzise zu einem Ziel zu navigen, zu opfern. Die neue Schicht fungiert als ein Schalter, der weiß, wann er den Hauptplaner arbeiten lassen und wann er die Kontrolle für Feinabstimmungen übernehmen muss. Bevor der Roboter etwas berührt, bewegt er sich exakt so, wie es die ursprüngliche KI beabsichtigt hat, wodurch seine hochgradigen Planungsfähigkeiten bewahrt werden. In dem Moment, in dem Kontakt registriert wird, greift die schnelle Reflexschicht ein, um die Kräfte zu steuern und sicherzustellen, dass der Roboter nicht gegen das Objekt prallt oder den Griff verliert. Diese Trennung der Aufgaben ermöglicht es dem Roboter, sowohl präzise in seinen Bewegungen als auch sanft in seinen Interaktionen zu sein. Die Forscher fanden auch heraus, dass dieser Ansatz unglaublich effizient ist. Da sie nur die kleine, schnelle Reflexschicht trainierten und die massive Haupt-KI eingefroren ließen, wurde die Zeit, die für das Training des Systems benötigt wird, im Vergleich zu Methoden, die versuchen, das gesamte Robotergehirn von Grund auf neu zu trainieren, um den Faktor 25 bis 66 reduziert.

Die Studie untersuchte auch, wie gut das System mit unerwarteten Störungen umgeht, wie etwa einer Oberfläche, die sich verschiebt, während der Roboter sie abwischt, oder einem Teil, das leicht deplatziert ist. In diesen Szenarien verloren die Standard-Robotermodelle oft den Kontakt und scheiterten an der Aufgabe. Die durch UniReflex verbesserten Roboter konnten jedoch schnell reagieren und den Kontakt wieder herstellen, indem sie die korrekte Kontaktkraft innerhalb von einer Sekunde oder weniger wiederherstellten. Diese Resilienz deutet darauf an, dass das System besser an die Unvorhersehbarkeit der realen Welt angepasst ist als bisherige Methoden. Die Forscher merkten an, dass die Methode zwar hervorragend für anhaltende Aufgaben wie Wischen oder Drücken funktioniert, aber bei sehr kurzen, schnellen Aktionen wie dem Einrasten eines Steckers in eine enge Buchse vor größeren Herausforderungen steht, bei denen das Zeitfenster für Anpassungen extrem klein ist. Dennoch demonstrieren die Ergebnisse einen leistungsstarken neuen Weg, Robotern den Tastsinn zu geben, der ihnen bisher fehlte, was es ihnen ermöglicht, mit der physischen Welt sicherer und effektiver zu interagieren, ohne dass sie komplett neu entworfen werden müssen.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →