Tri-Manual Visuomotor Imitation Learning of Robot Policies
Dieses Paper führt TriManPolicy ein, ein Imitationslernsystem mit Dependency-Aware Tri-Arm Scheduling (DATS), das es einem einzelnen menschlichen Operator ermöglicht, durch das Offline-Retiming unabhängiger Armbewegungen unter Wahrung von Aufgabenbeschränkungen effektive synchronisierte Policies für dreiarmige Roboter zu demonstrieren und zu trainieren, wodurch die Einschränkungen der traditionellen bimanualen Teleoperation überwunden werden.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Stellen Sie sich eine Welt vor, in der Roboter lernen, Hausarbeiten nicht durch Versuch und Irrtum zu erledigen, sondern indem sie zuerst Menschen dabei beobachten. Dieses Feld wird „Imitation Learning“ genannt, und es ist so, als würde man einem Roboter das Kochen beibringen, indem man ihm beim Schneiden von Gemüse und Rühren im Topf zusieht. Normalerweise funktioniert dies am besten, wenn der Roboter und der Mensch die gleiche Anzahl an Händen haben. Wenn ein Mensch zwei Hände benutzt, um ein Hemd zu falten, kann ein zweiarmer Roboter die Bewegung perfekt kopieren. Aber was passiert, wenn der Roboter superpowered ist und drei Arme hat, der menschliche Lehrer aber nur zwei? Dies ist das Rätsel, das Wissenschaftler zu lösen versuchen. Sie wollen wissen, ob ein Roboter lernen kann, einen dritten „Hilfsarm“ zu benutzen, indem er nur einen Menschen beobachtet, der gleichzeitig nur zwei Arme steuern kann. Wenn der Roboter versucht, den Rhythmus des Menschen exakt zu kopieren, könnte er stecken bleiben und darauf warten, dass der Mensch die Hände wechselt, obwohl der Roboter drei Dinge gleichzeitig tun könnte. Die große Frage ist: Können wir den Roboter lehren, die „Wechselverzögerungen“ des Menschen zu ignorieren und herauszufinden, wie er alle drei Arme gleichzeitig nutzt?
Hier kommt TriManPolicy ins Spiel, ein cleveres neues System, das darauf ausgelegt ist, dreiarme Roboter mithilfe eines zweihändigen menschlichen Lehrers zu trainieren. Die Forscher stellten fest, dass ein Mensch, der einen dreiar면gen Roboter steuert, abwechseln muss: Er steuert zwei Arme, dann wechselt er zu einem anderen Paar, wodurch der dritte Arm an Ort und Stelle eingefroren bleibt. Wenn ein Roboter einfach dieses Video kopiert, lernt er ebenfalls einzufrieren und wartet darauf, dass der Mensch den Modus wechselt. Um dies zu beheben, entwickelte das Team ein digitales „Zeitreise“-Werkzeug namens DATS (Dependency-Aware Tri-Arm Scheduling). Betrachten Sie DATS als einen Film-Editor, der die Aufnahme des Menschen betrachtet und die Zeitachse neu editiert. Er behält alle tatsächlichen Bewegungen bei – wie den Menschen, der mit einer Hand eine Tasche offen hält, während die anderen zwei ein Handtuch falten – aber er entfernt die unbeholfenen Pausen, in denen der Mensch aufhören musste, um die Steuerung zu wechseln. DATS findet heraus, welche Aktionen in einer bestimmten Reihenfolge erfolgen müssen (wie einen Deckel auf eine Box zu setzen, bevor man sie abstellt) und welche Aktionen gleichzeitig passieren können (wie eine Box festzuhalten, während ein anderer Arm sie abwischt). Durch das Neuordnen des Videos, um diese Aktionen gemeinsam geschehen zu lassen, trainiert es den Roboter zu einem wahren dreiarmi-gen Superhelden.
Die Ergebnisse sind beeindruckend. Das Team testete dies bei sechs verschiedenen realen Aufgaben, wie dem Falten von Handtüchern, dem Verkleben von Taschen und dem Platzieren von Radiergummis in Boxen. Sie führten jeweils 25 Versuche pro Aufgabe durch. Die Roboter, die mit der „zeitgereisten“ DATS-Methode trainiert wurden, waren signifikant schneller. Tatsächlich beendeten die mit DATS trainierten Roboter bei jeder einzelnen Aufgabe ihre Arbeit in kürzerer Zeit als die Roboter, die mit den rohen, uneditierten Videos trainiert wurden. Bei einer Aufgabe, die das Platzieren von Radiergummis beinhaltete, waren die DATS-Roboter beispielsweise fast 50 % schneller. Sie waren zudem genauso erfolgreich oder sogar erfolgreicher als die anderen Roboter. Die Daten zeigen, dass der Roboter durch das Lehren, die Wechselverzögerungen des Menschen zu ignorieren und sich statraz auf den logischen Ablauf der Aufgabe zu konzentrieren, lernt, alle drei Arme reibungslos zu koordinieren und so eine klobige Stop-and-Go-Performance in einen flüssigen, synchronisierten Tanz zu verwandeln.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.