← Neueste Arbeiten
💻 computer science

GPA-RAM: Grasp-Pretraining Augmented Robotic Attention Mamba for Spatial Task Learning

Das Paper schlägt GPA-RAM vor, ein neuartiges Framework, das Grasp-Pretraining Augmentation integriert, um die Erfolgsraten bei Manipulationen zu erhöhen, und eine Robotic Attention Mamba Architektur für eine effiziente Echtzeit-Aktionsgenerierung einsetzt, wodurch es eine State-of-the-Art-Leistung über mehrere Roboterplattformen hinweg erzielt.

Ursprüngliche Autoren: Juyi Sheng, Yangjun Liu, Sheng Xu, Zhixin Yang, Tiantian Xu, Mengyuan Liu

Veröffentlicht 2026-08-03
📖 3 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Juyi Sheng, Yangjun Liu, Sheng Xu, Zhixin Yang, Tiantian Xu, Mengyuan Liu

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie versuchen, einem Roboter beizubringen, Ihre Hausarbeit zu erledigen. Sie wollen nicht eine Million Zeilen Code schreiben, um ihm exakt vorzugeben, wie er seine Finger für jedes einzelne Objekt in Ihrem Haus bewegen soll. Stattdessen möchten Sie ihm zeigen, was zu tun ist, so wie ein Elternteil einem Kind zeigt, wie man Klötze stapelt oder einen Löffel in eine Tasse legt. Dies ist die Welt des Roboter-Imitationslernens. Es ist ein Zweig der Wissenschaft, bei dem Roboter lernen, indem sie menschliche Demonstrationen beobachten und nachahmen. Die große Herausforderung? Roboter sind gut darin, ihre Arme zu bewegen, aber sie sind oft schlecht im allerersten Schritt: das Richtige auf die richtige Weise zu greifen. Wenn ein Roboter einen Becher am Rand statt am Griff anfasst oder einen Dübel um einen Millimeter verfehlt, kann die gesamte Aufgabe scheitern, und der Roboter weiß vielleicht nicht, wie er das korrigieren soll. Wissenschaftler versuchen ständig, „Gehirne“ für Roboter zu bauen, die ein unordentliches Zimmer sehen, herausfinden können, wie man ein Objekt am besten hält, und es dann perfekt bewegen können, ohne mit allem zusammenzustoßen.

Lernen Sie nun GPA-RAM kennen, ein neues Robotergehirn, das genau dieses „Greifen-und-Gehen“-Problem lösen soll. Die Forscher hinter diesem Projekt erkannten, dass viele Roboter scheitern, weil sie nicht genug Aufmerksamkeit darauf verwenden, wie sie ein Objekt halten, noch bevor sie überhaupt mit der Bewegung beginnen. Sie entwickelten ein System, das zwei clevere Tricks kombiniert. Erstens gaben sie dem Roboter ein „Pre-Training“ (Vortraining) zum Greifen, unter Verwendung derselben Videos, die er auch nutzt, um den Rest der Aufgabe zu lernen. Es ist, als würde man einem Schüler einen kurzen Test darüber geben, wie man einen Bleistift hält, bevor man ihn bittet, einen Aufsatz zu schreiben; der Robot lernt den Griff, bevor er versucht, das Rätsel zu lösen. Zweitens ersetzten sie die langsame, schwere Denkmaschine des Roboters durch einen neuen, blitzschnellen Motor namens RAM (Robotic Attention Mamba). Stellen Sie sich RAM wie einen supereffizienten Bibliothekar vor, der eine riesige Bibliothek an visuellen Informationen scannen und in einem Bruchteil einer Sekunde das richtige Buch finden kann, während ältere Systeme überfordert wären und langsamer würden.

Das Team testete dieses neue Gehirn an vier verschiedenen Roboter-Setups, einschließlich echter physischer Roboter und simulierter Modelle. Sie fanden heraus, dass der Roboter durch das Hinzufügen des „Greif-Pre-Trainings“ viel besser in schwierigen Aufgaben wurde, wie etwa dem Stapeln von Bechern, dem Einsetzen von Dübeln in Löcher und dem Bewegen von Objekten zwischen zwei Armen. In einem Standardtest namens RLBench gelang dem System in 87,5 % der Fälle, womit es die bisher besten Methoden schlug. Noch beeindruckender war, dass es bei einer Dual-Arm-Roboteraufgabe, bei der ein Würfel bewegt wurde, in 98 % der Fälle erfolgreich war, und bei einer schwierigen zweihändigen Einfügung-Aufgabe sprang die Erfolgsquote von 16 % auf 56 %. Das Beste daran? Es erledigte all dies mit etwa 71 Bildern pro Sekunde (Frames per Second), was bedeutet, dass es schnell genug denkt, um in Echtzeit zu reagieren, ohne stecken zu bleiben. Die Forscher legen nahe, dass dieser Ansatz, Roboter zu lehren, „zuerst zu greifen und dann zu handeln“, sie zu viel zuverlässigeren Helfern in der realen Welt machen könnte, die feinfühlige Aufgaben bewältigen, an denen sie zuvor gescheitert sind.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →