← Neueste Arbeiten
💻 computer science

PrimitiveVLA: Learning Reusable Motion Primitives for Efficient and Generalizable Robotic Manipulation

PrimitiveVLA adressiert die Dateneffizienzprobleme und die mangelnde Generalisierungsfähigkeit von Vision-Language-Action-Modellen durch die Einführung eines primitiv-zentrierten Frameworks, das Demonstrationen mittels einer gemeinsamen multimodalen Repräsentation in wiederverwendbare Bewegungsprimitiven zerlegt und diese während der Inferenz wieder zusammensetzt, wodurch ein effizienteres Lernen und eine robuste Zero-Shot-Generalisierung über komplexe Aufgaben hinweg ermöglicht wird.

Ursprüngliche Autoren: Yutai Li, Shaohui Peng, Jiaming Guo, Di Huang, Zihao Zhang, Yuxuan Guo, Yunkai Gao, Siming Lan, Ling Li, Xing Hu, Yunji Chen

Veröffentlicht 2026-07-21
📖 3 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Yutai Li, Shaohui Peng, Jiaming Guo, Di Huang, Zihao Zhang, Yuxuan Guo, Yunkai Gao, Siming Lan, Ling Li, Xing Hu, Yunji Chen

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich eine Welt vor, in der Roboter nicht nur tollpatschige, vorprogrammierte Maschinen sind, die nur genau das tun können, was man ihnen gestern gesagt hat, sondern vielmehr kluge Helfer, die herausfinden können, wie man ein neues Glas öffnet oder einen seltsam geformten Block stapelt, ohne für jedes einzelne Objekt ein Handbuch zu benötigen. Dies ist der Traum der „Embodied AI“ – einem Roboter ein Gehirn zu geben, das kombiniert, was er sieht, was er hört und wie er sich bewegt. Derzeit versuchen Wissenschaftler, diese Gehirne mithilfe von etwas namens Vision-Language-Action (VLA)-Modellen aufzubauen. Betrachten Sie diese Modelle als das „Gehirn“ eines Roboters, das ein Bild betrachtet, einen Satz wie „stelle die Tasse auf den Tisch“ liest und dann entscheidet, welche Muskeln er zucken lassen muss, um dies zu bewirken. Das große Problem ist, dass diese Roboter derzeit schrecklich darin sind, schnell neue Dinge zu lernen. Sie sind wie Schüler, die den exakten Lösungsschlüssel für eine bestimmte Prüfung auswendig lernen, aber völlig versagen, wenn der Lehrer die Zahlen in den Aufgaben ändert. Sie versuchen, den gesamten, chaotischen Pfad einer Aufgabe auf einmal auswendig zu lernen, was sie langsam beim Lernen macht und sie leicht verwirrt, wenn sich die Welt verändert.

Hier kommt ein neues Paper namens „PrimitiveVLA“ ins Spiel, um die Rettung zu bringen. Die Forscher argumentieren, dass der Grund dafür, dass Roboter so schlecht darin sind zu generalisieren, darin liegt, dass sie versuchen, ganze, riesige Aufgaben als einen einzigen großen, unzerbrechlichen Block zu lernen. Stattdessen schlagen sie einen klügeren Weg vor: dem Roboter beizubringen, „Primitive“ zu lernen. Stellen Sie sich vor, Sie lernen kochen. Anstatt das exakte Rezept für „Spaghetti Carbonara“ als eine einzige, riesige, verwirrende Liste von Schritten auswendig zu lernen, lernen Sie die grundlegenden Bewegungen: hacken, kochen, rühren und braten. Sob wenn Sie diese wiederverwendbaren Bewegungen gemeistert haben, können Sie sie kombinieren und variieren, um fast jedes Gericht zuzubereiten, selbst solche, die Sie noch nie gesehen haben. Die Autoren schlagen vor, dass Roboter dasselbe tun sollten. Sie entwickelten ein System, das komplexe Roboteraufgaben in diese kleinen, wiederverwendbaren „Bewegungsprimitive“ (wie greifen, drücken oder heben) während des Trainings zerlegt. Wenn der Roboter dann vor einer neuen, schwierigen Aufgabe steht, versucht er nicht, das Ganze auswendig zu lernen; er setzt einfach die richtige Sequenz dieser Basisschritte zusammen, um das Problem zu lösen.

Das Paper zeigt, dass dieser „Zerlegen-und-Zusammensetzen“-Ansatz unglaublich gut funktioniert. In ihren Tests lernten Roboter, die mit dieser Methode trainiert wurden, viel schneller und benötigten nur halb so viele Trainingsdaten, um genauso gut abzuschneiden wie Roboter, die auf vollständigen Datensätzen trainiert wurden. Aber die wahre Magie geschah, als sie die Roboter mit Dingen testeten, die sie noch nie zuvor gesehen hatten. Beispielsweise gelang es dem Standard-Top-Robotermodell bei einer Reihe langer, komplizierter Aufgaben nur etwa 30 % der Zeit. Der Roboter, der PrimitiveVLA nutzte, sprang jedoch auf eine Erfolgsquote von 80 %. Noch beeindruckender war, dass die neue Methode bei völlig neuen Aufgaben, die der Roboter noch nie zuvor erlebt hatte, die Erfolgsrate im Vergleich zur alten Methode um das Sechsfache verbesserte. Die Forscher testeten dies sowohl in Computersimulationen als auch an einem echten physischen Roboterarm und bewiesen damit, dass es der Schlüssel dazu ist, Roboter wirklich zu smarten und anpassungsfähigen Helfern zu machen, zuerst die Grundlagen zu meistern, anstatt das gesamte Bild auswendig zu lernen.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →