← Neueste Arbeiten
💻 computer science

SeededGrasp: Language-Guided Grasping in Complex Scenes with Multiple Embodiments

SeededGrasp ist ein dateneffizientes Framework, das die semantische Hochebenen-Argumentation von der geometrischen Niedrigebenen-Ausführung entkoppelt, indem es ein Vision-Language-Modell verwendet, um einen Seed-Punkt für einen leichtgewichtigen Greifer-Generator vorherzusagen, was robustes, multi-embodiment-basiertes Greifen in komplexen Szenen ohne teures End-to-End-Training ermöglicht.

Ursprüngliche Autoren: Yang Xu, Gurpreet Singh Mukker, Raymond Wang, Jasper Gerigk, Maria Attarian, Igor Gilitschenski

Veröffentlicht 2026-07-23
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Yang Xu, Gurpreet Singh Mukker, Raymond Wang, Jasper Gerigk, Maria Attarian, Igor Gilitschenski

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich einen Roboter vor, der versucht, ein Spielzeug von einem unordentlichen Schlafzimmerboden aufzuheben. Für einen Menschen ist das einfach: Man sieht das Spielzeug, man weiß, wo sich der Griff befindet, und man greift zu. Aber für einen Roboter ist die Welt ein verwirrendes Durcheinander aus Formen und Schatten. Er muss zwei sehr unterschiedliche Dinge gleichzeitig verstehen: das „große Ganze“ („Was ist mein Ziel? ‚Greife den roten Becher an seinem Griff‘“) und die „winzigen Details“ („Wo genau sollten meine Finger aufsetzen, damit ich nicht die Lampe umstoße?“). Dies ist die Herausforderung des robotischen Greifens. Lange Zeit waren Roboter entweder sehr intelligent, aber tollpatschig (sie wussten, was sie tun sollten, konnten aber die Physik des Berührens von Dingen nicht erfassen) oder sehr gut in der Physik, aber dumm (sie konnten alles greifen, aber nur, wenn man ihnen genau sagte, wo, ohne die Sprache zu verstehen). Wissenschaftler haben versucht, einen Roboter zu bauen, der auf einen einfachen Satz wie „Greife den Korb an seinem Griff“ hören und dann die perfekte Art und Weise finden kann, ihn aufzunehmen, selbst in einem unordentlichen Raum, unter Verwendung verschiedener Arten von Roboterhänden.

Hier kommt SeededGrasp ins Spiel, eine neue Methode, die wie ein kluges Team aus zwei Teilen fungiert: einem „Gehirn“ und einer „Hand“. Anstatt zu versuchen, einem einzigen, riesigen und superkomplexen Robotergehirn alles auf einmal beizubringen (was so ist, als würde man versuchen, einem Hund gleichzeitig Differentialrechnung beizubringen und ihm das Apportieren zu lehren), teilen die Forscher die Aufgabe auf. Zuerst verwenden sie ein leistungsstarkes Vision-Language-Modell (VLM) – denken Sie an eine superintelligente KI, die lesen und sehen kann – um die unordentliche Szene und die Anweisung zu betrachten. Diese KI versucht nicht, die exakten Fingerpositionen zu berechnen; stattdessen zeigt sie lediglich auf einen einzelnen „Seed Point“ (einen Startpunkt), wie eine digitale Stecknadel, auf dem Objekt, an dem der Griff beginnen soll. Es ist so, als würde ein Mensch sagen: „Greif genau dort zu“ und mit dem Finger darauf zeigen.

Sobald dieser „Seed Point“ platziert ist, übernimmt ein zweites, leichtgewichtiges Modell. Dieses Modell ist wie ein hochqualifizierter Mechaniker, der genau weiß, wie er die Finger des Roboters basierend auf diesem einen Punkt bewegen muss. Da die schwere Arbeit des Sprachverständnisses von der ersten KI erledigt wird und die schwere Arbeit der Geometrie vom zweiten, können sie sehr effizient zusammenarbeiten. Die Forscher testeten dies mit drei verschiedenen Arten von Roboterhänden (einem Standard-Zwei-Finger-Greifer, einem Drei-Finger-Greifer und einer sehr geschickten Hand mit vielen Gelenken) in einem simulierten unordentlichen Raum. Sie fanden heraus, dass dieser „Seed Point“-Ansatz unglaublich gut funktionierte und in der Simulation eine Erfolgsquote von 72 % erreichte. Noch beeindruckender war, dass es, als sie es mit einem echten Roboter in der realen Welt versuchten, in 78 % der Fälle erfolgreich war.

Das Paper argumentiert auch gegen einige gängige Vorstellungen. Es legt nahe, dass der Versuch, ein einziges massives Modell von Grund auf für alles zu trainieren, zu teuer und datenhungrig ist. Es zeigt auch, dass die bloße Verwendung eines VLM, um die gesamte Greifpose direkt zu erraten, oft zu Fehlern führt, da die KI durch die 3D-Geometrie verwirrt wird. Stattdessen fungiert der „Seed Point“ als perfekte Brücke, die der smarten KI erlaubt, die Sprache zu handhaben, und dem spezialisierten Modell, die Physik zu handhaben. Um dies zu beweisen, hat das Team nicht nur auf bestehenden Daten vertraut, sondern einen brandneuen, massiven Datensatz von 2,56 Millionen Griffen über 610 unordentliche Szenen erstellt, um ihr System zu trainieren. Obwohl die Ergebnisse sehr vielversprechend sind, merken die Autoren an, dass dies in Simulationen und realen Versuchen mit spezifischen Setups getestet wurde und noch Arbeit geleistet werden muss, um sicherzustellen, dass der Roboterarm jeden Ort erreichen kann, auf den der „Seed“ zeigt, ohne mit Hindernissen zusammenzustoßen. Aber für den Moment zeigt SeededGrasp einen unterhaltsamen und effektiven Weg, Robotern beizubringen, zuzuhören, zu schauen und mit ein wenig Hilfe eines zeigenden Fingers zuzugreifen.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →