← Neueste Arbeiten
💻 computer science

MS-MEM: Multi-Skill Manipulation-Enhanced Mapping via Uncertainty- and Disturbance-Aware Action Selection

Dieses Paper schlägt MS-MEM vor, ein evidenzbasiertes Framework, das aktive Standpunktwahl, Objektverschieben und Greifen mit einer Kollateralschadensbeschränkung integriert, um die Kartierungsgenauigkeit in unübersichtlichen Umgebungen zu erhöhen und gleichzeitig unnötige Szenenänderungen zu minimieren.

Ursprüngliche Autoren: Yitian Shi, Jesper Mücke, Nils Dengler, Sicong Pan, Rania Rayyes, Maren Bennewitz

Veröffentlicht 2026-09-03
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Yitian Shi, Jesper Mücke, Nils Dengler, Sicong Pan, Rania Rayyes, Maren Bennewitz

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Roboter, die in unseren Häusern und Lagern arbeiten, stehen vor einem Problem, das täuschend einfach erscheint: Sie können nicht alles sehen. In einem unordentlichen Raum verbergen sich Objekte hinter einander und erzeugen tote Winkel, die die Sensoren eines Roboters verwirren. Um einen bestimmten Gegenstand zu finden, muss ein Roboter mehr tun, als nur zu schauen; er muss mit der Welt interagieren. Er könnte eine Box zur Seite schieben, um zu sehen, was dahinter liegt, oder an einen neuen Ort bewegen, um eine bessere Sicht zu erhalten. Dieses Forschungsfeld, bekannt als aktive Wahrnehmung (Active Perception), basiert auf der Idee, dass ein Roboter am besten lernt, indem er Dinge berührt und bewegt, anstatt sie nur anzustarren. Doch es gibt einen Haken. Jedes Mal, wenn ein Roboter ein Objekt schiebt, verändert er die Szene. Wenn er zu fest oder zu oft drückt, könnte er ein sorgfältig angeordnetes Regal durcheinanderbringen, was es später schwieriger macht, das Layout zu verstehen. Die Herausforderung für Ingenieure besteht darin, dem Roboter beizubringen, neugierig genug zu sein, um verborgene Dinge zu finden, aber vorsichtig genug, um dabei kein Chaos anzurichten.

Forscher des Karlsruher Instituts für Technologie, der Universität Bonn und der Technischen Universität Darmstadt haben ein neues System entwickelt, um diesen Balanceakt zu lösen. Sie nennen es MS-MEM, ein Framework, das darauf ausgelegt ist, Robotern zu helfen, enge, unordentliche Räume wie Regale zu kartieren, während die Szene so wenig wie möglich gestört wird. Das System ermöglicht es dem Roboter, zwischen drei verschiedenen Arten von Aktionen zu wählen: an einen neuen Standpunkt bewegen, um mehr zu sehen, Objekte schieben, um Verborgenes zu enthüllen, oder ein Objekt aufheben und entfernen, das die Sicht versperrt. Die zentrale Innovation besteht darin, dass der Roboter nicht einfach die Aktion wählt, die den meisten Informationsgewinn bringt; er berechnet auch die Kosten dieser Aktion. Er fragt sich selbst: „Wenn ich diese Box schiebe, wie sehr störe ich den Rest des Regals?“ und „Ist die neue Information den Aufwand wert, den ich anrichte?“

Das Team baute sein System auf einem Fundament der Unsicherheit auf. Anstatt die Karte des Raumes als ein festes Bild zu behandend, pflegt der Roboter eine „Überzeugung“ (Belief) darüber, was wo ist, ergänzt um ein Maß seiner Ungewissheit. Wenn der Roboter sich in einem Bereich sehr sicher ist, weiß er, dass er dort nicht eingreifen muss. Wenn er unsicher ist, weiß er, dass er untersuchen muss. Um diese Entscheidungen zu treffen, führten die Forscher eine neue Art und Weise ein, wie der Roboter Greifen (Grasping) versteht. Frühere Systeme hatten oft Schwierigkeiten vorherzusagen, wie der Greifer eines Roboters mit einem Objekt interagieren würde, wenn die Sicht nur teilweise vorhanden oder das Objekt in einer engen Stelle war. Dieses neue System lehrt den Roboter, nicht nur zu schätzen, wo er greifen soll, sondern auch, wie sicher er sich bei diesem Griff ist und wie die Orientierung des Objekts unsicher sein könnte. Dies ermöglicht es dem Roboter, Informationen aus mehreren Winkeln zusammenzuführen und sein Verständnis eines Griffs im Laufe der Zeit zu verfeinern, während er sich um das Objekt herum bewegt.

In ihren Experimenten testeten die Forscher dieses System in einer simulierten Umgebung, die ein reales Regal voller zufällig platzierter Objekte nachahmte. Sie verglichen diesen neuen Multi-Skill-Ansatz mit älteren Methoden, die sich nur auf eine Art von Aktion verlassen, wie etwa nur Schieben oder nur Greifen. Die Ergebnisse zeigten, dass die Kombination dieser Fähigkeiten weita viel effektiver war. Indem sie Schieben nutzten, um Objekte zu trennen und Platz zu schaffen, und anschließend das Greifen nutzten, um gezielt Blockaden zu entfernen, konnte der Roboter eine genauere Karte der Szene erstellen. Der bedeutendste Befund war jedoch die Fähigkeit des Systems, Störungen zu begrenzen. Als die Forscher eine spezifische Einschränkung in den Entscheidungsprozess des Roboters einführten – eine Regel, die unnötige Veränderungen der Szene sanktionierte – wurde der Roboter viel vorsichtiger. Er fand die verborgenen Objekte immer noch, bewegte aber weit weniger Gegenstände als die Systeme, die diese Regel nicht hatten. In Simulationen reduzierte das neue System die gesamte zurückgelegte Distanz der bewegten Objekte im Vergleich zu Methoden, die die Szenenstörung ignorierten, um eine signifikante Menge, während es gleichzeitig eine hohe Genauigkeit bei der Kartierung des Regals erreichte.

Das Team testete das System auch in der realen Welt mit einem physischen Roboterarm, der mit einer Kamera und einem Greifer ausgestattet war. Sie platzierten den Roboter vor einem Regal mit 69 Objekten in fünf verschiedenen, anspruchsvollen Aufbauten. Der Roboter musste so viele Objekte wie möglich finden und identifizieren. Das System, das Schieben, Greifen und vorsichtige Bewegungen kombinierte, fand mehr Objekte als die Systeme, die nur eine Fertigkeit nutzten. Es identifizierte erfolgreich 44 Objekte, im Vergleich zu 40 beim reinen Schiebe-System und 38 beim reinen Greif-System. Entscheidend war, dass es dies bei geringerer physischer Verschiebung der Gegenstände auf dem Regal tat. Das reine Greif-System bewegte zwar am wenigsten, fand aber viele verborgene Gegenstände nicht, weil es zu konservativ war. Das reine Schiebe-System fand viele Gegenstände, brachte das Regal jedoch erheblich durcheinander. Das neue System fand die beste Balance: Es fand die meisten Objekte und hielt die Szene gleichzeitig relativ geordnet.

Diese Arbeit zeigt, dass Roboter, um in menschlichen Umgebungen effektiv zu agieren, in der Lage sein müssen, über die Konsequenzen ihres Handelns nachzudenken. Es reicht nicht aus, lediglich Dinge aufheben oder schieben zu können; der Robot muss den Wert der gewonnenen Information gegen die Kosten der verursachten Veränderung abwägen. Indem die Forscher Roboter lehrten, diese Faktoren gegeneinander abzuwägen, haben sie einen Schritt in Richtung Maschinen gemacht, die sich mit der gleichen Sorgfalt und Anpassungsfähigkeit durch unsere unordentliche Welt bewegen können, wie es Menschen tun. Das System sieht die Welt nicht nur; es versteht den Unterschied zwischen einer hilfreichen Interaktion und einer störenden. Es ermöglicht dem Roboter, seine Umgebung zu erforschen, ohne die Ordnung, die er zu kartieren versucht, zu zerstören.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →