← Neueste Arbeiten
💻 computer science

RAFAIL: Relationship-Aware Failure Detection for Robotic Manipulation

RAFAl ist ein neuartiges Framework, das Fehler bei der robotischen Manipulation durch das Identifizieren von Anomalien in aufgabenspezifischen Beziehungen zwischen Entitäten unter Verwendung von Punktwolken-Repräsentationen und beziehungsspezifischen OOD-Detektoren erkennt und dabei eine hohe Genauigkeit erreicht, ohne auf Fehlerdaten oder VLM-Inferenz zur Laufzeit angewiesen zu sein.

Ursprüngliche Autoren: Loris Schneider, Edgar Welte, Rania Rayyes

Veröffentlicht 2026-09-17
📖 6 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Loris Schneider, Edgar Welte, Rania Rayyes

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Roboter sind mittlerweile bemerkenswert geschickt darin geworden, sich durch die Welt zu bewegen, Objekte aufzuheben und Teile zusammenzusetzen – mit einer Geschicklichkeit, die für Maschinen einst unmöglich schien. Doch trotz dieses Fortschritts bleiben sie fragil. Wenn ein Roboter auf eine Situation stößt, die er noch nicht gesehen hat – eine leicht veränderte Lichtbedingung, ein Objekt, das an einer unerwarteten Stelle platziert wurde, oder ein subtiles Rutschen der Hand – scheitert er oft lautlos. Er führt seine Bewegungen möglicherweise so fort, als wäre nichts geschehen, was letztlich zu Schäden oder zum Scheitern der Aufgabe führt. Damit Roboter in Haushalten oder Fabriken wirklich nützlich sein können, benötigen sie eine Möglichkeit zu erkennen, wann sie einen Fehler machen, und aufzuhören, bevor der Fehler dauerhaft wird. Die Herausforderung besteht nicht nur darin, zu bemerken, dass etwas anders ist als in der Vergangenheit, sondern zu verstehen, ob dieser Unterschied tatsächlich relevant ist. Eine harmlose Verschiebung im Hintergrund mag für einen Computer seltsam aussehen, während ein kritischer Fehler in der Art und Weise, wie ein Greifer eine Tasse hält, unbemerkt bleiben könnte.

Forscher des Karlsruher Instituts für Technologie haben eine neue Methode entwickelt, um dieses Problem zu lösen, indem sie ein System erschaffen haben, das die Handlungen eines Roboters nicht beobachtet, indem es die gesamte Szene betrachtet, sondern indem es sich auf die spezifischen Beziehungen zwischen den Objekten konzentriert, die der Roboter berührt. Sie nennen dieses System RAFAIL. Anstatt zu versuchen, die gesamte Umgebung auf einmal zu verstehen, was überwältigend sein und zu Fehlalarmen führen kann, unterteilt das System die Aufgabe in Paare interagierender Dinge: den Greifer und das Objekt oder das Objekt und sein Ziel. Durch die Überwachung, wie diese spezifischen Paare zueinander in Beziehung stehen, kann das System erkennen, wenn eine Aufgabe schiefläuft, und zwar mit einer viel größeren Präzision als bisherige Methoden.

Der Kern der Idee hinter dieser Arbeit ist, dass die meisten Roboterfehler auftreten, weil die Beziehung zwischen zwei Objekten fehlerhaft verläuft. Wenn ein Roboter versucht, Wasser aus einer Tasse in eine Schüssel zu gießen, liegt der Fehler nicht darin, dass der Raum anders aussieht, sondern darin, dass die Tasse in einem falschen Winkel relativ zur Schüssel geneigt ist. Um dem Roboter beizubringen, diese kritischen Momente zu erkennen, verwendeten die Forscher zuerst eine leistungsstarke Art von künstlicher Intelligenz, die als Vision-Language-Modell bekannt ist. Dieses Modell ist wie ein sehr kluger Beobachter, der ein Video einer erfolgreichen Aufgabe betrachten und beschreiben kann, was gerade passiert, wobei es identifiziert, welche Objekte wichtig sind und wie weit die Aufgabe fortgeschritten ist. Das Ausführen dieses klugen Beobachters bei jeder Bewegung eines Roboters wäre jedoch zu langsam und rechenintensiv.

Um dies zu umgehen, nutzten die Forscher den klugen Beobachter nur einmal, offline, um eine Sammlung erfolgreicher Demonstrationen zu studieren. Sie baten ihn, zu kennzeichnen, welche Beziehungen zwischen Objekten in jedem Schritt der Aufgabe am wichtigsten waren, und um zu verfolgen, wie weit die Aufgabe fortgeschritten war. Diese Labels wurden dann verwendet, um ein viel einfacheres, schnelleres System zu trainieren, das in Echtzeit neben dem Roboter läuft. Dieses neue System lernt, eine kompakte mathematische Beschreibung jeder wichtigen Beziehung zu erstellen, wie etwa den Raum zwischen einem Greifer und einer Tasse. Es prüft diese Beschreibungen dann gegen das, was es aus den erfolgreichen Durchläufen gelernt hat. Wenn eine Beziehung seltsam erscheint – das heißt, wenn die Objekte in einer Konfiguration sind, die während des erfolgreichen Trainings nie gesehen wurde – löst es einen Alarm aus. Entscheidend ist, dass das System diesen Alarmen nur dann Aufmerksamkeit schenkt, wenn die Beziehung derzeit wichtig für die Aufgabe ist. Wenn der Greifer eine Tasse hält, die für den nächsten Schritt noch nicht relevant ist, wird ein leichtes Wackeln ignoriert. Aber wenn dieselbe Tasse gerade für den Gießvorgang positioniert wird, reagiert das System hochsensibel auf jede Abweichung.

Das Team testete diesen Ansatz bei drei verschiedenen realen Aufgaben mit einem Roboterarm, der mit einer Kamera und einem Greifer ausgestattet war. In einer Aufgabe musste der Roboter einen Zylinder aufheben und in eine Schüssel legen. In einer anderen musste er eine umgekippte Tasse aufheben und aufrichten. In der dritten Aufgabe musste er einen Ball aus einer Tasse in eine Schüssel gießen. Sie ließen den Roboter hunderte von Versuchen durchführen, von denen einige absichtlich so vorbereitet waren, dass sie scheiterten, indem Objekte in ungewöhnliche Positionen gebracht oder Ablenkungen im Hintergrund hinzugefügt wurden. Das neue System erkannte Fehler in 73,4 % der Versuche erfolgreich, während es nur in etwa 11,6 % der erfolgreichen Durchläufe Fehlalarme auslöste. Diese Leistung war signifikant besser als bei anderen führenden Methoden, die auf der Messung allgemeiner Unsicherheit oder der Betrachtung der gesamten Sicht des Roboters auf die Welt basieren. Diese anderen Methoden hatten oft Schwierigkeiten zu unterscheiden, ob es sich um eine harmlose Änderung in der Szene oder um einen echten Fehler handelte, und ließen entweder Fehler unbemerkt oder stoppten den Roboter unnötig.

Was dieses Ergebnis besonders vielversprechend macht, ist, dass das System keine Beispiele für Fehler benötigt, um zu lernen, wie man diese erkennt. Es lernt ausschließlich durch das Beobachten erfolgreicher Aufgaben, die einfacher und sicherer zu sammeln sind. Darüber hinaus war das System, wenn es einen Fehler detektierte, in der Regel in der Lage, genau zu benennen, welche Beziehung fehlgeschlagen war. Bei der Gießaufgabe beispielsweise identifizierte es in fast 70 % der Fälle, in denen es einen Alarm auslöste, korrekt, dass die Tasse und die Schüssel falsch ausgerichtet waren. Diese Fähigkeit, den Fehler zu lokalisieren, deutet darauf hin, dass das System nicht nur vermutet, dass etwas nicht stimmt, sondern tatsächlich die spezifische Interaktion versteht, die zusammengebrochen ist.

Die Forscher räumen ein, dass das System nicht perfekt ist. Es ist darauf angewiesen, die beteiligten Objekte klar sehen und verfolgen zu können. Wenn ein Objekt verborgen ist, wenn die Kamera es aus den Augen verliert oder wenn der Fehler eine Kraft betrifft, die nicht sichtbar ist, könnte das System ihn übersehen. Zudem könnten sehr subtile Fehler, die die visuelle Beziehung zwischen den Objekten nicht verändern, durchrutschen. Dennoch zeigt die Studie, dass die Konzentration auf die spezifischen Verbindungen zwischen Objekten anstelle des Gesamtbildes einen robusten und effizienten Weg bietet, um Roboter sicher zu halten. Indem wir Maschinen lehren, die richtigen Dinge zur richtigen Zeit zu beobachten, bringen wir uns näher an Roboter heran, die ohne ständige Überwachung neben Menschen arbeiten können, indem sie wissen, wann sie anhalten und um Hilfe bitten müssen, bevor aus einem kleinen Fehler ein großes Problem wird.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →