← Neueste Arbeiten
💻 computer science

VLEM: Real-Time 3D Vision-Language Embedding Mapping

VLEM ist ein Echtzeit-Framework, das pixel-ausgerichtete 2D-Vision-Language-Embeddings aus rohen RGB-D-Streams in eine global konsistente, metrisch genaue 3D-Repräsentation integriert und so eine überlegene Open-Set-Segmentierung sowie interaktive robotische Manipulation ermöglicht, ohne dass Ground-Truth-Posen erforderlich sind.

Ursprüngliche Autoren: Christian Rauch, Björn Ellensohn, Linus Nwankwo, Vedant Dave, Elmar Rueckert

Veröffentlicht 2026-09-17
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Christian Rauch, Björn Ellensohn, Linus Nwankwo, Vedant Dave, Elmar Rueckert

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Roboter hatten lange Zeit damit zu kämpfen, die Welt so zu verstehen wie Menschen. Man kann sie darauf programmieren, einen bestimmten Stuhl oder eine bestimmte Tür zu erkennen, wenn man ihnen genügend Beispiele zeigt, aber sie können ein neues Objekt nicht ohne Weiteres erfassen, nur indem man eine Beschreibung wie „der blaue Becher“ oder „der schwere Werkzeugkasten“ hört. Diese Einschränkung rührt daher, wie Roboter traditionell ihre Umgebung abbilden: Sie erstellen präzise, geometrische Modelle des Raums, aber diese Modelle lassen die reiche, flexible Bedeutung vermissen, die die Sprache bietet. Damit ein Roboter wirklich mit einer dynamischen Umgebung interagieren kann, benötigt er eine Karte, die nicht nur in Bezug auf Distanz und Form genau, sondern auch durch die Wörter durchsuchbar ist, die wir im Alltag verwenden. Die Herausforderung bestand darin, die scharfe, metrische Präzision einer 3D-Karte mit dem breiten, offenen Verständnis moderner Sprachmodelle zu kombinieren, und das alles so schnell auszuführen, dass der Roboter sich in Echtzeit bewegen und reagieren kann, ohne einen Supercomputer zu benötigen.

Ein Forschungsteam der Technischen Universität Leoben hat ein neues System namens VLEM entwickelt, was für Vision-Language Embedding Mapping steht, um dieses Problem zu lösen. Ihre Arbeit schließt die Lücke zwischen Sehen und Verstehen, indem sie eine dreidimensionale Karte erstellt, die nicht nur die Form von Objekten speichert, sondern auch einen digitalen „Fingerabdruck“ dessen, wie diese Objekte aussehen und wie sie mit Sprache in Beziehung stehen. Im Gegensatz zu früheren Versuchen, die perfekte Kameradaten oder riesige Mengen an Speicher erforderten, arbeitet dieses System mit einem einfachen Strom von Farb- und Tiefenbildern einer Standardkamera. Es baut eine lebendige Karte der Welt auf, während sich der Roboter bewegt, was es einem Benutzer ermöglicht, zu fragen: „Wo ist die Kaffeemaschine?“, woraufhin der Roboter sofort auf das richtige Objekt zeigen kann, selbst wenn er diese spezifische Maschine noch nie zuvor gesehen hat.

Der Kern des Systems liegt darin, wie es die visuellen Informationen verarbeitet. Moderne Modelle der künstlichen Intelligenz können bereits die Beziehung zwischen Bildern und Text verstehen, indem sie diese in mathematische Vektoren umwandeln – im Wesentlichen Listen von Zahlen, die eine Bedeutung repräsentieren. Diese Modelle arbeiten jedoch normalerweise auf flachen, zweidimensionalen Bildern. Die Forscher standen vor der schwierigen Aufgabe, dieses zweidimensionale Verständnis in einen dreidimensionalen Raum zu projizieren, in dem ein Roboter navigieren kann. Sie erreichten dies, indem sie die Ansicht der Kamera in kleine Regionen unterteilten, einen Bedeutungs-Fingerabdruck für jede Region extrahierten und diese Fingerabdrücke zu einer einzigen, konsistenten 3D-Punktwolke zusammenfügten. Diese Punktwolke fungiert als digitaler Zwilling des Raumes, in dem jeder einzelne Punkt sowohl eine Position im Raum als auch eine semantische Bedeutung besitzt, die aus den visuellen Daten abgeleitet wurde.

Was diesen Ansatz unterscheidet, ist seine Effizienz und seine Fähigkeit, mit Unsicherheit umzugehen. Viele bestehende Systeme versuchen, diese Karten zu erstellen, indem sie komplexe neuronale Netze auf ganzen Datensätzen trainieren – ein Prozess, der langsam ist und voraussetzt, dass die genaue Position der Kamera bekannt ist. VLEM hingegen arbeitet in Echtzeit, verarbeitet Bilder beim Eintreffen und schätzt die Position der Kamera laufend. Es nutzt eine geschickte Methode zur Verfeinerung der visuellen Daten, indem es irrelevante Hintergrundgeräusche maskiert, um sicherzustellen, dass die an ein Objekt gebundene Bedeutung rein und präzise ist. Wenn das System beispielsweise eine Kaffeemaschine betrachtet, isoliert es dieses Objekt von der Wand dahinter, um sicherzustellen, dass der digitale Fingerabdruck für „Kaffeemaschine“ nicht durch die Farben der Wand verwässert wird. Dies ermöglicht es dem Roboter, zwischen ähnlichen Objekten mit hoher Genauigkeit zu unterscheiden, wie etwa zwischen einem generischen Bohrer und einem spezifischen Bosch-Bohrer, allein durch die Spezifität der Textanfrage.

Die Forscher testeten ihr System in einer Vielzahl von Umgebungen, von Küchen und Werkstätten bis hin zu großen Büros, wobei sie sowohl statische Datensätze als auch Live-Roboter-Experimente verwendeten. Sie stellten fest, dass ihre Methode signifikant bessere Ergebnisse bei der Identifizierung von Objekten basierend auf Textbeschreibungen lieferte als bisherige State-of-the-Art-Systeme. Während andere Systeme oft mit unscharfen Grenzen zu kämpfen hatten oder enorme Mengen an Computerarbeitsspeicher benötigten, schaffte es VLEM, eine kompakte, hochwertige Karte mit weniger als 12 Gigabyte Videospeicher zu erstellen – eine Größe, die auf Standard-Grafikkarten passt, wie sie in vielen modernen Computern zu finden sind. Diese Effizienz ist entscheidend, da sie es dem Roboter ermöglicht, die Kartierungssoftware und seine eigenen Bewegungssteuerungen gleichzeitig auszuführen, ohne dass es zu Verzögerungen kommt. In praktischen Demonstrationen führte das System erfolgreich einen Roboterarm dazu, gezielt Gegenstände aufzuheben und an vorgesehenen Stellen zu platzieren, basgeteilt auf einfache gesprochene oder getippte Anweisungen.

Der Erfolg von VLEM deutet darauf hin, dass die Zukunft der robotergestützten Interaktion möglicherweise nicht darin liegen wird, Robotern eine feste Liste jedes Objekts in der Welt beizubringen, sondern ihnen einen flexiblen Weg zu geben, die Welt durch Sprache zu verstehen. Das System bewies, dass es möglich ist, eine metrisch genaue 3D-Repräsentation aufrechtzuerhalten, die gleichzeitig vollständig durch natürliche Sprache abfragbar ist, ohne dass ein Vortraining für die spezifische Umgebung oder Ground-Truth-Kameradaten erforderlich ist. Die Forscher merkten an, dass ihre aktuelle Methode zwar gut bei der Identifizierung einzelner Objekte funktioniert, aber noch nicht die komplexen Beziehungen zwischen verschiedenen Gegenständen vollständig erfasst, wie etwa das Wissen, dass eine Tasse auf einem Tisch steht. Indem sie jedoch zeigten, dass qualitativ hochwertiges, semantisches Mapping in Echtzeit mit aktueller Hardware realisierbar ist, bietet diese Arbeit ein solides Fundament für die nächste Generation von Robotern, die in der Lage sind, die menschliche Welt wahrhaftig zu verstehen und mit ihr zu interagieren.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →