← Nieuwste papers
💻 computer science

VLEM: Real-Time 3D Vision-Language Embedding Mapping

VLEM is een real-time framework dat pixel-uitgelijnde 2D visie-taal-embeddings uit ruwe RGB-D-stromen integreert in een globaal consistente, metrisch accurate 3D-representatie, wat superieure open-set segmentatie en interactieve robotische manipulatie mogelijk maakt zonder dat daarvoor grondwaarheidsposes vereist zijn.

Oorspronkelijke auteurs: Christian Rauch, Björn Ellensohn, Linus Nwankwo, Vedant Dave, Elmar Rueckert

Gepubliceerd 2026-09-17
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Christian Rauch, Björn Ellensohn, Linus Nwankwo, Vedant Dave, Elmar Rueckert

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Robots worstelen al lang met het begrijpen van de wereld zoals mensen dat doen. Ze kunnen worden geprogrammeerd om een specifieke stoel of een bepaalde deur te herkennen als ze maar genoeg voorbeelden krijgen voorgeschoteld, maar ze kunnen niet gemakkelijk een nieuw object begrijpen door enkel een beschrijving te horen zoals "de blauwe mok" of "de zware gereedschapskist". Deze beperking komt voort uit de manier waarop robots hun omgeving traditioneel in kaart brengen: ze bouwen nauwkeurige, geometrische modellen van de ruimte, maar deze modellen missen de rijke, flexibele betekenis die taal biedt. Voor een robot om echt te kunnen interageren met een dynamische omgeving, heeft het een kaart nodig die niet alleen accuraat is in afstand en vorm, maar ook doorzoekbaar is met de woorden die wij dagelijks gebruiken. De uitdaging is geweest om de scherpe, metrische precisie van een 3D-kaart te combineren met het brede, open eind begrip van moderne taalmodellen, en dit alles terwijl het snel genoeg draait voor een robot om te bewegen en te reageren in realtime zonder een supercomputer nodig te hebben.

Een team onderzoekers aan de Technische Universiteit van Leoben heeft een nieuw systeem ontwikkeld genaamd VLEM, wat staat voor Vision-Language Embedding Mapping, om dit probleem op te lossen. Hun werk overbrugt de kloof tussen zien en begrijpen door een driedimensionale kaart te creëren die niet alleen de vorm van objecten opslaat, maar ook een digitale "vingerafdruk" van hoe die objecten eruitzien en hoe ze zich tot taal verhouden. In tegen tegenstelling tot eerdere pogingen die perfecte cameradata of enorme hoeveelheden geheugen vereisten, werkt dit systeem met een eenvoudige stroom van kleur- en dieptebeelden van een standaard camera. Het bouwt een levende kaart van de wereld terwijl de robot beweegt, waardoor een gebruiker kan vragen: "Waar is het koffiezetapparaat?" en de robot direct naar het juiste object kan wijzen, zelfs als hij dat specifieke apparaat nog nooit eerder heeft gezien.

De kern van het systeem ligt in de manier waarop het de visuele informatie verwerkt. Moderne kunstmatige intelligentiemodellen kunnen al de relatie tussen afbeeldingen en tekst begrijpen door ze om te zetten in wiskundige vectoren, wat in essentie lijsten met getallen zijn die betekenis vertegenwoordigen. Deze modellen werken echter meestal op vlakke, tweedimensionale plaatjes. De onderzoekers stonden voor de moeilijke taak om deze tweedimensionale begrippen te projecteren in een driedimensionale ruimte waarin een robot kan navigeren. Ze bereikten dit door het camerabeeld op te delen in kleine regio's, een betekenis-vingerafdruk voor elke regio te extraheren, en deze vingerafdrukken vervolgens aan elkaar te naaien tot één consistente 3D-puntenwolk. Deze puntenwolk fungeert als een digitale tweeling van de kamer, waarbij elk punt zowel een locatie in de ruimte als een semantische betekenis bevat die afgeleid is van de visuele data.

Wat deze aanpak onderscheidt, is de efficiëntie en het vermogen om met onzekerheid om te gaan. Veel bestaande systemen proberen deze kaarten te bouwen door complexe neurale netwerken te trainen op volledige datasets, een proces dat traag is en kennis vereist van de exacte positie van de camera vooraf. VLEM werkt daarentegen in realtime, verwerkt beelden zodra ze binnenkomen en schat de positie van de camera on the fly in. Het gebruikt een slimme methode om de visuele data te verfijnen, waarbij irrelevante achtergrondruis wordt weggefilterd om ervoor te zorgen dat de betekenis die aan een object wordt gekoppeld puur en precies is. Wanneer het systeem bijvoorbeeld naar een koffiezetapparaat kijkt, isoleert het dat object van de muur erachter, zodat de digitale vingerafdruk van "koffiezetapparaat" niet wordt verwaterd door de kleuren van de muur. Hierdoor kan de robot met hoge nauwkeurigheid tussen soortgelijke objecten onderscheiden, zoals het verschil zien tussen een generieke boormachine en een specifieke Bosch-boormachine, simpelweg door de specificiteit van de tekstuele zoekopdracht.

De onderzoekers testten hun systeem in een verscheidenheid aan omgevingen, van keukens en werkplaatsen tot grote kantoorpanden, waarbij ze zowel statische datasets als live robotexperimenten gebruikten. Ze ontdekten dat hun methode aanzienlijk betere resultaten produceerde dan eerdere state-of-the-art systemen bij het identificeren van objecten op basis van tekstbeschrijvingen. Terwijl andere systemen vaak worstelden met vage grenzen of enorme hoeveelheden computergeheugen vereisten, slaagde VLEM erin om een compacte, hoogwaardige kaart te maken met minder dan 12 gigabyte aan videogeheugen, een grootte die past op de standaard grafische kaarten die in veel moderne computers te vinden zijn. Deze efficiëntie is cruciaal omdat het de robot in staat stelt om de mapping-software en zijn eigen bewegingsbesturing simultaan te draaien zonder te vertragen. In praktische demonstraties leidde het systeem een robotarm succesvol naar het oppakken van specifieke items en het plaatsen ervan op aangewezen plekken, gebaseerd op eenvoudige gesproken of getypte instructies.

Het succes van VLEM suggereert dat de toekomst van robotinteractie wellicht niet ligt in het aanleren van robots een vaste lijst van elk object in de wereld, maar in het geven van een flexibele manier om de wereld door taal te begrijpen. Het systeem bewees dat het mogelijk is om een metrisch nauwkeurige 3D-representatie te behouden die ook volledig doorzoekbaar is via natuurlijke taal, zonder de noodzaak van voorbereiding op de specifieke omgeving of grondwaarheid-cameradata. De onderzoekers merkten op dat hoewel hun huidige methode goed werkt voor het identificeren van individuele objecten, het nog niet volledig de complexe relaties tussen verschillende items vastlegt, zoals weten dat een kopje op een tafel staat. Echter, door aan te tonen dat hoogwaardige, realtime semantische mapping haalbaar is met de huidige hardware, vormt dit werk een solide fundament voor de volgende generatie robots die werkelijk de menselijke wereld kunnen begrijpen en ermee kunnen interageren.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →