← Nieuwste papers
💻 computer science

Assessing VLM-Driven Semantic-Affordance Inference for Non-Humanoid Robot Morphologies

Dit onderzoek toont aan dat Vision-Language Models (VLMs) veelbelovend zijn voor het afleiden van affordances bij niet-humanoïde robots, maar dat hun prestaties worden beperkt door een conservatief gedrag met een hoge rate aan vals-negatieven, vooral bij onconventionele taakscenario's.

Oorspronkelijke auteurs: Jess Jones, Raul Santos-Rodriguez, Sabine Hauert

Gepubliceerd 2026-04-22
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Jess Jones, Raul Santos-Rodriguez, Sabine Hauert

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

De Kernvraag: Kunnen slimme camera's begrijpen wat een vreemde robot kan?

Stel je voor dat je een super-slimme, maar mensgerichte assistent hebt (een zogenaamd 'Vision-Language Model' of VLM). Deze assistent heeft miljoenen foto's en teksten van mensen gelezen. Hij weet precies wat een mens kan doen met een kopje: vastpakken, drinken, neerzetten.

Nu willen we deze assistent inzetten voor robots die er helemaal niet uitzien als mensen. Denk aan robots die eruitzien als een emmer, een stofzuiger, of een robot met een grote schop in plaats van handen.

De grote vraag van dit onderzoek is: Kan deze menselijke assistent begrijpen wat een vreemde robot met een vreemd voorwerp kan doen?

De Experimenten: Een proefkeuken voor robots

De onderzoekers hebben een soort proefkeuken gebouwd met twee delen:

  1. Echte beelden: Video's van echte robots (zoals de DOTS-robots) die door een rommelige kamer rijden.
  2. Gemaakte beelden: Video's die door een AI zijn gegenereerd om specifieke situaties te testen.

Ze hebben de VLM-assistenten (zoals GPT, Gemini en Claude) gevraagd: "Kijk naar dit beeld. Ik ben een robot met een schop. Wat kan ik hiermee doen?"

De Resultaten: Te voorzichtig en soms verward

De resultaten waren een mix van goed nieuws en belangrijke waarschuwingen:

1. De "Nee"-robot (Te voorzichtig)
De slimme assistenten waren erg goed in het niet doen van dingen die gevaarlijk of onzin zijn. Ze hadden een lage kans op "valse positieven" (ze dachten niet dat je een steen kon drinken).

  • De metafoor: Het is alsof je een zeer voorzichtige ouder hebt. Als je vraagt: "Mag ik met dit mes spelen?", zegt de ouder direct: "Nee." Zelfs als het een bot mes is en je wilt er alleen maar mee snijden in een stukje brood. De robot denkt vaak: "Ik weet het niet zeker, dus ik doe maar niets."
  • Het probleem: Hierdoor missen ze kansen. Een robot met een schop zou bijvoorbeeld heel goed een bal kunnen oppakken, maar de AI zegt: "Nee, dat is geen gras, dus ik kan er niet mee schoppen."

2. De "Menselijke" verwarring
Soms dachten de robots dat ze menselijke taken konden doen, terwijl ze dat fysiek niet konden.

  • De metafoor: Stel je hebt een robot die eruitziet als een grote, ronde emmer. De AI ziet een bal en denkt: "Ah, een mens zou die kunnen gooien!" Maar de robot heeft geen armen om te gooien. De AI blijft hangen in menselijke gewoontes en vergeet dat de robot een emmer is.
  • Het resultaat: De robot denkt dat hij een bal kan "werpen", maar dat is onmogelijk.

3. Ruimtelijke verwarring
De robots hadden moeite met de ruimte.

  • De metafoor: Een robot die alleen dingen boven zich kan tillen, dacht dat hij een zware steen op de grond kon tillen. Het was alsof de robot dacht: "Ik kan dingen tillen!" zonder te beseffen dat de steen onder zijn voeten ligt en hij daar niet bij kan.

Wat betekent dit voor de toekomst?

Het onderzoek laat zien dat we deze slimme AI-assistenten niet zomaar op elke robot kunnen zetten. Ze zijn te mensgericht.

  • De oplossing: Je moet de robot heel duidelijk vertellen wie hij is. "Ik ben een emmer met een schop, ik kan alleen duwen en schoppen, niet tillen of gooien." Als je dat doet, wordt de AI veel beter in het begrijpen van de specifieke robot.
  • De waarschuwing: De AI is nog steeds te bang om fouten te maken. Ze zeggen liever "niets" dan "misschien iets verkeers". Voor robots die samenwerken (bijvoorbeeld in een bouwplaats of bij opruimen), is dit een probleem. Je wilt dat ze proberen iets te doen, niet dat ze stil blijven staan uit angst.

Conclusie in één zin

Deze slimme camera's zijn geweldig in het begrijpen van wat mensen doen, maar ze moeten nog leren om te denken als een emmer, een stofzuiger of een kraan, en ze moeten leren om niet te bang te zijn om nieuwe dingen te proberen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →