← Nieuwste papers
💬 NLP

Infer Human's Intentions Before Following Natural Language Instructions

Het artikel stelt FISER voor, een framework dat de prestaties van embodied AI in collaboratieve taken verbetert door expliciet menselijke intenties af te leiden via sociaal redeneren voordat acties worden gepland, waardoor het standaard end-to-end methoden en sterke baselines op de HandMeThat benchmark overtreft.

Oorspronkelijke auteurs: Yanming Wan, Yue Wu, Yiping Wang, Jiayuan Mao, Natasha Jaques

Gepubliceerd 2026-08-27
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Yanming Wan, Yue Wu, Yiping Wang, Jiayuan Mao, Natasha Jaques

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een robot voor die is ontworpen om te helpen in het huishouden. Om deze machine werkelijk nuttig te maken, moet hij de informele, vaak onvolledige verzoeken begrijpen die we dagelijks aan elkaar richten. Wanneer iemand zegt: "Kun je dat van de bank pakken?" terwijl hij aan het opruimen is, spreekt diegene niet in een vacuüm. De persoon gaat ervan uit dat de luisteraar weet waar "dat" naar verwijst, gebaseerd op de gedeelde context en de geschiedenis van wat er zojuist is gebeurd. Als de persoon boeken in een doos heeft verzameld, zou de robot moeten begrijpen dat "dat" een boek betekent, en niet een kussen of een afstandsbediening. Dit vermogen om tussen de regels door te lezen, om verborgen doelen af te leiden uit waargenomen acties, is de kernuitdaging om kunstmatige intelligentie een echte partner te maken in menselijke omgevingen. Zonder deze vaardigheid zou een robot instructies misschien letterlijk opvolgen, maar tekortschieten in effectiviteit, omdat hij de kloof tussen een vage opdracht en de specifieke handeling die nodig is om een gezamenlijke taak te voltooien, niet kan overbruggen.

Onderzoekers aan de Universiteit van Washington en MIT hebben dit probleem aangepakt met een nieuwe benadering genaamd FISER, wat staat voor Follow Instructions with Social and Embodied Reasoning. Hun werk richt zich op een specifieke moeilijkheid: menselijke instructies zijn van nature ambigu omdat mensen details weglaten die zij als vanzelfsprekend beschouwen. Het team testte hun ideeën in een digitale omgeving genaamd HandMeThat, een tekstgebaseerde simulatie van een huishouden waarin een mens en een robot samen moetenwerken. In deze setting kan een mens bezig zijn met het ordenen van voorwerpen, en halverwege om hulp vragen aan de robot met een vage vraag. De taak van de robot is om uit te zoeken wat de mens precies wil, niet alleen door naar de woorden te luisteren, maar door te kijken naar wat de mens heeft gedaan en hun onderliggende plan te raden.

De onderzoekers ontdekten dat de meest succesvolle manier om dit op te lossen het is om het probleem in twee duidelijke stappen te splitsen. Eerst houdt de robot zich bezig met "sociale redenering", waarbij de robot pauzeert om expliciet de intentie van de mens te raden. De robot kijkt naar de geschiedenis van de acties van de mens en de huidige situatie om te beslissen wat de persoon daadwerkelijk probeert te bereiken. Als de mens bijvoorbeeld boeken in een doos heeft gestopt, concludeert de robot dat het doel is om de boeken op te bergen. Pas nadat de robot deze gevolgtrekking heeft gemaakt, gaat hij over naar de tweede stap, "belichaamde redenering" (embodied reasoning), waarbij de robot de fysieke bewegingen plant die nodig zijn om het juiste object aan te reiken. Dit tweetrapsproces is cruciaal omdat het het systeem dwingt de ambiguïteit van de taal op te lossen voordat het probeert te bewegen.

Om dit te testen, bouwde het team computermodellen die deze stappen konden uitvoeren. Ze vergeleken hun methode met andere benaderingen, waaronder het simpelweg instrueren van een groot, vooraf getraind taalmodel om de taak in één keer uit te voeren, of het gebruiken van een techniek genaamd "Chain of Thought" om het model door redeneerstappen te leiden. De resultaten waren duidelijk: de modellen die de sociale redenering expliciet scheidden van de fysieke planning presteerden aanzienlijk beter. Bij de meest uitdagende tests, waarbij instructies zeer ambigu waren, behaalde de nieuwe methode een succespercentage van 64,5 procent, waarmee een nieuw record vestigde voor dit type taak. In contrast hiermee slaagden zelfs de krachtigste vooraf getrainde taalmodellen er, wanneer ze zorgvuldig werden geprompt, niet in om hetzelfde prestatieniveau te bereiken; ze faalden vaak in het begrijpen van de verborgen doelen van de mens of raakten de details van de omgeving kwijt.

De studie onthulde ook waarom de krachtige vooraf getrainde modellen moeite hadden. Deze modellen, die enorme hoeveelheden tekst van het internet hebben gelezen, bezitten algemene kennis maar missen het specifieke vermogen om te redeneren over de directe, fysieke context van een gezamenlijke taak. Toen de onderzoekers probeerden deze modellen te helpen door irrelevante objecten uit de omgeving te filteren, slaagden de modellen er nog steeds niet in om effectief te plannen, wat suggereert dat het probleem niet alleen te veel informatie was, maar een fundamentele moeilijkheid in het verbinden van sociale signalen aan fysieke acties. De onderzoekers concludeerden dat voor robots om werkelijk behulpzame assistenten te zijn, ze getraind moeten worden om menselijke intenties te behandelen als een specifiek, observeerbaar deel van het probleem dat opgelost moet worden, in plaats van te hopen dat een algemeen taalmodel het uit zichzelf wel uitzoekt. Door het systeem te leren eerst de geest van de mens te begrijpen, en vervolgens te handelen op basis van dat begrip, hebben de onderzoekers een pad aangewezen naar meer capabele en coöperatieve kunstmatige agenten.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →