← Nieuwste papers
💻 computer science

ReLI: Cross-Lingual Language-to-Action Grounding for Human-Robot Interaction

RelI is een meertalig framework dat grootschalige fundamentele modellen aanpast om autonome agenten in staat te stellen natuurlijke taalinstructies te begrijpen, semantisch te redeneren en taken effectief uit te voeren in meer dan 140 diverse talen, inclusief talen met weinig middelen en creoolse varianten, waardoor de beperkingen van bestaande systemen die alleen gericht zijn op talen met veel middelen worden overwonnen.

Oorspronkelijke auteurs: Linus Nwankwo, Bjoern Ellensohn, Ozan Özdenizci, Elmar Rueckert

Gepubliceerd 2026-09-09
📖 7 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Linus Nwankwo, Bjoern Ellensohn, Ozan Özdenizci, Elmar Rueckert

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een wereld voor waarin een robot een commando kan begrijpen in elke taal, van de meest gesproken talen tot zeldzame dialecten die worden gesproken door kleine gemeenschappen. Decennialang werd de droom van natuurlijke mens-robot samenwerking tegengehouden door een eenvoudige barrière: taal. Hoewel moderne robots steeds beter in staat zijn om hun omgeving te zien en zich erdoorheen te bewegen, zijn ze grotendeels getraind om slechts een handvol grote talen te begrijpen, zoals Engels of Mandarijn. Deze beperking sluit miljarden potentiële gebruikers uit die andere talen, dialecten of creolen spreken, waardoor zij effectief worden buitengesloten van de toekomst van automatisering. Het vakgebied van mens-robotinteractie rust op het vermogen om een gesproken of geschreven verzoek te vertalen naar een fysieke handeling, een proces dat bekend staat als 'grounding'. Tot nu toe was deze vertaling een eenrichtingsverkeer, dat alleen goed werkte voor hen met toegang tot talen met veel digitale middelen, waardoor de rest van de wereld achterbleef.

Een team van onderzoekers heeft een nieuw systeem ontwikkeld genaamd ReLI, ontworpen om deze linguïstische muren af te breken. ReLI stelt autonome agenten in staat om natuurlijk te converseren, te redeneren over hun omgeving en taken uit te voeren, ongeacht de taal waarin de instructie wordt gegeven. Het systeem vertrouwt niet op het eerst vertalen van de spraak van de gebruiker naar het Engels, noch vereist het dat de robot voor elke nieuwe taal opnieuw wordt getraind. In plaats daarvan maakt het gebruik van het inherente vermogen van grootschalige, vooraf getrainde computermodellen om de betekenis achter woorden in honderden verschillende talen gelijktijdig te begrijpen. Door deze taalmodellen te combineren met visuele sensoren die de robot objecten en ruimtes laten "zien", kan ReLI een commando zoals "zoek de rode stoel" (in een zeldzaam dialect) omzetten in een precieze fysieke beweging, zonder dat de gebruiker enige technische code hoeft te kennen of een dominante wereldtaal hoeft te spreken.

De onderzoekers testten dit systeem in zowel gesimuleerde omgevingen als in de echte wereld met gebruik van wielenrobots en viervoetige machines uitgerust met camera's en dieptesensoren. Ze daagden de robots uit met meer dan 70.000 meerzaalige gesprekken in meer dan 140 verschillende talen. Deze talen werden zorgvuldig geselecteerd om een breed spectrum van de linguïstische diversiteit van de wereld te vertegenwoordigen, inclusief talen met veel middelen met een enorme hoeveelheid digitale data, talen met weinig middelen en kwetsbare talen of creolen die vaak worden genegeerd door technologie. De taken varieerden van eenvoudige, eenstapscommando's, zoals een specifieke afstand vooruit bewegen, tot complexe, meerstapsmissies die vereisten dat de robot door een kamer navigeerde, een object identificeerde op basis van een beschrijving en rapporteerde wat hij had gevonden.

De resultaten toonden aan dat het systeem met opmerkelijke consistentie presteerde over dit enorme linguïstische landschap. In bijna alle geteste talen begreep de robot de intentie van de gebruiker correct en voerde hij de taak uit met een succespercentage van meer dan 83 procent. Voor veel van de meest voorkomende talen steeg het succespercentage boven de 97 procent. Zelfs voor de meest kwetsbare en minder ondersteunde talen behield het systeem een hoog niveau van nauwkeurigheid, waarbij instructies succesvol werden geparsed en de robot naar zijn doel werd geleid. De tijd die de robot nodig had om een commando te verwerken en te beginnen met bewegen bleef stabiel, met een gemiddelde tussen de 2,1 en 2,6 seconden, ongeacht of de instructie werd gegeven in een belangrijke wereldtaal of een zeldzaam dialect. Deze snelheid en betrouwbaarheid suggereren dat het systeem niet alleen een theoretisch concept is, maar een praktisch hulpmiddel dat in realtime kan functioneren.

Om ervoor te zorgen dat de technologie werkelijk inclusief was, voerden de onderzoekers ook een studie uit met menselijke deelnemers die met de robots interactie hadden in hun moedertaal. Dertien beoordelaars, vloeiend in 13 verschillende talen, testten het systeem in een echte laboratoriumsetting. Zij rapporteerden dat de interacties natuurlijk en responsief aanvoelden, waarbij de grote meerderheid opmerkte dat zij geen verschil in prestaties merkten op basis van de taal die zij gebruikten. Dit bevinding is cruciaal, aangezien het aangeeft dat het systeem niet de voorkeur geeft aan de ene taal boven de andere, noch een verborgen kloof creëert waarbij gebruikers van bepaalde talen een minder goede ervaring krijgen. Het systeem ging succesvol om met 'code-switching', waarbij een gebruiker woorden uit twee verschillende talen in één zin kan mengen, en het beheerde complexe ruimtelijke redeneringen, zoals navigeren naar een locatie die alleen wordt beschreven door de functie, zoals "de plek waar voedsel wordt bereid".

De kern van deze prestatie ligt in hoe het systeem taal verbindt met actie. Wanneer een gebruiker een commando spreekt of typt, normaliseert het systeem eerst de invoer, waarbij spraak indien nodig in tekst wordt omgezet, en stuurt het deze vervolgens naar een groot taalmodel dat fungeert als het brein van de robot. Dit model interpreteert de intentie van het commando en breekt het af in een reeks logische stappen. Vervolgens raadpleegt het de visuele sensoren van de robot om de objecten en ruimtes te identificeren die in het commando worden genoemd. Als een gebruiker de robot vraagt naar een specifieke stoel te gaan, gebruikt het systeem computervisie om die stoel in de kamer te lokaliseren, de exacte positie ervan in de driedimensionale ruimte te bepalen en het pad te berekenen dat de robot moet afleggen om er te komen. Ten slotte genereert het systeem een plan en vraagt het, voor de veiligheid, vaak om bevestiging van de gebruiker voordat complexe of langeafstandsbewegingen worden uitgevoerd. Dit hele proces gebeurt naadloos, waarbij de kloof tussen menselijke gedachte en machineactie wordt overbrugd zonder de noodzaak van expliciete vertaling of gespecialiseerde training voor elke nieuwe taal.

De studie onderzocht ook de grenzen van deze technologie, wat onthulde dat hoewel het systeem robuust is, het niet onfeilbaar is. De grootste uitdagingen ontstonden wanneer de robot objecten moest identificeren die erg veel op elkaar leken, of wanneer de visuele omgeving rommelig was, waardoor het moeilijk werd om het doelwit te onderscheiden. Daarnaast waren taken die navigatie door complexe, meerstapssequenties vereisten, iets gevoeliger voor fouten dan eenvoudige, directe commando's, simpelweg omdat er meer kansen waren op een fout in de keten van redenering. Echter, zelfs in deze moeilijke scenario's bleef de prestatie van het systeem sterk, en de onderzoekers merkten op dat de fouten vaak gerelateerd waren aan de fysieke beperkingen van de sensoren van de robot of de complexiteit van de omgeving, in plaats van een falen in het begrijpen van de taal.

Door aan te tonen dat een enkel framework meer dan 140 talen met hoge nauwkeurigheid kan afhandelen, suggereert dit werk een nieuwe weg voorwaarts voor mens-robotinteractie. Het beweegt weg van het idee dat robots een specifieke taal moeten leren om nuttig te zijn, en naar een model waarbij de robot zich aanpast aan de moedertaal van de gebruiker. De onderzoekers hebben hun gegevens en code publiekelijk vrijgegeven, in een uitnodiging aan anderen om op deze basis voort te bouwen. Het uiteindelijke doel is niet alleen om robots te maken die vele talen kunnen spreken, maar om een toekomst te creëren waarin het vermogen om een machine aan te sturen een universeel recht is, toegankelijk voor iedereen, overal, in de taal die zij het beste kennen. Deze verschuiving belooft de toegang tot automatisering te democratiseren, en ervoor te zorgen dat de voordelen van robotica gedeeld worden door de gehele mensheid, en niet alleen door hen die de talen van de digitale elite spreken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →