← Nieuwste papers
💻 computer science

LH-AVLN: A Benchmark for Long-Horizon Audio-Visual-Language Navigation

Dit artikel introduceert LH-AVLN, een nieuwe benchmark voor audio-visuele-talige navigatie over lange perioden die agenten uitdaagt met missies met meerdere doelen in akoestisch rijke binnenomgevingen, en stelt PAG-Nav voor, een training-vrije agent die effectief gebruikmaakt van binaurale audio voor zoekopdrachten terwijl deze vertrouwt op visueel-semantische verificatie voor doelvoltooiing.

Oorspronkelijke auteurs: Rufeng Chen, Yue Chang, Zili Shao, Zhaofan Zhang, Li Chen, Hechang Chen, Hui Xiong, Sihong Xie

Gepubliceerd 2026-07-21
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Rufeng Chen, Yue Chang, Zili Shao, Zhaofan Zhang, Li Chen, Hechang Chen, Hui Xiong, Sihong Xie

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een robot leert om de ultieme huisdetective te zijn. Meestal, wanneer we robots leren om door een huis te bewegen, geven we ze een eenvoudige missie: "Ga op zoek naar de rode bal." Ze kijken rond met hun camera-ogen, onthouden misschien waar ze zijn geweest, en lopen totdat ze het object zien. Dit wetenschappelijke veld wordt "embodied navigation" genoemd, waarbij een robot leert te bewegen door de echte wereld om een taak op te lossen. Maar er is een addertje onder het gras: de meeste van deze trainingsspelletjes zijn volledig stil. De robot kan alleen zien wat direct voor zijn lens staat. Als de bal achter een gesloten deur of verborgen in een donkere hoek ligt, zit de robot vast, blind voor alles buiten zijn huidige gezichtsveld.

Stel je nu voor dat je die robot een superkracht geeft: oren. In de echte wereld reist geluid niet alleen in een rechte lijn; het weerkaatst om hoeken en sijpelt door kieren. Een robot met goede oren zou een hond kunnen horen blaffen in de kamer ernaast of een kraan kunnen horen druppelen achter een muur, wat het een hint geeft over waar het heen moet, zelfs als het het object nog niet kan zien. Dit artikel stelt een grote, lastige vraag: Wat gebeurt er als we deze twee superkrachten combineren — zien en horen — maar de missie veel moeilijker maken? In plaats van slechts één ding te zoeken, wat als de robot een hele lijst van verschillende items moet vinden, waarvan sommige worden beschreven door woorden, andere door plaatjes, en andere slechts door hun naam, terwijl de geluiden in het huis blijven veranderen terwijl hij het puzzel oplost?

De onderzoekers achter deze studie, onder leiding van Rufeng Chen en collega's van de Hong Kong University of Science and Technology en Jilin University, hebben een nieuwe uitdaging gebouwd genaamd LH-AVLN. Denk aan LH-AVLN als een uitdagend, meerlagig videogamesysteem voor robots. In dit spel wordt de robot in een 3D-huis gedropt en krijgt hij een "globale missie" die twee tot vier verschillende doelen bevat. Deze doelen zijn lastig: het ene kan zijn "zoek de bank" (een categorie), een andere "zoek de lichtgrijze bank naast de doorschijnende gordijnen" (een beschrijving), en een derde "zoek deze specifieke foto van een bed" (een afbeelding als referentie).

De echte wending is echter het geluid. In dit spel maakt elk item waar de robot naar op zoek is een geluid. Maar hier is de crux: de geluiden zijn geen vaste doelen. Terwijl de robot een doel vindt en voltooit, stopt het geluid van dat item. Ondertussen blijven de items die hij nog niet heeft gevonden geluid maken, waarbij ze om de beurt het hardst klinken. Dit creëert een verwarrende situatie. Als de robot op zoek is naar een bank, maar hij hoort een toilet doorspoelen (omdat hij de toilet nog niet heeft gevonden), dan is het geluid een afleiding. De robot moet uitzoeken: "Helpt dit geluid mij om mijn huidige doel te vinden, of is het een rode lap (red herring) die me naar een andere, onvoltooide taak leidt?"

Om dit te testen, hebben de auteurs een enorme dataset gemaakt met meer dan 150.000 episodes waarin robots door deze luidruchtige, multi-doel missies moeten navigeren. Ze ontdekten dat bestaande robots, zelfs de slimme die erg goed zijn in het volgen van instructies of het onthouden van visuele kaarten, er vreselijk mee worstelen. Wanneer het geluid verwarrend wordt of de missie lang duurt, raken deze robots de weg kwijt of geven ze op. Ze kunnen het verschil niet zien tussen een nuttige aanwijzing en een afleidende ruis.

Om te laten zien hoe moeilijk dit is, bouwde het team hun eigen robotagent genaamd PAG-Nav. Deze robot gebruikt geen complexe training om te leren; in plaats daarvan gebruikt hij een slimme strategie. Hij houdt een mentale kaart van het hele huis bij, waarbij hij bijhoudt waar hij is geweest, wat hij heeft gezien en waar de geluiden vandaan komen. Hij gebruikt het geluid om zijn zoektocht te sturen wanneer hij niets kan zien, maar hij weigert te zeggen "Ik heb het gevonden!" totdat hij een goed, duidelijk beeld van het object heeft gekregen om te controleren of het wel het juiste object is. Zelfs met deze slimme strategie slaagt de robot slechts in ongeveer 2% tot 3% van de geordende missies en 3% tot 5% van de ongeordende missies.

De belangrijkste bevinding van dit artikel is dat het toevoegen van geluid aan lange, complexe missies de technologie aanzienlijk moeilijker maakt, niet makkelijker. De auteurs suggereren dat hoewel geluid een krachtig hulpmiddel is om dingen te vinden die buiten het zicht liggen, het een nachtmerrie wordt als de robot niet kan uitzoeken welk geluid bij welke taak hoort. Ze betogen dat de toekomst van robotnavigatie niet alleen gaat over beter zien of beter horen, maar over leren om de ruis te negeren en je te concentreren op de juiste aanwijzing op het juiste moment. Het artikel concludeert dat we nog lang niet deze puzzel hebben opgelost, wat veel ruimte laat voor toekomstige uitvinders om robots te bouwen die echt kunnen navigeren in een lawaaierige, multi-task wereld.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →