Human-robot conversation with multiple participants in noisy public spaces
Dit artikel presenteert een audioformaat met een microfoonarray met meerdere kanalen dat is ontworpen voor lawaaierige openbare ruimtes en dat spraak verbetert voor zowel aandachtig luisteren door de android ERICA als interacties via afstandgestuurde avatar-robots via Teleco, terwijl het ook ruimtelijke audio biedt om de immersie in meerpartijgesprekken te verbeteren.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een serieus gesprek probeert te voeren midden in een bruisend treinstation, waar het gebrul van motoren, het geklets van menigten en de echo van de architectuur om je aandacht strijden. Mensen beheersen deze prestatie moeiteloos, een vaardigheid die wetenschappers het "cocktailparty-effect" noemen, waarbij onze hersenen de achtergrondherrie wegfilteren om zich op één stem te concentreren. Voor een robot is dit echter een enorme uitdaging. Hoewel kunstmatige intelligentie bijzonder goed is geworden in het voeren van tekstgebaseerde gesprekken, blijft het geven van het vermogen aan een robot om op natuurlijke wijze te luisteren en te spreken in een lawaaierige, drukke openbare ruimte een aanzienlijke hindernis. Dit geldt met name wanneer meerdere mensen tegelijkertijd praten, of wanneer de robot zelf door de omgeving beweegt. Zonder een manier om menselijke spraak te isoleren van de chaos, stort het vermogen van een robot om te begrijpen en te reageren ineen, waardoor hij doof wordt voor de mensen die hij juist moet dienen.
Onderzoekers van verschillende universiteiten in Japan en Singapore gingen deze uitdaging aan door een systeem te bouwen dat robots in staat stelt om duidelijk te horen in de echte wereld. Ze testten hun werk tijdens Expo 2025 in Osaka, een omgeving die specifiek werd gekozen omdat deze luidruchtig, onvoorspelbaar en vol met duizenden bezoekers is. Het team ontwikkelde een gespecialiseerd audiosysteem dat in staat is om de stemmen van meerdere mensen tegelijkertijd op te vangen, zelfs wanneer zij over elkaar heen praten, en het geluid op te schonen zodat zowel de robot als een menselijke operator op afstand hen kunnen verstaan. Het resultaat was een demonstratie waarbij robots succesvol gesprekken voerden met groepen mensen in een lawaaierige paviljoen, wat bewees dat machines kunnen worden aangeleerd om te luisteren met dezelfde focus die een mens gebruikt in een drukke kamer.
De kern van deze prestatie ligt in de manier waarop de robots zijn uitgerust om te horen. In plaats van te vertrouwen op één enkele microfoon, die alle ruis in de kamer gelijkmatig zou oppikken, gebruikten de onderzoekers een circulaire array van vier microfoons. Dit apparaat werkt als een set oren die elektronisch gestuurd kan worden om op specifieke richtingen te focussen. Wanneer een persoon spreekt, identificeert het systeem hun locatie en versterkt hun stem, terwijl het achtergrondgeluid uit andere richtingen wordt onderdrukt. Dit proces creëert een schoon audiosignaal dat voor twee verschillende doeleinden kan worden gebruikt: het stelt de interne computer van de robot in staat om de gesproken woorden te herkennen, en het stuurt een heldere, hoogwaardige versie van het gesprek naar een menselijke operator die de robot mogelijk vanaf een verre locatie bestuurt.
Het team demonstreerde deze technologie in twee verschillende scenario's, elk met zijn eigen unieke uitdagingen. In de eerste opstelling zat een androïde robot genaamd ERICA bij twee menselijke deelnemers. Het doel was om aan te tonen dat de robot kon fungeren als een aandachtige luisteraar, die het gesprek volgde en reageerde met knikjes of korte verbale signalen. Omdat de mensen op een vaste positie zaten, kon de microfoonarray op een statief tussen hen in worden geplaatst, wat een stabiele luisteromgeving creëerde. Het systeem slaagde erin de stemmen van de twee mensen te scheiden, waardoor ERICA begreep wie er sprak en gepaste reacties kon genereren, zoals het stellen van vervolgvragen op basis van wat er zojuist was gezegd. Dit scenario bewees dat de technologie de complexiteit van een groepsgesprek kan aan kunnen, waarbij mensen elkaar kunnen onderbreken of tegelijkertijd kunnen spreken.
Het tweede scenario was veel moeilijker omdat het beweging in barbracht. Hierbij gebruikten de onderzoekers kleine, mobiele robots genaamd Telecos. Eén van deze robots werd bestuurd door een menselijke operator die in een aparte kamer zat, optredend als een virtuele avatar, terwijl de andere robot zelfstandig rondbewoog om het gesprek te ondersteunen. In dit geval was de microfoonarray gemonteerd op de kop van de robot die door de mens werd bestuurd. Terwijl de robot zijn hoofd draaide of over de vloer bewoog, veranderde de richting van zijn "oren" voortdurend. De onderzoekers moesten het systeem zo programmeren dat het de positie van de menselijke deelnemer en de andere robot continu volgde, en de focus van de microfoon onmiddellijk verschoof naar de richting waaruit het gesprek kwam. Deze dynamische aanpassing maakte het mogelijk voor de externe operator om de menselijke deelnemer duidelijk te horen, zelfs terwijl de robot bewoog, en om het gevoel te hebben fysiek aanwezig te zijn in het gesprek.
Om dit te laten werken, moest het systeem meer doen dan alleen geluid versterken; het moest een gevoel van ruimte creëren. Wanneer de externe operator via een koptelefoon luisterde, werd het audio-signaal zo aangepast dat als de menselijke deelnemer links van de robot stond, de stem aan de linkerkant van de koptelefoon van de operator kwam. Dit ruimtelijke audio-effect hielp de operator om ondergedompeld te raken in de interactie, waarbij de natuurlijke relatie tussen de sprekers behouden bleef. Daarnaast bevatte het systeem een functie voor echo-onderdrukking om te voorkomen dat de eigen stem van de operator, die via de luidspreker van de robot werd afgespeeld, door de microfoon werd opgepikt en het systeem in verwarring bracht.
De resultaten van de demonstratie waren bemoedigend. Gedurende zes dagen op de Expo werkten de systemen met honderden bezoekers in een paviljoen dat gevuld was met het geluid van andere tentoonstellingen en het incidentele geluid van regen. De robots waren in staat om coherente gesprekken te voeren, en de externe operators rapporteerden dat zij de mensen met wie zij spraken duidelijk konden horen, ondanks de hoge geluidswaarden. In gecontroleerde tests voorafgaand aan het evenement was het vermogen van het systeem om spraak te herkennen vergelijkbaar met het gebruik van een standaard handmicrofoon, zelfs wanneer de robot bewoog of wanneer er aanzienlijke achtergrondruis was. De onderzoekers merkten op dat hoewel het systeem niet perfect was — het miste soms zachte sprekers of had moeite wanneer een persoon de rug naar de microfoon keerde — het een belangrijke stap voorwaarts vertegenwoordigde in het maken van robots die in staat zijn te functioneren in de publieke ruimte van de echte wereld.
Dit werk benadrukt een cruciale verschuiving in hoe we denken over mens-robotinteractie. Het beweegt voorbij de gecontroleerde, stille omgevingen van een laboratorium naar de rommelige, luidruchtige realiteit van het dagelijks leven. Door het probleem op te lossen hoe men duidelijk kan horen in een menigte, hebben de onderzoekers de weg vrijgemaakt voor robots die kunnen dienen als metgezellen, gidsen of assistenten in plaatsen zoals luchthavens, musea en winkelcentra. Het vermogen om de ruis weg te filteren en zich op de menselijke stem te concentreren is niet alleen een technische prestatie; het is het fundament voor het bouwen van machines die ons echt kunnen begrijpen en met ons kunnen verbinden, zelfs in de meest chaotische omgevingen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.