← Ultimi articoli
💻 computer science

Human-robot conversation with multiple participants in noisy public spaces

Questo articolo presenta un sistema audio con array di microfoni multi-canale progettato per spazi pubblici rumorosi che migliora il parlato sia per l'ascolto attento dell'androide ERICA che per le interazioni tramite avatar remoto con i robot Teleco, fornendo al contempo audio spaziale per migliorare l'immersione nelle conversazioni multiparte.

Autori originali: Divesh Lala, Yogeeswaran Muthukumaran, Vincent Fernandes, Kazushi Kato, Shota Fujiki, Zihao Chi, Masaya Iwasaki, Taiken Shintani, Megumi Kawata, Kazuki Sakai, Koji Inoue, Yuicihiro Yoshikawa, Tatsuya
Pubblicato 2026-09-02
📖 6 min di lettura🧠 Approfondimento

Autori originali: Divesh Lala, Yogeeswaran Muthukumaran, Vincent Fernandes, Kazushi Kato, Shota Fujiki, Zihao Chi, Masaya Iwasaki, Taiken Shintani, Megumi Kawata, Kazuki Sakai, Koji Inoue, Yuicihiro Yoshikawa, Tatsuya Kawahara

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Immaginate di cercare di avere una conversazione seria nel mezzo di una stazione ferroviaria affollata, dove il ruggito dei motori, il chiacchiericcio della folla e l'eco dell'architettura competono per la vostra attenzione. Gli esseri umani riescono in questa impresa senza sforzo, una capacità che gli scienziati chiamano "effetto cocktail party", dove il nostro cervello filtra il frastuono di fondo per concentrarsi su una singola voce. Per un robot, tuttavia, questa è una sfida formidabile. Sebbene l'intelligenza artificiale sia diventata straordinariamente brava a sostenere conversazioni basate sul testo, dare a un robot la capacità di ascoltare e parlare naturalmente in uno spazio pubblico rumoroso e affollato rimane un ostacolo significativo. Ciò è particolarmente vero quando più persone parlano contemporaneamente, o quando il robot stesso si muove attraverso l'ambiente. Senza un modo per isolare la voce umana dal caos, la capacità di un robot di comprendere e rispondere crolla, lasciandolo sordo proprio verso le persone che dovrebbe servire.

Ricercatori di diverse università in Giappone e Singapore si sono posti l'obiettivo di risolvere questo problema costruendo un sistema che permetta ai robot di sentire chiaramente nel mondo reale. Hanno testato il loro lavoro alla World Expo 2025 di Osaka, un ambiente scelto specificamente perché rumoroso, imprevedibile e pieno di migliaia di visitatori. Il team ha sviluppato un sistema audio specializzato capace di catturare le voci di più persone simultaneamente, anche quando parlano l'una sopra l'altra, e di pulire il suono in modo che sia il robot che un operatore umano remoto possano comprenderli. Il risultato è stato una dimostrazione in cui i robot hanno sostenuto con successo conversazioni con gruppi di persone in un padiglione rumoroso, provando che le macchine possono essere istruite ad ascoltare con lo stesso focus che un essere umano usa in una stanza affollata.

Il cuore di questo traguardo risiede nel modo in cui i robot sono equipaggiati per sentire. Invece di fare affidamento su un singolo microfono, che raccoglierebbe tutto il rumore della stanza in modo uniforme, i ricercatori hanno utilizzato un array circolare di quattro microfoni. Questo dispositivo agisce come un insieme di orecchie che possono essere orientate elettronicamente per concentrarsi su direzioni specifiche. Quando una persona parla, il sistema identifica la sua posizione e ne esalta la voce, sopprimendo al contempo il rumore di fondo proveniente dalle altre direzioni. Questo processo crea un segnale audio pulito che può essere utilizzato per due scopi distinti: permette al computer interno del robot di riconoscere le parole pronunciate e invia una versione chiara e di alta qualità della conversazione a un operatore umano che potrebbe controllare il robot da una posizione distante.

Il team ha dimostrato questa tecnologia in due scenari diversi, ciascuno con le proprie sfide uniche. Nel primo setup, un robot androide di nome ERICA sedeva con due partecipanti umani. L'obiettivo era dimostrare che il robot potesse agire come un ascoltatore attento, seguendo la conversazione e rispondendo con cenni del capo o brevi segnali verbali. Poiché gli umani erano seduti in una posizione fissa, l'array di microfoni poteva essere posizionato su un treppiede tra loro, creando un ambiente di ascolto stabile. Il sistema ha separato con successo le voci delle due persone, permettendo a ERICA di capire chi stesse parlando e di generare risposte appropriate, come porre domande di approfondimento basate su quanto appena detto. Questo scenario ha dimostrato che la tecnologia poteva gestire le complessità di una conversazione di gruppo in cui le persone potrebbero interrompersi o parlare contemporaneamente.

Il secondo scenario era molto più difficile perché coinvolgeva il movimento. In questo caso, i ricercatori hanno utilizzato piccoli robot mobili chiamati Telecos. Uno di questi robot era controllato da un operatore umano seduto in una stanza separata, che agiva come un avatar virtuale, mentre l'altro robot si muoveva autonomamente per supportare la conversazione. In questo caso, l'array di microfoni era montato sulla testa del robot controllato dall'umano. Mentre il robot girava la testa o si spostava sul pavimento, la direzione delle sue "orecchie" cambiava costantemente. I ricercatori hanno dovuto programmare il sistema affinché seguisse continuamente la posizione del partecipante umano e dell'altro robot, cambiando istantaneamente il focus del microfono verso la direzione da cui proveniva la conversazione. Questo aggiustamento dinamico ha permesso all'operatore remoto di sentire chiaramente il partecipante umano, anche mentre il robot si muoveva, e di sentirsi fisicamente presente nella conversazione.

Per far sì che ciò funzionasse, il sistema doveva fare molto più che amplificare il suono; doveva creare un senso di spazio. Quando l'operatore remoto ascoltava attraverso le cuffie, l'audio veniva regolato in modo che, se il partecipante umano si trovava alla sinistra del robot, la voce provenisse dal lato sinisto delle cuffie dell'operatore. Questo effetto audio spaziale aiutava l'operatore a sentirsi immerso nell'interazione, preservando la naturale relazione tra gli interlocutori. Inoltre, il sistema includeva una funzione di cancellazione dell'eco per evitare che la voce dell'operatore stesso, che veniva riprodotta attraverso l'altoparlante del robot, venisse captata dal microfono confondendo il sistema.

I risultati della dimostrazione sono stati incoraggianti. Durante i sei giorni all'Expo, i sistemi hanno interagito con centinaia di visitatori in un padiglione pieno del rumore di altre esposizioni e del suono occasionionale della pioggia. I robot sono stati in grado di mantenere conversazioni coerenti e gli operatori remoti hanno riferito di poter sentire chiaramente le persone con cui stavano parlando, nonostante gli alti livelli di rumore. In test controllati effettuati prima dell'evento, la capacità del sistema di riconoscere il parlato era paragonabile all'uso di un normale microfono a mano, anche quando il robot era in movimento o quando c'era un significativo rumore di fondo. I ricercatori hanno osservato che, sebbene il sistema non fosse perfetto — a volte perdeva gli interlocutori che parlavano piano o faticava quando una persona dava le spalle al microfono — rappresentava un passo avanti significativo nel rendere i robot capaci di funzionare in spazi pubblici del mondo reale.

Questo lavoro evidenzia un cambiamento cruciale nel modo in cui pensiamo all'interazione uomo-robot. Si va oltre gli ambienti controllati e silenziosi del laboratorio per entrare nella realtà disordinata e rumorosa della vita quotidiana. Risolvendo il problema di come sentire chiaramente in mezzo a una folla, i ricercatori hanno aperto la strada a robot che possano servire come compagni, guide o assistenti in luoghi come aeroporti, musei e centri commerciali. La capacità di filtrare il rumore e concentrarsi sulla voce umana non è solo un'impresa tecnica; è la base per costruire macchine che possano veramente capirci e connettersi con noi, anche negli scenari più caotici.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →