Human-robot conversation with multiple participants in noisy public spaces
Dieses Paper präsentiert ein Mehrkanal-Mikrofonarray-Audiosystem für laute öffentliche Räume, das die Sprache sowohl für das aufmerksame Zuhören des Androiden ERICA als auch für Fernavatar-Interaktionen via Teleco-Roboter verbessert und gleichzeitig räumliches Audio bereitstellt, um die Immersion in Mehrparteien-Gesprächen zu steigern.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Stellen Sie sich vor, Sie versuchen, mitten in einem belebten Bahnhof ein ernstes Gespräch zu führen, wo das Dröhnen der Motoren, das Geplapper der Menschenmassen und der Widerhall der Architektur um Ihre Aufmerksamkeit konkurrieren. Menschen bewältigen diese Leistung mühelos – eine Fähigkeit, die Wissenschaftler als „Cocktailparty-Effekt“ bezeichnen, bei dem unser Gehirn das Hintergrundrauschen herausfiltert, um sich auf eine einzelne Stimme zu konzentrieren. Für einen Roboter ist dies jedoch eine gewaltige Herausforderung. Während künstliche Intelligenz bemerkenswert gut darin geworden ist, textbasierte Gespräche zu führen, bleibt es eine erhebliche Hürde, einem Roboter die Fähigkeit zu geben, in einem lauten, überfüllten öffentlichen Raum natürlich zuzuhören und zu sprechen. Dies gilt insbesondere dann, wenn mehrere Menschen gleichzeitig sprechen oder wenn sich der Roboter selbst durch die Umgebung bewegt. Ohne eine Möglichkeit, die menschliche Sprache vom Chaos zu isolieren, bricht die Fähigkeit eines Roboters, zu verstehen und zu reagieren, zusammen, was ihn gegenüber den Menschen, denen er dienen soll, taub macht.
Forscher mehrerer Universitäten aus Japan und Singapur machten sich daran, dieses Problem zu lösen, indem sie ein System entwickelten, das es Robotern ermöglicht, in der realen Welt klar zu hören. Sie testeten ihre Arbeit auf der Weltausstellung 2025 in Osaka, einem Schauplatz, der speziell gewählt wurde, weil er laut, unvorhersehbar und voller tausender Besucher ist. Das Team entwickelte ein spezialisiertes Audiosystem, das in der Lage ist, die Stimmen mehrerer Personen gleichzeitig zu erfassen, selbst wenn diese sich gegenseitig übertönen, und den Klang so zu bereinigen, dass sowohl der Roboter als auch ein menschlicher Fernoperator sie verstehen können. Das Ergebnis war eine Demonstration, bei der Roboter erfolgreich Gespräche mit Gruppen von Menschen in einem lauten Pavillon führten, was bewies, dass Maschinen beigebracht werden können, mit demselben Fokus zuzuhören, den ein Mensch in einem überfüllten Raum nutzt.
Der Kern dieser Errungenschaft liegt darin, wie die Roboter ausgestattet sind, um zu hören. Anstatt sich auf ein einzelnes Mikrofon zu verlassen, das alle Geräusche im Raum gleichermaßen aufnehmen würde, verwendeten die Forscher ein kreisförmiges Array aus vier Mikrofonen. Dieses Gerät fungiert wie ein Satz Ohren, der elektronisch in bestimmte Richtungen gelenkt werden kann, um den Fokus zu schärfen. Wenn eine Person spricht, identifiziert das System deren Position und verstärkt deren Stimme, während es das Hintergrundrauschen aus anderen Richtungen unterdrückt. Dieser Prozess erzeugt ein sauberes Audiosignal, das für zwei unterschiedliche Zwecke genutzt werden kann: Er ermöglicht dem internen Computer des Roboters, die gesprochenen Wörter zu erkennen, und er sendet eine klare, hochwertige Version des Gesprächs an einen menschlichen Operator, der den Roboter möglicherweise aus einer entfernten Position steuert.
Das Team demonstrierte diese Technologie in zwei verschiedenen Szenarien, die jeweils ihre eigenen einzigartigen Herausforderungen mit sich brachten. In dem ersten Aufbau saß ein Androiden-Roboter namens ERICA bei zwei menschlichen Teilnehmern. Das Ziel war es zu zeigen, dass der Roboter als aufmerksamer Zuhörer agieren kann, indem er dem Gespräch folgt und mit Nicken oder kurzen verbalen Signalen reagiert. Da die Menschen an einer festen Position saßen, konnte das Mikrofon-Array auf einem Stativ zwischen ihnen platziert werden, was eine stabile Zuhörumgebung schuf. Das System konnte die Stimmen der beiden Personen erfolgreich trennen, sodass ERICA verstand, wer gerade sprach, und angemessene Antworten generieren konnte, wie etwa Rückfragen basierend auf dem eben Gesagten. Dieses Szenario bewies, dass die Technologie die Komplexität eines Gruppengesprächs bewältigen kann, bei dem Menschen sich unterbrechen oder gleichzeitig sprechen könnten.
Das zweite Szenario war weitaus schwieriger, da es Bewegung beinhaltete. Hierbei setzten die Forscher kleine, mobile Roboter namens Telecos ein. Einer dieser Roboter wurde von einem menschlichen Operator gesteuert, der in einem separaten Raum saß und als virtueller Avatar fungierte, während der andere Roboter sich autonom bewegte, um das Gespräch zu unterstützen. In diesem Fall war das Mikrofon-Array am Kopf des vom Menschen gesteuerten Roboters montiert. Wenn der Roboter seinen Kopf drehte oder sich über den Boden bewegte, änderte sich die Richtung seiner „Ohren“ ständig. Die Forscher mussten das System so programmieren, dass es die Position des menschlichen Teilnehmers und des anderen Roboters kontinuierlich verfolgt und den Fokus des Mikrofons sofort auf die Richtung wechselt, aus der das Gespräch kommt. Diese dynamische Anpassung ermöglichte es dem Fernoperator, den menschlichen Teilnehmer klar zu hören, selbst während sich der Roboter bewegte, und gab ihm das Gefühl, physisch an dem Gespräch teilzunehmen.
Um dies zu ermöglichen, musste das System mehr tun als nur den Schall zu verstärken; es musste ein Gefühl von Raum erzeugen. Wenn der Fernoperator durch Kopfhörer zuhörte, wurde das Audio so angepasst, dass, falls der menschliche Teilnehmer links vom Roboter stand, die Stimme auch auf der linken Seite der Kopfhörer des Operators zu hören war. Dieser räumliche Audioeffekt half dem Operator, in die Interaktion einzutauchen, und bewahrte die natürliche Beziehung zwischen den Sprechern. Zusätzlich enthielt das System eine Echounterdrückung, um zu verhindern, dass die eigene Stimme des Operators, die über den Lautsprecher des Roboters ausgegeben wurde, vom Mikrofon aufgefangen wird und das System verwirrt.
Die Ergebnisse der Demonstration waren ermutigend. Über sechs Tage hinweg bei der Expo interagierten die Systeme mit Hunderten von Besuchern in einem Pavillon, der vom Lärm anderer Ausstellungen und gelegentlichem Regen erfüllt war. Die Roboter konnten kohärente Gespräche führen, und die Fernoperatoren berichteten, dass sie die Menschen, mit denen sie sprachen, trotz der hohen Geräuschpegel klar hören konnten. In kontrollierten Tests vor der Veranstaltung war die Fähigkeit des Systems zur Spracherkennung vergleichbar mit der Verwendung eines Standard-Handmikrofons, selbst wenn der Roboter sich bewegte oder wenn erheblicher Hintergrundlärm herrschte. Die Forscher merkten an, dass das System nicht perfekt war – es überging manchmal leise Sprecher oder hatte Schwierigkeiten, wenn eine Person dem Mikrofon den Rücken zukehrte –, aber es stellte einen bedeutenden Schritt nach vorn dar, um Roboter in der Lage zu machen, in realen öffentlichen Räumen zu funktionieren.
Diese Arbeit verdeutlicht einen entscheidenden Wandel in der Art und Weise, wie wir über die Mensch-Roboter-Interaktion denken. Sie führt über die kontrollierten, ruhigen Umgebungen eines Labors hinaus in die chaotische, laute Realität des täglichen Lebens. Indem die Forscher das Problem gelöst haben, in einer Menge klar zu hören, haben sie den Weg geebnet für Roboter, die als Begleiter, Führer oder Assistenten an Orten wie Flughäfen, Museen und Einkaufszentren dienen können. Die Fähigkeit, das Rauschen herauszufiltern und sich auf die menschliche Stimme zu konzentrieren, ist nicht nur eine technische Leistung; sie ist das Fundament für den Bau von Maschinen, die in der Lage sind, uns wirklich zu verstehen und mit uns in Verbindung zu treten, selbst in den chaotischsten Situationen.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.