← 最新论文
💻 computer science

Human-robot conversation with multiple participants in noisy public spaces

本文提出了一种专为嘈杂公共场所设计的多通道麦克风阵列音频系统,该系统旨在增强安卓机器人 ERICA 的专注聆听以及通过 Teleco 机器人进行的远程化身交互时的语音效果,同时还提供空间音频以提升多方对话中的沉浸感。

原作者: Divesh Lala, Yogeeswaran Muthukumaran, Vincent Fernandes, Kazushi Kato, Shota Fujiki, Zihao Chi, Masaya Iwasaki, Taiken Shintani, Megumi Kawata, Kazuki Sakai, Koji Inoue, Yuicihiro Yoshikawa, Tatsuya
发布于 2026-09-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Divesh Lala, Yogeeswaran Muthukumaran, Vincent Fernandes, Kazushi Kato, Shota Fujiki, Zihao Chi, Masaya Iwasaki, Taiken Shintani, Megumi Kawata, Kazuki Sakai, Koji Inoue, Yuicihiro Yoshikawa, Tatsuya Kawahara

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,在繁忙的火车站中心尝试进行一场严肃的对话,那里引擎的轰鸣声、人群的嘈杂声以及建筑物的回声都在争夺着你的注意力。人类能够毫不费力地完成这一壮举,科学家称之为“鸡尾酒会效应”,即我们的脑部可以过滤掉背景噪音,从而专注于单一的声音。然而,对于机器人来说,这是一个巨大的挑战。虽然人工智能在进行基于文本的对话方面已经变得非常出色,但要让机器人在嘈iously、拥挤的公共空间中自然地倾听和说话,仍然是一个显著的障碍。当多个人同时说话,或者机器人本身在环境中移动时,情况尤其如此。如果没有一种方法将人类的语音从混乱中分离出来,机器人的理解和响应能力就会崩溃,使其对本应服务的对象“耳聋”。

来自日本和新加坡几所大学的研究人员致力于解决这一问题,他们构建了一个能让机器人在现实世界中清晰听见的系统。他们在2025年大阪世界博览会上测试了他们的研究成果,选择这个环境正是因为它嘈杂、不可预测且充满了成千上万的游客。该团队开发了一种专门的音频系统,能够同时捕捉多个人的声音,即使他们在互相争吵,并能对声音进行清理,使机器人和远程人类操作员都能理解他们。结果展示表明,机器人在嘈杂的展馆中成功地与人群进行了对话,证明了机器可以被教会像人类在拥挤房间里那样专注地倾听。

这一成就的核心在于机器人是如何配备听觉设备的。研究人员并没有依赖单个麦克风(单麦克风会平等地拾取房间内的所有噪音),而是使用了一个由四个麦克风组成的环形阵列。这个设备就像一副可以进行电子转向以聚焦特定方向的“耳朵”。当一个人说话时,系统会识别其位置并增强其声音,同时抑制来自其他方向的背景噪音。这个过程创造了一个清晰的音频信号,可用于两个截然不同的目的:它让机器人的内部计算机能够识别正在说的词句,并向可能在远处控制机器人的远程人类操作员发送清晰、高质量的对话内容。

该团队在两种不同的场景中演示了这项技术,每种场景都有其独特的挑战。在第一种设置中,一个名为ERICA的类人机器人与两名人类参与者坐在一起。目标是展示机器人可以作为一个专注的倾听者,跟随对话并做出点头或简短的言语反馈。由于人类坐在固定位置,麦克风阵列可以放置在他们之间的三脚架上,从而创建一个稳定的聆听环境。系统成功分离了两人的声音,使ERICA能够理解谁在说话,并生成适当的反应,例如根据刚刚说过的话提出后续问题。这一场景证明了该技术可以处理多人对话中的复杂性,例如人们可能会打断或同时说话。

第二个场景要困难得多,因为它涉及移动。在这里,研究人员使用了被称为Telecos的小型移动机器人。其中一个机器人由坐在另一个房间的人类操作员控制,充当虚拟化身,而另一个机器人则在周围移动以辅助对话。在这种情况下,麦克风阵列安装在受人类控制的机器人的头部。当机器人转头或在地面上移动时,它的“耳朵”的方向也在不断变化。研究人员必须编写程序,使系统能够持续追踪人类参与者和其他机器人的位置,并立即将麦克风的焦点切换到对话传来的方向。这种动态调整使得远程操作员即使在机器人移动时也能清晰地听到人类参与者的声音,并感觉自己仿佛亲临现场参与对话。

为了实现这一点,系统不仅要放大声音,还必须创造一种空间感。当远程操作员通过耳机聆听时,音频会经过调整,如果人类参与者站在机器人的左侧,那么声音就会从操作员耳机的左侧传来。这种空间音频效果帮助操作员沉浸在互动中,保留了说话者之间自然的关联关系。此外,系统还包含了一个回声消除功能,以防止操作员的声音(通过机器人的扬声器播放)被麦克风拾取并干扰系统。

演示结果令人鼓舞。在世博会期间的六天里,这些系统在充满其他展位噪音和偶尔有雨声的展馆中与数百名访客进行了互动。机器人能够维持连贯的对话,且远程操作员报告称,尽管噪音水平很高,他们仍能清晰地听到正在与他们交谈的人。在活动前的受控测试中,即使在机器人移动或存在显著背景噪音的情况下,该系统的语音识别能力也与使用标准手持麦克风的效果相当。研究人员指出,虽然该系统并不完美——有时会错过声音较小的人,或者在人背对着麦克风时遇到困难——但它代表了让机器人能够在现实公共空间中发挥作用的重要一步。

这项工作凸显了我们看待人机交互方式的一个关键转变。它超越了实验室中受控、安静的环境,进入了日常生活中嘈杂、混乱的现实。通过解决如何在人群中清晰听见的问题,研究人员为机器人能够在机场、博物馆和购物中心等场所担任伴侣、向导或助手铺平了道路。过滤噪音并专注于人类声音的能力不仅仅是一项技术成就;它是构建能够即使在最混乱的环境下也能真正理解并与我们建立联系的机器的基础。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →