← 最新论文
🤖 AI

Semantic Audio-driven Understanding for Dynamic Humanoid Whole Body Control

本文提出了一种新颖的多模态框架,通过基于连续音频流实时自主选择并执行运动技能,实现动态类人机器人全身控制,并能区分用于时间对齐的音乐与用于直接指令理解的语音。

原作者: J. M. A. Marcelo, M. Brienza, E. Bugli, L. Comito, D. Nardi, D. D. Bloisi, V. Suriani

发布于 2026-07-17
📖 1 分钟阅读☕ 轻松阅读

原作者: J. M. A. Marcelo, M. Brienza, E. Bugli, L. Comito, D. Nardi, D. D. Bloisi, V. Suriani

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个这样的世界:机器人不再仅仅是遵循僵硬、预先写好的剧本,像一支每天演奏同一曲调的行进乐队那样行动,而是能够“聆听”周围的世界并即兴起舞。这是人形机器人领域一个令人兴奋的前沿领域,科学家们正在教导金属和塑料如何像人类一样流畅地运动。长期以来,让机器人行走或挥手需要工程师费力地编写每一个关节的运动,就像通过描述每一个手指的动作来教孩子系鞋带一样。但最近,一种被称为“强化学习”的强大新工具改变了游戏规则。你可以把它想象成机器人学习骑自行车,不是通过阅读说明书,而是通过摔倒一千次,直到它最终弄明白如何保持平衡。现在,这些机器人可以通过观察人类来学习复杂的、自然的动作,从而创造出一个看起来极其逼真的技能库。然而,这里有一个难点:虽然机器人已经学会了“如何”运动,但它们仍然并不真正知道在周围发生什么时“何时”运动或“做什么”。它们就像一位才华横溢的舞者,虽然掌握了书本上的每一个舞步,但需要有人在它行动前大喊一声“跳!”或“旋转!”。这篇论文解决了这一缺失的环节,探讨我们如何赋予机器人通过聆听音乐或人类声音,并立即做出决定——例如,“啊,这是萨尔萨舞节奏,我应该做这个特定的舞蹈”,或者“那个人说了‘挥手致意’,所以我要做那个动作”——的能力,且这一切都是实时完成的。

这项研究背后的研究人员与名为 Unitree G1 的机器人合作,构建了一个聪明的“大脑”,充当这些机器人动作的指挥家。该系统不再等待人类按下按钮,而是聆听连续的声音流——比如派对上播放的歌曲或人对机器人的说话声——并立即确定要执行的动作。这就像拥有一个超级聪明的 DJ,他不仅播放音乐,还能根据节拍控制灯光和舞者的动作。

以下是他们的系统是如何运作的,分为简单的步骤。首先,机器人的“耳朵”(麦克风)捕捉声音,并将其切分成五秒钟的小段。这就像每隔几秒钟对音频进行一次快速快照。系统接着会问一个简单的问题:“这是音乐、是有人在说话,还是仅仅是噪音?”如果是音乐,机器人会使用一种高科技的“指纹”扫描器来识别歌曲。它不仅知道歌名,还准确知道歌曲进行到了哪个位置。是缓慢的序曲?还是快速的高潮部分?这使得机器人能够将歌曲的具体部分与特定的舞蹈动作相匹配。如果歌曲从慢节奏的民谣变为欢快的流行乐,机器人会立即切换其舞蹈风格。

如果声音是语音,系统的处理方式则更加直接。它倾听人们在说什么,将文字转化为文本,并将该文本与预先学习到的技能进行匹配。如果有人说“跳舞”,机器人就会寻找一个舞蹈动作;如果有人说“走路”,它就开始走路。这种设置的美妙之处在于,它是一个统一的系统。无论是输入的旋律还是指令,机器人都使用同一个“交换机”来决定从其技能库中提取哪种动作。

团队通过两种方式测试了这个想法。首先,他们在计算机模拟中运行,这是一个虚拟世界,他们可以在那里测试机器人的反应,而不必担心它会摔倒。他们播放了不同歌曲的“混音辑”,每 20 秒或 30 秒切换一次曲目。他们发现,当歌曲每 30 秒切换一次时,机器人的表现非常出色,能在动作之间实现平滑过渡。然而,当他们尝试每 20 秒切换一次时,机器人有时会踉跄。事实证明,机器人在动作之间需要一点时间来恢复平衡,而 20 秒不足以完成安全的过渡。在这些较快的情况下,机器人有时不得不退回到简单的“行走”模式以保持直立,这表明虽然“聆听”部分做得很好,但物理层面的“舞蹈”部分存在速度限制。

随后,他们将该系统从计算机转移到了真实的 Unitree G1 机器人上。结果非常令人振奋。机器人在现场成功聆听了音乐并选择了正确的舞蹈动作,证明了他们构建的这个“大脑”在现实世界中与在模拟器中一样有效。机器人可以“听到”音乐,理解节奏,并在无需人类为每一个步骤按下按钮的情况下,执行相应的全身动作。

作者认为,这种方法是一个巨大的进步,因为它使机器人从只能做指令任务的预设程序化机器,转向能够对环境做出反应的自主智能体。他们强调,该系统不需要在每次添加新歌时都进行重新训练;它使用一种智能匹配系统来即时识别出正确的动作。虽然他们指出,目前的系统在 30 秒一段的音乐下效果最好(因为机器人需要在动作之间稳定下来),但他们相信这是一个坚实的基石。论文总结道,这种方法为机器人在动态、不可预测的环境中(如舞蹈舞台或足球场)表演打开了大门,在那里它们可以聆听、理解并实时做出反应,使它们不再仅仅是机器,而是真正的表演伙伴。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →