想象一下正在教一个机器人做家务,比如捡起特定的玩具或倒一杯饮料。通常,我们通过向机器人展示人类做这些任务的视频来教导它们,这种方法被称为“模仿学习”。机器人观察视频,看到物体,并学习模仿动作。但问题在于:机器人往往不擅长处理它们看不见的东西。如果一个玩具被挡在窗帘后面,或者桌子上放着两个看起来一模一样的盒子,一个仅靠眼睛观察的机器人就会感到困惑。它不知道该抓哪一个盒子,也不知道该把玩具放进哪一个盒子里。这就是“多模态”学习概念介入的地方。就像人类通过听到踩到树枝时的碎裂声来使用耳朵,或者通过触觉来感知表面是否湿滑一样,机器人也可以被教导利用声音和触觉来更好地理解世界。科学家们早就知道,声音携带了关于物体材质及其位置的线索,但如何教机器人利用这些线索来做出决策,一直是一个棘手的难题。
这篇题为《S2A2:利用声学空间信息进行操纵任务的音视频模仿学习》的论文,通过给机器人配备一对“超级耳朵”来解决这个难题。来自京都大学和理化学研究所(RIKEN)的研究人员创建了一个名为 S2A2(空间-频谱音频动作)的新框架。可以将 S2A2 想象成一个特殊的翻译器,帮助机器人同时理解两种不同的声音信息:声音来自哪里(空间信息)以及声音本身是什么(频谱/音色信息)。
在现实世界中,团队在配备了环绕工作空间的多个麦克风的机器人手臂上测试了这一技术。他们设置了四个不同的挑战,以测试机器人是否能学会利用声音。在一个挑战中,桌上有两个外观完全相同的方块,但只有一个在发出声音;机器人必须找到那个发声的方块。在另一个挑战中,机器人需要倾听一个物体,并根据它发出的声音决定它属于哪一个盒子。最复杂的挑战涉及摇晃两个看起来静止不动的罐子,看哪一个会发出碰撞声,然后将发出碰撞声的那个放入盒中。
结果令人期待,但也具有细微的差别。在计算机模拟中,S2A2 框架被证明是教授机器人这些任务最有效的方法,尤其是当它们需要同时确定声音的“位置”和“内容”时。机器人学会了将桌面的视觉图像与声音位置的“热力图”以及频谱图(声音频率的视觉图像)结合起来,从而做出明智的选择。然而,研究人员发现,你不能只是把所有数据都丢给机器人;如果你给它在特定任务中并不需要的声音信息,它有时会感到困惑并表现得更差。
当他们从计算机模拟转向真实房间里的真实机器人时,S2A2 系统仍然比仅靠眼睛观察的机器人表现得更好。现实世界的测试证实,机器人确实可以学会通过倾听环境来解决仅靠视觉无法解决的问题。论文指出,虽然这种方法是一个重要的进步,但声音整合的方式在很大程度上取决于机器人正在使用的特定“大脑”(或策略)。有些机器人大脑能快速学会声音线索,而另一些则稍显吃力,这表明未来的工作需要研究如何针对不同类型的机器人学习者,将听觉和视觉进行最佳融合。最终,这项研究表明,赋予机器人倾听和定位声音的能力,可以帮助它们在并非总能被完美看见的世界中穿行。
技术摘要:S2A2:利用声学空间信息进行操纵任务的视听模仿学习
问题陈述
目前的机器人操纵模仿学习框架主要依赖于视觉观测和语言指令。虽然这些以视觉为中心的方法在许多任务中行之有效,但在操纵目标在视觉上难以区分、被遮挡,或者关键状态信息(如材料属性或内部内容)不可见时,这些方法会面临挑战。现有的整合非视觉模态的研究主要集中在触觉或单通道接触声上。然而,声学信息提供了独特的优势:它能提供关于物体位置、材料属性和动态状态(例如流速、液位)的线索,而这些是摄像头无法看到的。此外,声学数据包含“信号信息”(发生了什么,例如音色)和“空间信息”(发生在何处)。本文指出,目前在利用“声学空间信息”——特别是通过麦克风阵列实现的声源定位——并将其与用于机器人操纵策略的信号处理相结合方面,仍存在研究空白。
方法论:S2A2 框架
作者提出了 S2A2(Spatial-Spectral Audio Action,空间-频谱音频动作),这是一个旨在将声学空间和声学信号信息与视觉观测相结合的多模态模仿学习框架。
声学感知操纵任务:
为了评估该框架,作者定义了四个视觉单独无法完成的具体任务:
- 定位 (Localization): 在视觉上完全相同的静止物体中选择一个发声物体。
- 识别 (Identification): 根据特定物体的发射音色,将其运送到特定的目标箱。
- 定位与识别 (L&I): 从视觉相同的静止物体中选择一个发声物体,并根据其特定的音色将其运送到目的地。
- 探索性任务 (Exploratory): 主动摇晃视觉上相同的物体以诱发其中一个发出声音,然后抓取并放置该发声物体。
处理流水线:
S2A2 模型处理三种不同的模态:
- 视觉 (Visual): 由底层策略视觉编码器处理的标准 RGB 图像。
- 声学空间图 (Acoustic Spatial Map): 利用 MUSIC(多信号分类)算法从多通道音频中导出。该算法估算声源方向的可能性,并将其投影到与工作空间对应的二维图中。
- 声学频谱图 (Acoustic Spectrogram): 使用 Spotforming 技术(一种结合了多个麦克风阵列与非负矩阵分解的技术)导出。该技术可以隔离特定于识别出的声源的声学信号,从而抑制环境噪声和同向干扰。
多模态策略:
该框架将这些特征集成到策略网络中以预测动作序列。作者使用 S2A2 实现了四种不同的策略架构:ACT(基于 Transformer 的动作分块)、Diffusion Policy(扩散策略)、VQ-BeT(矢量量化行为 Transformer)以及 π0(一种视觉-语言-动作流模型)。来自空间图和频谱图的特征与本体感受及视觉特征进行拼接,随后输入策略网络。
核心贡献
- 任务定义: 引入了“声学感知操纵任务”,其中目标选择、目标确定或主动探索受空间分布的声环境控制。
- 框架提议: 开发了 S2A2,它独特地将声学空间图(代表声音在哪里)与频谱图(代表声音是什么)结合在一起,并纳入模仿学习流水线中。
- 系统性评估: 在模拟和真实环境中进行了全面的评估,分析了空间声学信息与信号声学信息对不同策略架构的具体贡献。
实验结果
- 模拟实验: 实验将完整的 S2A2 模型与仅使用视觉、视觉+空间、以及视觉+信号的基线模型进行了对比。
- 完整的 S2A2 模型取得了最高的成功率,特别是在需要同时进行定位和识别的 L&I 任务中(ACT 为 78.7%,Diffusion Policy 为 89.7%)。
- 缺乏必要模态的模型(例如,在定位任务中使用仅频谱图的模型)表现明显较差,通常无法超越仅使用视觉的基线模型。
- 潜在空间可视化: t-SNE 分析显示,S2A2 模型的潜在空间清晰地分离了声音类型和声源坐标,而缺失特定声学输入的模型则表现出较弱的分离度,这与较低的任务成功率相吻应。
- 真实机器人实验: 使用 ILOHA 双臂机械手和四个圆形麦克风阵列,作者在现实世界中验证了该框架。
- S2A2 模型(特别是 ACT)在 L&I 和探索性任务中成功超越了仅视觉的基线模型,证实了该方法在存在物理噪声和光照变化的情况下应用于现实世界操纵的可行性。
意义与主张
本文主张,声学信息是机器人操纵中至关重要的补充模态,尤其是在视觉线索模糊或不足时。作者强调:
- 模态匹配至关重要: 声学信息的有效性取决于将其表示形式与任务需求进行匹配。添加不必要的声学模态(例如,在纯定位任务中添加信号信息)可能会降低性能,这可能是由于在有限的演示数据下,过滤无关输入具有难度。
- 策略依赖性: 集成声学信息的效率在不同策略架构之间存在显著差异。ACT 和 Diffusion Policy 表现出显著提升,而 VQ-BeT 提升较小,π0 的结果则表现不一,这表明在集成新型模态(如空间音频)时,需要仔细考虑大规模预训练模型的设计。
- 主动探索: 该框架使机器人能够进行主动探索(例如,摇晃物体)以消除歧义,这是仅靠视觉难以实现的能力。
作者总结道,虽然目前的工作在受控环境和有限声源下展示了有效性,但向多样化平台、复杂环境(存在同时发声的多个声源)以及大规模预训练模型的泛化仍是未来的研究方向。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。