Sound-based Multi-Person 3D Pose Estimation
本文介绍了 SoundMHPE,这是首个通过利用一种新颖的编码器-解码器架构来克服信号叠加和反射等挑战,从而仅通过声学信号估计多人数 3D 姿态的框架,并在一个新构建的 6 小时同步数据集上进行了验证。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
几十年来,科学家们一直在寻找观测不可见之物的方法,开发出能够追踪人类运动而不依赖人眼的各种技术。依赖光线的摄像机在黑暗中或当人躲在墙后时会失效;用于某些传感系统的无线电波在遇到水或金属时则会表现不佳。在这些复杂的现实场景中,一种不同类型的信号作为一种极具前景的替代方案脱颖而出:声音。通过主动发出声波脉冲并仔细聆听其回声,研究人员可以绘制出房间内物体形状和位置的图谱。这种被称为“主动声学感知”的技术已经证明,即使在人体被遮挡的情况下,它也能确定单个人的姿态。然而,该领域仍存在一个显著的空白。虽然单一的声音或动作会产生清晰的回声,但一个充满多个人的房间会产生混乱且重叠的声音混合。要理清这些信号以了解每个人的站立位置及运动方式一直被认为几乎是不可能的,因为一个人的回声会与另一个人的回声混杂在一起,变得无法区分。
来自庆应义塾大学、东京理科大学和NTT的研究团队现在迈出了解决这一问题的第一步。他们开发出了一种仅通过声音即可估算多人三维姿态的系统。研究人员构建了一个定制数据集来训练他们的系统,记录了多达三人在房间内同时移动时的六小时同步音频和运动数据。实验设置包括一对发射特定声音信号的扬声器,以及一个能够捕捉全方位声音的专用麦克风。当参与者行走、扭转身体或抬起手臂时,系统会记录返回的回声。挑战是巨大的;声学信号是许多不同运动的叠加,由于声音在人体和墙壁上的反射方式,进一步导致了时间延迟,从而模糊了特定姿态与特定声音变化之间的直接联系,使情况更加复杂。
为了应对这种复杂性,该团队创建了一个名为SoundMHPE的新框架。该系统并没有尝试将声音作为一个单一且混乱的整体进行处理,而是将音频分解为多个层级的细节。它利用不同的时间窗口来分析声音,既观察瞬息之间发生的快速变化,也观察声音频率中较慢且更精细的细节。这使得系统能够分离出那些在噪声中可能被忽略的细微声学特征。一旦声音完成分析,系统就会使用一种高级方法来分离不同的人。它为每个人分配一组特定的数字“查询”(queries),使软件能够追踪一个人运动的时间演变,同时理解其如何与房间内的其他人进行交互。这种方法解开了重叠信息的纠缠,使系统能够逐帧重建每个人的姿态。
这项工作的成果证明了该系统的有效性。在针对最初为单人追踪设计或从无线电波感知领域改编的现有方法进行测试时,这种基于声音的新系统表现出了更高的准确性。它成功追踪了复杂的动作,例如在与其他移动个体共同行动时,一个人扭转身体或同时抬起双臂。在涉及两名和三名人员的测试中,该系统保持了高水平的精度,在测量预测关节位置与实际位置之间的距离方面优于基准模型。研究人员还发现,他们的方法可以适应未知的环境;当他们在房间内放置隔板以改变声音反射方式时,系统仍然能够估算出粗略的姿态,这表明它可以处理不同的声学条件。此外,该系统的底层逻辑也被证明在应用于射频数据时同样有效,表明该方法在不同类型的信号中具有鲁棒性。
这项研究标志着声学感知可能性的重大扩张。通过从单人场景转向多人环境,该团队为拥挤空间、灾难救援以及无法使用摄像机或无线电信号可能被阻挡的体育分析等应用领域打开了大门。虽然这项技术仍处于早期阶段,需要进一步开发才能在现实世界中部署,但这一新数据集的构建以及多人估算方法的验证,提供了一个至关重要的基础。这项工作证实,只要使用正确的工具进行分析,声音可以揭示人群隐藏的几何结构,将混乱的声波混合转化为清晰的人类运动图像。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。