想象一下,你正试图在繁忙的街道上认出一个朋友。你不需要看到他们的脸,只需要观察他们的步态。这就是步态识别(gait recognition)的魔力——它是计算机视觉的一个分支,通过人们独特的行走方式来识别身份。这就像是写在我们身体摆动、迈步和平衡方式中的一种秘密代码。多年来,计算机一直试图破解这一代码,并使用了两只主要的“眼睛”:一只观察轮廓(silhouette)(即人的黑色阴影轮廓),另一只观察骨架(skeleton)(即关节位置的火柴人地图)。轮廓非常擅长观察整体形状,比如外套或背包,但当衣服改变时,它会产生困惑。骨架非常擅长观察身体结构,比如臀部或膝盖,但如果视频模糊或人被遮挡,它就会变得不稳定。科学家们面临的一大挑战是,如何教计算机同时使用这两只眼睛,而不让它们互相干扰,尤其是当那个“火柴人”在抖动,或者那个“影子”正在伪装时。
于是,由湖南中医药大学的研究人员提出的新方法 HierGait 登场了。你可以把 HierGait 想象成一位超级聪明的侦探,它不仅仅是在观察一个走路的人,还在三个不同的细节层面上对他们进行“访谈”,以确保识别准确。研究人员注意到,以往的方法遗漏了三个关键线索:它们没有仔细观察微小的快速动作;当骨架数据出现噪声时,它们会感到困惑;而且它们将走路视频中的每一帧都视为同等重要,即便有些帧只是无聊的停顿。
为了解决这些问题,HierGait 采用了三步走的策略。首先,它使用一个名为 AMSTB 的模块,充当一台能够对身体不同部位进行缩放的高速摄像机。正如你的手臂摆动速度与腿部不同,这个模块会观察不同的时间尺度,以捕捉那些让一个人的步态变得特别的微小、独特的微动作。其次,它通过一个名为 MC-SJSF 的模块来应对“噪声骨架”问题。想象一下,你试图将一个影子与一个火柴人匹配,但那个火柴人正在摇晃。这个模块利用基于关节高度(例如知道膝盖总是低于肩膀)的“结构图”来引导计算机。它迫使计算机正确地对齐影子和骨架,即使骨架数据有些混乱。最后,GTCFM 模块充当了一位电影剪辑师。它不是一次性观看整个走路视频,而是挑选出最精彩的“锚点帧”——即大幅度踢腿或蹬地的时刻——并忽略掉人只是静止站立的无聊部分。然后,它将这些高光时刻与走路的稳定整体节奏融合在一起,从而创建一个完美的总结。
这种方法的测试结果非常令人印象深刻。在步态识别的标准基准数据集 CASIA-B 上,HierGait 在正常行走时的 Rank-1 准确率达到了 98.8%,在背着包时为 96.3%,而在穿着厚重外套时为 93.2%。这些数字之所以意义重大,是因为“外套”场景通常是计算机处理起来最困难的情况,因为外套会完全改变一个人的形状。研究人员还在模拟更混乱、更真实世界条件的 CCPG 数据集上测试了该方法,HierGait 再次超越了其他顶尖方法,达到了 75.3% 的平均准确率。
论文指出,通过结合这三个层面的分析——局部细节、结构引导和全局编辑——该系统在应对服装变化和噪声数据时变得更加鲁棒(稳健)。然而,作者也谨慎地指出,该系统仍然依赖于初始骨架数据的质量;如果骨架检测完全失效,系统就无法发挥它的魔力。虽然这并不是解决监控领域所有问题的万能灵药,但它表明,一种层级化的、多步骤的方法是教计算机通过我们的步态来识别我们的一种非常强大的方式,即使我们试图用不同的装束来隐藏身份。
技术摘要:HierGait
问题陈述
步态识别是一种通过行走模式识别个体的生物特征识别技术,在现实世界的复杂场景中面临着重大挑战。虽然基于轮廓(silhouette)的方法随着深度学习的发展而有所改进,但它们对服装变化、携带物品导致的遮挡以及分割噪声仍然非常敏感。相反,基于骨架(skeleton)的方法提供了结构稳定性,但受限于噪声累积、关键点抖动以及在低分辨率或遮挡条件下的检测缺失问题。
现有的尝试融合轮廓与骨架的多模态方法遇到了三个主要局限性:
- 细粒度特征提取不足: 当前方法难以捕捉特定身体部位的差异化微运动模式,因为单尺度时间卷积无法覆盖异构的运动尺度(例如,快速的手臂摆动与较慢的躯干运动)。
- 缺乏用于对齐的结构先验: 直接的跨模态融合(例如通过交叉注意力机制)往往缺乏结构约束。当骨架数据存在噪声或视角不匹配时,注意力机制可能会将轮廓条带(silhouette strips)与解剖学上无关的关节进行错误对齐,从而导致错误的特征融合。
- 全局时间建模能力有限: 长步态序列包含关键运动片段(如腿部摆动)和冗余帧(如支撑阶段)的混合。现有方法通常将所有帧视为等同,或使用简单的池化操作,未能区分并优先处理具有辨识性的运动片段与冗余数据。
方法论
作者提出了 HierGait,一个旨在实现结构-时间协同优化的分层多模态步态识别框架。该框架遵循一个三阶段的协作流水线:局部时间增强、结构引导的对齐融合以及全局上下文重校准。
1. 自适应多尺度时间分支 (AMSTB)
为了解决特征提取不足的问题,AMSTB 在条带级(针对轮廓)和关节级(针对骨架)进行操作。
- 多尺度提取: 它采用具有不同卷积核大小的并行 1D 卷积分支,以捕获不同时间粒度的局部运动模式。
- 自适应聚合: 一个基于 MLP 的机制为时间段生成自适应权重,使模型能够选择性地聚合信息丰富的运动片段,同时抑制冗余帧。这增强了对细粒度微运动的敏感性。
2. 多通道空间-关节结构融合 (MC-SJSF)
为了解决跨模态对齐问题,MC-SJSF 引入了结构先验来引导融合过程。
- 关节重校准: 根据关节的运动幅度及其置信度分数对骨架关节进行重新加权,以抑制噪声或静止的关键点。
- FBPF 先验构建: 基于关节相对于轮廓条带的垂直位置构建高斯相关先验。这编码了解剖学对应关系(例如,上部关节对应上部条带)。
- 结构引导注意力: 该先验被作为偏置项引入到交叉注意力机制中。这约束了注意力分布,使其仅作用于解剖学上接近的“条带-关节”对,从而减少了由骨架噪声或视角变化引起的对齐偏差。
3. 全局时间上下文融合模块 (GTCFM)
为了改进全局时间建模,GTCFM 将长序列压缩为具有辨识性的表示。
- 运动感知采样: 该模块计算“运动能量”(基于一阶和二阶帧差)以识别关键运动片段。
- 双分支锚点建模: 它采样两组锚点帧:
- 敏感分支: 选择具有峰值运动能量的帧,以捕获具有辨识性的局部动态。
- 鲁棒分支: 选择时间间隔中心位置的帧,以保持全局结构的稳定性。
- 自适应门控融合: 双分支建模方法使用自适应门控融合来结合来自两个分支的全局上下文。生成的权重以残差形式写回原始特征,在保留关键帧信息的同时,有效地实现了全局上下文的重校准。
核心贡献
本文概述了四个主要贡献:
- HierGait 框架: 一个实现结构-时间协同优化的分层多模态框架,同时解决了局部细节、结构对齐和全局上下文的核心瓶颈。
- AMSTB 模块: 一种用于捕获多时间粒度局部运动模式并自适应聚合信息片段的机制,旨在增强细粒度的时间敏感性。
- MC-SJSF 模块: 一个基于关节垂直位置构建结构先验的融合模块。通过将此先验作为交叉注意力的偏置,它实现了结构引导的对齐,显著降低了骨架噪声的影响。
- GTCFM 模块: 一个全局上下文模块,采用敏感-鲁棒双分支锚点建模和自适应门控融合,以辨识性地利用关键帧与冗余帧。
实验结果
该方法在 CASIA-B 和 CCPG 数据集上进行了评估。
CASIA-B 性能: HierGait 在正常行走 (NM)、提包 (BG) 和服装变化 (CL) 条件下均取得了极具竞争力的 Rank-1 准确率:
- NM: 98.8%
- BG: 96.3%
- CL: 93.2%
- 平均值: 96.1%
- 重要性: 在极具挑战性的 CL 条件下,该模型表现出显著优于现有最先进方法(如 VPNet, α-Gait-T)的能力,而在该条件下其他方法的性能通常会大幅下降。
CCPG 性能: 在这个更复杂的真实世界数据集上,HierGait 达到了 75.3% 的平均准确率,超过第二名方法 (SPOSGait) 5.6 个百分点。它在所有子条件(CL, UP, DN, BG)下都展现出了强大的鲁棒性。
消融实验: 实验证实,每个模块(AMSTB, MC-SJSF, GTCFM)都对性能有独立的贡献,完整的三模块组合产生了最佳结果。具体而言,MC-SJSF 中的结构先验被证明对于减少对齐偏差至关重要,而 GTCFM 中的双分支设计被证明对于平衡敏感性与稳定性是必要的。
重要性与主张
作者声称,HierGait 通过超越单阶段融合,为解决多模态步态识别的核心瓶颈提供了一个新视角。该框架的主要意义在于其能够:
- 减轻外观扰动: 通过利用结构先验和多尺度时间建模,该方法在服装变化 (CL) 条件下保持了高度的鲁棒性,而这通常是仅基于轮廓或对齐不良的多模态方法的失效点。
- 优化结构对齐: 将解剖学先验引入注意力机制,为“噪声骨架”问题提供了解决方案,确保即使在姿态估计不完美的情况下,跨模态融合仍能保持解剖学的一致性。
- 平衡局部与全局建模: 局部时间增强与全局上下文重校准的协同优化,使得模型能够有效地从冗余帧中区分出关键运动片段,而不会出现过度平滑或丢失细粒度身份特征的问题。
论文最后指出,尽管该方法非常有效,但仍表现出对骨架估计质量的某种依赖性,这表明未来的工作应侧于开发更鲁棒的姿态噪声抑制机制。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。