← 最新论文
💻 computer science

HierGait: Hierarchical multi-modal gait recognition method with structural–temporal co-optimization

HierGait 是一个层次化多模态步态识别框架,它集成了自适应多尺度时间增强、结构引导对齐融合以及全局上下文重校准,旨在克服细粒度运动捕捉、跨模态对齐和时间建模方面的局限性,并在 CASIA-B 数据集上实现了最先进的性能。

原作者: Jian Zhang, Ming Xu, Jinglei Zuo, Jun Liu, Yingying Peng

发布于 2026-08-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Jian Zhang, Ming Xu, Jinglei Zuo, Jun Liu, Yingying Peng

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图在繁忙的街道上认出一个朋友。你不需要看到他们的脸,只需要观察他们的步态。这就是步态识别(gait recognition)的魔力——它是计算机视觉的一个分支,通过人们独特的行走方式来识别身份。这就像是写在我们身体摆动、迈步和平衡方式中的一种秘密代码。多年来,计算机一直试图破解这一代码,并使用了两只主要的“眼睛”:一只观察轮廓(silhouette)(即人的黑色阴影轮廓),另一只观察骨架(skeleton)(即关节位置的火柴人地图)。轮廓非常擅长观察整体形状,比如外套或背包,但当衣服改变时,它会产生困惑。骨架非常擅长观察身体结构,比如臀部或膝盖,但如果视频模糊或人被遮挡,它就会变得不稳定。科学家们面临的一大挑战是,如何教计算机同时使用这两只眼睛,而不让它们互相干扰,尤其是当那个“火柴人”在抖动,或者那个“影子”正在伪装时。

于是,由湖南中医药大学的研究人员提出的新方法 HierGait 登场了。你可以把 HierGait 想象成一位超级聪明的侦探,它不仅仅是在观察一个走路的人,还在三个不同的细节层面上对他们进行“访谈”,以确保识别准确。研究人员注意到,以往的方法遗漏了三个关键线索:它们没有仔细观察微小的快速动作;当骨架数据出现噪声时,它们会感到困惑;而且它们将走路视频中的每一帧都视为同等重要,即便有些帧只是无聊的停顿。

为了解决这些问题,HierGait 采用了三步走的策略。首先,它使用一个名为 AMSTB 的模块,充当一台能够对身体不同部位进行缩放的高速摄像机。正如你的手臂摆动速度与腿部不同,这个模块会观察不同的时间尺度,以捕捉那些让一个人的步态变得特别的微小、独特的微动作。其次,它通过一个名为 MC-SJSF 的模块来应对“噪声骨架”问题。想象一下,你试图将一个影子与一个火柴人匹配,但那个火柴人正在摇晃。这个模块利用基于关节高度(例如知道膝盖总是低于肩膀)的“结构图”来引导计算机。它迫使计算机正确地对齐影子和骨架,即使骨架数据有些混乱。最后,GTCFM 模块充当了一位电影剪辑师。它不是一次性观看整个走路视频,而是挑选出最精彩的“锚点帧”——即大幅度踢腿或蹬地的时刻——并忽略掉人只是静止站立的无聊部分。然后,它将这些高光时刻与走路的稳定整体节奏融合在一起,从而创建一个完美的总结。

这种方法的测试结果非常令人印象深刻。在步态识别的标准基准数据集 CASIA-B 上,HierGait 在正常行走时的 Rank-1 准确率达到了 98.8%,在背着包时为 96.3%,而在穿着厚重外套时为 93.2%。这些数字之所以意义重大,是因为“外套”场景通常是计算机处理起来最困难的情况,因为外套会完全改变一个人的形状。研究人员还在模拟更混乱、更真实世界条件的 CCPG 数据集上测试了该方法,HierGait 再次超越了其他顶尖方法,达到了 75.3% 的平均准确率。

论文指出,通过结合这三个层面的分析——局部细节、结构引导和全局编辑——该系统在应对服装变化和噪声数据时变得更加鲁棒(稳健)。然而,作者也谨慎地指出,该系统仍然依赖于初始骨架数据的质量;如果骨架检测完全失效,系统就无法发挥它的魔力。虽然这并不是解决监控领域所有问题的万能灵药,但它表明,一种层级化的、多步骤的方法是教计算机通过我们的步态来识别我们的一种非常强大的方式,即使我们试图用不同的装束来隐藏身份。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →