← 最新论文
💻 computer science

Human action recognition based on cascade graph convolutional network

本文提出了一种级联图卷积网络(CGCN),该网络利用运动感知层次邻接矩阵来动态建模关节相关性,并采用逐步级联架构来逐步对复杂度递增的动作进行分类,从而在多个数据集上实现了识别准确率与计算效率之间的卓越平衡。

原作者: Mengai Yan, Jianying Xiong, Ben Huang, Jiabin Chen, Leiyue Yao

发布于 2026-08-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Mengai Yan, Jianying Xiong, Ben Huang, Jiabin Chen, Leiyue Yao

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

要理解计算机如何识别人类动作,首先必须理解它如何“看”一个人。传统的视频分析通常依赖于场景中的颜色和形状,试图通过衣着或所处背景来识别一个人。这种方法非常脆弱;光照的变化或拥挤的人群都会让机器感到困惑。一种更稳健的方法侧重于骨架本身,即由肩膀、肘部和膝盖等关节位置定义的身体骨架图。通过追踪这些点随时间的变化,计算机可以忽略环境的干扰,纯粹专注于运动。这是基于骨架的动作识别的基础,该领域已从简单的规则遵循转向了复杂的学习系统。在这些系统中,一种被称为图卷积网络(graph convolutional network)的人工智能类型已成为标准工具。它将人体视为一个连接的图,其中关节是节点,连接它们的骨骼是边,这使得计算机能够学习身体一个部位的运动如何影响另一个部位。

尽管取得了这些进展,但一个显著的瓶颈仍然存在。大多数现有系统将每种运动都视为需要完整的、详细的全身体部图谱才能理解。它们强迫计算机为每一个动作处理全部十五个关节,无论是一个简单的挥手还是一个复杂的跳跃。这在计算上非常昂贵且缓慢,就像为了寻找一个单词而阅读整部百科全书一样。此外,这些系统通常依赖于固定的连接图谱,假设只有物理接触的关节才能相互影响。这忽略了复杂动作中发生的微妙的非物理关系,例如手部如何预判脚步的移动,或者躯干如何稳定伸展的手臂。其结果是,系统要么太慢无法用于实时应用,要么太僵化而无法捕捉细微的人类行为。

江西中医药大学和南昌大学的研究人员提出了一种新方法来解决速度和准确性这两个问题。他们开发了一个名为级联图卷积网络(Cascade Graph Convolutional Network)的系统。该系统并没有强迫计算机为每个动作分析全身,而是像安全检查站根据风险过滤人员一样,分阶段进行工作。该过程始于对身体的一个非常简单的观察,仅使用五个关键关节:头部和四肢的主要关节。如果计算机根据这些稀疏信息对其判断足够自信,它就会在此停止并宣布识别出动作。只有当动作模糊或复杂时,系统才会进入下一阶段,增加更多关节进行分析,首先增加到十个,最后增加到完整的十五个。这种逐步细化的方式意味着,像站立或行走这样的简单动作几乎可以瞬间完成识别,仅需极少的数据;而只有那些困难、微妙的动作才需要使用完整骨架的全部计算能力。

为了使该系统更加精确,研究人员还改变了计算机理解关节连接的方式。传统方法使用基于解剖学的静态图谱,即手只与肘部相连。然而,新系统学习的是一种基于运动本身而变化的动态图谱。它计算不同身体部位随时间相对于彼此的运动方式,从而识别出那些虽然物理上没有连接、但在功能上相互关联的隐藏关系。例如,它可以检测到膝盖运动的速度与手腕加速度之间的相关性,尽管两者在身体上相距甚远。通过将这种动态理解与更丰富的数据(不仅包括关节的位置,还包括它们运动的速度和加速度)相结合,该系统获得了对动作更深层次的理解。

团队在三个不同的数据集上测试了这种新方法,其中包括一个新收集的日常动作数据集。结果显示,该系统能够以极高的准确度识别动作,同时比以往的方法快得多。在 UT-3D 数据集上,新方法实现了 97.50% 的准确率,创下了新的最先进基准,比排名第二的方法高出 5.00 个百分点。在 Florence-3D 数据集上,它达到了 93.48%,仅次于一个速度慢得多且更复杂的系统。至关重要的是,新方法的效率极高。当其他系统处理单个动作需要数百毫秒时,这个级联系统通常在不到 16 毫秒内即可完成。在评估速度与准确性的整体平衡时,新方法获得了近乎完美的评分,而那些较慢但更准确的系统得分明显较低。

研究人员承认,他们的系统并非没有局限性。当身体部位被遮挡或多人重叠出现在画面中时,由于骨架图变得不完整,系统会表现得较为吃力。它还依赖于在受控环境中收集的数据,这意味着它可能尚未准备好应对繁忙街道或拥挤房间中那种混乱且不可预测的情况。然而,核心创新提供了一条清晰的路径。通过证明计算机不需要看到全身就能理解简单的动作,并通过教导机器去寻找运动部件之间的隐藏联系,这项工作证明了效率与智能可以并存。该系统不仅能识别一个人正在做什么,还能以一种此前仅限于更慢、更耗资源的模型的细微程度来理解动作,使实时、智能的运动分析成为可能。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →