← 最新论文
💻 computer science

Skeleton-based Zero-Shot Spatio-Temporal Action Localization via Weakly-Supervised Pretraining

本文提出了一种新颖的基于骨架的零样本时空动作定位框架,该框架利用弱监督视觉-语言预训练和场景混合判别对比学习,在有效识别未见动作的同时,克服了高昂的标注成本。

原作者: Koshiro Nagano, Fumiaki Sato, Ryo Hachiuma, Kazuki Tsutsukawa, Taiki Sekii

发布于 2026-08-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Koshiro Nagano, Fumiaki Sato, Ryo Hachiuma, Kazuki Tsutsukawa, Taiki Sekii

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在计算机视觉领域,教机器理解人类动作是一个基础性的挑战,对于机器人技术、安全保障和自动化监控具有深远的影响。几十年来,研究人员一直依赖两种主要策略来破解这一难题。第一种策略观察整个场景,通过分析颜色、光照和背景来推测正在发生的事情。第二种策略则完全忽略场景,只关注人的移动骨架——即关节和肢体的特定排列方式。虽然第一种方法符合直觉,但当背景变化或光照不佳时往往会失效。第二种基于追踪骨架的方法对这些环境变化具有更强的鲁棒性,但在历史上却面临着一个不同的问题:它需要海量的人力投入来进行教学。为了训练计算机识别特定的动作(例如一个人跌倒或打斗),研究人员传统上必须在成千上万个视频的每一帧中,费力地在每个人周围画框,并精确标注他们正在做什么。这个过程极其昂贵且耗时,限制了教导计算机快速学习新动作的能力。

现在,一组研究人员开发出了一种新方法,绕过了这种沉重的手动标注负担,使计算机无需预先看到任何示例就能学会如何识别新动作。他们的研究方法详述于最近的一项研究中,引入了一种通过广泛、通用的视频描述而非逐帧标注来学习的系统。该系统不再是被告知“这个人是在这一秒钟在挥拳”,而是通过带有描述整体活动的简单文本标签(如“打高尔夫”或“驾驶”)的完整视频进行训练。通过使用一种将人类骨架的视觉数据与动作文本描述相匹配的技术,该系统学习到了一种通用的运动语言。一旦训练完成,它就可以观察一段包含它从未见过的动作的视频,并准确识别出是谁在做这个动作以及他们在做什么。研究人员证明,这种方法不仅在准确度上能媲美那些依赖大量详细标签训练的系统,而且在视频质量较差或背景杂乱时表现出显著的韧性。

这项创新的核心在于一种巧妙的信息处理转变,作者称之为“骨架-语言特征池化切换”(Skeleton-Language feature Pooling Switching)机制。想象一下这样一个系统:它首先通过听取一段对话的总结来理解房间的整体氛围,然后当被要求识别特定发言人时,它会切换焦点去聆听个体声音。在训练阶段,计算机查看一段视频,并将视频中所有人的骨架数据汇总成一个单一的摘要。然后,它将这个摘要与提供的整个视频的文本标签进行对比。这使得系统能够学习动作类型与单词之间的联系,而无需知道确切是谁在移动或何时在移动。然而,当系统进入测试阶段时,它会切换模式。它不再将视频作为一个整体来看待,而是转而单独隔离出每个人的骨架。由于它在训练阶段已经学习了运动模式与单词之间的联系,因此它现在可以观察单个人的骨架,并询问:“这看起来像‘挥拳’的文本描述吗?”这种切换使得系统能够定位特定人的特定动作,而无需在训练时见过这些特定人被标注过的视频。

为了使这一过程在多人同时运动的复杂场景中奏效,研究人员必须解决一个棘手的问题:如何在仅给定整个视频一个标签的情况下,教计算机区分不同的人。如果一个视频显示一个人在跑步,另一个人在走路,而标签仅仅是“锻炼”,计算机可能会对哪个动作属于哪个人感到困惑。为了解决这个问题,团队引入了一种名为“场景混合判别式对比学习”(Scene-Mixed Discriminative Contrastive Learning)的技术。该方法在训练过程中,通过人工手段将来自不同视频的片段混合在一起。通过创造一个多种动作并存的混乱环境,系统被迫学习它们之间的细微差别。它学会了辨别跑步者的动作与跳跃者的动作之间的不同,即使它们出现在同一个混合的上下文中。这确保了当系统遇到包含多个人的真实视频时,能够自信地将正确的动作分配给正确的人。

该方法的成果在几个用于评估计算机如何发现并标注视频动作的标准数据集上进行了测试。在一个包含二十四种不同动作的数据集上,这种新方法达到了 34.1% 的准确率,优于以往依赖于较不成熟训练的弱监督方法。更令人印象深刻的是,在专门用于追踪跌倒人员的数据集上,新系统达到了 73.3% 的准确率,显著超过了现有的依赖于追踪人员位置随时间变化的算法。研究人员还发现,他们的系统对低质量视频具有极强的鲁棒性。当输入视频出现模糊或丢帧时,依赖视觉外观的系统性能大幅下降,而基于骨架的系统则保持了高准确度。这表明,通过专注于身体结构而非场景外观,该系统可以在相机抖动或光线昏暗的现实世界条件下可靠运行。

另一个关键发现是该系统的效率。虽然许多能够理解视频和文本的现代人工智能模型需要数十亿个参数和庞大的计算能力来运行,但这种新方法所使用的模型仅包含约 7000 万个参数。尽管规模小得多,它在暴力行为数据集上的准确率达到了 84.0%,超越了许多更大、更复杂的模型。此外,该系统速度极快,处理视频的速率约为每秒 1900 帧,大约是用于类似任务的大型语言模型的 240 倍。这种高准确度、低计算成本以及无需昂贵重训即可学习新动作的能力,为部署能够适应新情况的智能监控和机器人系统提供了一条切实可行的路径。

研究结论指出,通过将重点从昂贵的逐帧标注转向更灵活的、由文本引导的学习过程,构建能够以以往仅限于重监督模型的水平理解人类动作的系统是可行的。研究人员已经证明,通过教授计算机身体运动与语言之间的关系,而不是强迫它记忆特定事件的每一种可能变化,来训练计算机识别未见过的动作是可行的。这种方法不仅降低了开发新动作识别系统所需的时间和成本,还创建了在面对现实世界混乱、不可预测的本质时更加稳健且具适应性的模型。随着技术的成熟,它将能够催生新一代的应用,例如监测安全、辅助体育分析或指导机器人,而无需承担长期以来作为领域瓶颈的手动数据标注的过高成本。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →