← 最新论文
💻 computer science

Label-Efficient Transfer Learning for Human Action Recognition Using Pretrained VideoMAE

本研究表明,结合轻量级线性分类器的冻结预训练 VideoMAE 编码器能够实现高度标签高效的人类动作识别,在仅需极少标注的情况下,在 UCF101 和 HMDB51 基准测试上取得了强劲性能,同时保持了稳定的优化过程和恒定的计算资源消耗。

原作者: Nousheen Taj

发布于 2026-09-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Nousheen Taj

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在计算机视觉领域,教机器理解人类动作长期以来一直是一个极其复杂的难题。几十年来,研究人员一直试图构建能够观看视频并识别一个人正在做什么的系统,无论是网球发球、握手还是跌倒。早期的尝试依赖于手工设计的规则,即由工程师手动定义运动的特征,但当摄像机角度发生变化或背景变得杂乱时,这些系统往往会失效。随着深度学习的到来,领域发生了转变,它允许计算机直接从原始视频数据中学习这些模式。然而,这种新方法付出了沉重的代价:它需要海量的标注视频,需要人类费力地观看数小时的片段并为每一个动作打上标签。这个过程缓慢、昂贵,且对于专家稀缺的专业任务来说往往是不可能的。为了解决这个问题,科学家们转向了自监督学习,这是一种让计算机通过尝试预测图像中缺失的部分,从而从海量无标签视频中学习的方法,实际上是在没有人类帮助的情况下,让机器自学运动的结构。剩下的问题是,这些自学成才的系统是否真的准备好应对现实世界——在现实世界中,带标签的数据通常很有限——还是它们仍然需要人类的高度监督才能正常工作。

印度西达甘加理工学院(Siddaganga Institute of Technology)的一位研究人员致力于通过测试一种特定类型的自监督模型——VideoMAE,来回答这个问题。想象一个读遍了图书馆里每一本书,却从未参加过考试的学生;研究人员想要观察,如果只给这个学生少量的样本答案进行学习,他能否答对考试题目。在这项研究中,研究人员使用了一个预训练的 VideoerMAE 模型,该模型已经通过重建成千上万个无标签片段中被遮盖的部分,学会了如何理解视频。他们冻结了这个模型的“大脑”,使其无法学习新知识,并在其上方附加了一个简单的、轻量级的分类器。这种设置使他们能够通过向模型输入不同数量的标注训练数据(范围从极小比例到完整数据集),来测试模型对人类动作的原始理解能力。他们在两个著名的动作识别基准数据集上测试了这种方法:一个是包含多样化体育运动和日常活动的 UCF101,另一个是更具挑战性的 HMDB51,后者包含了来自电影和公共数据库的片段,具有复杂的相机运动和多变的背景。

结果揭示了使用这些先进模型的清晰且具有实践意义的前行路径。当研究人员仅提供可用标注数据的百分之十时,系统仍然能以惊人的准确率识别动作。在 UCF101 数据集上,仅使用这一小部分标注示例,模型的识别率就接近百分之八十八。随着标注数据增加到百分之二十五和百分之五十,准确率稳步攀升,在使用完整数据集时达到了百分之九十二以上。然而,最重要的发现不仅在于该模型在少量数据下表现出色,还在于增加更多数据所带来的收益开始迅速递减。一旦系统获得了一半的标注训练样本,再增加剩余的一半所带来的性能提升非常微小。这表明自监督预训练已经捕捉到了理解人类运动所需的绝大部分视觉和时间信息,使得简单的分类器几乎不需要做太多工作来适应特定任务。

当研究人员测试难度更高的 HMDB51 数据集时,情况略有不同,但也同样具有启发性。由于这些视频更加杂乱,伴随着晃动的相机和复杂的背景,模型在仅使用百分之十标签时,起始准确率约为百分之五十二。然而,随着标注数据的增加,系统的提升幅度比在较容易的数据集上更为显著,最终在使用全监督时达到了百分之六十三以上的准确率。这表明,虽然自监督基础很强大,但现实环境越混乱、越复杂,额外的标注示例就越有价值。即便如此,该系统在仅使用一半数据时仍实现了很高的性能水平,证明了自学模型已经学习到了一种鲁棒的动作表示,能够处理显著的视觉变化,而无需完整的辅助指导。

除了最终得分外,研究人员还仔细观察了系统的学习过程及其消耗的资源。他们发现,在所有监督水平下,训练过程都表现得稳定且可预测,模型收敛平滑,没有出现异常行为。在计算能力方面,该方法非常高效。由于主模型是冻结的,只有顶层的微小层在进行训练,因此无论使用多少标注数据,所需的计算机内存都保持近乎恒定。训练所需的时间确实会随着数据的增加而增加,因为计算机必须处理更多的示例,但内存占用并没有增长。这意味着该方法具有可扩展性,并且不会为了处理更大的数据集而要求昂贵的硬件升级。研究还检查了模型出错的情况,发现错误主要集中在视觉特征相似的动作上,这是区分人类运动细微变化时的自然局限。

最终,这项工作证明了为每一个新应用都需要海量、完美标注视频数据集的时代可能即将结束。研究人员展示了通过无标签视频训练的模型可以作为一个强大的基础,用于识别人类动作,且仅需一小部分人工标注的工作量即可达到高性能。研究结果表明,对于许多实际应用,例如监控工厂安全或分析体育技术,组织机构可以依靠这些预训练系统来提供准确的结果,而无需承担为每一个视频帧进行标注的昂贵成本。虽然最困难的数据集仍然受益于额外的标注示例,但核心能力已存在于自监督模型中,这为将智能视频理解引入现实世界提供了一种实用且资源高效的解决方案。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →