TransHands: Repurposing Human Pose Encoders as Hand Pose Encoders
该论文介绍了 TransHands,这是一个与骨干网络无关的迁移学习框架,它通过重新利用预训练的人体运动编码器来有效地从 2D 输入中估计 3D 手部姿态,从而克服了大规模 3D 手部数据集稀缺的问题,并在多种架构和具有挑战性的第一视角场景中展示了持续的性能提升。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在计算机视觉领域,教会机器观察并理解人体是一个漫长的旅程。多年来,研究人员一直致力于构建能够追踪人体全身三维运动的系统,这些系统利用了海量的视频数据,其中每一个关节和肢体都被仔细地标注了出来。由于有大量的数据可以用来教学,这些系统已经非常擅长理解人类如何行走、奔跑或伸手。然而,一旦涉及到手部,情况就大不相同了。手部极其复杂,拥有数十个以错综复杂方式运动的小骨头和关节,而且用于教导计算机如何运作的数据却少得多。这种信息的匮乏使得通过简单的摄像头来可靠地追踪手部三维运动变得十分困难,而这一能力对于从虚拟现实到医疗康复的各个领域都至关重要。
来自都灵理工大学和意大利国家研究委员会的一个研究小组提出了一个巧妙的解决方案,以应对这种数据短缺。他们没有试图利用有限的手部数据从头开始构建一个新系统,而是提出了一个简单的问题:计算机已经学到的关于全身的知识,是否可以被复用来理解手部?他们开发了一个名为 TransHands 的新框架,充当了两者之间的桥梁。其核心思想是,虽然手部看起来与全身不同,但基本的运动规则——即关节如何连接、运动如何随时间平滑流动以及肢体如何构成——是共通的。通过将已经掌握了全身运动的强大计算机模型进行适配,使其专注于手部,研究人员发现他们可以在不需要海量新数据集的情况下实现高精度。
他们方法的核心是一个既尊重身体与手部差异,又利用其相似性的模块化系统。想象一下,一个计算机模型已经学习了多年人类骨架是如何运动的。这个模型非常擅长理解运动的流向,但当面对手部的特定布局时(手部的关节数量不同且形状不同),它会感到困惑。研究人员设计了一个特殊的适配器,它位于这个预训练模型的面前。这个适配器接收手部的原始数据并对其进行轻微的重塑,将手部独特的几何结构转化为该身体模型能够理解的格式。这就像是一个翻译器,将用一种语言编写的故事转换成另一种语言,让读者无需学习新的字母表即可欣赏叙事。一旦数据完成翻译,强大的身体模型就会对其进行处理,最后由一个解码器将结果转换回精确的手部三维坐标。
为了测试这个想法是否奏效,团队将该框架应用于四种不同类型的先进计算机模型,包括基于 Transformer 和图网络的模型。他们使用两步走的过程来训练这些系统。首先,他们保持主要的身体模型处于“冻结”状态,这意味着其内部知识是锁定的,仅对新的适配器和最终的解码器进行手部数据训练。这使得系统能够在学习如何将手部映射到身体理解的过程中,不会忘记已有的知识。在第二步中,他们小心地解锁了模型的深层,以让其专门针对手指细微且快速的运动进行微调。结果令人瞩目。在他们测试的所有不同模型中,使用预训练身体知识的系统表现始终优于从头开始训练的模型。在其中一个最佳案例中,与未使用身体知识的相同模型相比,该系统将预测手部位置的误差降低了 21% 以上。
研究还表明,该方法在面对现实世界的挑战时具有显著的鲁棒性。当在不同的环境(包括视角经常发生畸变的穿戴式摄像头第一视角)下进行测试时,该系统依然保持了准确性。即使输入的是来自标准 2D 手部检测器的带有噪声、不完美的图像数据(这是日常应用中的常见问题),它也表现良好。在直接对比中,该系统在一个极具挑战性的数据集上实现了约 93 毫米的平均误差,这足以媲美那些处理完整视频图像的更大型、更复杂的系统。或许最重要的一点是,研究表明该方法具有极高的效率。该系统仅使用四分之一的可用手部数据,就能达到与从头开始训练的模型相同的准确度水平。这表明,从身体运动中转移过来的知识非常强大,足以弥补特定手部样本的缺乏。
除了追踪位置之外,研究人员还发现,这些经过适配的模型所学习到的运动模式蕴含着丰富的意义。当他们利用系统的内部表示来识别特定的手势时,无论是在静态的第三人称视角还是动态的第一人称视角下,结果都非常出色。系统能以高准确度正确识别手势,证明它不仅学习了手的形状,还学习了运动的语义含义。这表明,从身体到手部的知识迁移不仅仅是一个数学技巧,更是一种捕捉人类运动基本物理特性和逻辑的方式。
这项工作为计算机视觉指明了一条新的道路,即在这一领域,特定数据的匮乏并不一定意味着死路一条。通过认识到运动原理在身体不同部位之间是通用的,研究人员证明了我们可以重新利用现有的强大工具来解决新问题。他们的发现表明,通过适当的适配,对人体运动的深度理解可以有效地被重新定向,从而理解手部复杂的舞动,为在现实应用中实现更准确、更易获取的三维手部追踪打开了大门。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。