CLERF: Contrastive LEaRning for Full Range Head Pose Estimation
本文引入了 CLERF,这是一种利用 3D 感知生成对抗网络(3D-aware GANs)来克服数据稀疏性,并实现具有全范围头部姿态估计(包括对倒置姿态的准确预测以及对轻微图像旋转的鲁棒性)的最先进技术的创新对比学习框架。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图教一个机器人理解人类的肢体语言。你希望它能准确知道一个人是如何歪头的——是抬头看鸟,还是低头看手机,亦或是转圈圈。这项任务被称为头部姿态估计(Head Pose Estimation, HPE),它对于虚拟现实游戏或需要识别行人是否在注视自己的自动驾驶汽车等领域都至关重要。为了教会计算机这一点,我们通常会给它展示数以千计的人脸照片。但问题在于,在现实世界中,很难找到两张不同的人看向完全相同方向的照片。这就像是在一个拥挤的体育场里寻找两个盯着天花板上同一个微小尘埃点的陌生人一样困难。因为这些“匹配”对如此难以寻觅,一种强大的教学方法——“对比学习”(Contrastive Learning,通过比较相似事物来学习其共同特征)——在处理这项特定任务时陷入了泥潭。
现在,一群研究人员决定架起这座跨越泥沼的桥梁。他们创建了一个名为 CLERF(用于全范围头部姿态估计的对比学习)的新框架。他们不再等待宇宙为他们提供匹配的照片,而是使用一种特殊的 AI 生成器,实时创造出自己的“孪生”照片。他们还意识到,大多数现有的机器人大脑在处理即使是轻微倾斜或翻转的照片时表现都很糟糕;如果你把一张图片旋转 10 度,机器人就会感到困惑。然而,CLERF 的构建旨在应对整个 360 度的世界,包括倒置的头部,并且即使照片变得有些凌乱,它也能保持冷静。
问题所在:头部姿态中的“大海捞针”
把头部姿态估计想象成教学生识别方向。如果你只给他们看看向正前方或稍微向侧面看的照片,他们会成为专家。但如果你要求他们识别直视上方、直视下方甚至倒着看的动作,他们可能会失败,因为他们从未见过这些角度。
研究人员发现,尝试针对这种全范围运动使用“对比学习”几乎是不可能的。简单来说,对比学习就像是一个“找不同”的游戏,计算机通过将一个“目标”图像(锚点)与一个“匹配项”(正样本)以及一个“不匹配项”(负样本)进行比较来学习。为了学好,计算机需要看到许多看向相同方向的人的配对。但在庞大的 3D 头部运动空间中,找到两个看向完全相同方向的人在统计学上几乎是不可能的——概率不到 0.02%。由于缺乏这些匹配项,计算机无法学习角度之间的细微差别。
解决方案:魔镜与旋转室
为了解决这个问题,作者设计了一个聪明的两步走策略。
第一步:魔镜(合成孪生)
他们没有去寻找看向相同方向的真实人类,而是使用了一种“具备 3D 感知的 GAN”(一种可以生成逼真 3D 图像的 AI 类型)来创造一个合成孪生。想象一下,你有一张人向左看稍偏的照片。AI 会生成一张不同人的假照片,而那个人正看向与原图完全相同的方向。现在,计算机就拥有了一个完美的“正样本对”(匹配项)来进行研究。这通过在需要时随时创造出“针头”,解决了“大海捞针”的问题。
第二步:旋转室(几何变换)
研究人员意识到,仅仅拥有匹配项是不够的;他们需要教会计算机处理任何角度,包括那些奇怪的角度,比如倒着的头。他们在图像上应用了数学上的“翻转”和“旋转”。把这想象成拿着一张照片并旋转房间。如果你将一张人向左看的照片旋转 180 度,他们现在就是在向右看。通过对这些图像进行数学上的翻转和旋转,他们可以覆盖整个头部运动的球体,从 -180 到 180 度,确保计算机看到了所有可能的角度。
至关重要的是,他们证明了如果以完全相同的方式旋转或翻转一对匹配的图像,它们仍然是匹配的。这使得他们能够有效地使用对比学习,教会计算机理解一个向左看的头在本质上与一个向右看的头是不同的,即使照片是倒过来的。
研究发现:不会晕头的机器人
团队使用标准测试数据集对他们的 CLER 进行了测试,并将其与现有的顶尖模型进行了对比。结果如下:
- 在正常照片上: 在测试标准、正向的照片时,CLERF 的表现与顶尖模型不相上下。它并不是那种能瞬间让一切变得完美的灵丹妙药,但它足以应对。
- 在轻微倾斜的照片上: 这正是奇迹发生的地方。当研究人员将测试照片旋转 10 度或进行翻转(创建了他们所谓的“轻微增强”或 SA 版本)时,旧的模型开始踉跄。它们的准确率显著下降。然而,CLERF 依然稳如泰山。在这些棘手的、轻微旋转的图像上,它比次优模型精确了约 0.5 到 1.3 度。
- 在剧烈旋转的照片上: 当他们测试那些被大幅度旋转或翻转的图像(即“全范围”或 FA 版本)时,差异变得巨大。现有的模型,即使是那些声称可以处理全范围的模型,也会感到困惑,误差会增加超过 10 度。相比之下,CLERF 轻松应对了这些疯狂的角度,以巨大的优势超越了竞争对手。
研究人员还将计算机如何“观察”世界进行了可视化处理。他们展示了一个人进行全圆周转动的视频。旧的模型看到的转动者是一个模糊、混乱的影像,起始点和终点看起来过于相似。而 CLERF 则看到了一个清晰、平滑的圆圈,能够完美区分出那些距离很近的角度和距离很远的角度。
总结
论文表明,通过生成自己的“孪生”图像并对数据进行数学旋转,他们成功地教会了计算机以一种前所未有的方式理解头部姿态。他们不仅仅是做出了一个在完美照片上表现良好的模型;他们创造了一个足够鲁棒的模型,能够处理现实世界中凌乱、旋转和倒置的真实情况。虽然他们并未声称解决了计算机视觉中的所有问题,但他们证明了这种新方法可以实现一个“真正的全范围”模型,能够准确预测任何头部姿态,包括那些此前一直让最优秀的 AI 系统感到困惑的角度。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。