Isolated Sign Language Recognition in Low-Resolution Videos via Privileged Knowledge Distillation
本文提出了一种特权知识蒸馏框架(PKD-ISLR),通过将判别性知识从多模态高分辨率教师模型迁移到低分辨率学生模型,从而提升了低分辨率视频中的孤立手语识别性能,并在 WLASL 和 ASLCitizen 基准测试上超越了现有基准模型。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在计算机视觉领域,机器在理解人类动作方面正变得越来越出色。它们可以观看一段视频,并告诉你一个人是在跑步、跳跃还是挥手。然而,有一种特定的运动对它们来说更难破译:手语。与简单的挥手不同,手语依赖于微小且精确的细节。手指精确的弧度、手腕细微的倾斜,或是面部表情转瞬即逝的变化,都可能完全改变一个词的意思。为了让计算机理解这些手势,它需要清晰地观察到这些精细的细节。
问题在于视频质量较差时。在现实世界中,摄像机捕捉到的画面往往是模糊、像素化或为了节省数据而经过压缩的。在这些低分辨率视频中,区分不同手势的关键细节消失了。在清晰的高清图像中看起来截然不同的手形,在分辨率下降后会变成一个模糊的色块。这使得标准的计算机程序几乎无法分辨相似的手势,从而为在并非总能提供高质量摄像机的日常场景中部署手语技术制造了重大障碍。
土耳其赫塞特帕大学(Hacettepe University)的研究人员针对这种专门针对模糊、低质量视频设计的挑战,开发了一种新方法。他们开发了一个系统,教计算机即使在视觉输入退化的情况下也能识别手语,而无需在实际工作期间让计算机看到高清图像。他们称这种方法为“特权知识蒸馏”(privileged knowledge distillation)框架,它通过一个两阶段的学习过程来运作。这类似于一个学生正在向一位拥有完美教科书的老师学习,而学生手里只有一份模糊的复印件。
在这个系统中,“老师”是一个强大的计算机模型,它使用高清视频进行训练,在这些视频中,每一根手指和每一个面部表情都清晰可见。至关重要的是,老师还看到了签名者的身体骨架图——这是一个展示关节和骨骼的数字轮廓,突出了动作的结构。这种骨架信息起到了引导作用,向老师展示了手部和手臂是如何定位的,即使视频本身略显模糊。老师通过结合清晰的视觉图像和这种结构图,学会了完美地识别手语。
“学生”是一个更简单的模型,它最终将在现实世界中使用。在训练期间,学生只看到低分辨率、模糊版本的视频,就像它在实际使用中看到的那样。它看不见高清细节,也看不见骨架图。然而,在学生学习的过程中,老师会观看同一节课并分享它的理解。老师并不会把高清视频或骨架图交给学生;相反,它分享的是它对该手势的“看法”。老师会告诉学生:“即便你看到的是一片模糊,但由于手部的形状方式,这看起来像是‘玉米’这个手势。”通过这种方式,老师将它对精细细节的知识转移给了学生。随着时间的推移,学生通过模仿老师正确的猜测,学会了从模糊视频中识别出老师认为重要的微妙模式。
研究人员在两个大型手语视频集上测试了这种方法,并通过创建低分辨率版本来模拟现实世界的条件。他们发现,这种新方法显著优于现有的方法。其他方法试图通过简单地放大模糊视频或尝试重建缺失的细节来解决问题,但这些策略无法有效地恢复丢失的信息。研究人员表明,在图像已经模糊之后再尝试修复图像是不够的;计算机需要在开始时就学会如何解读这种模糊。
他们的结果清晰且一致。在涉及数百种不同手势的测试中,该系统的识别正确率比他们对比过的任何其他方法都要高,包括那些专为高质量视频设计的强大模型。该系统在一个数据集上实现了约 77% 的准确率,在另一个数据集上达到了 82%,这比他们对比的次优方案有了实质性的提升。重要的是,该系统在实际使用时不需要任何额外的处理。一旦训练完成,学生模型就可以仅使用低分辨率视频在标准计算机上运行,无需计算身体骨架或增强图像质量。
该研究还探讨了系统的不同部分是如何促成其成功的。他们发现,老师所使用的骨架图质量至关重要;如果地图不准确,学生的学习效果就会变差。他们还发现,老师结合视觉图像和骨架图的方式也至关重要,不同的组合对于不同类型的手语数据有不同的效果。此外,他们发现让老师分享其最终的“猜测”比分享其原始内部数据更有效,这表明学生通过理解老师的结论,而不是试图模仿其内部机制,能学得更好。
这项工作证明了低分辨率手语识别并不是一个可以通过仅仅使用更好的摄像机或试图后期修复视频就能解决的问题。相反,这是一个关于计算机如何学习解释它所拥有的信息的问题。通过使用一个看到的比学生看到的还要多的老师,研究人员展示了计算机可以学习识别隐藏在模糊图像中的不可见细节。这种方法为使手语技术在现实世界中变得触手可及提供了一条切实可行的路径,因为在现实世界中,高清视频往往是一种奢侈品,而清晰的沟通却是一种必需品。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。