A HamNoSys-Guided Dataset and Baselines for Fine-Grained Isolated Handshape Recognition in Sign Language
本文介绍了一个大规模、基于 HamNoSys 的数据集,包含来自 15 名参与者的 144,000 张 RGB 图像,涵盖 160 个手型类别,并通过在受试者相关和留一受试者测试评估协议下使用各种深度学习和机器学习模型,建立了基准性能,以推进细粒度手语识别。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
手语是完整且复杂的语言,拥有其自身的语法和结构,被全世界数百万人使用。正如口语是由声音构建而成,手语则是通过手部、面部和身体的物理动作构建而成的。其中最关键的构建模块之一是手势所呈现的形状。手指的一个微小弯曲或拇指位置的不同,都可能完全改变一个手势的含义,就像改变一个字母就能将一个单词变成另一个单词一样。为了让计算机理解或翻译这些语言,它们必须首先学会高精度地识别这些特定的手型。然而,创建一个能够做到这一点的计算机系统非常困难,因为人类的手在人与人之间存在很大差异,而且相似手型之间的区别可能极其细微。
研究人员长期以来一直寻求一种能够描述这些手型、且不属于特定国家或文化的通用语言。其中一种被称为“汉堡记谱法”(Hamburg Notation System)的系统,就像是一张关于手部配置的详细地图,将其分解为诸如手指选择和拇指位置等特定部分。虽然这个系统为手型应该呈现的样子提供了清晰的定义,但一直缺乏现实世界的真实数据来教计算机如何识别真人表现出的这些形状。由于缺乏展示这些特定形状的大量真实图像,计算机程序很难进行泛化,在遇到新的人或略微不同的角度时往往会失败。
为了填补这一空白,一个研究小组创建了一个全新的、大规模的数据集,旨在教计算机如何识别 160 种不同的手型。他们没有依赖计算机生成的图像或简单的绘图,而是记录了真实的人。十五名志愿者(均为大学生)被要求做出官方图表定义的 160 种特定手型中的每一种。研究人员设置了一个带有纯白背景和高清摄像机的受控环境。每位参与者保持要求的形状,并缓慢旋转手部,以便摄像机从不同角度捕捉动作。这一过程生成了 144,000 张单张彩色图像,创建了一个丰富的库,其中每一张照片都精确标注了它所代表的特定手型。
随后,研究人员测试了不同的计算机模型从这个新库中学习的效果。他们尝试了两种主要方法。第一种方法将图像作为一个整体来看待,就像人类一样,关注手部的整体外观、肤色和光照。第二种方法则完全忽略图像本身,仅专注于手部二十一个特定点(如指尖和关节)的数学坐标。他们以两种不同的方式测试了这些模型:在第一种测试中,计算机看到的图像是它在训练期间已经见过的,这模拟了系统已知用户的情况;在第二种更难的测试中,计算机看到的是它从未见过的人,迫使它依靠所学到的形状本身而非特定个人的表现来进行识别。
结果显示,识别一个人与识别一个形状之间存在明显的区别。当计算机在处理它已经见过的用户时,表现得非常好,使用表现最好的基于图像的模型,在超过 86% 的案例中正确识别了手型。然而,当计算机面对从未遇到的新面孔时,其准确率显著下降,降至约 45%。这种大幅下降表明,虽然计算机擅长识别熟悉的面孔模式,但它们仍然难以将手势的通用形状与其个人独特的表现方式区分开来。研究还发现,模型在处理那些看起来几乎完全相同、仅在微小细节(如单个手指的弯曲程度或拇指位置)上有所差异的手型时,出错率最高。
这项工作为未来的技术提供了坚实的基础。通过提供大量平衡的真实图像集,并测试计算机如何处理新用户,研究人员为该领域创建了一个标准工具。该数据集允许科学家构建更好的系统,这些系统最终可以帮助将手语翻译成文本或语音,从而帮助听障人士,或者帮助聋人更轻松地与听力正常的人交流。虽然目前的模型在识别陌生人的手势方面仍面临困难,但这一新资源为研究人员提供了一条改进这些系统的清晰路径,确保未来的技术能够理解人类双手那微妙而美丽的复杂性。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。