← 最新论文
💻 computer science

A HamNoSys-Guided Dataset and Baselines for Fine-Grained Isolated Handshape Recognition in Sign Language

本文介绍了一个大规模、由 HamNoSys 指导的基准数据集,包含来自 15 名参与者的 144,000 张 RGB 图像,涵盖 160 个手型类别,通过使用各种深度学习模型建立了受试者相关和留一受试者基准,旨在推进细粒度孤立手型识别和手语技术的发展。

原作者: Ushnish Sarkar, Suvajit Patra, Bhaswar Chattopadhyay, Pranab Singha Roy, Tapas Samanta

发布于 2026-08-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Ushnish Sarkar, Suvajit Patra, Bhaswar Chattopadhyay, Pranab Singha Roy, Tapas Samanta

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个机器人理解人类的手语。这不仅仅是观察手部的挥动;这是在解码一套复杂的、无声的词汇,其中手型的形状、大拇指的角度或手指的弯曲程度都可能彻底改变一个词的意思。这就像是“竖起大拇指”与“大拇指向下”的区别——对人类来说,这显而易见,但对计算机而言,这两个手势仅仅是一组看起来极其相似的像素集合。这就是“细粒度手型识别”的世界,科学家们试图在这个领域构建数字字典,以读取人们构成手势时那些微妙且细小的差异。其目标是创造能够将手语翻译成文本或语音的工具,为数百万聋哑或听障人士架起沟通的桥梁。但要教会计算机这项技能,你需要一个海量的示例库,而直到现在,这个库一直缺少一个至关重要的、有组织的章节。

这时,一项研究出现了,它就像是手语领域的一位“首席图书管理员”。研究人员构建了一个庞大且组织严密的相册,其中包含由15个人拍摄的14.4万张手部照片。他们并非随机抓取照片,而是使用了一套名为 HamNoSys(汉堡符号系统)的特殊“规则书”。这套系统就像是语言学家用来描述手势的一种通用字母表,它不依赖于任何特定的口语。他们要求参与者摆出符合这套规则书中160种特定形状的手势,捕捉每一次扭转、旋转和手指的弯曲。

随后,团队测试了四种不同类型的“学生”计算机,以观察它们从这张相册中学习的效果。两名学生通过观察实际的照片进行学习(就像人类看图片一样),而另外两名学生则仅通过观察手部关节的骨架图进行学习(就像看火柴人简笔画一样)。他们进行了两场不同的考试:一场是学生学习的对象与被测试的对象是同一批人(一次友好的、简单的测试);另一场则是学生必须识别从未见过的陌生人的手势(一次更难的、现实世界的测试)。

以下是他们的发现:当计算机被允许学习并测试同一批受试者时,观察照片的学生表现得非常好,其中最先进的模型(名为 ViT-B/16 的模型)答对了约 86% 的题目。然而,当测试转向“未见过的受试者”时,得分显著下降,表现最好的模型也仅能答对约 45% 的题目。这表明,虽然计算机在识别通用手型方面做得不错,但在面对手部大小或风格不同的新使用者时,它们仍然难以实现泛化。该研究还强调,有些手型在视觉上极其相似——仅因手指的一个微小弯曲而有所不同——以至于即使是最优秀的模型也会感到困惑,将它们混淆,就像在人群中分辨双胞胎一样。

最终,这篇论文并不声称已经解决了手语识别的问题。相反,它提供了一个坚实且可复现的基础——一个高质量的新数据集和一套基准评分——其他研究人员可以利用这些成果来构建更好的工具。它向我们展示了当前技术的水平,并指出下一个重大挑战在于:如何教会计算机无论谁在做手势,都能准确识别出这些微妙的手型。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →