JSL-DC: A Word-Level Japanese Sign Language Dataset with Linguist-Derived Descriptions for Distinguishing Confusable Signs
本文介绍了 JSL-DC,这是规模最大的以聋人(Deaf-centric)为中心的日本手语数据集,包含 36.7K 个视频以及针对易混淆手势的语言学家衍生描述,这使得新模型在具有挑战性的子集上能够超越现有最先进的识别方法 9.8%。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
对于许多聋哑儿童而言,最关键的语言发展时期发生在他们进入教室之前。在此期间,他们依赖父母来教导他们如何进行交流。然而,统计数据表明,百分之九十五的聋哑儿童出生在不懂手语的听力正常父母手中。这在家庭中造成了一个沉默的鸿沟,由于父母缺乏表达基本需求、情感或概念的词汇,导致他们难以与孩子建立联系。虽然存在可以帮助家长学习的在线视频,但真正的流利程度通常需要动手实践,而这种方法在缺乏合适工具的情况下很难实现规模化。为了构建有效的学习辅助工具,计算机科学家需要大量的视频数据,展示不同的人如何进行手语单词的动作。然而,对于日本手语(JSL)而言,此类数据一直非常匮乏,往往仅限于单个人或极少数单词,这使得计算机无法通过训练来识别新用户的语言。
一组研究人员现在填补了这一空白,创建了 JSL-DC,这是有史以来收集到的规模最大的日本手语视频集。该项目的驱动力来自于一个简单而深刻的认知:要教会计算机理解手语,数据必须来自每天使用它的人。研究人员没有雇佣演员或学生来模仿手势,而是招募了十九位将日本手语作为主要交流方式的聋人成年人。这些参与者记录了自己表演 270 个特定单词的过程,这些单词是专门为帮助听力正常的父母与年幼的孩子沟通而挑选的。最终形成的数据集包含超过 36,000 段视频,其容量是之前任何日本手语收藏的三倍。
这项工作的真正创新不仅在于数据的体量,还在于其策划方式。研究人员与聋人语言学家紧密合作,挑选出对早期儿童沟通最有用的词汇,优先选择动词和形容词而非名词,因为这些是早期句子的基石。更重要的是,团队识别出了成对的、在未经训练的人眼中看起来几乎完全相同但含义不同的手势。在许多情况下,这些手势仅在细微的面部动作或口型上有所区别,而这些线索是标准计算机视觉模型经常会忽略的。为了解决这个问题,语言学家提供了书面描述,准确解释了如何区分这些容易混淆的词对。例如,他们指出,“苦”的手势和“辣”的手势使用相同的手部动作,但需要不同的口型来区分。
研究人员随后测试了这些人类描述是否真的能提高计算机识别手语的能力。他们构建了一个系统,首先利用标准的视频分析来识别手势,如果该手势属于那些容易混淆的词对,系统则专门检查嘴部动作以做出最终判定。这种直接受语言学家笔记启发的方法,显著提高了计算机对困难手势的识别准确率。该系统对混淆词汇的正确识别率比现有的最佳方法高出近百分之十。这证明了将人类语言学知识融入机器学习模型,可以弥补纯视觉数据失效时的差距。
团队还通过将一款流行的街机游戏改编为学习工具,展示了这项技术如何应用于现实世界。在这个版本中,玩家通过做出一个单词的手势来释放一个彩色球进入其他球组成的区域。如果计算机正确识别了手势,球的颜色就会匹配并清除屏幕;如果手势错误,球的颜色就会出错。这种互动式游戏让听力正常的父母能够在低压力的环境下练习手语,并对其表现获得即时反馈。整个数据集,连同语言学描述和游戏软件,都将向公众开放,以加速进一步的研究与开发。
通过将项目核心置于聋人社区,从单词的选择到每一段视频的最终审核,研究人员确保了数据的真实性与可靠性。每段视频都经过了两轮聋人专家的检查,以确保手势表演正确,且背景中没有意外捕捉到个人信息。这一严谨的过程过滤掉了近百分之十的初始录制内容,留下了一个洁净、高质量的资源。这项工作表明,手语技术的未来在于语言学家与工程师之间的协作,即利用人类的洞察力来引导机器。随着这些工具的改进,它们为缩小日本各家庭中的沟通差距提供了一条切实的路径,让父母终于能够说出孩子的语言。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。