American Sign Language Recognition Using Mediapipe and Deep Learning: A Real-Time Approach
本文提出了一种实时、轻量级的美国手语识别系统,该系统利用 Google MediaPipe 进行手部关键点检测,并利用深度神经网络在消费级设备上实现了对静态 ASL 字母手势 98.49% 的分类准确率。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
对于许多人来说,沟通能力是理所当然的,是一种声音与意义的无缝流动。但对于聋哑或听障人士而言,世界往往呈现出一道沉默之墙,尤其是在与不懂手语的人交流时。美国手语(ASL)是一种丰富的视觉语言,其意义由手形、手指的动作以及手掌的位置所承载。几十年来,研究人员一直试图制造出能够观察一个人做手势并将其转化为文字的机器,希望能弥合这一差距。早期的尝试通常需要昂贵且笨重的设备,例如带有传感器的特制手套或能够识别深度的沉重摄像头,这使得该技术在日常使用中并不切实际。目标始终是寻找一种方法,仅通过一个简单的摄像头——比如笔记本电脑或手机内置的那种——来实现这种翻译,从而让任何人都能在任何地方使用这项技术。
拉合尔工程技术大学的阿姆娜·阿提克(Amna Atiq)最近的一项研究向这一目标迈出了重要一步。研究人员开发了一套系统,该系统可以利用一个标准的网络摄像头和一台计算机,实时识别美国手语字母中的静态字母。该系统并非依赖复杂的硬件,而是使用了一个名为 MediaPipe 的软件工具来充当“数字眼睛”。这个工具会扫描视频流,并找到人手上的二十一个特定点,例如拇指尖、指关节和手腕。它追踪这些点的移动,创建一个存在于三维空间中的手部数字骨架。通过专注于这些点的位置而非图像的原始像素,系统可以忽略背景杂乱或光照变化等干扰因素,只专注于手部的形状本身。
一旦软件映射了手部结构,它就会将这些信息发送给一个旨在学习模式的小型、高效的计算机程序。这个程序是一种被称为深度神经网络的人工智能,它通过收集超过六千个手势示例进行了训练。每个示例都展示了手部形成从 A 到 Z 的字母的过程。该程序学会了将这二十一个手部点的特定排列与正确的字母联系起来。为了测试其效果如何,研究人员将数据进行了拆分,利用大部分数据来教导程序,并保留另一部分用于测试其知识。结果令人震惊:该系统在近百分之九十九的测试案例中正确识别了手势。它能够足够快地跟上实时视频流,处理每一帧大约需要三十二毫秒,这足以让肉眼观察者感到是即时的。
研究还仔细观察了系统可能出错的地方。虽然它在大多数字母上表现出色,但偶尔会混淆那些看起来非常相似的字母,例如 M、N 和 T。这是一个自然的挑战,因为这些手势涉及手指位置的细微差别,如果视角不完美,即使是人类也很难区分。尽管存在这些小瑕疵,该系统证明了高精度并不需要庞大的超级计算机或专门的传感器。整个设置在配备八个吉字节内存的标准笔记本电脑上运行顺畅,证明了强大的辅助技术可以是轻量化且易于获取的。研究人员指出,该系统在处理静态手势(即保持不动的手势字母)时效果最好,而处理完整句子的连续流动动作则是未来仍需面对的更复杂的挑战。
这项工作的意义在于其对实用性的关注。通过剥离对手套、深度摄像头或高端显卡的依赖,这项研究表明,一个能够翻译手语的工具很快就能让任何拥有计算机和互联网连接的人使用。该系统不仅能识别形状,它还为那些可能因此陷入孤立的人群打开了一扇沟通之门。研究人员计划在此基础上进行发展,教导系统理解动态手势的流动,并将软件适配到移动设备上运行。目前,这一成就清晰地展示了:通过合适的软件与简单硬件的结合,我们可以开始拆除分隔听力人群与聋哑人群的障碍,将一个标准的网络摄像头转化为人类连接的桥梁。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。