Bidirectional Deaf-Hearing Communication: a Modular Service- Oriented System Combining Multi-Purpose Artificial Intelligence and 3D Avatar Rendering
本文提出了一种模块化、面向服务的系统,该系统集成了计算机视觉、深度学习和 3D 化身渲染技术,旨在实现聋人与听人之间使用葡萄牙语手语进行的有效、近实时的双向通信。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
几个世纪以来,聋人与听人之间根本性的障碍在于一种简单的感官错位:一群人通过手部和面部的视觉语言进行交流,而另一群人则依赖声音。虽然技术长期以来一直允许我们将语音转化为文字供聋人阅读,或将文字转化为语音供听人聆听,但在实时对话中弥合这一差距仍然是一个极其困难的问题。挑战不仅在于将一种语言转换为另一种语言,还在于管理两种完全不同的感知世界的方式。聋人使用手语,这是一种复杂的系统,其意义由手的形状、手臂的动作、身体的位置以及面部的表情共同承载。相反,听人通过在空气中传播的声音进行交谈。当一名聋人签署一个句子时,计算机必须观察视频,理解特定的动作,并将其转化为文字。当一名听人说话时,计算机必须将这些词汇分解为正确的符号序列,然后展示给聋人。要在不破坏对话流畅性的情况下同时完成这两件事,需要一个既极其快速又极其智能的系统。
葡萄牙的一个研究小组构建了一个旨在解决这一问题的全新系统,创造了一个数字桥梁,让聋人和听人能够尽可能自然地进行交谈。他们将这一成果称为 SLaDIS,这是一个模块化平台,充当了双向对话的通用翻译器。研究人员并没有试图将所有内容强行塞进一个庞大的程序中,而是将系统分解为三个相互协作的独立部分,就像一场组织有序的接力赛。第一部分观察聋人的双手和面部;第二部分倾听听人的话语并将其转化为手语;第三部分则是实际进行对话的屏幕。通过保持这些部分的独立与连接,该系统可以在不减慢对话速度的情况下,处理计算机视觉和人工智能的高强度计算任务。
旅程始于一名聋人想要表达意图之时。他们通过手机或电脑上的摄像头对自己的信息进行手语表达。系统并不会尝试记忆视频中的每一个像素,因为那样速度太慢且需要过多的数据。相反,它使用一种专门的工具来寻找人体关键点——手指关节、肘部、肩膀以及嘴角。它追踪这些点的移动,从而创建一个简化的动作映射图。随后,这个映射图被输入到一个深度学习模型中,该模型经过了数千个葡萄牙手语实例的训练。该模型观察动作序列并识别出正在进行的特定手势,将视觉运动转化为单词列表。由于手语通常会省略一些微小的连接词,或者使用与口语不同的句子结构,系统随后会将这个单词列表传递给一个大型语言模型。这第二层智能就像一位得力的编辑,负责重新排列单词、添加必要的语法并平滑句子,使其对听人来说逻辑通顺。其结果是一个清晰、自然的句子,出现在屏幕上供听人阅读或聆听。
当听人想要回复时,过程则反向运作。他们输入或说出信息,系统会立即将其翻译成葡萄牙手语的特定“语素”(glosses)或构建块。这不仅仅是简单的词对词转换;系统理解手语拥有自己的规则和语法。一旦句子被转换为正确的符号序列,系统便准备好将其展示给聋用户。为了避免下载预录制的人类手语视频所带来的延迟,且避免无法匹配精确词汇的问题,系统使用了 3D 数字虚拟形象(avatar)。这个虚拟人在应用程序内部运行。系统从库中提取每个手势的特定动画并将其串联起来,创造出流畅、连续的表现。虚拟形象通过移动双手、手臂和面部来模仿真实的签名者,直接在聋用户的屏幕上展示信息。
研究人员对该系统进行了广泛测试,以观察其是否能跟上真实对话的速度。他们发现,识别手语的部分具有极高的准确性,对测试手势的识别正确率达到了 95.6%。当系统将这些手语转化为完整句子时,其含义与预期信息的相似度很高,在以 1.0 为完美匹配的量表中得分为 0.81。系统的速度同样令人印象深刻。识别一个手势并将其转化为句子的时间不到十分之一秒,而虚拟形象在听人发送消息后开始动作的时间仅为一秒多一点。这些速度足以让人感觉到是在进行自然的流利对话,而非僵硬的信息交换。
为了确保系统的实用性,研究人员邀请了来自葡萄牙聋人协会的专家来评估该虚拟形象。两名独立的评估员观看虚拟形象表演手语,并对其理解程度进行了评分。一位专家理解了 9 \textow 0% 的手势,而另一位理解了 78%。研究指出,当动画质量较高时,理解程度是完美的,这表明动作的清晰度与词汇的准确性同样重要。该系统还证明了其灵活性,能够处理购物、旅游和医疗等不同场景下的对话,显示出其能够适应日常生活中多样化词汇的能力。
这项工作的真正创新之处在于各组件是如何有机结合的。通过将系统设计为相互通信的独立服务集合,研究人员创建了一个可以不断成长的平台。如果未来开发出了更好的 AI 模型,可以直接进行替换而无需重建整个系统。如果需要增加更多手势到库中,也可以在不干扰翻译过程的情况下进行记录和添加。这种方法意味着该系统不仅仅是一次性的实验,而是一个可以进化的基础工具。研究人员承认,与语言的丰富性相比,目前的词汇量仍然有限,且通过更多训练数据,从文本到手语的转换可以变得更加流畅。然而,研究结果表明,聋人世界与听人世界之间一个功能完备的双向桥梁不仅是一个理论上的可能性,更是一个能够在所需的速度和可靠性下实现真实人类连接的现实工具。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。