← 最新论文
🤖 AI

Deep Learning-Based Sign Language Recognition from Videos and Cross-Lingual Translation to Indian Vernaculars

本文提出了一种两阶段深度学习流水线,该流水线利用微调后的 VideoMAE Transformer 从视频中识别孤立的印度手语手势,并使用 NLLB-200 模型将生成的英文标签翻译成印地语、泰卢固语和孟加拉语,同时提供了一个 Streamlit 演示,并分析了在小规模数据集上的性能局限性。

原作者: Chandranath Adak, Ramesh Nandipalli

发布于 2026-06-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Chandranath Adak, Ramesh Nandipalli

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教一台电脑理解一种用双手和面部表情而非言语表达的秘密语言。这本质上就是这篇论文所做的事情,但有一个特别的转折:它通过使用英语作为中间人,帮助将印度手语 (ISL) 翻译成三种主要的印度口语(印地语、泰卢固语和孟加拉语)。

以下是他们如何构建这个系统的简单分解,使用了日常类比。

大局观:一场两阶段的接力赛

研究人员并没有试图教计算机直接从“手势”跳跃到“印地语单词”。那就像是试图直接教一只狗说法语一样。相反,他们设置了一个两阶段的接力赛

  1. 第一阶段(翻译员): 摄像机观察一个人的手势。一个智能 AI(称为 VideoMAE)观看视频并说:“啊,那个手势的意思是英文单词 'Happy'(快乐)。”
  2. 第二阶段(口译员): 一旦 AI 知道这个单词是 "Happy",它就会将这个词传递给第二个 AI(称为 NLLB)。这个第二个 AI 就像一个通晓多种语言的翻译家,能瞬间将英文单词 "Happy" 转化为 "Khush"(印地语)、"Santosham"(泰卢固语)和 "Sukhi"(孟加拉语)。

食材:他们使用了什么

  • 老师 (VideoMAE): 把这想象成一个已经看过数百万小时普通视频(如电影和运动)并学会了识别动作的“优等生”。研究人员拿走了这个“超级学生”,并给他们进行了一场针对手语视频的速成班。
  • 教科书 (数据集): 由于计算机存储限制,他们并没有使用整个手语视频库。相反,他们使用了一份来自 IIT Madras 的精选“学习指南”。这份指南包含了仅有 13 个特定手势(如“大声”、“安静”、“帽子”、“连衣裙”、“聋”、“盲”)的视频。
  • 测试: 他们将这份小型的学习指南分成了“练习题”(训练)和“期末考试”(验证)。

表现如何:成绩单

结果既有“A+”也有“需要改进”,这在利用有限的练习学习新技能时是很常见的。

  • 练习阶段 (训练): AI 学习了 13 个手势,准确率达到了 99%。这就像是一个完美背诵了闪卡的学生。
  • 期末考试 (验证): 当测试全新的、未见过的视频时,准确率降至 78%。这仍然是一个很高的分数,但也表明 AI 有点过于专注于死记硬背练习卡片,而不是真正理解概念。

AI 在哪里卡住了(小故障):
论文强调了两种特定的混淆类型,就像一个会混淆相似单词的学生:

  1. “衣物”混淆: AI 有时会混淆服装类的手势。例如,它可能会把“帽子”的手势误认为“连衣裙”或“衬衫”或“西装”。这很有道理,因为这些手势通常涉及头部或躯干附近相似的手部动作。
  2. “感觉”混淆: AI 在处理抽象概念时遇到了困难,比如“美丽”、“丑陋”、“聋”和“盲”。它经常将这些概念或“悲伤”这个词混淆。研究人员怀疑这是因为这些手势高度依赖面部表情,而 AI 没有足够的示例来学习细微的差别。

演示:用户友好的工具

团队不仅停留在数学层面;他们还构建了一个 Streamlit app(一个简单的 Web 界面)。

  • 它是如何工作的: 用户上传一段某人做手势的短视频。
  • 发生了什么: 该应用提取 16 帧(就像拍下 16 张快速快照),通过 AI 进行处理,并显示结果。
  • 输出内容: 它显示英文单词(例如 "Happy"),并立即将其翻译成印地语、泰卢固语和孟加拉语脚本。

局限性:这个系统目前还不能做到的事

作者非常诚实地说明了他们工作的边界。这还不是一个可以翻译整场对话的魔杖。

  • 一次一个单词: 该系统只能理解孤立的单词(如“帽子”)。它无法理解完整的句子,比如“我戴着一顶帽子”。它就像一本只认识单词但不懂语法词典。
  • 词汇量小: 它只认识 13 个特定的单词。如果你做其他手势,它将不知道该做什么。
  • 非实时速度: 它是为处理上传的视频而设计的,而不是为了实时观看现场手势并进行翻译。
  • 语境问题: 因为它翻译的是单个单词,所以可能会产生混淆。例如,“Suit”这个词可以指一件衣服,也可以指“适合某人”。没有完整的句子,计算机只能靠猜测。

底线

这篇论文是一个概念验证。它证明了你可以利用强大的视频 AI,教它一些手语单词,并将其连接到翻译 AI,从而架起手语与印度地区语言之间的桥梁。虽然它现在还没准备好取代法庭或医院的人类翻译员,但它是一个正在运行的原型,展示了让技术对印度的听障群体更具无障碍性的发展路径。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →