← 最新论文
💻 computer science

Open Sign Bibles (OSB): An Open-Access Multilingual Sign Language Bibles Dataset

本文介绍了开放手语圣经(Open Sign Bibles, OSB),这是此类规模最大且在法律上无权利负担的多语言数据集,包含超过 700 小时以开放许可形式发布的 20 种手语视频,并与 800 多种口语语言的平行文本对齐,旨在促进多模态检索和对比学习研究。

原作者: Colin Leong, Joshua Nemecek, Kavitha Raju, Joel Mathew, Vijayan Asari, Elisabeth Leong

发布于 2026-08-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Colin Leong, Joshua Nemecek, Kavitha Raju, Joel Mathew, Vijayan Asari, Elisabeth Leong

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

语言是人类分享思想、讲述故事和传承历史的主要工具。对于世界上的大多数人来说,这通过声音和言语来实现。但对于数百万聋人而言,语言是视觉性的,由手部动作、面部表情和身体姿态构成。这些是手语,是拥有自身语法和文化的独特且复杂的系统。然而,在数字时代,这些语言却被遗忘了。虽然计算机可以轻松搜索文本或理解语音,但它们却难以“阅读”手语。由于缺乏足够的数据,开发能够在一长段视频中寻找特定手势,或将一个手势与一个书面句子相连接的技术一直非常困难。大多数现有的手语视频集合要么规模过小,要么被锁在付费墙后,或者受到版权限制,导致研究人员缺乏训练机器理解签名者视觉世界的原材料。

一支研究团队现在发布了一个旨在改变这一现状的海量新资源:Open Sign Bibles 数据集。该集合汇集了 20 种不同手语的 700 多小时专业翻译的圣经视频。与以往散落在互联网上或需要特殊许可才能使用的数据集不同,这整个库都是免费开放供任何人下载和研究的。该项目将这些视频与 800 多种口头语言的圣经文本相连,在视觉与书面之间架起了一座桥梁。通过将例如美国手语(ASL)的签名者视频与同一故事的英文、西班牙文或印地文文本进行匹配,研究人员创造了一个强大的工具,用于训练计算机理解手势与其含义之间的关系。

该数据集由两个主要来源构建。第一个来自数字圣经图书馆(Digital Bible Library),它提供了数千个视频,其中的签名者背景各异,通常伴有屏幕上的图形或文字。第二个来源是一组来自印度的原始录影室录像,展示了单一签名者在纯色背景下的影像。总计,该集合包含了超过 8,000 个独立的视频片段。为了让这些数据对计算机有用,团队并没有只是将视频上传到网上;他们对其进行了精心的组织。他们将每个视频都链接到特定的圣经章节,使计算机能够准确知道正在讲述的是哪个故事。对于其中较小一部分视频,他们甚至更进一步,手动标记了特定手势(如“上帝”或“天”)出现在屏幕上的精确时刻。这种细致程度将一个简单的视频存档变成了一个结构化的学习工具。

研究人员利用这个新数据集测试了当前技术在这些长视频中寻找特定手势(这项任务被称为“手势检测”)的效果如何。他们尝试了两种不同的方法。第一种方法依赖于测量视频中签名者双手与身体之间的物理距离,并将其与已知示例进行比较。这种方法效果不佳;计算机会被连续的动作流所迷惑,无法可靠地识别出单个手势。第二种方法使用了一种更先进的系统,该系统学习理解动作背后的含义,类似于人类识别概念而非仅仅是形状的方式。这种方法显示出了前景。它成功识别了一些手势,例如“天”或“人”,且具有很高的准确度。然而,该系统在处理其他手势时仍然感到吃力。它有时会混淆看起来相似但含义迥异的手势,例如“男人”和“神”。它也无法识别那些表现形式与所见示例不同的手势,例如左撇子签名者,或是在与标准词典定义不同的特定文化语境下使用的手势。

结果凸显了这项技术的潜力与当前的局限性。当系统分析的视频与其训练样本高度相似时,其表现最好。当签名者动作迅速、使用另一只手,或以独特的含义签署一个词时,计算机往往会失准。研究人员发现,虽然技术可以可靠地捕捉到一些常见的手势,但它尚未准备好理解连续对话的完整复杂性。然而,该数据集本身是一个重大的进步。通过提供一个大规模、开放且法律清晰的多语言手语视频集合,研究人员为科学界奠定了一个坚实的基石。他们表明,有了正确的数据,计算机可以开始学习聋人的视觉语言,但也明确指出,要处理人类表达的细微差别,还需要进行大量的工作。未来的路径在于收集更多样化的示例,并改进工具,以更好地理解那些看起来相似但意义不同的手势之间的微妙差异。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →