← 最新の論文
💻 computer science

Open Sign Bibles (OSB): An Open-Access Multilingual Sign Language Bibles Dataset

本論文は、マルチモーダルな検索および対照学習の研究を促進するために、800以上の話し言葉の並行テキストに整合された20種類の手話による700時間以上のオープンライセンスの聖書動画で構成される、この種のものとしては最大かつ法的に制約のない多言語データセットであるOpen Sign Bibles (OSB) を紹介するものである。

原著者: Colin Leong, Joshua Nemecek, Kavitha Raju, Joel Mathew, Vijayan Asari, Elisabeth Leong

公開日 2026-08-20
📖 1 分で読めます☕ さくっと読める

原著者: Colin Leong, Joshua Nemecek, Kavitha Raju, Joel Mathew, Vijayan Asari, Elisabeth Leong

原論文は CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

言語は、人間が思考を共有し、物語を語り、歴史を伝承するために用いる主要な道具です。世界の大半の人々にとって、これは音と話し言葉を通じて行われます。しかし、ろう者である何百万人もの人々にとって、言語は視覚的なものであり、手の動き、顔の表情、そして身体の姿勢によって形作られます。これらは手話であり、独自の文法と文化を持つ、明確かつ複雑な体系です。しかし、デジタル時代において、これらの言語は取り残されてきました。コンピュータは書かれたテキストを容易に検索したり、話し言葉を理解したりすることができますが、手話を「読む」ことには苦戦しています。長い動画の中から特定のサイン(手話)を見つけ出したり、サインを書かれた文章に結びつけたりするために必要な技術を構築することは困難でした。なぜなら、単に十分なデータが存在しなかったからです。既存の手話ビデオのコレクションの多くは、規模が小さすぎるか、ペイウォールの後ろに隠されているか、あるいは著作権によって制限されており、研究者が機械に手話の視覚的世界を教えるための原材料を入手できない状態にありました。

研究チームは今、この状況を変えるために設計された大規模な新しいリソース、「Open Sign Bibles」データセットを公開しました。このコレクションは、20種類の異なる手話による、プロの翻訳による聖書ビデオ700時間以上を集めたものです。インターネット上に散在していたり、使用に特別な許可を必要としたりした以前のデータセットとは異なり、このライブラリ全体は誰でも自由にダウンロードして研究することができます。このプロジェクトは、これらのビデオを800以上の話し言葉による聖書のテキストと結びつけ、視覚的なものと書かれたものの間の架け橋を作っています。例えば、アメリカ手話(ASL)の署名者のビデオを、英語、スペイン語、またはヒンディー語で書かれた同じ物語と一致させることで、研究者たちは、コンピュータがサインとその意味の関係を理解するための強力なツールを作り上げました。

このデータセットは、主に2つのソースから構築されています。1つ目は、さまざまな背景を持つ署名者が登場し、しばしば画面上にグラフィックやテキストが添えられた数千本のビデオを提供するデジタル・バイブル・ライブラリからのものです。2つ目のソースは、プレーンな背景の前に一人の署名者がいる、インドからの生のリハーサル録画セットです。合計で、このコレクションには8,000個以上の個別のビデオクリップが含まれています。コンピュータにとって有用なデータにするために、チームは単にビデオをオンラインに放り込んだわけではありません。彼らは注意深く整理を行いました。彼らはすべてのビデオを聖書の特定の節にリンクさせ、コンピュータがどの物語が語られているのかを正確に把握できるようにしました。さらに、より少数のビデオについては、さらに踏み込み、「神」や「日」といった特定のサインが画面上に現れる正確な瞬間を手動でマークしました。このレベルの詳細さが、単純なビデオアーカイブを構造化された学習ツールへと変貌させています。

研究者たちは、この新しいデータセットを使用して、現在のテクノロジーがこれらの長いビデオの中から特定のサインを見つけ出す能力(「サイン・スポッティング」として知られるタスク)をテストしました。彼らは2つの異なるアプローチを試みました。最初のメソッドは、ビデオ内の署名者の手と身体の物理的な距離を測定し、既知の例と比較することに依存していました。このアプローチはうまくいきませんでした。コンピュータは連続的な動きのフローに混乱し、個々のサインを確実に選び出すことができなかったのです。2番目のメソッドは、人間が単なる形ではなく概念を認識するのと同様に、動きの背後にある意味を理解することを学習する、より高度なシステムを使用しました。このアプローチは有望な結果を示しました。それは、「日」や「人々」といった特定のサインを高い精度で特定することに成功しました。しかし、システムは他のサインについては依然として苦戦していました。見た目が似ているサイン、例えば「男」と「神」を、それらが非常に異なる意味を持っている場合でも混同してしまうことがありました。また、左利きの手によるサインや、標準的な辞書の定義とは異なる特定の文化的文脈で使用されるサインなど、見た目の例とは異なる方法で行われたサインを認識することにも失敗しました。

結果は、このテクノロジーの可能性と現在の限界の両方を浮き彫りにしています。システムは、分析しているビデオが、学習に使用された例と非常によく似ている場合に最もよく機能しました。署名者が素早く動いたり、異なる手を使ったり、あるいは独特の意味を持つ言葉をサインしたりすると、コンピュータはしばしば的外れな結果を出しました。研究者たちは、テクノロジーがいくつかの一般的なサインを確実に特定できる一方で、連続した会話の全容を理解する準備はまだ整っていないことを発見しました。しかし、データセット自体は大きな前進です。大規模で、オープンで、法的に明確な多言語の手話ビデオのコレクションを提供することで、研究者たちは科学界に強固な基礎を与えました。彼らは、適切なデータがあれば、コンピュータはデフ(ろう者)の視覚言語を学び始めることができることを示しましたが、同時に、人間の表現のニュアンスを扱うにはさらなる作業が必要であることも明らかにしました。今後の道のりは、より多様な例を集め、見た目は似ているが意味が異なるサインの微妙な違いをより良く理解するためのツールを洗練させていくことです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →