← 최신 논문
💻 computer science

Open Sign Bibles (OSB): An Open-Access Multilingual Sign Language Bibles Dataset

이 논문은 멀티모달 검색 및 대조 학습 연구를 용이하게 하기 위해 800개 이상의 구어와 병렬로 정렬된 20개의 수어 및 700시간 이상의 공개 라이선스 성경 영상을 포함하는, 이와 같은 유형 중 가장 규모가 크고 법적으로 제약이 없는 다국어 데이터셋인 Open Sign Bibles (OSB)를 소개한다.

원저자: Colin Leong, Joshua Nemecek, Kavitha Raju, Joel Mathew, Vijayan Asari, Elisabeth Leong

게시일 2026-08-20
📖 4 분 읽기☕ 가벼운 읽기

원저자: Colin Leong, Joshua Nemecek, Kavitha Raju, Joel Mathew, Vijayan Asari, Elisabeth Leong

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

언어는 인간이 생각을 공유하고, 이야기를 들려주며, 역사를 전수하기 위해 사용하는 주요한 도구입니다. 세계 대부분의 사람들에게 이는 소리와 말(음성)을 통해 이루어집니다. 하지만 수백만 명의 농인들에게 언어는 손의 움직임, 얼굴의 표정, 그리고 몸의 위치로 형성되는 시각적인 것입니다. 이것들이 바로 수어이며, 고유한 문법과 문화를 가진 별개의 복잡한 체계입니다. 그러나 디지털 시대에 이 언어들은 뒤처져 왔습니다. 컴퓨터는 텍-스트를 쉽게 검색하거나 음성 단어를 이해할 수 있지만, 수어를 "읽는" 데에는 어려움을 겪습니다. 긴 영상 속에서 특정 수어를 찾아내거나, 수어를 문장과 연결하는 데 필요한 기술을 구축하는 것은 그동안 충분한 데이터가 존재하지 않았기 때문에 매우 어려웠습니다. 기존의 수어 영상 컬렉션 대부분은 규모가 너무 작거나, 유료 결제 장벽 뒤에 숨겨져 있거나, 저작권에 의해 제한되어 있어 연구자들이 기계에게 수어라는 시각적 세계를 이해하도록 가르칠 데 필요한 원재고를 확보하는 데 어려움을 겪었습니다.

한 연구팀이 이제 이를 변화시키기 위해 설계된 거대한 새로운 자원인 '오픈 사인 바이블(Open Sign Bibles)' 데이터셋을 공개했습니다. 이 컬렉션은 20가지의 서로 다른 수어로 번역된 700시간 이상의 전문 번역 성경 영상을 모아놓은 것입니다. 인터넷에 흩어져 있거나 사용을 위해 특별한 허가가 필요했던 이전의 데이터셋들과 달리, 이 전체 라이브러리는 누구나 자유롭게 다운로드하고 연구할 수 있도록 공개되어 있습니다. 이 프로젝트는 이 영상들을 800개 이상의 다양한 구어(말)로 된 성경 텍스트와 연결하여, 시각적인 것과 기록된 것 사이의 가교를 만듭니다. 예를 들어, 미국 수어(ASL)로 수어하는 사람의 영상을 영어, 스페인어 또는 힌디어로 쓰인 동일한 이야기와 매칭함으로써, 연구자들은 컴퓨터가 수어와 그 의미 사이의 관계를 이해하도록 훈련시키는 강력한 도구를 만들어냈습니다.

이 데이터셋은 두 가지 주요 출처로 구축되었습니다. 첫 번째는 디지털 성경 라이브러리(Digital Bible Library)에서 온 것으로, 다양한 배경을 가진 수어 사용자들이 등장하며 종종 화면에 그래픽이나 텍스트가 동반되는 수천 개의 영상을 제공했습니다. 두 번째 출처는 인도에서 촬영된, 평범한 배경 앞에 단 한 명의 수어 사용자가 있는 로우(raw) 스튜디오 녹화본입니다. 총합하여, 이 컬렉션은 8,000개 이상의 개별 영상 클립을 포함하고 있습니다. 컴퓨터가 이 데이터를 유용하게 사용할 수 있도록, 팀은 단순히 영상을 온라인에 쏟아부은 것이 아니라 세심하게 정리했습니다. 그들은 모든 영상을 성경의 특정 구절과 연결하여, 컴퓨터가 어떤 이야기가 전달되고 있는지 정확히 알 수 있게 했습니다. 더 적은 부분의 영상들에 대해서는 한 걸음 더 나아가, "하나님(God)"이나 "날(day)"과 같은 특정 수어가 화면에 나타나는 정확한 순간을 수동으로 표시했습니다. 이러한 수준의 상세함은 단순한 영상 아카이브를 구조화된 학습 도구로 탈바け합니다.

연구진은 이 새로운 데이터셋을 사용하여 현재의 기술이 이러한 긴 영상 속에서 특정 수어를 얼마나 잘 찾아낼 수 있는지, 즉 "수어 탐지(sign spotting)"라고 불리는 과제를 테스트했습니다. 그들은 두 가지 다른 접근 방식을 시도했습니다. 첫 번째 방법은 영상 속 수어 사용자의 손과 몸 사이의 물리적 거리를 측정하여 알려진 사례들과 비교하는 것에 의존했습니다. 이 방식은 잘 작동하지 않았습니다. 컴퓨터는 연속적인 움직임의 흐름에 혼란을 느꼈고, 개별적인 수어를 안정적으로 골라내지 못했습니다. 두 번째 방법은 형태가 아닌 개념을 인식하는 인간처럼, 움직임 뒤에 숨겨진 의미를 이해하도록 학습된 더 발전된 시스템을 사용했습니다. 이 방식은 유망한 결과를 보여주었습니다. 이 시스템은 "날(day)"이나 "사람들(people)"과 같은 특정 수어를 높은 정확도로 성공적으로 식별해 냈습니다. 그러나 시스템은 여전히 다른 수어들에는 어려움을 겪었습니다. 시스템은 때때로 "남자(man)"와 "신(god)"처럼 모양은 비슷하지만 의미는 매우 다른 수어들을 혼동했습니다. 또한, 왼쪽 손을 사용하는 수어 사용자나 표준 사전 정의와 다른 문화적 맥락에서 사용되는 수어처럼, 학습한 예시와 다르게 수행된 수어를 인식하는 데 실패했습니다.

결과는 이 기술의 잠재력과 현재의 한계를 동시에 보여줍니다. 시스템은 분석 중인 영상이 자신이 훈련받은 예시와 매우 유사할 때 가장 잘 작동했습니다. 수어 사용자가 빠르게 움직이거나, 다른 쪽 손을 사용하거나, 독특한 의미를 가진 수어를 사용할 때 컴퓨터는 종로를 놓치는 경우가 많았습니다. 연구진은 기술이 몇몇 흔한 수어들을 안정적으로 찾아낼 수는 있지만, 아직 연속적인 대화의 전체적인 복잡성을 이해할 준비는 되지 않았다는 것을 발견했습니다. 그러나 데이터셋 자체는 중요한 진전입니다. 대규모의, 개방적이고, 법적으로 명확한 다국어 수어 영상 컬렉션을 제공함으로써, 연구진은 과학계에 토대를 구축할 수 있는 견고한 기반을 마련해 주었습니다. 그들은 적절한 데이터가 있다면 컴퓨터가 수어라는 시각적 언어를 배우기 시작할 수 있다는 것을 보여주었지만, 동시에 인간 표현의 미묘한 차이를 다루기 위해서는 훨씬 더 많은 작업이 필요하다는 점도 분명히 했습니다. 앞으로의 길은 더 다양한 예시를 수집하고, 모양은 비슷하지만 의미가 다른 수어들 사이의 미세한 차이를 더 잘 이해할 수 있도록 도구를 정교화하는 것을 포함합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →