← 최신 논문
💻 computer science

JSL-DC: A Word-Level Japanese Sign Language Dataset with Linguist-Derived Descriptions for Distinguishing Confusable Signs

이 논문은 36,700개의 비디오와 혼동하기 쉬운 수어에 대한 언어학자 유래 설명을 특징으로 하는 가장 큰 규모의 농인 중심 일본 수어 데이터셋인 JSL-DC를 소개하며, 이를 통해 새로운 모델이 까다로운 하위 집합에서 기존 최첨단 인식 방법보다 9.8% 더 우수한 성능을 발휘할 수 있게 합니다.

원저자: Ken Takaki, Asuka Ando, Misa Suzuki, Uiko Yano, Masaya Tsujimoto, Bill Neubauer, Ananay Vikram Gupta, Rose Shao, Matthias Hoppe, Sahir Shahryar, Celeste Mason, Kai Kunze, Yohei Oseki, Yoshihiro Kawaha
게시일 2026-08-20
📖 3 분 읽기☕ 가벼운 읽기

원저자: Ken Takaki, Asuka Ando, Misa Suzuki, Uiko Yano, Masaya Tsujimoto, Bill Neubauer, Ananay Vikram Gupta, Rose Shao, Matthias Hoppe, Sahir Shahryar, Celeste Mason, Kai Kunze, Yohei Oseki, Yoshihiro Kawahara, Thad Starner

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

많은 청각 장애 아동들에게 있어, 언어 발달을 위한 가장 결정적인 시기는 학교에 입학하기 전의 시기입니다. 이 시기에 아이들은 부모가 소통하는 법을 가르쳐 주기를 의지하게 됩니다. 그러나 통계에 따르면, 청각 장애 아동의 95%는 수어를 알지 못하는 청인 부모 밑에서 태어납니다. 이는 가정 내에 침묵의 간극을 만듭니다. 부모들이 기본적인 욕구나 감정, 혹은 개념을 표현할 어휘력이 부족하여 자녀와 연결되는 데 어려움을 겪게 되는 것입니다. 부모들이 수어를 배우는 데 도움을 주는 온라인 영상들이 존재하지만, 진정한 유창성을 위해서는 직접 해보는 실습이 필요한데, 적절한 도구 없이는 이를 확장하는 것이 어렵다는 점이 입증되었습니다. 효과적인 학습 보조 도구를 구축하기 위해, 컴퓨터 과학자들은 서로 다른 사람들이 일본 수어를 어떻게 수행하는지를 보여주는 방대한 비디오 데이터 라이브러리가 필요합니다. 하지만 일본 수어(JSL)의 경우, 이러한 데이터는 매우 희귀했으며 종종 단 한 명의 인물이나 적은 수의 단어로 제한되어 있어, 컴퓨터가 새로운 사용자로부터 언어를 인식하도록 훈련시키는 것이 불가능했습니다.

한 연구팀은 이제 JSL-DC를 구축함으로써 이 공백을 메웠으며, 이는 지금까지 수집된 일본 수어 영상 중 가장 큰 규모입니다. 이 프로젝트는 단순하지만 심오한 깨달음에서 시작되었습니다. 즉, 컴퓨터에게 수어를 이해시키려면 데이터가 그 언어를 매일 사용하는 사람들로부터 나와야 한다는 것입니다. 연구진은 배우를 고용하거나 학생들에게 수어를 흉내 내게 하는 대신, 일본 수어를 주요 의사소통 수단으로 사용하는 19명의 성인 청각 장애인을 모집했습니다. 참가자들은 청인 부모가 어린 자녀와 소통하는 데 특히 도움이 되도록 선정된 270개의 특정 단어를 수행하며 자신을 녹화했습니다. 결과적으로 생성된 데이터셋은 36,000개 이상의 영상을 포함하고 있으며, 이는 이전의 어떤 일본 수어 컬렉션보다 3배 더 큰 규모입니다.

이 작업의 진정한 혁신은 데이터의 양뿐만 아니라 그것을 어떻게 큐레이션했느냐에 있습니다. 연구진은 농담이나 명사보다는 동사와 형용사를 우선시하여, 초기 아동 의사소통에 가장 유용한 단어들을 선택하기 위해 농인 언어학자들과 긴밀히 협력했습니다. 이는 초기 문장의 구성 요소가 동사와 형용사이기 때문입니다. 더 중요한 것은, 연구팀이 훈련되지 않은 눈에는 거의 동일해 보이지만 서로 다른 의미를 지닌 수어 쌍을 식별해 냈다는 점입니다. 많은 경우, 이러한 수어들은 미세한 얼굴 움직임이나 입 모양의 차이로 구분되는데, 이는 표준 컴퓨터 비전 모델이 놓치기 쉬운 단서들입니다. 이를 해결하기 위해 언어학자들은 이 혼동되는 쌍들을 어떻게 구별할 수 있는지 설명하는 상세한 서면 설명을 제공했습니다. 예를 들어, '쓰다(bitter)'라는 수어와 '맵다(spicy)'라는 수어는 손 동작은 같지만, 이를 구별하기 위해 서로 다른 입 모양이 필요하다는 점을 기록했습니다.

연구진은 이후 이러한 인간의 설명이 컴퓨터의 수어 인식 능력을 실제로 향상시킬 수 있는지 테스트했습니다. 그들은 먼저 표준 비디오 분석을 사용하여 수어를 식별한 다음, 만약 해당 수어가 혼동되는 쌍 중 하나라면 최종 결정을 내리기 위해 입 모양을 구체적으로 조사하는 시스템을 구축했습니다. 언어학자들의 노트에서 직접 영감을 받은 이 접근 방식은 어려운 수어들에 대한 컴퓨터의 정확도를 크게 향 향상시켰습니다. 이 시스템은 기존의 최선 방법들보다 혼동되는 단어들을 거의 10% 더 정확하게 식별해 냈습니다. 이는 순수한 시각적 데이터가 실패하는 지점을 인간의 언어적 지식을 통합함으로써 메울 수 있음을 증명합니다.

연구팀은 또한 인기 있는 아케이드 게임을 학습 도구로 변형하여 이 기술이 실제 세상에서 어떻게 적용될 수 있는지 보여주었습니다. 이 버전에서 플레이어는 단어를 수어로 표현하여 다른 공들이 있는 영역으로 유색 공을 발사합니다. 컴퓨터가 수어를 올바르게 인식하면 공의 색상이 일치하여 화면을 비우고, 수어가 틀리면 공의 색상이 잘못됩니다. 이 상호작용적인 게임을 통해 청인 부모들은 압박감이 없는 환경에서 수어를 연습하며 자신의 수행에 대해 즉각적인 피드백을 받을 수 있습니다. 전체 데이터셋은 언어적 설명 및 게임 소프트웨어와 함께 추가적인 연구와 개발을 가속화하기 위해 대중에게 공개됩니다.

단어의 선택부터 모든 영상의 최종 검토에 이르기까지 프로젝트의 중심에 농인 커뮤니티를 둠으로써, 연구진은 데이터가 정통성 있고 신뢰할 수 있음을 보장했습니다. 모든 영상은 수어가 올바르게 수행되었는지, 그리고 배경에 개인 정보가 실수로 캡처되지 않았는지 확인하기 위해 두 명의 농인 전문가에 의해 두 번씩 검수되었습니다. 이러한 엄격한 과정은 초기 녹화본의 약 10%를 걸러내어 깨끗하고 고품질인 리소스를 남겼습니다. 이 작업은 수어 기술의 미래가 언어학자와 엔지니어 사이의 협업에 있으며, 기계를 안내하는 데 인간의 통찰력을 사용하는 데 있다는 것을 시사합니다. 이러한 도구들이 개선됨에 따라, 일본 전역의 가정 내 의사소통 간극을 좁히는 실질적인 경로를 제공하며, 부모들이 마침내 자녀의 언어로 말할 수 있게 해줄 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →