← 최신 논문
💻 computer science

SMART: MLLM-guided Temporal Alignment for Unifying Sign Language Recognition and Spotting

이 논문은 MLLM이 생성한 동작 기술과 멀티 스케일 시간 어댑터를 활용하여 효율적인 소규모 배치 비디오-텍스트 정렬 및 결합된 시간적 국소화를 통해 연속 수어 인식 및 탐지를 향상시키는 통합 프레임워크인 SMART를 제안한다.

원저자: Eunjee Choi, JungHoon Sung, Seongwhan Cho, Chu Xin, Younggeun Choi

게시일 2026-08-27
📖 4 분 읽기☕ 가벼운 읽기

원저자: Eunjee Choi, JungHoon Sung, Seongwhan Cho, Chu Xin, Younggeun Choi

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

수백만 명의 농인 및 난청인들에게 수어는 단순히 손동작의 집합이 아니라, 고유한 문법, 리듬, 그리고 뉘앙스를 가진 완전하고 흐르는 하나의 언어입니다. 구어체 단어들이 쉼 없이 문장 속에서 하나로 어우러지는 것처럼, 수어 역시 연속적인 흐름 속에서 서로 섞여 들어가는 경우가 많아 컴퓨터가 하나의 수어가 어디서 끝나고 다음 수어가 어디서 시작되는지 구분하는 것을 어렵게 만듭니다. 수십 년 동안 연구자들은 기계가 이러한 영상을 이해하도록 가르치려 노력해 왔지만, 그들은 한 가지 고질적인 장애물에 부딪혔습니다. 즉, 이러한 시스템을 훈련하기 위해 사용 가능한 데이터는 대개 최종 문장(전사된 내용)만을 제공할 뿐, 영상의 정확히 어느 순간이 특정 단어와 일치하는지는 알려주지 않는다는 점입니다. 이러한 정밀한 타이밍의 결여는 컴퓨터로 하여금 추측하게 만들며, 결과적으로 기계가 단어는 인식할 수 있어도 그 단어가 얼마나 지속되었는지 또는 어디서 시작되었는지는 알지 못하는 불규칙하고 고르지 못한 이해를 초래합니다. 이러한 세밀한 지식 없이는 진정으로 유창한 수어 번역기를 구축하는 것은 여전히 도달하기 어려운 목표로 남아 있습니다.

한국 단국대학교의 연구진은 이제 이 간극을 메우기 위한 새로운 접근 방식을 제안하며, SMART라고 불리는 시스템을 도입했습니다. 이들의 연구는 수어가 무엇인지 인식하는 것과 그 수어가 영상의 어느 시점에 발생하는지를 정확히 찾아내는 두 가지 과제를 동시에 해결합니다. 연구진은 문장 길이만을 바탕으로 단어의 경계를 추측하던 기존 방식에 의존하는 대신, 멀티모달 거대 언어 모델(multimodal large language model)이라 불리는 강력한 유형의 인공지능을 사용하는 프레임워크를 구축했습니다. 시스템이 학습을 시작하기도 전에, 이 AI는 세심한 관찰자로서 역할을 수행하며 수어 영상을 관찰하고, 매 순간 발생하는 손의 움직임과 얼굴 표정에 대한 상세한 설명을 작성합니다. 이러한 설명은 풍부한 의미론적 가이드 역할을 하며, 컴퓨터가 시각적 움직임을 특정 언어 개념과 연관 지어 학습하도록 돕습니다. 이는 마치 교사가 제스처를 가리키며 그 의미를 설명해 주는 것과 같습니다.

그 후 연구진은 영상의 변화를 주의 깊게 살피는 특화된 엔진을 설계했습니다. 일반적인 영상 분석 도구들은 종종 프레임을 개별적으로 살펴보는 반면, 이 새로운 시스템은 움직임의 흐름을 다양한 척도로 이해하도록 설계되어, 빠르고 날카로운 움직임부터 느리고 신중한 제스처까지 모두 포착합니다. 이러한 시간적 인지 능력과 앞서 생성된 상세한 텍스트 설명을 결합함으로써, 시스템은 컴퓨터가 한 번에 적은 양의 영상만을 처리할 때도 시각적 영상과 언어적 의미를 안정적이고 효율적인 방식으로 정렬하는 법을 배웁니다. 이를 통해 모델은 이전보다 훨씬 더 명확한 수어 역학 관계를 구축할 수 있게 됩니다.

이 연구에서 가장 중요한 혁신은 아마도 인식과 타이밍이라는 두 가지 과업을 동시에 처리하는 방식일 것입니다. 연구진은 수어를 식별하는 부분이 경계를 찾는 부분에 지식을 직접 전달하는 통합된 구조를 만들었습니다. 이전의 시도들에서는 이 두 과업이 별개로 취급되거나 타이밍 정보가 너무 희소하여 유용하지 않은 경우가 많았습니다. 여기서 시스템은 특정 수어를 인식하는 데 대한 확신도를 활용하여 해당 수의 시간적 경계를 더욱 날카롭게 다듬습니다. 즉, 컴퓨터에게 "이 단어가 '멈춤(stop)'이라는 것을 확신하니, 정확히 언제 시작하고 끝나는지 표시하자"라고 말하는 것과 같습니다. 이는 인식이 경계 찾이를 개선하고, 경계의 정밀한 타이밍이 다시 단어 인식을 더욱 정확하게 만드는 피드백 루프를 생성합니다.

연구팀은 독일어, 중국어, 그리고 두 종류의 서로 다른 한국 수어 컬렉션을 포함한 네 가지 서로 다른 수어 데이터셋을 통해 이 새로운 프레임워크를 테스트했습니다. 결과에 따르면, 이들의 방식은 수어의 순서를 인식하고 영상 내에서 위치를 정확히 찾아내는 데 있어 기존의 모든 최첨단 시스템보다 뛰어난 성능을 보였습니다. 한 대규모 데이터셋에서 이 시스템은 수어 인식 오류율을 1% 미만으로 낮추었으며, 이는 기존 방법들에 비해 상당한 개선입니다. 또한, 수어의 정확한 시작과 종료 시간을 찾아내라는 요청에 대해, 시스템은 전통적인 방식들을 훨씬 능가하는 정확도를 달양함으로써 두 과업이 실제로 상호 보완적임을 입증했습니다. 연구진은 언어 설명을 가이드로 사용하고 인식과 탐색 과업이 서로를 지원하게 함으로써, 오랫동안 이 분야를 괴롭혀 온 약한 감독(weak supervision)의 한계를 극적으로 극복할 수 있음을 발견했습니다.

이 연구는 유창한 수어 이해로 가는 길이 단순히 더 좋은 카메라나 더 빠른 프로세서를 갖추는 것이 아니라, 인간 움직임의 의미론적 풍부함을 이해하도록 기계에 가르치는 데 있음을 시사합니다. 움직임에 대한 상세한 설명을 생성하고 이를 학습 과정의 가이드로 사용함으로써, SMART 프레임워크는 컴퓨터가 인간의 지각에 근접한 수준의 세밀함으로 수어를 볼 수 있음을 보여줍니다. 이러한 결과는 언어 모델의 폭넓은 이해력과 영상 분석의 정밀한 타이밍을 결합하는 것이 강력한 시너지를 창출하며, 농인 및 난청인 커뮤니티를 위한 소통의 장벽을 마침내 허물 수 있는 유망한 새로운 방향을 제시한다는 것을 나타냅니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →