← 최신 논문
💻 computer science

Bidirectional Deaf-Hearing Communication: a Modular Service- Oriented System Combining Multi-Purpose Artificial Intelligence and 3D Avatar Rendering

이 논문은 청각 장애인과 비장애인 간의 포르투갈 수어(Libras)를 이용한 효과적인 실시간 양방향 통신을 가능하게 하기 위해 컴퓨터 비전, 딥러닝, 3D 아바타 렌더링을 통합한 모듈형 서비스 지향 시스템을 제시한다.

원저자: Telmo Adão, Somayeh Shahrabadi, Bruno Ribeiro, Duarte Dias, Vasco Alves, Filipe Pereira, Tiago Oliveira, Fábio Araújo, Luís Romero, Pedro Miguel Faria, Luís Gonzaga Magalhães

게시일 2026-08-25
📖 4 분 읽기☕ 가벼운 읽기

원저자: Telmo Adão, Somayeh Shahrabadi, Bruno Ribeiro, Duarte Dias, Vasco Alves, Filipe Pereira, Tiago Oliveira, Fábio Araújo, Luís Romero, Pedro Miguel Faria, Luís Gonzaga Magalhães

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

수 세기 동안 청각 장애인과 비장애인 사이의 근본적인 장벽은 단순한 감각의 불일치였습니다. 한 집단은 손과 얼굴을 이용한 시각적 언어로 소통하는 반면, 다른 집단은 목소리의 소리에 의존합니다. 기술은 오랫동안 음성을 텍스트로 변환하여 청각 장애인에게 전달하거나, 텍스트를 음성으로 변환하여 비장애인에게 전달하는 것을 가능하게 해왔지만, 실시간 대화에서 그 간극을 메우는 일은 여전히 매우 어려운 과제로 남아 있었습니다. 이 과제는 단순히 한 언어를 다른 언어로 변환하는 것뿐만 아니라, 완전히 다른 두 가지 방식의 세계 경험을 관리하는 것에 관한 것입니다. 청각 장애인은 손의 모양, 팔의 움직임, 몸의 위치, 그리고 얼굴 표정에 의미가 담긴 복잡한 체계인 수어를 사용합니다. 반면, 비장애인은 공기를 통해 전달되는 소리로 말합니다. 청각 장애인이 문장을 수어로 표현하면, 컴퓨터는 영상을 관찰하고 특정 움직임을 이해하여 이를 단어로 바꾸어야 합니다. 비장애인이 말을 하면, 컴퓨터는 그 단어들을 가져와 올바른 순서의 수인(sign)으로 분해한 뒤 이를 청각 장애인에게 보여주어야 합니다. 이 두 가지 작업을 대화의 흐름을 깨뜨리는 지연 없이 즉각적으로 수행하려면, 믿을 수 없을 정도로 빠르고 똑똑한 시스템이 필요합니다.

포르투갈의 한 연구팀은 바로 이 문제를 해결하기 위해 설계된 새로운 시스템을 구축하여, 청각 장애인과 비장로인이 최대한 자연스럽게 대화할 수 있도록 하는 디지털 가교를 만들었습니다. 그들은 자신들의 창조물을 양방향 대화를 위한 유니버설 번역기 역할을 하는 모듈형 플랫폼인 SLaDIS라고 부릅니다. 모든 것을 하나의 거대한 프로그램에 강제로 밀어 넣는 대신, 연구진은 이 시스템을 마치 잘 조직된 릴레이 경주처럼 함께 작동하는 세 개의 뚜렷한 부분으로 나누었습니다. 첫 번째 부분은 청각 장애인의 손과 얼굴을 관찰하고, 두 번째 부분은 비장애인의 말을 듣고 이를 수인으로 변환하며, 세 번째 부분은 실제로 대화가 이루어지는 화면입니다. 이 부분들을 분리하면서도 서로 연결함으로써, 시스템은 대화 속도를 늦추지 않으면서 컴퓨터 비전과 인공지능의 무거운 작업들을 처리할 수 있습니다.

여정은 청각 장애인이 말을 하고 싶을 때 시작됩니다. 그들은 휴대폰이나 컴퓨터의 카메라를 향해 메시지를 수어로 표현합니다. 시스템은 너무 느려지거나 너무 많은 데이터를 요구할 수 있는 영상의 모든 픽수(pixel)를 기억하려고 하지 않습니다. 대신, 특수한 도구를 사용하여 사람의 신체 주요 지점, 즉 손가락 마디, 팔꿈치, 어깨, 입술 끝 등을 찾아냅니다. 시스템은 이러한 지점들이 움직이는 것을 추적하여 동작의 단순화된 지도를 만듭니다. 이 지도는 이후 딥러닝 모델, 즉 포르투갈 수어의 수천 가지 사례를 학습한 인공지능 모델로 전달됩니다. 모델은 움직임의 순서를 살펴보고 특정 수인을 식별하여, 시각적 움직임을 단어 목록으로 변환합니다. 수어는 종식어(connecting words)를 생략하거나 구어와 다른 문장 구조를 사용하는 경우가 많기 때문에, 시스템은 이 단어 목록을 대규모 언어 모델(LLM)로 전달합니다. 이 두 번째 지능 계층은 유능한 편집자처럼 작동하여, 단어를 재배열하고, 필요한 문법을 추가하며, 문장을 매끄럽게 다듬어 비장애인이 완벽하게 이해할 수 있도록 만듭니다. 그 결과, 명확하고 자연스러운 문장이 화면에 나타나 비장애 참여자가 읽거나 들을 수 있게 됩니다.

비장애인이 답장을 하고 싶을 때는 과정이 역순으로 진행됩니다. 그들이 메시지를 입력하거나 말하면, 시스템은 즉시 이를 포르투갈 수어의 특정 글로스(gloss, 수어의 구성 단위)로 번역합니다. 이것은 단순히 단어를 일대일으로 바꾸는 것이 아닙니다. 시스템은 수어가 고유한 단어 순서와 문법 규칙을 가지고 있음을 이해합니다. 문장이 올바른 수인 순서로 변환되면, 시스템은 이를 청각 장애인에게 보여줄 준비를 합니다. 다운로드 시간이 걸리고 정확한 단어와 일치하지 않을 수 있는 실제 인간 수어사의 녹화 영상을 보내는 대신, 시스템은 3D 디지털 아바타를 사용합니다. 이 아바타는 애플리케이션 내부에 존재하는 가상의 인간입니다. 시스템은 라이브러리에서 각 수인에 해당하는 특정 애니메이션을 불러와 하나로 엮어, 유동적이고 연속적인 퍼포먼스를 만들어냅니다. 아바타는 실제 수어사처럼 손, 팔, 얼굴을 움직이며 메시지를 청각 장애 사용자의 화면에 직접 표시합니다.

연구진은 이 시스템이 실제 대화의 속도를 따라갈 수 있는지 확인하기 위해 광범위한 테스트를 실시했습니다. 그들은 수인을 인식하는 시스템 부분이 매우 정확하여, 테스트된 수인의 95.6%를 정확히 식별했다는 것을 발견했습니다. 시스템이 수인을 완전한 문장으로 변환했을 때, 그 의미는 의도된 메시지와 높은 유사성을 보였으며, 1.0이 완벽한 일치를 의미하는 척도에서 0.81점을 기록했습니다. 시스템의 속도 또한 인상적이었습니다. 수인을 인식하여 문장으로 변환하는 데 걸린 시간은 0.1초 미만이었으며, 비장애인이 메시지를 보낸 후 아바타가 움직이기 시작할 때까지 걸린 시간은 1초를 약간 상회했습니다. 이러한 속도는 끊김 없는 메시지 교환이 아닌, 자연스럽고 흐르는 듯한 대화처럼 느껴지기에 충분합니다.

시스템이 실제로 유용한지 확인하기 위해, 연구진은 포르투갈 청각 장애인 협회의 전문가들을 초빙하여 아바타를 평가하게 했습니다. 두 명의 독립적인 평가자가 아바타의 수어 수행을 지켜보며 메시지를 얼마나 잘 이해할 수 있는지 평가했습니다. 한 전문가는 수인의 90%를 이해했고, 다른 전문가는 78%를 이해했습니다. 연구에서는 애니메이션 품질이 높을 때 이해도가 완벽해졌다는 점을 언급하며, 움직임의 명확성이 단어의 정확도만큼 중요하다는 것을 시사했습니다. 또한 시스템은 쇼핑, 관광, 의료와 같은 다양한 환경에서의 대화를 처리할 수 있어 유연성을 입증했으며, 이는 일상생활에 필요한 다양한 어휘에 적응할 수 있음을 보여줍니다.

이 연구의 진정한 혁신은 이 조각들이 어떻게 맞물려 돌아가는지에 있습니다. 시스템을 서로 통신하는 독립적인 서비스들의 집합체로 설계함으로써, 연구진은 성장 가능한 플랫폼을 만들었습니다. 향약에 더 나은 AI 모델이 개발된다면, 전체 시스템을 다시 구축하지 않고도 이를 교체할 수 있습니다. 더 많은 수인이 라이브러리에 추가되어야 한다면, 번역 과정을 방해하지 않고도 이를 기록하여 추가할 수 있습니다. 이러한 접근 방식은 이 시스템이 단순한 일회성 실험이 아니라 진화할 수 있는 토대임을 의미합니다. 연구진은 현재 어휘가 언어의 풍부함에 비해 여전히 제한적이며, 텍스트에서 수어로의 번역이 더 많은 학습 데이터를 통해 더욱 유연해질 수 있다는 점을 인정합니다. 그러나 결과는 완전한 기능의 양방향 가교가 청각 장애인과 비장애인 세계 사이에서 이론적인 가능성일 뿐만 아니라, 진정한 인간적 연결에 필요한 속도와 신뢰성을 갖춘 작동하는 현실임을 입증합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →