Bridging communication between hearing and visually impaired individuals via speech recognition and synthesis
본 논문은 별도의 특수 하드웨어 없이도 음성을 고대비 텍스트로, 텍스트를 합성 음성으로 변환함으로써 청각 장애인과 시각 장애인 간의 양방향 소통을 용이하게 하며 약 90%의 운영 효율성을 달리는, MATLAB으로 개발된 비용 효율적인 소프트웨어 전용 음성 인식 및 합성 도구(SRST)를 제시한다.
원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
세상을 의사소통이 활발하게 이루어지는 거대하고 북적이는 파티라고 상상해 보세요. 대부분의 사람들에게 이것은 쉬운 일입니다. 당신이 말하면 친구가 듣고, 친구가 말하면 당신은 그들의 입술이 움직이는 것을 봅니다. 하지만 어떤 손님들에게 이 파티는 조금 고장 난 것처럼 느껴집니다. 만약 음악을 들을 수 없다면(청각 장애), 대화는 농담을 놓치게 되는 무성 영화를 보는 것과 같습니다. 만약 화면을 볼 수 없다면(시각 장애), 음악은 들릴지 몰라도 자막을 읽을 수 없기에 영화가 무엇에 관한 것인지 전혀 알 수 없습니다.
이 논문은 "보조 공학(Assistive Technology)"이라는 과학의 한 구석에 자리 잡고 있습니다. 이는 기본적으로 장애가 있는 사람들이 파티에 참여할 수 있도록 돕는 도구들을 만드는 분야입니다. 연구자들이 무엇을 했는지 이해하려면, 컴퓨터가 인간과 대화하기 위해 사용하는 두 가지 주요 기술을 알아야 합니다. 첫 번째는 **음성 인식(Speech Recognition)**으로, 이는 당신의 목소리를 듣고 이를 화면 위의 글자로 바꾸는 초고속 번역가와 같습니다. 두 ثاني는 **음성 합성(Speech Synthesis)**으로, 이는 그 반대로 글자를 가져와 컴퓨터 목소리로 소리 내어 읽어주는 것입니다. 보통 이러한 도구들은 들을 수는 있지만 볼 수 없는 사람, 혹은 볼 수는 있지만 들을 수 없는 사람들을 위해 설계됩니다. 하지만 청각 장애가 있는 사람이 시각 장애가 있는 사람과 대화를 시도할 때 어떤 일이 벌어질까요? 한 명은 대답을 들을 수 없고, 다른 한 명은 질문을 읽을 수 없는 루프에 갇히게 됩니다. 이 논문은 바로 그 특정한 끊어진 루프를 고치고자 합니다.
에티오피아 악숨 대학교(Aksum University)의 연구팀은 **음성 인식 및 합성 도구(SRST)**라는 디지털 다리를 구축했습니다. 이것은 단순히 소리만 전달하는 것이 아니라, 소리를 즉시 텍스트로 바꾸고 텍스트를 다시 소리로 바꾸는 양방향 무전기라고 생각하면 됩니다. 그들의 목표는 청각 장애인이 마이크에 대고 말하면 그 단어들이 화면에 크고 선명한 텍스트로 나타나 시각 장애인이 컴퓨터 목소리로 "들을" 수 있게 하고, 다시 시각 장애인이 말을 하면 그 목소리가 텍스트로 변해 청각 장애인이 읽을 수 있는 시스템을 만드는 것이었습니다.
이 프로젝트의 멋진 점은 그들이 화려한 새로운 로봇이나 비싼 하드웨어를 만들지 않았다는 것입니다. 대신, 그들은 일반적인 마이크와 스피커를 사용하여 표준 컴퓨터에서 실행되는 영리한 소프트웨어 프로그램을 작성했습니다. 이는 일반 노트북을 마법의 통신 장치로 바꾸는 것과 같습니다. 시스템은 두 가지 주요 방향으로 작동합니다. 한쪽에서는 시각 장애인의 목소리를 듣습니다. 시스템은 소리를 아주 작은 조각으로 나누고, 음성의 고유한 패턴(소리의 지문과 같은 것)을 분석한 뒤, 학습된 단어 목록과 그 패턴을 대조합니다. 무엇이 말해졌는지 파악하면, 청각 장애인이 읽을 수 있도록 화면에 고대비 텍스트로 단어를 출력합니다. 다른 쪽에서는 청각 장애인이 메시지를 입력합니다. 그러면 컴퓨터는 이 글자들을 가져와서 사람의 목소리 조각들(이음절, diphones라고 불리는)을 엮어 새로운 목소리를 만들어 메시지를 시각 장애인에게 소리 내어 읽어줍니다.
연구팀은 시끄러운 대학 실험실에서 사람들이 시스템에 대고 말하게 함으로써 자신들의 창작물을 테스트했습니다. 그들은 시스템이 약 **90%**의 확률로 메시지를 정확히 전달하며 꽤 잘 작동한다는 것을 발견했습니다. 시스템은 문장을 이해하는 것(89.5%)보다 단어를 개별적으로 인식하는 것(91.2%)에 약간 더 뛰어났으며, 배경 소음이 있을 때는 성능이 조금 더 떨어졌습니다(84.1%). 저자들은 몇몇 실수가 발생한 이유는 일부 단어들이 컴퓨터의 귀에는 쌍둥이처럼 매우 비슷하게 들리기 때문이라고 설명했습니다.
그들은 또한 이 시스템이 유연하다는 것을 발견했습니다. 복잡한 문법 규칙을 직접 코딩하지 않았기 때문에, 시스템은 영어, 티그리냐어, 암하라어가 섞인 대화도 성공적으로 인식할 수 있었습니다. 하지만 그들은 시스템이 아직 완벽하지 않다고 인정합니다. 가끔 갑작스러운 큰 소리(의자를 끄는 소리 등)가 발생하면 혼란을 겪을 수 있고, 컴퓨터가 너무 많은 단어를 한꺼번에 확인해야 할 경우 약간 느려질 수 있습니다.
연구자들은 이것이 완성된 상용 제품은 아니지만, 작동 가능한 프로토타입으로서 저비용의 소프트웨어 전용 솔루션이 어떻게 두 공동체 사이의 간극을 성공적으로 메울 수 있는지 증명한다고 결론지었습니다. 그들은 향로에 따라 번역 계층을 추가하면 사람들이 서로 다른 언어로 말하더라도 서로 이해할 수 있게 될 것이며, 더 좋은 마이크를 사용하면 배경 소음을 무시하는 데 도움이 될 것이라고 제안합니다. 하지만 현재로서는, 그들은 기술이 서로 다른 방식으로 세상을 경험하는 두 사람이 마침내 대화를 나눌 수 있도록 돕는 디지털 악수, 즉 견고한 토대를 마련했습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.