Omnilingual ASR: Open-Source Multilingual Speech Recognition for 1600+ Languages
이 논문은 70억 개의 파라미터를 가진 자기 지도 학습 아키텍처와 거대하고 다양한 학습 코퍼스를 활용하여 500개 이상의 미지원 언어를 포함한 1,660개 이상의 언어를 지원하며, 커뮤니티가 최소한의 데이터로 새로운 언어에 시스템을 쉽게 적응시킬 수 있도록 하는 확장 가능한 오픈 소스 음성 인식 모델 제품군인 Omnilingual ASR을 소개한다.
원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신에게 어떤 언어로 말하더라도 즉시 이해하고 받아 적을 수 있는 마법의 번역기가 있다고 상상해 보세요. 오랫동안 이 마법은 영어, 스페인어, 중국어와 같은 가장 대중적인 언어들에게만 작동했습니다. 만약 당신이 더 작고 덜 흔한 언어를 사용한다면, 번역기는 그저 멍하니 바라보거나 엉뚱한 추측을 할 뿐이었을 것입니다. 이것이 바로 자동 음성 인식(ASR)의 세계입니다. ASR은 말소리를 텍스트로 변환하는 기술입니다. 이것을 대화 내용을 듣고 타이핑하는 매우 빠른 서기라고 생각해보세요. 큰 과제는 세상에 7,000개가 넘는 언어가 있지만, 대부분의 서기들은 그중 아주 적은 부분만을 알고 있다는 점이었습니다. 새로운 언어를 배우는 데는 보통 방대한 양의 녹음된 대화 라이브러리와 컴퓨터를 가르칠 전문가 팀이 필요하며, 이는 비용이 많이 들고 느린 작업입니다. 하지만 만약 우리가 모든 언어가 작동하는 '패턴'을 학습하여, 단 몇 문장만 듣고도 거의 즉시 새로운 언어를 익힐 수 있는 서기를 만들 수 있다면 어떨까요? 그것이 바로 이 논문이 다루는 핵심 질문입니다. 어떻게 하면 '큰' 언어를 사용하는 소수만이 아닌, 모두를 위해 공정하고 접근 가능한 음성 기술을 만들 수 있을까요?
여기, Meta에서 선보인 새로운 오픈 소스 프로젝트인 Omnilingual ASR이 있습니다. 이것은 1,600개 이상의 언어를 구사하도록 설계된, 초강력한 다국어 능력을 갖춘 서기와 같습니다. 연구팀은 단순히 컴퓨터에게 더 많은 단어를 가르치려 한 것이 아닙니다. 그들은 AI가 이전에 들어본 적 없는 공동체의 녹음 데이터를 포함하여, 방대한 양의 음성 데이터로부터 학습한 거대하고 다양한 '두뇌'를 구축했습니다. 그들은 시스템을 다양한 크기로 제작했습니다. 강력한 컴퓨터를 위한 거대하고 매우 정확한 버전(70억 개의 파라미터)과, 간단한 휴대폰에서도 실행할 수 있는 작고 가벼운 버전(3억 개의 파라미터)이 그것입니다. 가장 흥-미로운 부분은 컴퓨터가 본 적 없는 언어를 처리하는 방식입니다. 이 시스템은 새로운 언어를 배우기 위해 데이터 라이브러리 전체를 필요로 하는 대신, 누군가가 말하고 쓰는 10개의 짧은 예시만으로도 학습할 수 있습니다. 마치 숙련된 요리사에게 새로운 과일의 사진과 그 과일을 사용한 요리 레시 recipe를 보여주는 것과 같습니다. 그러면 요리사는 그 과일을 천 번 맛보지 않고도 갑자기 그 요리를 만들어낼 수 있게 됩니다.
연구진은 이 새로운 시스템이 특히 데이터가 매우 적은 언어들에게 게임 체인저가 될 것이라는 사실을 발견했습니다. 테스트 결과, 이 모델은 1,200개 이상의 언어에 대해 10% 미만의 '문자 오류율'(얼마나 많은 글자를 틀렸는지 측정하는 점수)을 기록했습니다. 실제로 500개 이상의 언어에 대해서는, 어떤 음성 시스템도 이전에 해내지 못했던 최초의 전사(transcription)를 이 모델이 해냈습니다. 논문은 이 새로운 모델이 Whisper나 USM 같은 이전의 챔피언들을, 특히 희귀한 '롱테일(long-tail)' 언어들에서 능가한다는 것을 보여줍니다. 기존의 시스템들이 이러한 언어들에서 혼란을 느끼고 실패했던 반면, Omnilingual ASR은 침착함을 유지했습니다. 또한, 특정 소수 언어에 대해 시스템을 더욱 개선하고 싶다면, 아주 적은 컴퓨팅 파워와 단 몇 시간의 데이터만으로도 거대 모델에 필적하는 결과를 얻을 수 있도록 작은 버전들을 미세 조정(fine-tuning)할 수 있다는 점도 발견했습니다.
하지만 이 논문은 이것이 모든 것을 완벽하게 해결하는 마법 지팡이는 아니라는 점을 주의 깊게 명시하고 있습니다. 시스템은 여전히 학습 중이며, 본 적 없는 언어를 몇 가지 예시만으로 처리할 수는 있지만(제로샷 능력), 엄청난 양의 데이터로 특정 언어를 위해 특별히 훈련된 시스템만큼 성능이 뛰어나지는 않습니다. 저자들은 의료나 법률 전사와 같이 매우 중요한 용도의 경우, 여전히 인간이 작업을 재검토해야 한다고 제안합니다. 또한, 그들은 이 기술이 공동체가 자신들의 언어를 보존하고 자체적인 아카이브를 구축하기 위한 도구이지, 인간 화자를 대체하거나 일률적인 솔루션을 강요하기 위한 것이 아님을 강조합니다. 그들은 모든 코드와 데이터를 무료로 공개함으로써, 전 세계의 연구자와 공동체가 이 파티에 참여하여 디지털 세상에서 모든 언어가 목소리를 낼 수 있는 미래를 만드는 데 동참하기를 희망하고 있습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.