← 최신 논문
💬 NLP

MoLGE: Mixture of Language Group Experts for Efficient Scaling of Massively Multilingual Speech Recognition

이 논문은 계층적 저계수 적응(Low-Rank Adaptation)과 언어 클러스터링을 결합하여 495개 언어에 걸쳐 대규모 다국어 음성 인식을 효율적으로 확장하고 다국어의 저주를 극복하며 최소한의 파라미터 오버헤드로 밀집형 베이스라인 모델들을 능가하는 MoLGE(Mixture of Language Group Experts) 프레임워크를 제안한다.

원저자: Sangmin Lee, Woojin Chung, Woongjib Choi, Hong-Goo Kang

게시일 2026-07-28
📖 3 분 읽기☕ 가벼운 읽기

원저자: Sangmin Lee, Woojin Chung, Woongjib Choi, Hong-Goo Kang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 세상의 모든 언어를 말할 수 있는 단 한 대의 아주 똑똑한 로봇을 가르치려 한다고 상상해 보세요. 당신은 이렇게 생각할지도 모릅니다. "쉬워! 지금까지 기록된 모든 책, 노래, 대화를 로봇에게 입력하기만 하면 돼." 하지만 여기 함정이 있습니다. 로봇의 뇌 크기는 제한되어 있다는 점입니다. 만약 수백 개의 언어를 하나의 작은 뇌에 억지로 밀어 넣으려 한다면, 로봇은 혼란에 빠지기 시작할 것입니다. 프랑스어와 파르시어를 헷갈리거나, 한동안 들어본 적 없는 언어로 "안녕"이라고 말하는 법을 잊어버릴 수도 있습니다. 이는 마치 단 한 세트의 손가락만을 가지고 오케스트라의 모든 악기를 배우려는 것과 같습니다. 바이올린과 드럼을 동시에 마스터하려고 하면 스스로의 발목을 잡게 되어 둘 다 잘할 수 없게 됩니다. 과학자들은 이를 "다국어의 저주(curse of multilingality)"라고 부릅니다. 이를 해결하기 위해 연구자들은 점점 더 큰 로봇의 뇌를 만들려고 노력해 왔지만, 이는 엄청난 양의 전기와 비용이 들기 때문에 모두에게 실용적이지 않습니다. 그렇다면 큰 질문이 생깁니다. 어떻게 하면 행성 크기만한 뇌를 필요로 하지 않으면서도, 수백 개의 언어를 잘 구사하는 로봇을 만들 수 있을까요?

여기서 연세대학교 연구진이 제안한 MoLGE(Mixture of Language Group Experts, 언어 그룹 전문가 혼합)라는 새로운 아이디어가 등장합니다. 로봇의 뇌를 더 크게 만드는 대신, 그들은 더 똑똑하게 조직하기로 했습니다. 로봇의 뇌를 하나의 거대한 지식 덩어리가 아니라, 바쁘게 돌아가는 주방이라고 생각해 보세요. 전통적인 주방에서는 한 명의 요리사가 스시부터 스파게티, 타코까지 메뉴에 있는 모든 요리를 만들려고 노력합니다. 그러면 요리사는 과부하가 걸리고 음식의 품질은 떨어집니다. MoLGE는 주방을 바꾸어, 전문적인 요리사 팀을 고용하되 약간의 반전을 줍니다. 모든 요리마다 요리사를 한 명씩 고용하는 대신(그것은 너무 비싸니까), 비슷한 요리들의 '그룹'을 담당할 요리사를 고용하는 것입니다.

작동 방식은 이렇습니다. 연구진은 언어가 마치 가족과 같다는 사실을 깨달았습니다. 스페인어와 이탈리아어는 사촌 관계이며, 문법과 소리를 많이 공유합니다. 일본어와 한국어도 나름의 방식으로 서로 연결되어 있습니다. MoLge는 이러한 '사촌' 언어들을 하나로 묶고, 그 전체 가족을 처리할 특정 '전문가(expert)' 모듈을 할당합니다. 따라서 한 명의 전문가는 모든 로맨스어군을 담당하고, 다른 전문가는 게르만어군을 담당하는 식입니다. 로봇이 스페인어로 된 문장을 들으면, 일본어 전문가에게 도움을 요청하는 것이 아니라 로맨스어 전문가에게 요청합니다. 이렇게 하면 로봇은 모든 언어를 처음부터 배울 필요 없이, 해당 그룹의 패턴만 배우면 됩니다.

또한 이 논문은 이 과정을 더욱 효율적으로 만들기 위한 영리한 기술을 소개합니다. 그들은 로봇의 뇌를 두 부분으로 나누었습니다. 원초적인 소리(리듬이나 높낮이 같은 것)를 다루는 하단 부분은 모든 이가 공유하는데, 왜냐하면 사람이 어떤 언어를 말하든 목소리는 어느 정도 비슷하게 들리기 때문입니다. 실제 의미와 구체적인 단어를 다루는 상단 부분은 바로 전문가들이 거주하는 곳입니다. 전문가들이 너무 무거워지거나 느려지지 않도록, 그들은 "LoRA"라는 기술을 사용합니다. 이는 요리사들에게 매 끼니마다 새로운 도구 상자를 통째로 들고 다니게 하는 대신, 가볍고 조절 가능한 도구 세트를 쥐여주는 것과 같습니다.

연구진은 13,758시간의 음성과 495개의 서로 다른 언어를 포함하는 방대한 데이터셋을 통해 이 아이디어를 테스트했습니다. 그들은 이 새로운 MoLGE 시스템을 기존의 "하나의 크기로 통일된(one-size-fits-all)" 로봇 및 무작위 그룹화 시스템과 비교했습니다. 결과는 유망했습니다: MoLGE는 특히 데이터가 많지 않은 언어들에 대해 음성 인식 성능이 일관되게 더 뛰어났습니다. 특히 다양한 언어의 복잡한 문자 체계를 다룰 때 오류를 크게 줄였습니다. 이 연구는 언어를 가족 관계나 지리적 위치에 따라 논리적인 그룹으로 조직함으로써, 불가능할 정도로 거대한 컴퓨터를 구축하지 않고도 음성 인식을 훨씬 더 효율적이고 정확하게 만들 수 있음을 시사합니다.

하지만 이 논문은 이것이 모든 것을 즉각적으로 해결하는 마법 지팡이는 아니라는 점을 주의 깊게 언급합니다. 연구진은 언어를 실제 가족 역사나 지리적 위치에 따라 그룹화하는 것이 단순히 컴퓨터가 스스로 그룹을 추측하게 하는 것보다 더 효과적이라는 것을 발견했습니다. 또한 이 방법이 단순한 소리 패턴보다는 복잡한 문자 체계를 가진 언어들에 특히 도움이 된다는 점도 발견했습니다. 궁극적으로, 이 논문은 구조화되고 스마트한 조직화가 언어 기술을 확장하는 강력한 방법이며, 막대한 비용이나 전력망을 낭비하지 않고도 더 많은 사람이 기계와 소통할 수 있도록 돕는 길을 제시한다고 제안합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →