MEUSLI: a Multilingual Projector for LLM-based ASR and Beyond
이 논문은 Whisper 음성 인코더를 오픈 소스 LLM과 연결하여 28개 유럽 언어에 걸쳐 확장 가능한 엔드 투 엔드 자동 음성 인식 및 기타 음성 이해 작업을 가능하게 하는 최초의 오픈 사이언스 다국어 프로젝터 제품군인 MEUSLI를 소개합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
세상의 모든 텍스트를 읽고 쓸 수 있지만, 소리는 전혀 듣지 못하는 완전히 귀가 먹은 슈퍼 스마트 로봇 뇌를 가진 당신을 상상해 보세요. 반면에, 소리를 완벽하게 들을 수는 있지만 그 의미는 이해하지 못하는 슈퍼 귀를 가진 당신이 있습니다. 오랫동안 이들이 서로 대화하게 만들기 위해 엔지니어들은 투박한 중개인을 만들어야 했습니다. 소리가 번역기로 전달된 다음, 텍스트 변환기를 거쳐, 마지막으로 뇌로 전달되는 방식이었죠. 이는 느렸고, 만약 번역기가 실수를 하면 뇌는 혼란에 빠졌습니다.
최근 과학자들은 "슈퍼 귀"와 "슈퍼 뇌" 사이에 직접적인 다리를 놓는 방법을 알아냈습니다. 이 다리의 이름은 **프로젝터(projector)**입니다. 이것은 마치 유니버설 어댑터 플러그처럼 생각하면 됩니다. 이것은 소리로부터 오는 가공되지 않은 전기 신호를 받아 즉시 뇌가 이해하는 언어로 번역하여, 두 존재가 직접 대화할 수 있게 해줍니다. 이것이 바로 **음성 언어 모델(SLM)**의 세계입니다. 연구자들이 던지는 큰 질문은, 영어를 사용하는 사람뿐만 아니라 모든 사람을 위한 이러한 어댑터를 만들 수 있는가 하는 것입니다. 만 만약 가능하다면, 우리는 디지털 대화에서 소외되었던 수천 개의 언어, 특히 화자가 매우 적거나 기록된 데이터가 충분하지 않은 언어들에 드디어 목소리를 부여할 수 있을 것입니다.
여기에 28개의 유럽 언어를 위한 마스터 키 역할을 하는 새로운 프로젝트인 MEUSLI가 등장합니다. 연구진은 강력한 소리 귀(Whisper라고 불리는)를 오픈 소스 기반의 다국어 로봇 뇌에 연결하는 일련의 "어댑터 플러그"를 구축했습니다. 그들의 주요 발견은 이 시스템이 스페인어나 독일어 같은 흔한 언어뿐만 아니라 브르타뉴어나 몰타어 같은 희귀한 언어에도 놀라울 정도로 잘 작동한다는 것입니다. 그들은 만약 여러분이 미리 만들어진 다국어 어댑터로 시작한다면, 아주 적은 양의 데이터, 때로는 단 46분의 오디오만으로도 새로운 언어를 가르칠 수 있다는 것을 발견했습니다.
하지만 주의할 점이 있습니다. 만약 아무런 주의 없이 이 어댑터에 새로운 언어를 가르치려 한다면, 이 시스템은 마치 새로운 시험 공부를 하느라 예전 숙제를 즉시 잊어버리는 학생처럼, 원래 알고 있던 28개 언어에 대한 모든 것을 "잊어버리는" 경향이 있습니다. 논문은 이를 해결하기 위해 "데이터 리플레이(data replay)"라는 기술을 사용해야 한다고 제안합니다. 이는 새로운 언어를 배우는 동안 가끔씩 예전 언어들을 연습함으로써 기억을 유지하는 방식입니다.
단순히 사람들이 말하는 것을 받아 적는 것(전사)을 넘어, 팀은 이 어댑터가 말하는 내용을 영어로 번역하거나 대화의 주제(예: 스포츠 또는 정치)를 추측하는 것과 같은 다른 작업들도 수행하도록 미세 조정될 수 있음을 보여주었습니다. 그들은 각 새로운 작업에 대해 몇 시간 정도의 특정 훈련만 거치면, 시스템이 이러한 일들도 할 수 있게 된다는 것을 발견했습니다.
이 논문은 이러한 시스템을 구축하기 위해 방대한 양의 데이터나 독점적인(비밀스러운) 정보가 필요하다는 생각을 명시적으로 부정합니다. 그들은 저자원 언어를 지원하는 것이 불가능하다는 관점에 반론을 제기하며, 대신 좋은 출발점(그들의 다국어 프로젝터)이 있다면 아주 적은 데이터만으로도 새로운 언어를 "부트스트래핑(bootstrap, 스스로 기초를 세움)"하는 것이 가능하다는 것을 보여줍니다. 그들이 세상의 모든 문제를 해결했다고 주장하는 것은 아니지만, 이 접근 방식이 확장 가능하고, 개방적이며, 효과적이라는 강력한 증거를 제공합니다. 그들은 실제 데이터를 사용한 표준 테스트를 통해 결과를 측정했으며, 그들의 방식이 특히 가장 어렵고 희귀한 언어들에 대해 처음부터 시작하는 것보다 일관되게 우수함을 보여주었습니다.
요약하자면, MEUSLI는 우리가 소수의 사람만을 위한 것이 아니라 다수를 위한 포용적이고 오픈 소스적인 음성 기술을 구축할 수 있음을 증명하는 툴킷입니다. 이는 영리하고 가벼운 어댑터의 도움을 받아, 귀머거리 로봇 뇌를 다국어 구사 능력을 갖춘 청취자로 변화시키는 과정입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.