The Eloquence team submission for task 1 of MLC-SLM challenge
Eloquence 팀은 서로 다른 프로젝터를 사용한 베이스라인 아키텍처 평가, SLAM-ASR 프레임워크를 통한 커스텀 선형 프로젝터 학습, 그리고 대조 학습 및 확장된 대화 문맥의 이점 조사를 포함하는 세 가지 다국어 ASR 접근 방식을 탐구하며 MLC-SLM 챌린지의 Task 1에 대한 자신들의 연구 결과물을 발표합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 수많은 언어가 뒤섞이고, 사람들이 서로의 말을 가로채며 소리 지르고, 5분 전에 했던 말을 기억해야만 이해할 수 있는 농담을 던지는 북적이고 시끄러운 파티장의 소리를 듣는 법을 초지능 로봇에게 가르치려 한다고 상상해 보세요. 이것이 바로 **다국어 대화 음성 인식(multilingual conversational speech recognition)**의 세계입니다. 오랫동안 컴퓨터는 이 과정을 릴레이 경주처럼 처리했습니다. 인간(또는 기계)이 먼저 말하는 내용을 정확하게 받아 적고(전사), 그 다음 두 번째 기계가 그 텍스트를 읽어 의미를 이해하는 방식이었죠. 하지만 이 릴레이 경주에는 결함이 있습니다. 첫 번째 주자가 발이 꼬여 단어를 잘못 적으면, 두 번째 주자는 혼란에 빠지고 전체 메시지가 엉망이 되어 버립니다. 게 plus, 두 번째 주자는 텍스트만을 전달받기 때문에 목소리의 '느낌', 즉 어조, 속도, 그리고 감정을 놓치게 됩니다.
이를 해결하기 위해 과학자들은 **음성 언어 모델(Speech Language Models, SLMs)**을 구축하고 있습니다. 이것들을 하나의 '모든 것을 아는 뇌'라고 생각해보세요. 이 뇌는 중간 단계로 글을 적을 필요 없이, 음파를 직접 듣고 동시에 그 의미를 이해합니다. 이는 외국어를 번역해 주는 사람이 있어야 농담을 이해할 수 있는 로봇을, 원래 언어로 농담을 직접 듣고 적절한 순간에 웃을 수 있는 로봇으로 업그레이드하는 것과 같습니다. 연구자들이 던지는 핵심 질문은 이것입니다: 어떻게 하면 이 로봇들이 여러 언어를 동시에 다루는 복잡한 실제 대화를 정말 잘 이해하도록 만들 수 있을까?
이 논문에서 "Eloquence" 프로젝트(유럽 연합의 지원을 받는 그룹)의 연구팀은 어떤 AI의 두뇌가 가장 잘 듣는지 확인하기 위해 이 AI 뇌들에게 파티를 열어주기로 했습니다. 그들은 AI가 다국어 대화를 얼마나 잘 처리할 수 있는지 테스트하기 위해 특별히 설계된 MLC-SLM 챌린지라는 경연에 참여했습니다. 그들의 목표는 단순히 듣는 로봇을 만드는 것이 아니라, 대화의 '맥락'을 이해하는 로 [예: "춥다"라는 말이 어떤 상황에서는 "히터를 켜라"는 뜻이지만, 다른 상황에서는 "코트를 입고 있다"는 뜻임을 아는 것]를 할 수 있는 로봇을 만드는 것이었습니다.
연구팀은 어떤 접근 방식이 AI를 최고의 리스너로 만들 수 있는지 알아보기 위해 세 가지 다른 전략을 시도했습니다.
첫째, 게임의 규칙을 점검했습니다.
새로운 것을 발명하기 전에, 그들은 공식적인 "베이스라인(baseline)"—경연 주최 측이 제공한 표준 설정—을 살펴보았습니다. 이것을 모두가 받는 "스타터 키트"라고 생각하면 됩니다. 그들은 이 키트를 다양한 종류의 "두뇌"(거대 언어 모델, LLM) 및 "귀"(오디오 인코더)를 두뇌에 연결하는 다양한 방식과 함께 테스트했습니다. 그들은 단순히 연결 방식을 미세하게 조정하는 것만으로는 큰 차이가 없다는 것을 발견했습니다. 그것은 마치 자동차의 속도를 높이려고 바퀴의 색깔을 바꾸는 것과 같았습니다. 엔진은 그대로였기에 속도는 변하지 않았습니다. 또한 그들은 "Q-Former"라고 불리는 화려한 새로운 연결 방식도 시도해 보았지만, 이 역시 문제를 마법처럼 해결해주지는 못했습니다.
둘둘째, 그들만의 맞춤형 엔진을 구축했습니다.
이것은 그들의 가장 성공적인 시도였습니다. 그들은 SLAM-ASR이라는 프레임워크를 사용했는데, 이는 음성 로봇을 만들기 위한 하이테크 작업실과 같습니다. 그들은 강력한 오디오 리스너인 Whisper Large V3 Turbo와 EuroLLM 1.7B라는 특정 유형의 두뇌를 결합했습니다. 이 두뇌가 오디오를 이해할 수 있도록, 그들은 소리를 두뇌가 이해할 수 있는 언어로 변환하는 맞춤형 "번역기"(선형 프로젝터)를 구축했습니다.
여기서 그들은 창의력을 발휘했습니다. 그들은 로봇에게 "노이즈가 섞인" 연습 데이터를 주어 가르치는 방법을 시도했습니다. 정적을 추가하거나, 목소리 속도를 조절하거나, 피치를 변화시키는 등 나쁜 오디오 환경을 시뮬레이션하여 로봇이 혹독한 환경에서 연습하게 만들었습니다. 그들은 이를 통해 로봇이 마치 헤비급 복서가 무거운 무게를 들고 훈련하듯 더 강해지기를 바랐습니다. 그러나 결과는 다소 엇갈렸습니다. 노이즈 훈련이 특정 사례에서는 도움이 되었지만, 이미 잘하고 있던 그들의 최고의 로봇을 더 낫게 만들지는 못했습니다. 실제로 그들의 최고 시스템은 LoRA(두뇌 전체를 재구축하는 대신, 두뇌에 가볍고 조절 가능한 훈련용 조끼를 입히는 것과 같은 기술)라는 특수 훈련 기법을 사용한 EuroLLM 1.7B 두뇌를 사용하여 24개 팀 중 13위를 차지했습니다. 우승은 아니었지만, 작은 '동결된(frozen)' 두뇌와 스마트한 번역기의 조합이 여전히 훌륭한 일을 수행할 수 있음을 증명했습니다.
셋째, 로봇에게 "기억력"을 부여하려고 시도했습니다.
실제 대화는 문장 하나하나로 이루어지지 않습니다. 그것은 아이디어의 흐름입니다. 만약 누군가 "비가 온다"라고 말하고 나서 나중에 "우산을 챙기는 걸 깜빡했다"라고 말한다면, 두 번째 문장은 첫 번째 문장이 있기 때문에 비로소 의미를 갖습니다. 연구팀은 이전 문장을 대화의 맥락(context)으로 입력함으로써 AI에게 이러한 종류의 기억력을 부여하려고 시도했습니다. 또한 그들은 "대조 학습(contrastive learning)"이라는 기술도 시도했는데, 이는 "차이점 찾기" 게임과 같습니다. 그들은 AI에게 서로 어울리는 문장 쌍과 어울리지 않는 문장 쌍을 보여줌으로써, AI가 논리적인 대화와 무작위로 섞인 단어들의 나열 사이의 차이를 배우도록 강제했습니다.
이 결과는 흥ًا로웠습니다. "기억(맥락)"과 "차이점 찾기 게임(대조 학습)"을 추가했을 때, AI는 대화를 더 잘 이해하게 되어 테스트 세트에서의 오류율이 **17.18%**로 떨어졌습니다. 하지만 그들은 이상한 점을 발견했습니다. "훈련용 조끼(LoRA)"를 "기억" 및 "대조 학습"과 함께 사용했을 때 오히려 성능이 저하되었습니다. 그들은 로봇에게 충분한 학습 시간(단 두 번의 훈련 세션)을 주지 못해 추가된 복잡성이 로봇을 혼란스럽게 만든 것으로 추측했습니다.
그들은 무엇을 배웠을까요?
연구팀은 음성을 이해하기 위해 항상 가장 크고 비싼 두뇌가 필요한 것은 아니라는 사실을 발견했습니다. 작고 동결된 두뇌(EuroLLM 1.7B)와 스마트하게 잘 훈련된 번역기를 결합하는 것만으로도 매우 효과적일 수 있습니다. 또한 AI에게 약간의 "대화 기록"을 주는 것이 이야기를 이해하는 데 도움이 되지만, 훈련을 너무 복잡하게 만들지 않도록 주의해야 한다는 것도 배웠습니다. 비록 그들의 시스템이 1위를 차지하지는 못했지만, 이러한 가볍고 효율적인 모델들이 여전히 큰 잠재력을 가지고 있음을 보여주었습니다.
결론적으로, Eloquence 팀은 음성 인식의 미래가 이러한 스마트하고 효율적인 구조를 인간이 실제로 말하는 방식에 대한 깊은 이해와 결합하는 데 있다고 제안합니다. 즉, 고립된 단어들을 듣는 것이 아니라 대화의 흐름을 염두에 두는 것입니다. 그들은 앞으로 언어를 혼합하고 더욱 복잡한 과제를 처리하는 법을 계속 탐구하며, 로봇이 단순히 우리의 말을 듣는 것을 넘어 진정으로 우리를 이해할 수 있게 되기를 희망하고 있습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.