MOSS Transcribe Diarize Technical Report
MOSS Transcribe Diarize는 기존 시스템의 한계를 극복하기 위해 128k 컨텍스트 윈도우와 광범위한 실제 데이터를 활용한 엔드 투 엔드 학습을 활용하여, 최첨단 수준의 화자 식별 및 타임스탬프가 포함된 전사 기능을 달성하는 통합 멀티모달 거대 언어 모델입니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 북적이는 커피숍에 앉아 세 명의 서로 다른 친구들이 나누는 대화를 정확하게 받아 적으려고 노력하고 있다고 상상해 보세요. 당신은 단순히 단어뿐만 아니라, 누가 그 말을 했는지, 그리고 정확히 언제 말했는지까지 알아야 합니다. 이것이 바로 "화자 식별 및 타임스탬프가 포함된 전사(Speaker-Attributed, Time-Stamped Transcription, SATS)"의 과제입니다. 이는 컴퓨터에게 일종의 초능력과도 같아서, 지저받은 오디오 녹음 파일을 깔끔하고 체계적인 대본으로 바꾸어, 모든 문장에 화자의 이름과 정밀한 시각 정보를 태그로 달아줍니다. 이 기술은 비즈니스 회의를 전사하거나, 고객 서비스 통화를 분석하거나, 청각 장애가 있는 사람들이 복잡한 대화를 따라가는 것을 돕는 데 매우 유용합니다.
지금까지 컴퓨터는 보통 이 문제를 두 가지 별개의 단계로 해결하려 했습니다. 먼저, "음성-텍스트 변환(speech-to-text)" 로봇이 소리를 듣고 글자를 타이핑합니다. 그다음, 별도의 "화자 탐정" 로봇이 누가 무엇을 말했는지 알아내려고 노력합니다. 문제는 이 두 로봇이 서로 대화를 나누지 않는다는 점입니다. 만약 첫 번째 로봇이 작은 실수를 하면, 두 번째 로봇은 혼란에 빠지게 되고, 최종 결과물인 스크립트는 엉망진창이 됩니다. 이는 마치 퍼즐 조각의 절반이 다른 상자에서 온 것처럼 조립하는 것과 같습니다. 이 새로운 논문은 이 두 가지 작업을 동시에, 하나의 매끄러운 동작으로 수행하는 새로운 종류의 컴퓨터 두뇌를 소개합니다.
하나의 두뇌 솔루션
이 프로젝트의 팀인 OpenMOSS는 MOSS Transcribe Diarize라는 새로운 모델을 구축했습니다. 이 모델을 다재다능한 초지능 지휘자로 생각해보세요. 단어를 위한 별도의 오케스트라와 목소리를 위한 별도의 오케스트라를 고용하는 대신, 이 지휘자는 전체 악보를 머릿속에 담고 전체 공연을 한 번에 직접 지휘합니다.
과거에 컴퓨터는 긴 대화를 처리하는 데 어려움을 겪었습니다. 만약 회의가 한 시간 동안 지속된다면, 기존 시스템은 오디오를 30초 단위의 작은 조각으로 잘라 각 조각을 해결한 뒤 다시 이어 붙이려 노력해야 했습니다. 이 과정에서 컴퓨터는 휴식기 이후에 "화자 A"가 누구였는지 잊어버리거나 대화의 흐로를 놓치는 경우가 많았습니다. MOSS Transcribe Diarize는 128k 토큰이라는 거대한 "메모리 윈도우"를 가짐으로써 게임의 판도를 바꿉니다. 이를 척도로 설명하자면, 이 모델은 단 한 번의 끊김 없는 패스로 최대 90분 분량의 오디오를 듣고 이해할 수 있습니다. 오디오를 잘게 쪼갤 필요가 없습니다. 모델은 처음부터 끝까지 전체 이야기를 들으며, 설령 누군가 한동안 말을 하지 않았더라도 누가 누구인지에 대한 명확한 정신적 이미지를 유지합니다.
작동 원리 (마법의 기술)
이 모델은 "멀티모달 거대 언어 모델(multimodal large language model)"입니다. 이는 텍스트를 읽는 동시에 오디오를 들을 수 있다는 뜻입니다. 작동 방식은 다음과 같습니다:
- 귀: 모델은 가공되지 않은 음파를 받아 디지털 형식으로 변환합니다.
- 번역가: 특수한 "프로젝션(projection)"을 사용하여 이러한 음파를 텍스트를 읽는 뇌가 이해할 수 있는 언어로 변환합니다.
- 출력: 단순히 단어를 내뱉는 대신, 모델은
[0.11] [S01] 좋은 아침입니다! [1.03] [S02] 안녕, 얘들아!와 같은 형태의 스크립트를 출력합니다. 즉, 화자 ID(S01, S02), 발화 시작 시각, 그리고 말한 내용을 단 한 번의 순방향 패스(forward pass)로 알려줍니다.
이 모델을 학습시키기 위해 연구진은 단순히 깨끗한 스튜디오 품질의 녹음만을 사용하지 않았습니다. 배경 소음, 겹치는 목소리, 다양한 억양, 그리고 사람들이 서로 말을 가로채는 상황이 포함된 인터넷상의 "실제 야생(real wild)" 데이터를 대량으로 학습시켰습니다. 또한, 서로 다른 목소리를 섞고 조합하여 두 사람이 동시에 말하는 것과 같은 까다로운 상황을 처리하는 법을 배우도록 "시뮬레이션된" 대화 데이터도 만들었습니다.
연구 결과
팀은 자신들의 새로운 모델을 현재 사용 가능한 가장 크고 비싼 상용 시스템들(Doubao, ElevenLabs 및 다양한 Google 모델 등)과 비교 테스트했습니다. 세 가지 유형의 테스트를 사용했습니다:
- AISHELL-4: 실제 세계의 긴 회의 녹음 (최대 약 40분).
- Podcast: 여러 명의 게스트가 참여하는 고품질의 긴 인터뷰.
- Movies: 빠르고 대사가 겹치는 짧은 클립.
결과는 인상적이었습니다. 거의 모든 테스트에서 MOSS Transcribe Diarize는 경쟁 모델들보다 적은 실수를 기록했습니다.
- 정확도: 단어를 더 자주 정확하게 맞혔습니다 (더 낮은 문자 에러율, CER).
- 정체성: 누가 무엇을 말했는지 추적하는 능력이 훨씬 뛰어났습니다. 연구진은 이를 Δcp(단어 에러와 화자 에러 사이의 차이)라는 지표로 측정했습니다. 이 수치가 낮을수록 모델이 화자를 혼동하지 않았음을 의미합니다. MOSS Transcribe Diarize는 가장 낮은 Δcp 점수를 기록하며, 길고 무질서한 대화 속에서도 화자의 정체성을 일관되게 유지했습니다.
- 장문 처리 능력: 일부 유명한 상용 모델들(GPT-4o나 Gemini 3 Pro 등)이 긴 오디오 파일을 처리하는 데 실패하거나 올바른 형식을 출력하지 못한 반면, MOSS Transcribe Diarize는 90분의 입력을 아무런 문제 없이 처리했습니다.
이것이 중요한 이유
이 논문은 음성 인식과 화자 식별을 하나의 통합된 시스템과 긴 메모리로 결합함으로써, 훨씬 더 신뢰할 수 있는 전사 결과를 얻을 수 있음을 시사합니다. 이 모델은 긴 오디오를 이해하기 위해 굳이 쪼갤 필요가 없으며, 전체 대화를 한 번에 듣고도 세부 사항을 정확히 파악할 수 있다는 것을 증명합니다.
저자들은 자신의 모델이 중요한 진전이지만, 모든 문제를 완벽하게 해결하는 마법 지팡이는 아니라는 점을 주의 깊게 언급했습니다. 실시간 스트리밍 기능 구현이나 더 많은 언어 지원과 같이 개선할 여지가 여전히 남아 있습니다. 하지만 현재로서는, 하나의 통합된 두뇌가 두 개의 별개 로봇보다 더 잘 수행할 수 있으며, 특히 대화가 길고 복잡해질 때 더욱 그렇다는 것을 보여주었습니다.
코드와 모델은 현재 GitHub와 Hugging Face를 통해 누구나 시도해 볼 수 있도록 공개되어 있으며, 다른 이들이 이 새로운 토대 위에 더 나은 도구를 구축할 수 있도록 초대하고 있습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.