Qwen3-ASR Technical Report
이 보고서는 52개 언어에 걸쳐 최첨단 수준의 정확도와 효율성을 달성하는 동시에 Apache 2.0 라이선스로 공개되는 두 개의 고성능 올인원 음성 인식 모델(0.6B 및 1.7B 파라미터)과 새로운 비자기회적(non-autoregressive) 강제 정렬 모델로 구성된 Qwen3-ASR 제품군을 소개합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
음성 기술의 세계를 북적이는 도시라고 상상해 보세요. 수년 동안 "경찰"(기존 음성 인식 시스템)은 조용한 방 안에서 명확하게 쓰인 표지판을 읽는 데는 매우 뛰어났습니다. 하지만 사람들이 시장통에서 소리를 지르거나, 노래를 부르거나, 심한 억양으로 말하면 그들은 종종 혼란에 빠지거나 포기하곤 했습니다.
Qwen3-ASR 팀은 게임의 판도를 완전히 바꿀 새로운 "슈퍼 경찰"들과 "타이머"를 막 출시했습니다. 이들이 무엇을 만들었는지 쉽게 설명해 드리겠습니다.
1. 두 명의 슈퍼 경찰: Qwen3-ASR-1.7B와 Qwen3-ASR-0.6B
이 두 모델을 서로 다른 강점을 가진 한 쌍의 형사라고 생각하세요. 두 모델 모두 세상을 깊이 이해하는 "슈퍼 멘토"(기반 모델인 Qwen3-Omni)로부터 훈련받았습니다.
- 대형 형사 (Qwen3-ASR-1.7B): 이 모델은 강력한 한 방을 가진 베테랑입니다. 세상의 모든 것을 들어본 노련한 형사와 같습니다. 시끄러운 공장에서 나누는 대화를 알아듣거나, 풀 밴드가 배경에서 연주하는 노래를 이해하거나, 심지어 희귀한 방언으로 말하더라도 그 내용을 파악해 낼 수 있습니다. 이 모델은 매우 뛰어나서 거대 기술 기업들이 운영하는 가장 비싸고 폐쇄적인 서비스들과 견줄 만합니다.
- 스피디 형사 (Qwen3-ASR-0.6B): 이 모델은 가볍고 민첩한 파트너입니다. 더 작고 빠릅니다. 퍼즐을 풀면서 마라톤을 달리는 형사를 상상해 보세요. 이 모델은 믿을 수 없을 정도로 효율적입니다. 논문에 따르면, 여러 작업을 동시에 수행할 때 1초 만에 2,000초 분량의 음성을 처리할 수 있다고 합니다. 휴대폰이나 소형 기기에 탑재하기에 완벽하며, 작동하기 위해 거대한 컴퓨터를 필요로 하지 않습니다.
무엇이 특별한가요?
- "만능 번역가" 모자: 이들은 단순히 영어와 중국어만 하는 것이 아니라, 52개의 언어와 방언을 이해합니다. 표준 중국어, 사천 방언 같은 특정 지역 방언, 또는 베트남어 같은 언어를 말하더라도 즉시 모자를 바꿔 쓸 수 있습니다.
- "소음 차단" 귀: 이들은 혼돈을 무시하도록 훈련되었습니다. 드럼 소리가 울려 퍼지는 가운데 노래를 부르거나, 북적이는 거리에서 아이가 소리를 질러도, 이 모델들은 여전히 단어들을 또렷하게 들을 수 있습니다.
- "언어 식별" 배지: 단어를 받아 적기도 전에, 이들은 당신이 정확히 어떤 언어로 말하고 있는지 알아냅니다. 말레이어와 인도네시아어처럼 비슷하게 들리는 언어들도 높은 정확도로 구별해 낼 수 있습니다.
2. 타이머: Qwen3-ForcedAligner-0.6B
예전에는 녹음 파일에서 단어가 정확히 언제 시작되고 끝나는지(자막 제작 등을 위해) 알고 싶다면, 자주 실수하고 느릿느릿한 기계를 사용해야 했습니다.
팀은 Qwen3-ForcedAligner라는 새로운 도구를 선보였습니다.
- 비유: 여러분에게 전사된 텍스트(단어)와 녹음 파일(소리)이 있다고 가정해 봅시다. 기존의 도구들은 소리에 단어를 맞추기 위해 추측하는 것과 같았습니다. 이 새로운 모델은 매우 빠르고 비자기회론적(non-autoregressive)인 타이머와 같습니다.
- 작동 방식: 단어를 하나씩 추측하며 진행하는 대신(이것은 느립니다), 문장 전체를 보고 즉시 모든 단어나 글자에 타임스탬프를 할당합니다.
- 결과: 이는 믿을 수 없을 정도로 정확하고 빠릅니다. 11개의 언어를 처리할 수 있으며, 화자가 문장 중간에 언어를 바꾸더라도 작동합니다. 매우 빨라서 한 시간 분량의 오디오를 단 몇 분 만에 처리할 수 있습니다.
3. 어떻게 학습했나 (훈련 과정)
"어떻게 이렇게 똑똑해졌을까?"라는 의문이 들 수 있습니다.
- 기반: 이들은 이미 오디오, 비전, 텍스트를 이해하는 모델(Qwen3-Omni)에서 시작했습니다.
- 연습: 이들은 4,000만 시간에 달하는 방대한 양의 녹음된 음성 라이브러리(주로 중국어와 영어)를 통해 연습했습니다.
- "실전" 훈련: 단순히 조용한 스튜디오에서만 연습한 것이 아닙니다. 다음 상황들에 대해 테스트를 거쳤습니다:
- 노인과 아이들: 다양한 목소리의 높낮이.
- 잰말놀이(Tongue Twisters): 빠르고 어려운 발음.
- 노래: 단어를 길게 늘어뜨리는 멜로디.
- 배경 소음: 시끄러운 음악과 군중 소리.
- "강화" 수업: 마지막으로, 이들은 가장 어려운 실수들에 대해 교정을 받는 특수한 훈련 방법(강화 학습)을 사용하여, 실제 세상의 혼란 속에서도 훨씬 더 견고하게 만들어졌습니다.
4. 결과: 이것이 왜 중요한가
논문은 이 새로운 모델들을 최고의 경쟁자들(무료 오픈 소스 모델 및 유료 상용 모델 모두)과 비교합니다.
- 정확도: 대형 모델(1.7B)은 종종 가장 정확한 오픈 소스 모델이며, 비싼 유료 서비스와 대등하거나 이를 능가합니다.
- 속도: 소형 모델(0.6B)은 가장 빠르며, 속도와 지능 사이의 최적의 균형을 제공합니다.
- 다재다능함: 이들은 고품질의 음성 인식, 언어 식별, 그리고 노래 인식을 수십 개의 언어에서 작동하는 하나의 패키지로 결래한 최초의 모델입니다.
요약하자면: Qwen3-ASR 제품군은 컴퓨터가 시끄럽고, 어수선하거나, 음악이 흐르는 상황에서도 인간처럼 인간의 말을 이해할 수 있도록 돕는 툴킷입니다. 또한 이를 다양한 언어로 수행합니다. 이들은 연구자와 개발자들이 미래의 더 나은 음성 기술을 구축할 수 있도록 이 도구들을 모두가 사용할 수 있게 무료로 공개하며, 더 나은 미래를 향한 희망을 담고 있습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.