← 최신 논문
💬 NLP

VibeVoice-ASR-BitNet Technical Report

VibeVoice-ASR-BitNet은 이종 양자화(VAE를 위한 INT8 및 언어 모델을 위한 BitNet 스타일의 삼진 가중치)와 커스텀 SIMD 커널을 통해 에지 CPU에 최적화된 압축형 실시간 ASR 모델로, Whisper.cpp보다 최소한의 정확도 손실만으로 1.6~2.3배 빠른 추론 성능을 달성합니다.

원저자: Songchen Xu, Ting Song, Shaohan Huang, Zhiliang Peng, Yan Xia, Yujie Tu, Xin Huang, Xun Wu, Wenhui Wang, Yaoyao Chang, Jianwei Yu, Li Dong, Furu Wei

게시일 2026-07-28
📖 2 분 읽기☕ 가벼운 읽기

원저자: Songchen Xu, Ting Song, Shaohan Huang, Zhiliang Peng, Yan Xia, Yujie Tu, Xin Huang, Xun Wu, Wenhui Wang, Yaoyao Chang, Jianwei Yu, Li Dong, Furu Wei

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대한 고화질 도서관을 아주 작은 배낭 안에 집어넣으려고 노력한다고 상상해 보십시오. 보통 책을 읽기 쉽고 정확하게 유지하려면 두껍고 무거워야 합니다. 너무 많이 줄이려고 하면 페이지가 흐릿한 낙서처럼 변하거나, 배낭이 너무 무거워져서 들 수 없게 됩니다. 이것이 컴퓨터가 인간의 음성을 이해하기 위해 매일 겪는 고충입니다. 수년 동안 최고의 '음성-텍text' 시스템은 거대하고 무거운 도서관과 같아서, 오직 거대하고 비싼 데이터 센터(클라우드)에서만 살 수 있었습니다. 이 시스템들은 믿을 수 없을 정도로 똑똑했지만 구동하려면 슈퍼컴퓨터가 필요했기에, 당신의 목소리가 처리를 위해 인터넷을 통해 전달되어야 했습니다. 이는 개인정보 보호 문제를 일으켰고 짜증 나는 지연 시간을 유발했습니다. 반면에 당신의 휴대폰이나 노트북에서 실행될 수 있는 작고 빠른 시스템들은 종종 어린아이의 스케치북과 같았습니다. 빠르게 넘겨볼 수는 있지만, 복잡한 문장이나 다양한 언어를 이해하지는 못했습니다. 과학자들의 큰 질문은 이것이었습니다: 거대한 도서관만큼 똑똑하면서도 배낭에 들어갈 만큼 가볍고 일반적인 컴퓨터 칩에서 즉각적으로 실행될 수 있는 시스템을 만들 수 있을까?

이 논문은 그 음성 도서관을 위한 숙련된 짐 싸기 전문가 역할을 하는 VibeVoice-ASR-BitNet이라는 새로운 솔루션을 소개합니다. 연구진은 음성 인식 시스템의 모든 부분이 똑같이 무거운 것은 아니라는 사실을 발견했습니다. 어떤 부분은 소리 파동을 듣는 '귀'와 같고, 다른 부분은 그 소리가 어떤 단어를 의미하는지 파악하는 '뇌'와 같습니다. 모든 것에 하나의 크기의 상자를 사용하는 대신, 그들은 두 가지 다른 유형의 압축을 혼합하는 영리한 '이종(heterogeneous)' 전략을 사용했습니다. '귀'(원시 오디오를 처리하는 부분)를 위해 그들은 전체 파이프라인 INT8 압축을 사용했는데, 이는 잉크는 선명하게 유지하면서 페이지를 약간 더 얇은 종이에 인쇄하는 것과 같습니다. '뇌'(다음 단어를 예측하는 부분)를 위해 그들은 훨씬 더 공격적인 BitNet 스타일의 삼진(ternary) 압축을 사용하여, 가중치를 단 세 가지 값인 -1, 0, +1로 축소했습니다. 이것은 복잡한 문단을 화살표, 점, 대시로 이루어진 간단한 코드로 바꾸는 것과 같습니다.

이 두 가지 방법을 결합함으로써, 팀은 전체 모델을 육중한 4.62 GB에서 날렵한 1.58 GB로, 즉 2.9배 줄이는 데 성공했습니다. 그 결과, 이 압축된 모델은 강력한 그래픽 카드 없이도 표준 컴퓨터 프로세서(CPU)에서 실행될 수 있습니다. 테스트에서 이 압축된 모델은 20초 길이의 음성 클립을 듣고 오디오가 재생되는 속도보다 더 빠르게 타이핑해 냈습니다(실시간 계수(RTF)가 1 미만). 이는 처리 스레드가 매우 적은 컴퓨터에서도 가능했습니다. 이 모델은 압축되지 않은 거대 버전보다 약간 덜 정확하지만(오차율이 일반적으로 1~4% 정도 약간 증가함), 비슷한 크기의 다른 모델들보다 훨씬 빠르고 효율적이며, 인기 있는 Whisper.cpp 시스템보다 1.6배에서 2.3배 더 빠른 속도를 보여주었습니다. 저자들은 이 시스템이 일상적인 기기에서 스마트한 AI를 실행하기 위한 큰 진전이지만, 현재는 녹음된 오디오에 가장 적합하며 실시간 스트리밍 대화에 대해서는 아직 테스트되지 않았다고 언급했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →