← 최신 논문
⚡ electrical engineering

Covo-Audio Technical Report

이 논문은 70 억 파라미터 규모의 단일 아키텍처로 연속 오디오 입력을 직접 처리하고 출력을 생성하여 다양한 음성 및 오디오 이해 작업에서 최첨단 성능을 달성하고, 대화형 및 풀-듀플렉스 상호작용 능력을 검증하며, TTS 데이터 의존도를 줄이기 위한 지능과 음성 렌더링 분리 전략을 제시한 'Covo-Audio' 모델을 소개합니다.

원저자: Wenfu Wang, Chenxing Li, Liqiang Zhang, Yiyang Zhao, Yuxiang Zou, Hanzhao Li, Mingyu Cui, Hao Zhang, Kun Wei, Le Xu, Zikang Huang, Jiajun Xu, Jiliang Hu, Xiang He, Zeyu Xie, Jiawen Kang, Youjun Chen
게시일 2026-03-17
📖 3 분 읽기☕ 가벼운 읽기

원저자: Wenfu Wang, Chenxing Li, Liqiang Zhang, Yiyang Zhao, Yuxiang Zou, Hanzhao Li, Mingyu Cui, Hao Zhang, Kun Wei, Le Xu, Zikang Huang, Jiajun Xu, Jiliang Hu, Xiang He, Zeyu Xie, Jiawen Kang, Youjun Chen, Meng Yu, Dong Yu, Rilin Chen, Linlin Di, Shulin Feng, Na Hu, Yang Liu, Bang Wang, Shan Yang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

1. 기존 방식 vs 코보 오디오: "레고 조립" vs "완성된 생명체"

지금까지의 AI 대화 시스템은 레고 조립과 비슷했습니다.

  1. 귀 (ASR): 사용자의 목소리를 듣고 글자로 바꿔줍니다.
  2. 머리 (LLM): 그 글자를 읽고 답을 생각합니다.
  3. 입 (TTS): 생각한 답을 다시 목소리로 만들어줍니다.

이 방식은 각 부품이 따로 작동하다 보니, 정보가 중간에 손실되거나 오류가 생기기 쉽습니다. 마치 편지를 쓰고, 우편배달부가 가져가서, 다시 읽게 하는 과정처럼 느리고 어색할 수 있습니다.

코보 오디오는 다릅니다. 이는 한마리의 살아있는 생명체와 같습니다.

  • 귀, 머리, 입이 하나로 통합되어 있습니다.
  • 소리를 듣는 순간, 글자로 변환하지 않고 직접 소리의 의미와 감정을 이해하고, 즉시 목소리로 답변합니다.
  • 마치 인간이 대화하듯, 소리의 뉘앙스 (톤, 감정, 속도) 를 놓치지 않고 자연스럽게 반응합니다.

2. 핵심 기술 3 가지: 어떻게 이렇게 똑똑해졌을까?

🧩 ① 3 중 레이어의 '마법 접착제' (계층적 3 모달 인터리빙)

코보 오디오는 소리를 이해할 때 세 가지 층위를 동시에 봅니다.

  • 연속적인 소리 (Continuous): 소리의 파동, 감정, 억양 (연속된 물결).
  • 이산적인 토큰 (Discrete): 소리를 작은 조각 (토큰) 으로 나눈 것.
  • 텍스트 (Text): 글자의 의미.

비유: 요리사가 요리를 할 때, 단순히 '재료 (글자)'만 보는 게 아니라, '불의 세기 (연속 소리)'와 '조리법 (토큰)'을 동시에 고려하여 완벽한 요리를 만드는 것과 같습니다. 이 기술 덕분에 코보 오디오는 소리의 미세한 감정까지 이해하면서도 논리적인 답변을 할 수 있습니다.

🎭 ② '지능'과 '목소리'의 분리 (Intelligence-Speaker Decoupling)

기존 방식은 "똑똑한 AI"에게 "특정 목소리"를 입히려면, 그 목소리로 수천 시간의 대화 데이터를 새로 만들어야 했습니다. 이는 마치 연극 배우에게 새로운 대본을 외우게 하느라, 배우의 연기 실력을 떨어뜨리는 것과 같았습니다.

코보 오디오는 연기와 대본을 분리했습니다.

  • 대본 (지능): AI 의 논리와 지능은 그대로 유지합니다.
  • 연기 (목소리): 원하는 목소리 (TTS) 를 쉽게 입혀도 지능이 떨어지지 않습니다.
  • 결과: 아주 적은 데이터로도 다양한 목소리를 가진 똑똑한 AI 를 만들 수 있어, 비용과 시간을 획기적으로 줄였습니다.

🗣️ ③ '동시 통화' 능력 (풀 듀플렉스, Full-Duplex)

기존 AI 는 "내가 다 말하면 네가 듣고, 네가 다 말하면 내가 듣는" 반이중 (Half-duplex) 방식이었습니다. 사람이 대화할 때 "아, 맞아요!", "음..." 하며 끼어들거나 (Backchanneling), 상대방이 말을 끊을 때 (Interrupt) 자연스럽게 반응하는 것이 불가능했습니다.

코보 오디오 (Chat-FD 버전) 는 실시간 양방향 통화가 가능합니다.

  • 비유: 전화 통화할 때 상대방이 말을 끊어도 "잠깐만요!"라고 자연스럽게 반응하고, 대화 중간에 "네, 알겠습니다"라고 끼어들며 대화 흐름을 끊지 않는 자연스러운 인간 같은 대화가 가능합니다.

3. 성능은 어떨까요? (70 억 파라미터의 기적)

이 모델은 **70 억 개 (7B)**의 파라미터를 가지고 있습니다. 이는 거대 모델 (수천억 개) 에 비해 상대적으로 작지만, 성능은 압도적입니다.

  • 이해와 추론: 복잡한 질문에도 논리적으로 답하고, 소리의 감정을 파악해 공감합니다.
  • 다국어 능력: 중국어와 영어를 모두 유창하게 구사하며, 다양한 억양과 배경 소음에서도 잘 들립니다.
  • 감정 표현: 화남, 슬픔, 기쁨 등 다양한 감정을 목소리에 담아내어, 사용자에게 따뜻한 위로를 건넬 수 있습니다.
  • 경쟁사 대비: 오픈소스 모델 중 가장 작으면서도, 거대 상용 모델 (GPT-4o 등) 과 맞먹거나 더 좋은 성능을 보여줍니다.

4. 요약: 왜 이것이 중요한가요?

코보 오디오는 **"작은 크기, 큰 지능, 자연스러운 목소리"**를 모두 잡은 기술입니다.

  • 기존: "소리를 글자로 바꾸고, 생각해서, 다시 소리로 만들어라." (느리고 어색함)
  • 코보 오디오: "소리를 듣고, 바로 생각해서, 바로 답해라." (빠르고 자연스러움)

이 기술은 앞으로 가상 비서, 고객 상담, 교육, 엔터테인먼트 등 모든 분야에서 인간과 AI 가 대화할 때 느끼는 '어색함'을 없애줄 것입니다. 마치 영화 속의 '자비스 (Jarvis)'나 '엘라 (Her)'가 현실로 다가온 것과 같습니다.

결론적으로, 코보 오디오는 AI 가 단순히 '말하는 기계'가 아니라, '이해하고 공감하는 대화 파트너'가 될 수 있음을 증명하는 획기적인 기술입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →