← 최신 논문
⚡ electrical engineering

Unified Audio Intelligence Without Regressing on Text Intelligence

이 논문은 강력한 텍스트 전용 MoE 백본을 기반으로 구축되어, 기존 모델의 고도화된 추론 및 에이전트 능력을 유의미한 퇴보 없이 유지하면서도 다양한 오디오 및 음성 작업에서 최첨단 성능을 달절하는 통합 30B 오디오-텍스트 LLM인 Audex를 소개한다.

원저자: Zhifeng Kong, Sang-gil Lee, Jaehyeon Kim, Boxin Wang, Zihan Liu, Sungwon Kim, Yang Chen, Arushi Goel, Rajarshi Roy, Wenliang Dai, Zhuolin Yang, Yangyi Chen, Dongfu Jiang, Sreyan Ghosh, Tuomas Rintamak
게시일 2026-07-08
📖 4 분 읽기☕ 가벼운 읽기

원저자: Zhifeng Kong, Sang-gil Lee, Jaehyeon Kim, Boxin Wang, Zihan Liu, Sungwon Kim, Yang Chen, Arushi Goel, Rajarshi Roy, Wenliang Dai, Zhuolin Yang, Yangyi Chen, Dongfu Jiang, Sreyan Ghosh, Tuomas Rintamaki, Andrew Tao, Jonathan Raiman, Mohammad Shoeybi, Bryan Catanzaro, Wei Ping

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

핵심 아이디어: 사고하는 법을 잊지 않는 "맥가이버 칼" 같은 두뇌

당신에게 글쓰기, 복잡한 수학 문제 풀기, 소프트웨어 코딩에 능숙한 아주 똑똑한 교수님이 있다고 상상해 보세요. 이 교수님이 바로 당신의 텍스트 전용 AI입니다. 이제 이 교수님에게 음악을 이해하고, 새의 노래를 인식하며, 인간의 목소리로 대답하는 법까지 가르치고 싶다고 가정해 봅시다.

보통 새로운 어려운 기술(예: 저글링)을 가르치면, 천재적인 교수님이라도 원래 하던 일(예: 글쓰기)에서 조금 서툴러질 수 있습니다. 새로운 기술을 배우느라 뇌가 너무 바빠지면 문법 실수를 하거나 사실을 잊어버릴 수도 있죠.

이 논문은 "Audex"라는 새로운 AI 모델을 소개합니다. Audex는 자신의 명료한 사고 능력을 떨어뜨리지 않으면서 오디오와 음성을 다루는 법을 배웁니다.

연구진은 매우 똑똑한 텍스트 전용 두뇌인 Nemotron-Cascade-2 위에 Audex를 구축했습니다. 그들의 목표는 간단했습니다. 소리를 듣고, 말하고, 이해할 수 있으면서도, 추론하거나 수학 문제를 풀거나 지시를 따르는 능력을 절대 잃지 않는 AI를 만드는 것이었습니다.

작동 원리: "만능 번역기" 기법

소리를 처리하는 대부분의 AI 모델은 손을 잡고 있는 두 명의 별개 인물과 같습니다. 한 명은 듣고, 다른 한 명은 말합니다. 만약 이들이 완벽하게 소통하지 못하면 결과는 엉망이 됩니다.

Audex는 다릅니다. Audex는 하나의 통합된 두뇌입니다. 어떻게 동시에 모든 것을 수행하는지는 다음과 같습니다.

  1. 귀 (오디오 인코더): Audex가 소리(예: 개가 짖는 소리나 누군가 말하는 소리)를 들으면, 즉시 가공되지 않은 음파를 이해하려고 시도하지 않습니다. 대신, 특화된 "번역기"(오디오 인코더)를 사용하여 소리를 AI가 이미 알고 있는 단어와 매우 유사한 숫자 리스트로 변럽니다.
  2. 두뇌 (LLM): 이 숫자들은 메인 두뇌로 입력됩니다. 두뇌는 이 숫자들을 "토큰"(단어와 같은 것)으로 인식하기 때문에, 소리 클립을 문장 형태의 텍스트와 똑같이 취급합니다.
  3. 입 (오디오 코덱): Audex가 말을 하거나 소리를 내고 싶을 때, 단순히 "생각"만 하는 것이 아니라, 문장에서 다음 단어를 예측하듯 다음 "소리 토큰"을 예측합니다.

비유: 텍스트 레시피로만 요리하던 셰프를 상상해 보세요. Audex는 그 셰프에게 소리 재료로 요리하는 법을 가르치는 것과 같습니다. 별도의 소리 전용 주방을 필요로 하는 대신, Audex는 소리 재료를 셰프가 이미 구사할 줄 아는 언어로 번역합니다. 덕분에 셰프는 "텍스트 케이크"를 굽는 법을 잊지 않으면서도 "소리 수프"를 요리할 수 있게 됩니다.

비결: 두뇌를 망가뜨리지 않는 학습법

연구진은 큰 난관에 봉착했습니다. 똑똑한 텍스트 AI를 오디오에 대해 너무 과하게 학습시키면, 똑똑함을 잃어버릴 수 있기 때문입니다. 이를 방기하기 위해 그들은 세심하고 단계적인 학습 레시피를 사용했습니다.

  • 워밍업 (Warm-up): 먼저, 핵심 지식을 변경하지 않고 "소리 재료"(오디오 토큰)를 다루는 법을 가르쳤습니다.
  • 계층적 학습 (Layered Learning): 모든 것을 한꺼번에 던져주지 않았습니다. 먼저 소리를 생성하는 법을 가르친 다음, 소리를 이해하는 법을 가르쳤고, 마지막으로 이 모든 것을 혼합했습니다. 이는 외발자전거를 타기 전에 보조 바퀴가 달린 자전거를 배우는 것과 같습니다.
  • "퇴보 없음"의 약속 (The "No-Regression" Promise): 모든 학습이 끝난 후, 연구진은 AI의 기존 기술들을 테스트했습니다. 결과는 놀라웠습니다. Audex는 기존의 텍스트 전용 버전만큼이나 해당 작업들을 잘 수행했습니다. 즉, 소리를 듣고 말하는 능력을 얻으면서도 기존의 "천재성"을 전혀 잃지 않았습니다.

Audex는 실제로 무엇을 할 수 있나요?

논문에 따르면, Audex는 오디오를 위한 "맥가이버 칼"입니다. 다음과 같은 일이 가능합니다.

  • 듣고 이해하기: 들리는 내용에 대해 질문에 답할 수 있습니다 (예: "저게 개인가요, 늑대인가요?" 또는 "이 음악의 분위기는 어떤가요?").
  • 전사 및 번역: 음성 언어를 텍스트로 바꾸고, 시끄러운 방 안에서도 다른 언어로 번러할 수 있습니다.
  • 말하기 및 노래하기: 텍스트 프롬프트를 받아 인간과 유사한 음성을 생성하거나, 음악 및 효과음(예: "내리는 빗소리" 또는 "새가 지저귀는 소리")을 만들 수 있습니다.
  • 음성 대 음성 (Talk to Talk): 음성 입력을 받아 다른 목소리의 출력(음성 대 음성)을 생성할 수 있습니다.

결과: 두 세계의 장점 결합

이 논문은 Audex를 다른 최상위 AI 모델들과 비교합니다.

  • 텍스트 측면: 가장 똑똑한 텍스트 전용 모델들과 대등한 성능을 보이며, 복잡한 수학 및 논리 퍼즐을 성능 저하 없이 풀어냅니다.
  • 오디오 측면: 음성 인식 및 일반적인 소리 이해 능력에서 다른 많은 모델을 능가합니다.
  • "사고" 모드: 생각과 말하기를 동시에 하려 할 때 "멍청해지는" 일부 모델들과 달리, Audex는 소리 문제에 대해 "사고(추론)"한 뒤 그 답을 오디오로 한 번에 생성할 수 있습니다.

요약

이 논문은 Audex를 통해, "똑똑한 사고가"가 되는 것과 "잘 듣고 말하는 것" 중 하나를 선택할 필요가 없음을 증명합니다. 소리를 또 다른 종류의 언어로 취급함으로써, 연구진은 본래의 지능을 온전히 유지하면서도 소리의 세계를 마스터하여, 듣고 말하고 추론하는 데 모두 탁월한 능력을 갖춘 단일 AI를 구축했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →