Unified Audio Intelligence Without Regressing on Text Intelligence
이 논문은 강력한 텍스트 전용 MoE 백본을 기반으로 구축되어, 기존 모델의 고도화된 추론 및 에이전트 능력을 유의미한 퇴보 없이 유지하면서도 다양한 오디오 및 음성 작업에서 최첨단 성능을 달절하는 통합 30B 오디오-텍스트 LLM인 Audex를 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
핵심 아이디어: 사고하는 법을 잊지 않는 "맥가이버 칼" 같은 두뇌
당신에게 글쓰기, 복잡한 수학 문제 풀기, 소프트웨어 코딩에 능숙한 아주 똑똑한 교수님이 있다고 상상해 보세요. 이 교수님이 바로 당신의 텍스트 전용 AI입니다. 이제 이 교수님에게 음악을 이해하고, 새의 노래를 인식하며, 인간의 목소리로 대답하는 법까지 가르치고 싶다고 가정해 봅시다.
보통 새로운 어려운 기술(예: 저글링)을 가르치면, 천재적인 교수님이라도 원래 하던 일(예: 글쓰기)에서 조금 서툴러질 수 있습니다. 새로운 기술을 배우느라 뇌가 너무 바빠지면 문법 실수를 하거나 사실을 잊어버릴 수도 있죠.
이 논문은 "Audex"라는 새로운 AI 모델을 소개합니다. Audex는 자신의 명료한 사고 능력을 떨어뜨리지 않으면서 오디오와 음성을 다루는 법을 배웁니다.
연구진은 매우 똑똑한 텍스트 전용 두뇌인 Nemotron-Cascade-2 위에 Audex를 구축했습니다. 그들의 목표는 간단했습니다. 소리를 듣고, 말하고, 이해할 수 있으면서도, 추론하거나 수학 문제를 풀거나 지시를 따르는 능력을 절대 잃지 않는 AI를 만드는 것이었습니다.
작동 원리: "만능 번역기" 기법
소리를 처리하는 대부분의 AI 모델은 손을 잡고 있는 두 명의 별개 인물과 같습니다. 한 명은 듣고, 다른 한 명은 말합니다. 만약 이들이 완벽하게 소통하지 못하면 결과는 엉망이 됩니다.
Audex는 다릅니다. Audex는 하나의 통합된 두뇌입니다. 어떻게 동시에 모든 것을 수행하는지는 다음과 같습니다.
- 귀 (오디오 인코더): Audex가 소리(예: 개가 짖는 소리나 누군가 말하는 소리)를 들으면, 즉시 가공되지 않은 음파를 이해하려고 시도하지 않습니다. 대신, 특화된 "번역기"(오디오 인코더)를 사용하여 소리를 AI가 이미 알고 있는 단어와 매우 유사한 숫자 리스트로 변럽니다.
- 두뇌 (LLM): 이 숫자들은 메인 두뇌로 입력됩니다. 두뇌는 이 숫자들을 "토큰"(단어와 같은 것)으로 인식하기 때문에, 소리 클립을 문장 형태의 텍스트와 똑같이 취급합니다.
- 입 (오디오 코덱): Audex가 말을 하거나 소리를 내고 싶을 때, 단순히 "생각"만 하는 것이 아니라, 문장에서 다음 단어를 예측하듯 다음 "소리 토큰"을 예측합니다.
비유: 텍스트 레시피로만 요리하던 셰프를 상상해 보세요. Audex는 그 셰프에게 소리 재료로 요리하는 법을 가르치는 것과 같습니다. 별도의 소리 전용 주방을 필요로 하는 대신, Audex는 소리 재료를 셰프가 이미 구사할 줄 아는 언어로 번역합니다. 덕분에 셰프는 "텍스트 케이크"를 굽는 법을 잊지 않으면서도 "소리 수프"를 요리할 수 있게 됩니다.
비결: 두뇌를 망가뜨리지 않는 학습법
연구진은 큰 난관에 봉착했습니다. 똑똑한 텍스트 AI를 오디오에 대해 너무 과하게 학습시키면, 똑똑함을 잃어버릴 수 있기 때문입니다. 이를 방기하기 위해 그들은 세심하고 단계적인 학습 레시피를 사용했습니다.
- 워밍업 (Warm-up): 먼저, 핵심 지식을 변경하지 않고 "소리 재료"(오디오 토큰)를 다루는 법을 가르쳤습니다.
- 계층적 학습 (Layered Learning): 모든 것을 한꺼번에 던져주지 않았습니다. 먼저 소리를 생성하는 법을 가르친 다음, 소리를 이해하는 법을 가르쳤고, 마지막으로 이 모든 것을 혼합했습니다. 이는 외발자전거를 타기 전에 보조 바퀴가 달린 자전거를 배우는 것과 같습니다.
- "퇴보 없음"의 약속 (The "No-Regression" Promise): 모든 학습이 끝난 후, 연구진은 AI의 기존 기술들을 테스트했습니다. 결과는 놀라웠습니다. Audex는 기존의 텍스트 전용 버전만큼이나 해당 작업들을 잘 수행했습니다. 즉, 소리를 듣고 말하는 능력을 얻으면서도 기존의 "천재성"을 전혀 잃지 않았습니다.
Audex는 실제로 무엇을 할 수 있나요?
논문에 따르면, Audex는 오디오를 위한 "맥가이버 칼"입니다. 다음과 같은 일이 가능합니다.
- 듣고 이해하기: 들리는 내용에 대해 질문에 답할 수 있습니다 (예: "저게 개인가요, 늑대인가요?" 또는 "이 음악의 분위기는 어떤가요?").
- 전사 및 번역: 음성 언어를 텍스트로 바꾸고, 시끄러운 방 안에서도 다른 언어로 번러할 수 있습니다.
- 말하기 및 노래하기: 텍스트 프롬프트를 받아 인간과 유사한 음성을 생성하거나, 음악 및 효과음(예: "내리는 빗소리" 또는 "새가 지저귀는 소리")을 만들 수 있습니다.
- 음성 대 음성 (Talk to Talk): 음성 입력을 받아 다른 목소리의 출력(음성 대 음성)을 생성할 수 있습니다.
결과: 두 세계의 장점 결합
이 논문은 Audex를 다른 최상위 AI 모델들과 비교합니다.
- 텍스트 측면: 가장 똑똑한 텍스트 전용 모델들과 대등한 성능을 보이며, 복잡한 수학 및 논리 퍼즐을 성능 저하 없이 풀어냅니다.
- 오디오 측면: 음성 인식 및 일반적인 소리 이해 능력에서 다른 많은 모델을 능가합니다.
- "사고" 모드: 생각과 말하기를 동시에 하려 할 때 "멍청해지는" 일부 모델들과 달리, Audex는 소리 문제에 대해 "사고(추론)"한 뒤 그 답을 오디오로 한 번에 생성할 수 있습니다.
요약
이 논문은 Audex를 통해, "똑똑한 사고가"가 되는 것과 "잘 듣고 말하는 것" 중 하나를 선택할 필요가 없음을 증명합니다. 소리를 또 다른 종류의 언어로 취급함으로써, 연구진은 본래의 지능을 온전히 유지하면서도 소리의 세계를 마스터하여, 듣고 말하고 추론하는 데 모두 탁월한 능력을 갖춘 단일 AI를 구축했습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.