← 최신 논문
⚡ electrical engineering

PhaseCoder: Microphone Geometry-Agnostic Spatial Audio Understanding for Multimodal LLMs

이 논문은 로우 멀티채널 오디오와 마이크로폰 좌표를 공간 임베딩으로 변환하는 기하학적 구조에 무관한 트랜스포머 인코더인 PhaseCoder를 소개하며, 이를 통해 멀티모달 LLM이 다양한 장치 구성 전반에서 견고한 위치 추정 및 복잡한 공간 추론을 수행할 수 있도록 한다.

원저자: Artem Dementyev, Wazeer Zulfikar, Sinan Hersek, Pascal Getreuer, Anurag Kumar, Vivek Kumar

게시일 2026-08-07
📖 3 분 읽기☕ 가벼운 읽기

원저자: Artem Dementyev, Wazeer Zulfikar, Sinan Hersek, Pascal Getreuer, Anurag Kumar, Vivek Kumar

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

시끄러운 파티장에 있다고 상상해 보세요. 음악 소리가 크게 울려 퍼지고 다른 사람들의 대화가 뒤섞여 있는 와중에도, 당신은 방 건너편에 있는 친구의 목소리를 쉽게 구별해 낼 수 있습니다. 이것은 인간이 가진 '칵테일 파티 효과(cocktail party effect)'라는 초능력입니다. 우리는 단순히 소리를 듣는 것이 아니라, 그 소리가 어디에서 오는지 느낍니다. 목소리가 우리 뒤에 있는지, 왼쪽에 있는지, 혹은 멀리 떨어져 있는지 우리는 알고 있습니다. 이러한 공간 인지 능력은 우리에게 너무나 자연스러워서 좀처럼 의식하지 못하지만, 로봇이나 스마트 비서들에게는 거대한 미스터리입니다. 현재 대부분의 스마트 기기들은 위치에 대해 '청각 장애'를 가지고 있습니다. 이들은 마치 한쪽 귀로만 라디오를 듣는 것처럼 단일하고 평면적인 소리의 흐름만을 듣습니다. 이들은 당신이 무엇을 말했는지는 알 수 있지만, 화자가 어디에 서 있는지는 전혀 알지 못합니다.

이를 해결하기 위해 과학자들은 컴퓨터에게 소리의 방향을 이해하도록 가르치려 노력해 왔습니다. 하지만 여기에는 함정이 있습니다. 대부분의 이러한 '공간 청취' 프로그램들은 특정 발에만 맞춰 제작된 맞춤형 신발과 같습니다. 만약 어떤 장치에 4개의 마이크가 사각형 형태로 배치되어 있다면 그 프로그램은 작동합니다. 하지만 다른 장치에 8개의 마이크가 원형으로 배치되어 있다면, 그 프로그램은 고장 납니다. 이는 소프트웨어가 특정 형태에 맞춰 학습되었기 때문에 새로운 형태에 적응할 수 없기 때문입니다. 게다가, 이러한 프로그램들은 보통 손가락으로 가리키며 "저기요"라고 말할 뿐, 그 위치에 대해 대화를 나누거나 그 위치 정보를 로봇의 실내 주행에 활용하지는 못합니다. 이들은 가리키는 데는 뛰어나지만, 생각하는 데는 형편없습니다.

여기서 구글 딥마인드(Google DeepMind)와 MIT 연구진이 개발한 새로운 발명품인 **페이즈코더(PhaseCoder)**가 등장합니다. 페이즈코더는 소리에 대한 '범용 번역기'와 같습니다. 페이즈코더를 마이크 모양의 '귀'가 어떤 형태인지 상관하지 않는 마법의 귀라고 생각해 보세요. 마이크가 지저분한 원형으로 흩어져 있든, 한 줄로 늘어서 있든, 혹은 로봇 머리에 이상한 패턴으로 붙어 있든, 페이스코더는 소리가 정확히 어디에서 오는지 알아낼 수 있습니다. 이는 마치 우리의 뇌가 왼쪽과 오른쪽 귀에 도달하는 미세한 시간 차이를 이용해 소리의 위치를 찾는 것처럼, 각 마이크에 부딪히는 음파의 미세한 '타이밍(또는 위상, phase)' 차이에 귀를 기울임으로써 가능해집니다.

하지만 페이즈코더는 단순히 가리키는 것에 그치지 않습니다. 연구진은 이 시스템을 '젬마(Gemma)'라는 특정 버전의 LLM(대규모 언어 모델)인 강력한 '두뇌'와 연결했습니다. 이제 이 두뇌에 새로운 감각, 즉 3D 입체 음향으로 세상을 보는 능력을 부여했다고 상상해 보세요. 이제 AI는 단순히 "안녕"이라는 말만 듣는 것이 아니라, "안녕, 그리고 나는 네 왼쪽으로 3미터 지점에 서 있어"라는 말을 이해할 수 있습니다. 연구진은 수백만 개의 컴퓨터 생성 음향 시나리오를 사용하여 이 시스템을 학습시켰으며, 이를 통해 마이크 배열의 형태에 구애받지 않고 오직 소리 자체에만 집중하도록 만들었습니다.

결과는 인상적입니다. 실제 환경의 다양한 장치 녹음본을 사용한 테스트에서, 페이즈코더는 까다로운 데이터셋을 대상으로 약 7.44도의 정확도로 소리의 위치를 찾아냈으며, 특정 마이크 형태에 갇혀 있던 기존의 최첨단 모델들을 능가했습니다. 더 중요한 점은, 연구진이 AI에게 복잡한 질문을 던졌을 때 AI가 소리에 대해 추론할 수 있었다는 것입니다. AI는 "화자가 내 왼쪽에 있는가?"라거나 "내 뒤에 서 있는 사람의 말만 받아쓰기 해줘"와 같은 질문에 답하며, 다른 사람들의 소리는 성공적으로 무시했습니다. 이 시스템은 3개에서 8개 사이의 어떤 마이크 개수와도 작동하며, 이는 페이즈코더가 단순히 특정 레이아웃을 암기하는 것이 아니라 소리의 기하학적 구조를 진정으로 이해하고 있음을 증명합니다. 비록 이 시스템이 정확한 거리를 판단하는 데는 여전히 약간의 어려움(오디오만으로는 매우 어려운 작업입니다)을 겪고 있지만, 원시 소리 데이터와 지능적 추론 사이의 간극을 성공적으로 메웠으며, 기계가 세상을 진정으로 '듣는' 능력을 갖추게 해주었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →