← 최신 논문
🤖 AI

SelectTSL: Prompt-Guided Selective Target Sound Localization in Complex Scenarios

이 논문은 프롬프트 유도 선택적 주의 메커니즘을 활용하여 복잡한 다중 소스 음향 환경에서 사용자가 지정한 대상 음원을 정확하게 국지화하고 그 기수(cardinality)를 추정함으로써, 대상 음원 추출과 음원 국지화 사이의 간극을 효과적으로 메우는 엔드 투 엔드 딥러닝 프레임워크인 SelectTSL을 소개한다.

원저자: Ziyang Jiang, Yu Chen, Zexu Pan, Xinyuan Qian, Bowen Xing, Ivor W. Tsang, Xu-Cheng Yin, Haizhou Li

게시일 2026-07-03
📖 3 분 읽기☕ 가벼운 읽기

원저자: Ziyang Jiang, Yu Chen, Zexu Pan, Xinyuan Qian, Bowen Xing, Ivor W. Tsang, Xu-Cheng Yin, Haizhou Li

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

시끄럽고 혼란스러운 파티에 있다고 상상해 보세요. 사람들의 대화 소리, 음악 소리, 그리고 구석에서 짖는 강아지 소리가 들립니다. 만약 당신이 특정 친구의 목소리만 듣고 싶다면, 당신의 뇌는 자연스럽게 소음을 걸러내고 그 목소리에만 집중합니다. 이것을 "칵테일 파티 효과(cocktail party problem)"라고 부릅니다.

하지만 현재의 컴퓨터 시스템은 필터링을 할 줄 모르는 파티 손님과 같습니다. 만약 당신이 일반적인 음원 위치 추적 컴퓨터에게 "소리가 어디에서 들려?"라고 묻는다면, 그 컴퓨터는 음악, 강아지, 사람들 대화 등 모든 곳을 가리킬 것입니다. 즉, 소리의 방향을 엉망진창으로 보여주는 것이죠.

반면, 어떤 고급 시스템들은 특정 목소리(예: 당신의 친구 목소리)를 추출하여 더 명확하게 들려줄 수는 있지만, 그 과정에서 그 목소리가 정확히 어디에서 오는지 알려주는 능력은 종종 상실하곤 합니다. 무엇을 들어야 하는지는 알지만, 그것이 어디에 있는지는 모르는 상태가 되는 것입니다.

"SelectTSL": 스마트한 파티 손님

이 논문은 SelectTSL(Selective Target Sound Localization, 선택적 대상 음원 위치 추적)이라는 새로운 시스템을 소개합니다. 이것을 아주 똑똑한 파티 손님이라고 생각해보세요. 이 손님은 두 가지를 모두 할 수 있습니다. 당신이 원하는 것만 골라 듣는 동시에, 그것이 정확히 어디에 있는지도 알려주는 것이죠.

작동 원리는 다음과 같은 쉬운 비유를 통해 설명할 수 있습니다.

1. "프롬프트" (당신의 요청)

SelectTSL는 단순히 소음을 듣는 대신, 프롬프트라고 불리는 특정한 지시를 기다립니다. 당신은 두 가지 방식으로 이 지시를 내릴 수 있습니다:

  • 텍스트: "음성을 찾아줘"라고 타이핑합니다.
  • 오디오: 찾고자 하는 소리(예: 강아지가 짖는 1초 정도의 샘플)를 들려주며 "이 소리를 찾아줘"라고 말합니다.

2. "선택적 필터" (PGSA 모듈)

요청을 받으면, 시스템은 PGSA(Prompt-Guided Selective Attention, 프롬프트 유도 선택적 주의)라고 불리는 특별한 필터를 사용합니다.

  • 비유: 방 안에 모든 소리를 나타내는 거대하고 엉클어진 실타래 뭉치가 있다고 상상해 보세요. 당신의 프롬프트는 특정 색깔의 염료와 같습니다. PGSA 모듈은 이 실타래 속에 자석을 담급니다. 자석은 당신의 염료 색상과 일치하는 실들(대상 소리)만 잡아내고, 나머지(소음 및 다른 목소리)는 무시합니다.
  • 이 과정을 통해 시스템은 오디오를 정화하여, 대상 소리와 관련된 "실"들만 남깁니다.

3. "공간 탐정" (IPD 인핸서)

대상 소리를 분리해낸 후, 시스템은 이제 그 위치를 찾아야 합니다.

  • 비유: 두 개의 귀(또는 두 개의 마이크)를 사용하여 소리의 근원을 찾는다고 상상해 보세요. 시스템은 소리가 왼쪽 귀와 오른쪽 귀에 도달하는 미세한 시간 차이(Inter-Channel Phase Difference, IPD)를 살펴봅니다.
  • 시스템이 이미 소음을 걸러냈기 때문에, 이제 이러한 미세한 타이밍 차이를 훨씬 더 명확하게 포착할 수 있습니다. 이는 마치 록 콘서트장에서의 속삭임을 듣는 것과 조용한 방 안에서의 속삭임을 듣는 것의 차이와 같습니다. 조용한 방에서는 타이밍 단서를 훨씬 더 쉽게 찾을 수 있습니다 있습니다.

4. "개수 세기와 추적" (Cardinality Head)

시스템은 단순히 한 방향만을 추측하는 것이 아니라, 대상 소리가 몇 개 존재하는지도 함께 계산합니다.

  • 비유: 만약 당신이 "음성을 찾아줘"라고 요청했다면, 시스템은 다음과 같이 확인합니다: "말하는 사람이 한 명인가, 두 명인가, 아니면 아무도 없는가?" 이를 통해 움직이는 화자의 수가 변하는 상황도 처리할 수 있습니다.
  • 또한, 시스템은 단순히 흔들리는 점 하나를 보여주는 것이 아니라, 시간이 흐름에 따라 소리가 이동하는 경로를 지도 위에 매끄러운 선으로 그려냅니다.

이것이 왜 중요한가요?

논문에서는 이 시스템을 두 가지 방식으로 테스트했습니다:

  1. 시뮬레이션된 공간: 움직이는 스피커, 짖는 강아지, 큰 소음이 있는 디지털 공간을 만들었습니다.
  2. 실제 녹음: 실제 울림(에코)과 가구가 있는 실제 방에서 테스트했습니다.

결과:

  • 기존 시스템들: 소음이 많은 방에 직면했을 때, 모든 곳을 가리키며 혼란스러워하거나 엉뚱한 곳을 가리켰습니다.
  • SelectTSL: 일관되게 정확한 대상을 찾아냈고, 소음을 무시했으며, 움직임을 매끄럽게 추적했습니다. 심지어 대상 화자가 잠시 말을 멈췄다가 다시 시작하는 상황에서도 시스템은 추적을 놓치지 않았습니다.

요약

요약하자면, SelectTSL는 컴퓨터가 시끄러운 방에서 듣는 법을 배우는 새로운 방식입니다. 단순히 "모든 소리가 들려요!"라고 외치는 대신, "나는 '이것'을 듣고 싶어"라는 당신의 요청을 기다린 후, 레이저처럼 집중된 스포트라이트가 되어 혼란스러운 환경 속에서도 그 특정 소리가 정확히 어디에서 오고 어디로 가고 있는지를 알려줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →