← 최신 논문
💻 computer science

Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation

본 논문은 혼합된 소리를 분리하기 위한 음향-의미 프로젝터(Acoustic-Semantic Projector)와 시간적 불일치를 처리하기 위한 비동기 역학 변조기(Asynchronous Dynamics Dynamics Modulator)를 활용하여 AVISeg 벤치마크에서 최첨단 성능을 달리는 새로운 오디오-비주얼 인스턴스 분할 프레임워크인 Hear to See (H2S)를 제안한다.

원저자: Leiye Liu, Miao Zhang, Jiahong Jiang, Jingjing Li, Jialong Zhong, Kai Peng, Tingwei Liu, Wei Ji, Yongri Piao, Huchuan Lu

게시일 2026-08-05
📖 5 분 읽기🧠 심층 분석

원저자: Leiye Liu, Miao Zhang, Jiahong Jiang, Jingjing Li, Jialong Zhong, Kai Peng, Tingwei Liu, Wei Ji, Yongri Piao, Huchuan Lu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 북적이는 거리 축제에 있다고 상상해 보세요. 당신의 눈은 군중을 훑으며 저글러, 마술사, 그리고 거리 음악가를 찾아내느라 분주합니다. 하지만 당신의 귀에는 동전이 짤랑거리는 소리, 기타의 웅성거림, 그리고 관중의 함성이 한데 뒤섞여 하나의 크고 무질서한 음파로 섞인 혼란스러운 소리가 들립니다. 오랫동안 컴퓨터는 세상을 '보는' 데는 뛰어났지만, 세상을 '듣는' 데는 어려움을 겪어 왔습니다. 컴퓨터는 소리가 '있다'는 것은 말할 수 있지만, 특히 여러 사람이 동시에 말하거나 악기를 연주할 때 그 소리가 '누구'의 것인지는 잘 구별하지 못합니다. 이것이 바로 '오디오-비주얼(Audio-Visual)' 이해의 난제입니다. 즉, 기계에게 단순히 일반적인 분위기가 아니라, 특정 기타나 특정 가수처럼 구체적인 사물을 추적하며 보이는 것과 들리는 것을 연결하도록 가르치는 일입니다. 이는 마치 시끄러운 방 안에서 누군가 말을 잠시 멈추더라도, 그 사람의 입 모양을 계속 주시하며 단 한 명의 대화에 집중하는 것과 같습니다.

이것이 바로 "Hear to See (H2S)"라고 불리는 새로운 컴퓨터 모델이 해결하고자 하는 과제입니다. 이 연구의 연구진들은 기존의 컴퓨터들이 두 가지 주요 문제로 인해 혼란을 겪고 있다는 점을 깨달았습니다. 첫째, 여러 소리가 섞일 때 컴퓨터는 그것들을 구별하는 데 필요한 세부 정보를 놓칩니다. 둘째, 소리와 시각은 항상 같은 속도로 일어나지 않습니다. 사람은 서 있는 상태로 노래를 멈출 수도 있고, 카메라가 초점을 맞추기도 전에 노래를 시작할 수도 있습니다. 이 논문은 컴퓨터에게 두 가지 특별한 초능력을 부여함으로써 이 문제를 해결하는 영리한 방법을 제안합니다. 하나는 엉망으로 섞인 소리의 수프를 풀어내는 능력이고, 다른 하나는 상황이 혼란스러울 때나 평온할 때에 따라 '듣는 속도'를 조절하는 능력입니다.

문제점: 소음이 가득한 무질서한 세상

이 새로운 모델이 왜 특별한지 이해하기 위해, 컴퓨터가 보통 이 문제를 어떻게 해결하려 하는지 살펴보겠습니다. 마치 형사가 지문(소리)을 용의자(시각적 대상)와 매칭하려는 상황을 상상해 보세요. 기존 방식들은 지문 전체를 가져와서 다루기 쉽게 약간 흐릿하게 만든 다음, 그것이 누구의 것인지 추측하려고 했습니다. 하지만 세 명의 용의자가 동시에 지문을 남기고 있다면, 그들을 하나로 뭉뚱그려 흐릿하게 만드는 것은 누가 누구인지 구별하는 것을 불가능하게 만듭니다. 결국 컴퓨터는 "오, 소리가 나니까 분명 사람이 있을 거야"라고 추측할 뿐, 그것이 '어떤' 사람의 소리인지, 혹은 소리가 멈춘 것인지조차 알지 못하게 됩니다.

게다가, 이 오래된 형사들은 매우 경직되어 있었습니다. 그들은 마치 시계를 1초마다 확인하듯 고정된 시간 블록 단위로 세상을 바라보았습니다. 만약 어떤 사람이 1초가 지나기 중간에 노래를 멈췄다면, 컴퓨터는 정해진 일정에 묶여 있기 때문에 여전히 그 사람이 노래하고 있다고 생각할 것입니다. 컴퓨터는 소리가 사라졌다는 사실에 적응하지 못해, 소리가 없는 물체가 여전히 소리를 내고 있다고 '환각'을 일으키는 결과를 초래했습니다.

해결책: 소리 수프를 분리하고 기어를 바꾸기

"Hear to See (H2S)" 모델은 다음 두 가지 기술, 즉 저자들이 **Acoustic-Semantic Projector (ASP)**와 **Asynchronous Dynamics Modulator (ADM)**라고 부르는 방법으로 이를 해결합니다.

1. 소리 분리 도구 (ASP)
오디오 신호를 딸기, 바나나, 블루베리가 모두 섞인 거대한 스무디라고 생각해 보세요. 기존 방식들은 스무디의 맛을 보고 그 안에 어떤 과일이 들어있는지 추측하려 했습니다. 하지만 H2S는 Acoustic-Semantic Projector라는 특별한 도구를 사용하여 스무디를 원래의 과일들로 다시 분리합니다. 이 도구는 엉망으로 섞인 소리를 가져와서 기타, 우쿨렐레, 가수 각각의 뚜렷한 스트림으로 나눕니다.

소리가 분리되면, 모델은 단순히 소리만 보는 것이 아니라 소리의 '의미'와 물체의 '위치' 사이에 다리를 놓습니다. 이는 기타 소리라는 '개념'을 비디오 속 기타의 '형태'와 매칭하는 것과 같습니다. 먼저 소리를 분리한 다음 단계적으로 시각적 세계와 매칭함으로써, 컴퓨터는 드디어 세 대의 기타가 동시에 연주되고 있더라도 "저 소리는 '저' 특정 기타의 것이다"라고 말할 수 있게 됩니다.

2. 스마트 속도 조절기 (ADM)
두 번째 기술은 타이밍에 관한 것입니다. 자동차 운전을 상상해 보세요. 직선의 빈 도로를 달릴 때는 풍경을 감상하며 여유롭게 주행합니다. 하지만 갑자기 과속 방지턱을 만나거나 아이가 도로로 뛰어들면, 당신은 브레이크를 밟고 즉각적인 위험에 온전히 집중합니다.

**Asynchronous Dynamics Modulator (ADM)**는 컴퓨터의 '두뇌'를 위해 정확히 이 역할을 수행합니다. 이 모델은 속도를 바꿀 수 있는 특수한 유형의 메모리 시스템(Mamba라고 불리는 것에 기반함)을 사용합니다.

  • 상황이 혼란스러울 때: 소리가 갑자기 시작되거나 멈추는 경우(예: 누군가 소리를 지르거나 문이 쾅 닫히는 경우), 모델은 이러한 변화를 감지하고 주의력을 높입니다. 모델은 새로운 소리를 놓치거나 소리가 없는 물체를 계속 추적하는 일이 없도록, 현재의 순간에 집중하여 변화를 포착합니다.
  • 상황이 평온할 때: 장면이 안정적이고 소리가 일관적이라면, 모델은 속도를 늦추고 과거의 기록을 되돌아봅니다. 모델은 추적을 매끄럽고 꾸준하게 유지하기 위해 방금 전 무엇을 보았는지 기억합니다.

이러한 "빠른 반응"과 "안정적인 기억" 사이를 전환하는 능력 덕분에, 컴퓨터는 소리와 시각이 항상 완벽하게 일치하지 않는 현실 세계의 비동기적 특성을 처리할 수 있습니다.

연구 결과

연구진은 복잡한 소리와 시각적 시나리오가 포함된 AVISeg라는 데이터셋을 통해 이 새로운 모델을 테스트했습니다. 그들은 "Hear to See" 모델을 기존의 가장 뛰어난 방법들과 비교했습니다.

결과는 매우 인상적이었습니다. 표준 카메라 백본(COCO라는 대규모 데이터셋으로 학습된 ResNet50)을 사용했을 때, 이 모델은 48.54 mAP(물체를 얼마나 잘 탐지하고 추적하는지를 나타내는 척도)를 달성했습니다. 이는 이전의 최고 기록보다 7.8% 더 높은 수치입니다.

특히 소리가 비동기적이거나(시작과 멈춤이 불규칙한 경우) 서로 섞여 있는 가장 어려운 시나리오를 살펴보았을 때, 모델의 격차는 더욱 벌어졌습니다. 특수한 "비동기 하위 집합(asynchronous subset)" 데이터에서, H2S 모델은 46.75 mAP를 기록한 반면, 기존의 최고 모델은 32.66 mAP에 그쳤습니다. 이는 14.09 mAP라는 엄청난 향상이며, 속도를 조절하고 소리를 분리하는 모델의 능력이 혼란스러운 상황에서 진가를 발휘한다는 것을 보여줍니다.

이것이 중요한 이유

이 논문은 컴퓨터에게 소리를 '분리'하고 세상의 움직임에 따라 '기어를 바꾸는' 능력을 부여함으로써, 비디오에 대한 이해도를 훨씬 높일 수 있음을 보여줍니다. 이제 컴퓨터는 단순히 활동의 잔상을 보는 것이 아니라, 소리가 없는 기타와 소리가 나는 기타를 구분하거나, 노래를 멈춘 가수를 놓치지 않고 추적할 수 있습니다.

저자들은 이 모델이 녹화된 영상을 보는 것(offline)에는 매우 효과적이지만, 컴퓨터가 다음에 일어날 일을 미리 볼 수 없는 실시간 상황(online)에 대해서는 아직 테스트되지 않았다고 언급했습니다. 하지만 현재로서는 "Hear to See"는 적절한 소리 분리와 스마트한 타이밍이 결합된다면, 기계도 마침 눈으로 보는 것만큼 명확하게 세상의 소리를 들을 수 있다는 것을 증명하고 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →