← 최신 논문
🤖 AI

Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models

이 논문은 4만 개의 파노라마 비디오와 앰비소닉스(Ambisonics) 오디오를 포함하는 대규모 시공간 오디오-비주얼 벤치마크인 ST-OmniQA를 소개하고, 점진적 커리큘럼과 강화 학습을 통해 방향성 오디오 단서와 시각적 문맥을 통합하여 음원의 정체성, 위치 및 움직임을 추론함으로써 베이스라인을 크게 능가하는 모델인 ST-Omni-R1을 제안한다.

원저자: Zhi Zeng, Cheng Zhang, Zesheng Yang, Rendong Pi, Jiaying Wu, Di Zhang, Zihan Ma, Guodong Li, Zhou Yang, Yu Xiang, Yifei Zheng, Minnan Luo

게시일 2026-08-11
📖 5 분 읽기🧠 심층 분석

원저자: Zhi Zeng, Cheng Zhang, Zesheng Yang, Rendong Pi, Jiaying Wu, Di Zhang, Zihan Ma, Guodong Li, Zhou Yang, Yu Xiang, Yifei Zheng, Minnan Luo

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 눈을 감은 채 번화한 거리를 걷고 있다고 상상해 보십시오. 개가 짖는 소리, 자동차 경적 소리, 그리고 누군가 웃는 소리가 들립니다. 당신의 뇌는 단순히 '소음'을 듣는 것이 아니라, 그 소리가 무엇인지, 어디에서 오는지, 그리고 어디로 가고 있는지를 즉각적으로 파악합니다. 개가 왼쪽으로 달려가고 있고, 자동차는 오른쪽에서 다가오고 있으며, 웃음소리는 아직 보이지 않는 어떤 사람에게서 나오고 있다는 것을 알아차립니다. 소리를 통해 움직이는 물체를 추적하기 위해 청각과 시각을 결합하는 이 능력은 인간이 가진 초능력이지만, 컴퓨터에게는 악몽과 같습니다.

오랫동안 소리를 이해하는 컴퓨터 프로그램(오디오-언어 모델)은 눈을 감고 있는 사람과 같았습니다. 그들은 개가 짖고 있다는 것은 말할 수 있었지만, 그 개가 당신 쪽으로 다가오고 있는지 아니면 멀어지고 있는지는 말할 수 없었습니다. 반면에 영상을 이해하는 프로그램(비전-언어 모델)은 귀를 막고 있는 사람과 같았습니다. 그들은 개를 볼 수는 있었지만, 그 개가 지금 짖고 있는 바로 그 개인지 아니면 그냥 가만히 서 있는 것인지는 알지 못했습니다. 현재 과학계의 큰 과제는 이 두 가지를 동시에 수행할 수 있는 로봇의 뇌를 만드는 것입니다. 즉, 소리를 듣고, 영상을 보고, 공간과 시간 속에서 소리의 근원이 어떻게 움직이는지 정확히 파악하도록 만드는 것입니다. 이 논문은 바로 이 문제를 다루며, 기계에게 동시에 "듣고, 보고, 추적하는" 법을 가르치고자 합니다.


문제점: "눈먼" 로봇과 "귀먹은" 로봇

이 논문의 저자들은 현재의 똑똑한 컴퓨터들이 생각하는 방식에 격차가 있다는 점을 발견했습니다. 어떤 모델들은 소리를 이해하는 데는 뛰어나지만, 전체 영상 클립을 하나의 크고 흐릿한 소리 이벤트로 취급합니다. 이들은 소리가 어디에서 오는지, 혹은 어떻게 움직이는지에 대한 세부 사항을 놓칩니다. 다른 모델들은 영상을 보는 데는 뛰어나지만, 위치 정보(방향이나 거리 등)가 부족한 단순한 오디오에 의존하기 때문에 사물의 위치를 알지 못합니다.

이것은 마치 붐비는 공원에서 친구를 찾는 것과 같습니다. 만약 당신이 친구의 목소리(오디오) 정보만 가지고 있다면, 그가 거기 있다는 것은 알 수 있지만 그를 가리킬 수는 없습니다. 만약 사진(비디오)만 가지고 있다면, 그를 볼 수는 있지만 그가 지금 말하고 있는 사람인지 알 수 없습니다. 장면을 진정으로 이해하려면, 목소리를 특정 인물과 매칭시키고 그 사람이 나무 뒤로 가거나 코너를 돌 때의 움직임을 추적해야 합니다. 기존 모델들은 이러한 "결합(binding)" 문제, 즉 움직이는 소리를 영상 속의 움직이는 물체와 쉽게 연결하지 못하는 문제로 어려움을 겪습니다.

해결책: 새로운 놀이터와 새로운 뇌

이를 해결하기 위해 연구진은 두 가지를 만들었습니다: 거대한 새로운 테스트인 ST-OmniQA와 새로운 AI 모델인 ST-Omni-R1입니다.

1. 테스트: ST-OmniQA
카메라가 360도로 회전하는 파노라마 영상이고, 소리는 소리의 위치를 정확히 아는 특수 마이크(First-Order Ambisonics 또는 FOA라고 불림)로 녹음된 거대한 비디오 게임을 상상해 보십시오. 연구진은 40,000개의 영상 클립과 이에 대한 400,000개의 질문으로 구성된 데이터셋을 구축했습니다.

질문은 비디오 게임처럼 네 단계의 난이도로 높아집니다:

  • 단계 A (기초): "이것은 어떤 소리인가요?" 또는 "얼마나 멀리 있나요?"
  • 단계 B (군중): "두 마리의 개가 짖고 있습니다. 어느 쪽이 왼쪽에 있습니까?"
  • 단계 C (추격): "어떤 소리 근원이 저기에 서 있는 사람을 향해 움직이고 있습니까?"
  • 단계 D (미스터리): "2초에서 3초 사이에 소리가 들렸지만, 소스의 모습은 아직 보이지 않았습니다. 이 소스는 3초에서 5초 사이에 왼쪽 문을 통해 들어왔습니다. 그것은 누구였습니까?"

이 테스트는 AI가 단순히 추측하는 것이 아니라 시간, 공간, 그리고 소리와 시각이 어떻게 맞물리는지에 대해 추론하도록 강제합니다.

2. 뇌: ST-Omni-R1
연구진은 이 테스트를 치를 새로운 AI 모델을 구축했습니다. 이 모델은 단순히 평면적인 오디오 파일을 듣는 대신, 3D 소리 데이터를 "궤적 토큰(trajectory tokens)"의 목록으로 변환하는 특수한 "번역기(STA-encoder)"를 사용합니다. 이 토큰들은 AI에게 소리가 시간에 따라 어떻게 움직였는지를 알려주는 빵 부스러기 길과 같습니다.

모델은 학교를 다니는 학생처럼 단계별로 학습합니다:

  • 단계 A: 간단한 소리를 식별하고 그 위치를 파악하는 법을 배웁니다.
  • 단계 B: 여러 소리를 동시에 처리하는 법을 배웁니다.
  • 단계 C: 서로 다른 소리들이 상대적으로 어떻게 움직이는지 비교하는 법을 배웁니다.
  • 단계 D: 물체가 벽 뒤로 사라졌다가 다시 나타나는 경우(폐쇄/occlusion)에도 소리를 특정 물체와 연결하는 법을 배웁니다.

모델을 더 똑똑하게 만들기 위해, 연구진은 "추론 트리 강화 학습(Reasoning-Tree Reinforcement Learning)" 기법을 사용했습니다. AI가 퍼즐을 풀고 있다고 상상해 보십시오. 시스템은 단순히 정답을 알려주는 대신, AI의 사고 과정의 모든 단계를 점검합니다. 만약 AI가 "개는 왼쪽에 있다"라고 말한다면, 시스템은 AI가 개를 올바르게 식별했는지, 개가 왼쪽에 있다는 것을 올바르게 보았는지, 그리고 짖는 소리를 개와 올바르게 연결했는지를 확인합니다. 만약 단계들이 일치하지 않으면, AI는 "빨간 펜" 교정을 받게 됩니다. 이는 모델이 일관성 있고 논리적으로 학습하도록 돕습니다.

결과: 거대한 도약

연구진이 ST-Omni-R1을 ST-OmniQA 테스트에 투입했을 때, 모델은 놀라운 성과를 거두었습니다.

  • 가장 뛰어난 기존 모델들(현존하는 가장 똑똑한 범용 AI 포함)은 평균적으로 약 **37.28%**의 정답률을 보였습니다.
  • ST-Omni-R1은 특수 훈련 후 **77.83%**의 정확도를 달럽했습니다.

이것은 단순한 개선이 아니라 엄청난 도약입니다. 이 모델은 소스 근원이 물체 뒤로 숨었다가 다시 나타나는 상황이나, 서로 다른 방향으로 움직이는 유사한 두 소리를 구별하는 것과 같은 복잡한 시나리오를 처리할 수 있음을 증명했습니다.

또한 연구진은 이 모델을 한 번도 학습에 사용하지 않은 세 가지 실제 오디오 데이터셋(TAU-NIGENS, L3DAS22, STARSS23)에 대해서도 테스트했습니다. 별도의 훈련 없이도 ST-Omni-R1은 이전의 최고 모델들을 능가했습니다. 이는 모델이 공간과 움직임을 이해하는 방식이 특정 테스트뿐만 아니라 다양한 상황에서 사용할 수 있는 기술임을 시사합니다.

이것이 왜 중요한가

이 논문은 컴퓨터가 세상을 하나의 움직이는 이야기로서 "보고 듣는" 인간과 같은 능력을 갖추는 데 우리가 점점 더 가까워지고 있음을 보여줍니다. 소리 근원의 여정(어디서 시작되었고, 어디로 갔으며, 숨겨져 있을 때 어떤 모습이었는지)을 추적하도록 기계를 가르침으로써, 우리는 역동적이고 소란스러우며 시각적인 세상을 진정으로 이해할 수 있는 로봇과 가상 비서의 토대를 구축하고 있습니다. 저자들은 3D 사운드와 파노라마 영상을 결합하고 AI에게 단계별로 추론하도록 가르치는 이 접근 방식이 다음 단계의 지능을 여는 열쇠라고 제안합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →