← 최신 논문
💻 computer science

Active Perception Agent for Omnimodal Audio-Video Understanding

OmniAgent는 별도의 학습 없이도 최첨단의 전방위적 오디오-비디오 이해를 달성하기 위해 특화된 단일 모달 도구들을 동적으로 조율하고 새로운 조대-미세(coarse-to-fine) 오디오 가이드 패러다임을 채택한 최초의 완전 능동형 인지 에이전트를 소개합니다.

원저자: Keda Tao, Wenjie Du, Bohan Yu, Weiqiang Wang, Jian Liu, Huan Wang

게시일 2026-02-06
📖 3 분 읽기☕ 가벼운 읽기

원저자: Keda Tao, Wenjie Du, Bohan Yu, Weiqiang Wang, Jian Liu, Huan Wang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 길고 소음이 많은 영화 속에서 미스터리를 풀려고 한다고 상상해 보세요. 당신에게는 이런 질문이 있습니다. "캐릭터가 고양이가 야옹 하기 직전에 언급한 가게 간판의 이름은 무엇인가?"

일반적인 AI(예: 전형적인 "OmniLLM")에게 이 질문을 던진다면, 그것은 마치 사람에게 영화 전체를 한꺼번에 보고, 사운드트랙 전체를 한꺼번에 들으면서 정답을 추측하라고 하는 것과 같습니다. 그들은 정보에 압도당하거나, 특정 순간(고양이가 야옹 한 순간)을 놓치거나, 가게 간판을 다른 무언가와 혼동할 수도 있습니다. 그들은 모든 것을 동시에 처리하려고 노력하며, 이는 종종 실수를 유발합니다.

OmniAgent의 등장.

이 논문은 OmniAgent를 단순히 영화를 수동적으로 "보는" 것이 아니라, 언제 보고 언제 들어야 할지를 정확히 결정하며 단계별로 능동적으로 현장을 조사하는 매우 똑똑한 탐정에 비유하여 소개합니다.

OmniAgent가 어떻게 작동하는지, 쉬운 비유를 통해 설명하겠습니다.

1. 탐정의 도구 상자 (The "Tools")

하나의 거대한 뇌가 모든 것을 한꺼번에 하려고 하는 대신, OmniAgent는 특화된 도구들이 담긴 도구 상자를 가지고 있습니다:

  • "귀" (오디오 도구): 이 도구들은 사람들이 말하는 내용을 즉시 받아쓰기할 수 있으며, 결정적으로 탐정에게 소리가 발생한 정확한 시점(예: 고양이가 야옹 하는 소리)을 알려줍니다.
  • "눈" (비디오 도구): 이 도구들은 영화 전체를 빠르게 스캔하여 대략적인 흐름을 파악하거나, 특정 10초 구간을 확대하여 아주 작은 디테일(예: 벽에 걸린 간판 읽기)을 볼 수 있습니다.
  • "검색 엔진" (이벤트 도구): 이것은 탐정의 비밀 무기입니다. 오디오를 듣고 "중요한 순간들"의 지도를 만듭니다 (예: "1:48에 야옹 함", "2:10에 웃음").

2. 조사 과정 (The "Loop")

OmniAgent는 **"생각하기-행동하기-관찰하기-성찰하기(Think-Act-Observe-Reflect)"**라는 순환 과정을 따릅니다. 논문의 예시를 통해 이 미스터리를 어떻게 해결하는지 보겠습니다:

  • 1단계: 단서 찾기 (생각 및 행동): 탐정은 "고양이"에 대한 질문을 받습니다. 영화 전체를 다시 보는 대신, 오디오 검색 엔진을 사용합니다. 오디오를 스캔하며 말합니다. "아! 1:48에서 1:49 사이에 고양이가 야옹 하는 소리가 들린다."
  • 2단계: 맥락 파악 (관찰): 이제 언제 영상을 봐야 할지 알게 되었습니다. 오디오 도구에게 묻습니다. "야옹 하기 바로 직전에 무슨 말이 나오고 있었지?" 도구가 대답합니다. "캐릭터가 '오, 난커(Nán Kē), 내가 코난을 봤는데...'라고 말했습니다."
  • 3단계: 검증 (성찰 및 행동): 이제 탐정은 "난커"와 "코난"이라는 단어에 대한 짐작을 가졌습니다. 탐정은 비디오 클립 도구를 사용하여 해당 시점(1:30–1:40)의 영상을 확대하기로 결정합니다. 화면을 자세식히 보니 "난커"라고 적힌 간판이 보입니다.
  • 4단계: 결론 (성찰): 탐정은 점들을 연결합니다. 오디오에서는 "난커"를 언급했고, 비디오에서는 "난커"라고 적힌 간판이 보였습니다. 탐정은 "난커"가 오래된 중국 이야기의 참조이며, "코난"은 일본 애니메이션임을 깨닫습니다. 그리고 자신 있게 질문에 답합니다.

3. 왜 다른 모델보다 더 나은가

논문은 OmniAgent를 다른 모델들(예: Qwen3-Omni 또는 Gemini)과 비교하며, OmniAgent가 세밀한 이해(fine-grained understanding) 측면에서 훨씬 뛰어나다는 것을 보여줍니다.

  • 과거의 방식 (수동적): 누군가 당신에게 소리를 지르는 와중에 책을 읽으면서, 특정 페이지를 확인하기 위해 멈추지 않고 정답을 추측해야 하는 상황을 상상해 보세요. 당신은 틀릴 수도 있습니다.
  • OmniAgent의 방식 (능동적): 먼저 시간을 찾기 위해 귀를 사용해야겠다고 말하는 탐정을 상상해 보세요. "좋아, 이제 시간을 알았어. 이제 영상을 잠시 멈추고 저 부분을 확대해서 글자를 읽어보자."

핵심 요약

이 논문은 AI가 귀로 듣고 눈으로 볼지를 능동적으로 선택하게 하고, 오디오를 사용하여 영상을 볼 정확한 시간을 찾게 함으로써, 다른 모델들이 틀리는 문제들을 해결한다고 주장합니다.

그들이 수행한 테스트(Daily-OmniWorldSense 벤치마크)에서, OmniAgent는 별도의 재학습 없이도 기존의 최고 모델들보다 10%에서 20% 더 많은 질문을 맞혔습니다. 이는 언제 귀를 기울이고 언제 눈을 집중해야 할지 아는 "똑똑한 탐정"이 되는 것이, 단순히 모든 것을 한꺼번에 하려는 "거대한 뇌"를 갖는 것보다 더 낫다는 것을 증명했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →