← 최신 논문
🤖 AI

Agentic Active Omni-Modal Perception for Multi-Hop Audio-Visual Reasoning

본 논문은 다단계 오디오-시각 추론을 위한 벤치마크인 MOV-Bench 를 소개하고, 추가 학습 없이 능동적인 오모달 지각을 통해 오픈소스 Omni-LLM 의 추론 능력을 향상시키는 효율적인 에이전트 프레임워크인 AOP-Agent 를 제안합니다.

원저자: Ke Xu, Yuhao Wang, Ziyang Cheng, Hongcheng Liu, Yanfeng Wang, Yu Wang

게시일 2026-05-28
📖 4 분 읽기☕ 가벼운 읽기

원저자: Ke Xu, Yuhao Wang, Ziyang Cheng, Hongcheng Liu, Yanfeng Wang, Yu Wang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

이 글은 간단한 언어와 창의적인 비유를 사용하여 해당 논문을 설명합니다.

큰 문제: "건초더미 속의 바늘" 비디오

30 분짜리 분주한 작업장 비디오를 받았다고 상상해 보세요. 누군가 당신에게 까다로운 질문을 합니다: "기술자가 왜 그 특정 접착제를 칩에 바랐을까?"

이 질문에 답하려면 1 초만 보면 안 됩니다. 다음을 수행해야 합니다:

  1. 5 분 전에 한 "불량 칩"에 대한 코멘트를 듣기.
  2. 10 분 전에 느슨한 전선을 보여주는 시각적 샷을 보기.
  3. 저 멀리 떨어진 두 가지 정보를 연결하여 접착제가 불량 납땜 접합부에 대한 임시 해결책임을 깨닫기.

현재의 AI 모델 (Omni-LLM 이라고 함) 은 비디오 전체를 한 번에 외우려 하는 학생과 같습니다. 비디오가 길어지면 압도당합니다. 5 분 전의 단서나 10 분 전의 시각적 단서를 잊어버리거나 놓칩니다. 증거가 흩어져 있고 희소하기 때문에 전체 혼란을 바탕으로 답을 추측하려다 종종 틀립니다.

해결책 1: MOV-Bench ("어려운 시험")

연구자들은 먼저 MOV-Bench라는 새로운 시험을 만들었습니다.

  • 무엇인가: 실제 비디오를 기반으로 한 519 개의 까다로운 질문 모음입니다.
  • 주의할 점: 모든 질문은 "멀티홉 (multi-hop)" 추론을 요구합니다. 클립 하나만 보고는 답할 수 없습니다. 비디오의 서로 다른 시간을 오가며 청각 (오디오) 과 시각 (시각) 을 전환해야 합니다.
  • 결과: 현재 AI 모델을 이 시험으로 테스트했을 때, 모델들은 실패했습니다. 흩어진 단서를 찾고 점들을 연결하는 데 어려움을 겪었습니다.

해결책 2: AOP-Agent ("탐정")

AI 에게 비디오 전체를 한 번에 외우게 하는 대신, 연구자들은 AOP-Agent라는 새로운 시스템을 만들었습니다. 시험을 위해 암기하는 학생이 아니라 미스터리를 해결하는 탐정으로 생각하세요.

다음은 "저자원 (Low-Resource)" 접근 방식을 사용하여 탐정이 작동하는 방식입니다 (비싼 슈퍼컴퓨터나 특수한 훈련이 필요하지 않음):

  1. 문서함 (계층적 기억):
    탐정이 시작하기 전에 비디오는 지능적인 문서함으로 정리됩니다.

    • 개요: 전체 비디오에 대한 한 페이지 요약.
    • 챕터: 비디오는 30 초 단위로 나뉘며, 각 챕터에는 짧은 요약과 "키워드" 목록 (예: "접착제", "칩", "납땜") 이 있습니다.
    • 세부 사항: 필요하면 탐정은 고해상도 세부 정보를 위해 특정 5 초 클립으로 확대할 수 있습니다.
  2. 세 단계 루프 (관찰, 반성, 재계획):
    탐정은 단순히 보는 것이 아니라 세 가지 역할을 통해 적극적으로 단서를 찾습니다:

    • 기획자: 질문과 "문서함"을 봅니다. *"접착제에 대해 논의한 부분을 찾아야 해. 먼저 '키워드' 섹션을 검색하자."*라고 말합니다.
    • 관찰자: 기획자가 요청한 특정 비디오 세그먼트를 불러오기 위해 도구를 사용합니다.
    • 반성자: 증거를 확인합니다. "좋아, 접착제는 찾았지만 '불량 칩'은 아직 못 찾았어. 현재 단서로는 부족해. 다시 가서 다음 30 초의 '오디오' 섹션을 검색하자."

    단서가 여전히 부족하면 기획자는 전략을 변경 (재계획) 하고 다른 검색 도구를 시도합니다. 이 루프는 탐정이 모든 조각을 확보했다고 확신할 때까지 계속됩니다.

  3. 답변:
    탐정이 비디오의 서로 다른 부분에서 충분한 구체적인 증거를 수집하면, **추론자 (최종 판사)**가 퍼즐을 맞춰 답을 제시합니다.

이것이 중요한 이유

  • 마법 같은 훈련 없음: 이 시스템은 재훈련하거나 비싼 독점 "블랙박스" 모델을 사용할 필요 없이 오픈소스 AI 모델로 작동합니다.
  • 능동적 vs. 수동적: 이전 방법은 수동적이었습니다 (비디오 전체를 보고 기억하기를 바라는 것). AOP-Agent 는 능동적입니다 (무엇을, 언제 볼지, 언제 멈출지 정확히 결정하는 것).
  • 결과: "어려운 시험 (MOV-Bench)" 및 기타 비디오 벤치마크에서 테스트했을 때, AOP-Agent 는 특히 긴 비디오와 많은 다른 단서를 연결해야 하는 질문에서 기존 방법보다 훨씬 뛰어난 성과를 보였습니다.

한계점 ("탐정의 실수")

논리는 이 시스템이 완벽하지 않다고 인정합니다:

  • 환각 (Hallucinations): "문서함"(기억) 이 장면을 잘못 설명하면 (예: 사람이 외치지 않았는데 외쳤다고 함), 탐정은 그 거짓말을 바탕으로 잘못된 이론을 세울 수 있습니다.
  • 속도: 탐정이 여러 번 멈추고, 생각하고, 검색하고, 확인해야 하기 때문에 비디오를 한 번 보는 것보다 시간이 더 걸립니다.
  • 실시간: 시스템은 먼저 전체 비디오를 문서함으로 처리해야 하므로 현재 라이브 스트리밍 비디오 (예: 라이브 스포츠 중계) 에 실시간으로 작동할 수 없습니다.

요약

이 논문은 AI 에게 긴 비디오에 대해 추론하는 새로운 방법을 소개합니다. 비디오 전체를 한 번에 삼키려 하는 대신, AI 에게 탐정의 도구 상자를 제공합니다: 흩어진 단서를 사냥하고, 찾은 것을 반성하며, 확신할 때만 답변하는 지능적인 문서 시스템과 단계별 프로세스입니다. 이를 통해 표준 오픈소스 AI 모델이 이전에 처리하지 못했던 복잡한 비디오 퍼즐을 해결할 수 있게 됩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →