← 최신 논문
🤖 AI

VideoSearcher: Empowering Video Deep Research with Multi-Tool Agentic Reasoning via Reinforcement Learning

이 논문은 시간적 국소화, 공간적 집중, 그리고 멀티모달 검색을 통합하여 비디오 딥 리서치(Video Deep Research)를 발전시키기 위해 다중 도구 추론과 새로운 이분기 시퀀스 정책 최적화(Bi-branch Sequence Policy Optimization, BiSPO) 강화 학습 알고리즘을 활용하는 폐쇄 루프 에이전트 프레임워크인 VideoSearcher를 소개하며, 이와 함께 평가를 위한 새로운 VideoSearch-QA 벤치마크를 제시한다.

원저자: Zhenkun Gao, Yicheng Bao, Jinlong Peng, Xueheng Li, Theo Huang, Bangwei Liu, Kunquan Li, Zhenye Gan, Tao Hu, Chengjun Xie, Mingqian Yang, Xuanhua He, Zhizhong Zhang, Xin Tan, Chengjie Wang, Yuan Xie

게시일 2026-07-07
📖 3 분 읽기☕ 가벼운 읽기

원저자: Zhenkun Gao, Yicheng Bao, Jinlong Peng, Xueheng Li, Theo Huang, Bangwei Liu, Kunquan Li, Zhenye Gan, Tao Hu, Chengjun Xie, Mingqian Yang, Xuanhua He, Zhizhong Zhang, Xin Tan, Chengjie Wang, Yuan Xie

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 미스터리를 해결하려는 탐정이라고 상상해 보세요. 하지만 당신의 "범죄 현장"은 범죄 현장이 아니라, 길고 지루한 영상입니다.

문제점: "닫힌 상자" 속의 탐정
현재 대부분의 비디오 AI 모델은 방 안에 갇혀 오직 비디오 파일만을 마주하고 있는 탐정과 같습니다. 그들은 "필요한 모든 정보는 이 영상 안에 있다"라는 말을 듣습니다. 만약 정답이 영상에 명시적으로 적혀 있거나 보여지지 않는다면, 그들은 꼼짝도 할 수 없습니다. 이름을 찾아보거나, 날짜를 확인하거나, 사실 관계를 검증하기 위해 방 밖으로 나갈 수 없기 때문입니다.

해결책: VideoSearcher
이 논문은 VideoSearcher라는 새로운 종류의 AI 탐정을 소개합니다. 이 탐정은 방 밖으로 나갈 수 있는 허가를 받았습니다. 이 모델은 비디오를 최종적인 정답이 아니라 하나의 단서로 취급합니다.

VideoSearcher를 스마트폰, 돋보기, 그리고 지도를 가진 탐정이라고 생각해보세요. 작동 방식은 다음과 같습니다.

  1. 범죄 현장 스캔하기 (비디오): 탐정은 영상을 시청합니다. 영상을 한꺼번에 통째로 쳐다보는 대신, 흥미로운 부분(예: 특정 캐릭터 찾기)으로 빨리감기를 하거나 아주 작은 디테일(예: 번호판이나 로고 읽기)을 확대하는 법을 알고 있습니다.
  2. 지원 요청하기 (도구 활용): 단서(예: "저건 어떤 비디오 게임의 캐릭터 같다")를 포착하면, 추측하지 않습니다. 대신 도구를 사용합니다:
    • 이미지 검색: 단서의 사진을 찍어 인터넷에서 그것이 무엇인지 검색합니다.
    • 웹 검색: 기사와 위키피디아 등을 읽어 해당 캐릭터에 대한 사실(예: "그 캐릭터의 특수 기술은 무엇인가?")을 알아냅니다.
  3. 종합하기: 영상에서 본 것과 인터넷에서 찾은 정보를 결합하여 최종적인 답을 내놓습니다.

비법: 어떻게 학습했는가?
AI에게 이런 능력을 가르치는 것은 어렵습니다. 단순히 "정답을 맞춰라"라고만 말하면, 운 좋게 한 번은 맞힐 수 있어도 다음번에는 실패할 수 있습니다. 저자들은 BiSPO(Bi-branch Sequence Policy Optimization)라고 불리는 특별한 훈련법을 만들었습니다.

이것은 마치 두 개의 별도 성적표를 가진 학생을 교육하는 것과 같습니다:

  • 성적표 A (정답): 최종 정답을 맞혔는가?
  • 성적표 B (과정): 도구를 제대로 사용했는가? 적절한 지점을 확대했는가? 적절한 타이밍에 웹 검색을 했는가?

대부분의 AI 훈련은 성적표 A에만 관심을 둡니다. 하지만 VideoSearcher는 둘 다 신경 씁니다. 이를 통해 AI가 단순히 정답을 찍는 것이 아니라, 훌륭한 조사관이 되는 습관을 배우도록 합니다. AI는 충분한 정보를 얻었을 때 검색을 멈추는 법과, 막혔을 때 더 열심히 검색하는 법을 배웁니다.

새로운 테스트: VideoSearch-QA
저자들은 기존의 테스트들이 영상만으로 답을 낼 수 있는 질문들만 던지기 때문에 불공평하다는 점을 깨달았습니다. 그래서 그들은 VideoSearch-QA라는 새로운 벤치마크를 구축했습니다.

학생에게 유명한 랜드마크가 나오는 영상을 보여준 뒤, "이곳은 언제 개관했습니까?"라고 묻는다고 상상해 보세요. 만약 영상 속에 날짜가 적힌 명판이 없다면, 학생은 반드시 이를 직접 찾아봐야만 합니다. 이 새로운 벤치마크는 바로 이 점을 테스트합니다: AI가 영상에서 단서를 찾아낸 다음, 오픈 웹에서 나머지 정보를 찾아낼 수 있는가?

결과
VideoSearcher를 다른 AI 모델들(무료 및 유료 모델 모두)과 비교 테스트했을 때, 이 모델이 승리했습니다. VideoSearcher는 다음 항목들에서 훨씬 뛰어난 성능을 보였습니다:

  • 긴 영상에서 특정 순간 찾기.
  • 빈틈을 메우기 위해 인터넷 활용하기.
  • 시각적 확인과 검색이 모두 필요한 복잡한 문제 해결하기.

요약
VideoSearcher는 수동적인 관찰자에서 능동적인 조사관으로 졸업한 AI입니다. 이 모델은 단순히 영상을 "보는" 것이 아니라, 영상을 "조사"하고, 현실 세계의 정보를 모으기 위해 도구를 사용하며, 이전에는 컴퓨터가 풀 수 없었던 퍼즐들을 해결합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →