← 최신 논문
🤖 AI

VideoThinker: Building Agentic VideoLLMs with LLM-Guided Tool Reasoning

VideoThinker 은 강력한 언어 모델이 캡션 공간에서 생성한 도구 사용 궤적을 비디오 프레임으로 치환하여 합성 데이터를 구축함으로써, 장기간 비디오 이해의 한계를 극복하고 적응적 탐색 및 다단계 도구 추론 능력을 갖춘 에이전트형 비디오 LLM 을 구현합니다.

원저자: Chenglin Li, Qianglong Chen, Feng Han, Yikun Wang, Xingxi Yin, Yan Gong, Ruilin Li, Yin Zhang, Jiaqi Wang

게시일 2026-04-21
📖 3 분 읽기☕ 가벼운 읽기

원저자: Chenglin Li, Qianglong Chen, Feng Han, Yikun Wang, Xingxi Yin, Yan Gong, Ruilin Li, Yin Zhang, Jiaqi Wang

원본 논문은 CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/)에 따라 공공 도메인에 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

🎥 비디오 씽커 (VideoThinker): 긴 영상을 똑똑하게 분석하는 '탐정 AI'

이 논문은 **긴 영상 **(예: 1 시간짜리 다큐멘터리나 영화)을 이해하는 데 어려움을 겪고 있는 최신 AI 들을 해결하기 위해 개발된 새로운 시스템, 'VideoThinker(비디오 씽커)를 소개합니다.

기존 AI 들이 왜 실패했는지, 그리고 VideoThinker 는 어떻게 '마법' 같은 해결책을 찾았는지 쉽게 설명해 드릴게요.


1. 🕵️‍♂️ 기존 AI 의 문제: "모든 장면을 한 번에 보려고 하다가 눈이 멀다"

지금까지의 영상 AI 들은 긴 영상을 볼 때, 전체 영상을 균일하게 잘게 쪼개서 (예: 1 초마다 한 장씩) 한 번에 보려고 했습니다.

  • 비유: 1 시간짜리 영화를 볼 때, 1 초마다 한 장씩 찍은 사진 3,600 장을 한눈에 다 보려고 하는 것입니다.
  • 문제점:
    1. 정보 과부하: 너무 많은 사진이 쏟아져서 중요한 순간 (예: 범인이 칼을 든 순간) 을 놓치기 쉽습니다.
    2. 시간 감각 상실: "언제" 일어난 일인지 정확히 기억하지 못합니다.
    3. 계산 비용: 모든 장면을 다 보려면 컴퓨터가 너무 많이 피곤해집니다.

이런 AI 들은 마치 모든 장면을 동시에 보려고 하다가, 정작 중요한 단서 하나를 놓쳐버리는 초보 탐정과 같습니다.


2. 💡 VideoThinker 의 아이디어: "스마트한 탐정처럼 단계별로 조사한다"

VideoThinker 는 AI 가 스스로 '도구'를 사용하며 탐정처럼 조사하는 방식을 도입했습니다.

🛠️ 핵심 도구 두 가지

  1. **시간 검색 **(Temporal Retrieval) "이 영상에서 범인이 등장하는 구간은 어디일까?"라고 물어보면, AI 는 자막이나 대본을 먼저 훑어보고 **가장 의심스러운 구간 **(예: 35 분 10 초~35 분 20 초)을 찾아냅니다.
  2. **시간 확대 **(Temporal Zoom) 찾은 구간에 대해 "자, 이제 그 10 초 구간을 확대해서 자세히 보자!"라고 명령합니다. 이때 AI 는 그 부분의 프레임 (화면) 을 직접 보고 세부 사항을 파악합니다.

🔄 작동 원리: "글로 생각한 뒤, 영상으로 확인한다"

여기서 가장 혁신적인 점은 데이터를 만드는 방법입니다.

  • 기존 방식: 이미 영상을 잘 이해하는 AI 가 있어야 도구를 쓸 수 있는 데이터를 만들 수 있었습니다. (닭이 먼저냐 달걀이 먼저냐의 문제)
  • VideoThinker 방식:
    1. 먼저 영상을 **자막 **(글)로 바꿉니다.
    2. 강력한 언어 AI (LLM) 가 이 글자막만 보고 "어디를 찾아봐야 할지", "어디를 확대해서 봐야 할지" 단계별 탐정 시나리오를 만듭니다.
    3. 그 시나리오를 실제 영상 화면으로 바꿔서 학습시킵니다.
    • 비유: 마치 **명탐정 코난이 사건 현장 **(영상)입니다.

3. 🚀 VideoThinker 의 특징: "자신감 게이트"

VideoThinker 는 답을 바로 내놓을지, 아니면 다시 조사할지 스스로 판단합니다.

  • **자신감 **(Confidence)
    • **높을 때 **(90% 이상) "아, 이거 확실해!"라고 바로 답을 냅니다. (빠름)
    • **낮을 때 **(50% 미만) "아니, 뭔가 부족해. 다시 찾아보자!"라고 **도구 **(검색, 확대)를 꺼내어 더 자세히 조사합니다. (정확함)

이 방식 덕분에 짧은 영상은 빠르게, 긴 영상은 꼼꼼하게 처리할 수 있습니다.


4. 🏆 결과: 왜 이것이 중요한가?

실험 결과, VideoThinker 는 기존 최고의 AI 들보다 긴 영상 이해 능력에서 압도적으로 뛰어났습니다.

  • 기존 AI: 긴 영상을 보면 "머리가 아파서" 중요한 내용을 놓칩니다.
  • VideoThinker: "필요한 부분만 찾아서 확대해서" 정확한 답을 냅니다.

한 줄 요약:

VideoThinker 는 **긴 영상을 무작정 다 보지 않고, 필요한 부분만 찾아서 확대해 보는 '스마트한 탐정 AI'**입니다. 글로 먼저 계획을 세우고, 영상으로 확인하는 방식을 통해 기존 AI 들이 못 풀던 긴 영상 문제를 해결했습니다.

이 기술은 앞으로 법정 영상 분석, 의료 영상 진단, 긴 교육 자료 요약 등 다양한 분야에서 큰 도움을 줄 것으로 기대됩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →