← 최신 논문
💬 NLP

VideoARM: Agentic Reasoning over Hierarchical Memory for Long-Form Video Understanding

이 논문은 긴 영상 이해를 위해 수동적 전처리를 대체하여 적응형 에이전트 추론과 계층적 멀티모달 메모리를 결합한 'VideoARM'을 제안하며, 기존 최첨단 방법보다 토큰 소비를 크게 줄이면서도 성능을 향상시킵니다.

원저자: Yufei Yin, Qianke Meng, Minghao Chen, Jiajun Ding, Zhenwei Shao, Zhou Yu

게시일 2026-03-31
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yufei Yin, Qianke Meng, Minghao Chen, Jiajun Ding, Zhenwei Shao, Zhou Yu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

비디오를 한 번에 다 보는 게 아니라, '탐정'처럼 찾아보는 방법: VideoARM

이 논문은 매우 긴 영상 (예: 영화, 강의, 다큐멘터리) 을 이해하는 AI에 대한 연구입니다. 기존의 방법들은 영상을 처음부터 끝까지 다 분석하려다 보니 시간이 너무 오래 걸리고, 컴퓨터 자원 (토큰) 을 엄청나게 많이 써버리는 문제가 있었습니다.

저희가 제안한 VideoARM은 이 문제를 해결하기 위해 **"지혜로운 탐정"**과 **"스마트 메모리"**를 활용한 새로운 방식을 소개합니다.


1. 기존 방식의 문제점: "모든 책을 다 읽는 비효율"

기존의 AI 들은 긴 영상을 볼 때 다음과 같은 방식을 썼습니다.

  • 비유: 10 시간짜리 영화를 볼 때, 중요한 장면이든 아닌지 상관없이 1 초 1 초를 모두 캡처해서 메모장에 적어두고 (전체 분석), 그 방대한 메모를 바탕으로 질문을 답하려 합니다.
  • 문제점:
    • 비효율: 질문이 "주인공이 언제 웃었나요?"인데, 주인공이 안 나오는 9 시간 50 분 분량까지 다 분석합니다.
    • 비용: 이 과정에서 컴퓨터가 처리해야 할 정보량이 너무 많아져서 비용이 천문학적으로 듭니다.
    • 혼란: 너무 많은 정보 속에서 정작 중요한 단서를 찾기 어렵습니다.

2. VideoARM 의 해결책: "지혜로운 탐정"과 "층층이 정리된 메모장"

VideoARM 은 영상을 처음부터 끝까지 다 보지 않습니다. 대신 **질문 (수사 의뢰)**에 맞춰 적극적으로 찾아보는 (Agentic Reasoning) 방식을 사용합니다.

🕵️‍♂️ 역할 1: 지혜로운 탐정 (Controller & Tools)

VideoARM 의 핵심은 '질문'을 먼저 보고, 필요한 정보만 골라내는 탐정입니다.

  • ** coarse-to-fine (거시에서 미시로):**
    • 먼저 영상 전체를 빠르게 훑어보며 (Coarse), "아, 이 부분에서 사건이 일어났을 것 같다"라고 추측합니다.
    • 그다음, 추측한 부분만 자세히 들여다봅니다 (Fine).
  • 도구 사용:
    • 시간 제한 도구: "이 10 분 구간만 봐줘"라고 명령합니다.
    • 이해 도구: "이 장면에서 무슨 일이 벌어지고 있어?", "대사는 뭐라고 해?"라고 물어봅니다.
  • 효과: 질문과 관련 없는 9 시간 분량은 아예 보지 않으니, 컴퓨터 비용 (토큰) 이 1/34~1/50 수준으로 줄어듭니다.

📓 역할 2: 층층이 정리된 스마트 메모장 (Hierarchical Multimodal Memory, HM3)

탐정이 단서를 찾을 때, 모든 것을 머릿속에만 기억할 수는 없습니다. VideoARM 은 세 가지 층위로 나뉜 메모장을 사용합니다.

  1. 감각 메모 (Sensory Memory): 지금 당장 보고 있는 장면의 '스냅샷'입니다. (예: "지금 해변에 사람이 많아")
  2. 결과 메모 (Result Memory): 탐정이 찾은 '중요한 단서'를 기록합니다. (예: "30 분 10 초에 범인이 도망감")
  3. 작업 메모 (Working Memory): 탐정이 "왜 이 장면을 봤지?", "다음엔 무엇을 찾아야 하지?"라고 생각한 과정을 기록합니다.

이 메모장은 영상 분석이 진행되는 동안 지속적으로 업데이트됩니다. 덕분에 AI 는 "아, 전에 봤던 그 단서와 연결되네!"라고 생각하며 논리를 이어갈 수 있습니다.


3. 실제 작동 원리: "관찰 - 생각 - 행동 - 기억"의 루프

VideoARM 은 다음 4 단계를 끊임없이 반복합니다.

  1. 관찰 (Observe): 현재 메모장에 기록된 정보와 질문을 봅니다.
  2. 생각 (Think): "어디를 더 찾아봐야 할까? 소리가 들리는 구간을 확인해볼까?"라고 계획을 세웁니다.
  3. 행동 (Act): 필요한 도구 (예: 특정 구간 캡처, 음성 변환) 를 호출하여 정보를 얻습니다.
  4. 기억 (Memorize): 새로 얻은 정보를 메모장에 정리하고, 다음 단계를 위해 준비합니다.

이 과정이 반복되면서 AI 는 질문에 대한 답을 스스로 찾아냅니다.


4. 왜 이것이 중요한가요? (결론)

  • 비용 절감: 기존 방식보다 토큰 (컴퓨터 자원) 사용량을 50 배 이상 줄였습니다.
  • 정확도 향상: 불필요한 정보에 방해받지 않고, 중요한 단서에 집중하므로 정답률이 더 높습니다.
  • 유연성: 영상의 길이나 종류에 상관없이, 질문의 성격에 맞춰 스스로 전략을 바꿀 수 있습니다.

한 줄 요약:
VideoARM 은 긴 영상을 한 번에 다 읽는 게 아니라, 질문을 해결하기 위해 필요한 부분만 '탐정'처럼 찾아보고, 그 과정을 '스마트 메모장'에 정리하며 답을 찾아내는 똑똑한 AI 입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →