← 최신 논문
🤖 AI

Watch, Remember, Reason: Human-View Video Understanding with MLLMs

이 논문은 멀티모달 거대 언어 모델을 이용한 비디오 이해를 위해 '인간의 관점'이라는 통합된 프레임워크를 제시하며, 길고 복잡한 비디오 시나리오를 처리하는 데 있어 도전 과제, 방법론, 응용 분야 및 향후 방향을 체계적으로 분석하기 위해 이 분야를 관찰(watching), 기억(remembering), 추론(reasoning)이라는 세 가지 핵심 능력 중심으로 구성한다.

원저자: Jiahao Meng, Yue Tan, Qi Xu, Kuan Gao, Weisong Liu, Yanwei Li, Jason Li, Lingdong Kong, Haochen Wang, Qianyu Zhou, Jiangning Zhang, Guangliang Cheng, Yunhai Tong, Lu Qi, Minghsuan Yang

게시일 2026-06-08
📖 5 분 읽기🧠 심층 분석

원저자: Jiahao Meng, Yue Tan, Qi Xu, Kuan Gao, Weisong Liu, Yanwei Li, Jason Li, Lingdong Kong, Haochen Wang, Qianyu Zhou, Jiangning Zhang, Guangliang Cheng, Yunhai Tong, Lu Qi, Minghsuan Yang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

매우 길고 복잡한 영화를 이해하려고 노력하고 있다고 상상해 보세요. 단순히 훑어보는 것만으로는 부족합니다. 영화를 보고, 줄거리를 기억하고, 미스터리를 풀어내야 합니다. 이 논문은 컴퓨터가 이와 똑같은 일을 수행하도록 가르치기 위해서는 관찰하기(Watching), 기억하기(Remembering), 그리고 **추론하기(Reasoning)**라는 세 가지 특정한 인간다운 기술을 숙달해야 한다고 주장합니다.

다음은 일상적인 비유를 사용하여 이 논문이 말하는 바를 쉽게 풀어서 설명한 것입니다.

핵심 개념: "인간 관점(Human-View)" 접근법

저자들은 비디오 이해를 단순히 여러 개의 별개 수학 문제로 취급하는 대신, 인간이 하는 방식처럼 바라봐야 한다고 말합니다. 당신이 2시간짜리 영화를 볼 때, 모든 프레임을 똑같은 강도로 뚫어지게 쳐다보지는 않습니다. 당신은 중요한 부분을 관찰하고, 등장인물과 줄거리의 핵심 지점을 기억하며, "누가 범인인가?" 또는 "왜 그런 일이 일어났는가?"와 같은 질문에 답하기 위해 이야기의 맥을 짚으며 추론합니다.

이 논문은 최신 AI 연구를 이 세 가지 카테고리로 분류합니다.


1. 관찰하기(Watching): "선택적 시선"

문제점: 비디오는 방대합니다. 1시간짜리 영화에는 수천 개의 프레임이 있습니다. 만약 컴퓨터에게 모든 프레임을 다 보여준다면, 컴퓨터는 과부하에 걸릴 것입니다(마치 소방 호스로 물을 들이붓는 것과 같습니다). 또한, 가장 중요한 단서는 아주 짧은 순간 동안만 나타나는 아주 작은 디테일일 수도 있습니다.

해결책: 이 논문은 AI가 "선택적 관찰자"가 되도록 가르치는 방법들을 검토합니다.

  • 세밀한 관찰(Fine-Grained Watching): 이것은 탐정이 특정 지문을 확대해서 보는 것과 같습니다. AI는 어떤 일이 정확히 언제, 어디서 일어났는지 찾아내는 법을 배웁니다 (예: "총성이 12시 05분에 발사되었다").
  • 포괄적 관찰(Comprehensive Watching): 이것은 영화 평론가가 영화 전체를 요약하는 것과 같습니다. AI는 비디오 전체를 묘사하거나 장면별로 나누는 법을 배웁니다.
  • 시청각 관찰(Audio-Visual Watching): 이것은 소리를 켜고 영화를 보는 것과 같습니다. AI는 액션을 보면서 대사와 음악을 듣고, 비명 소리가 무서운 표정과 일치한다는 것을 이해하는 법을 배웁니다.
  • 효율적 관찰(Efficient Watching): 이것은 "지루한 부분 건너뛰기" 기술입니다. AI는 중복되는 프레임(예: 벽을 길게 비추는 장면)을 무시하고, 질문에 답하는 데 실제로 필요한 프레임만을 남기는 법을 배웁니다.

2. 기억하기(Remembering): "스마트한 서류함"

문제점: AI가 비디오를 관찰했다 하더라도, 그 전체 내용을 한꺼번에 "두뇌"에 담아둘 수는 없습니다. 만약 비디오가 2시간 길이인 경우, AI는 끝에 도달했을 때쯤이면 처음 10분 동안 일어났던 일을 잊어버릴 수도 있습니다.

해결책: 이 논문은 AI가 어떻게 "기억 시스템"을 구축하는지 살펴봅니다.

  • 오프라인 메모리(Offline Memory): 당신이 영화를 보고 나서 노트에 요약본을 쓰는 것을 상상해 보세요. 나중에 당신은 그 노트를 훑어보며 세부 사항을 찾을 수 있습니다. 일부 AI 시스템은 질문에 답하기 전에 비디오를 더 작은 "요약본"이나 주요 사건 목록으로 압축하는 방식으로 이를 수행합니다.
  • 스트리밍 메모리(Streaming Memory): 이것은 생방송 뉴스 앵커와 같습니다. 비디오가 실시간으로 들어오고 있으며, AI는 공간이 부족해지지 않으면서도 방금 전에 일어난 일과 한 시간 전에 일어났던 일을 동시에 기억해야 합니다. 이는 가장 중요한 최근 정보는 "롤링 버퍼(rolling buffer)"로 유지하고, 큰 그림을 위한 "장기 아카이브"를 사용하는 방식을 사용합니다.
  • 에이전트형(Agentic) vs 비에이전트형(Non-Agent):
    • 비에이전트형: AI가 진행하면서 자동으로 자신의 요약본을 작성합니다 (마치 노트를 필기하는 학생처럼).
    • 에이전트형: AI는 사서처럼 행동합니다. 자신이 무언가를 잊었다는 것을 깨달으면, 다시 "비디오 도서관"으로 가서 특정 클립을 찾아 자신의 "책상"으로 가져와 다시 확인합니다.

3. 추론하기(Reasoning): "탐정의 논리"

문제점: 단순히 보고 기억하는 것만으로는 충분하지 않습니다. AI는 점들을 연결해야 합니다. 만약 AI가 "집사가 범인이다"라고 말하면서도, 비디오의 어느 지점이 그것을 증명하는지 짚어내지 못한다면, 그것은 환각(hallucination, 거짓말)입니다.

해결책: 이 논문은 AI가 말을 하기 전에 어떻게 "생각"하는지를 다룹니다.

  • 텍스트 전용 추론(Text-Only Reasoning): AI는 답변을 내놓기 전에 긴 내부 사고 과정(탐정의 노트와 같은)을 작성합니다. AI는 "X를 보았고, 그 후 Y가 일어났으므로, Z가 참임이 틀림없다"라고 말합니다.
  • 비디오를 통한 사고(Thinking with Videos): 이것은 가장 새롭고 진보된 아이디어입니다. 단순히 추측하는 대신, AI는 자신의 작업을 확인하기 위해 능동적으로 비디오로 돌아갑니다. 이는 마치 탐정이 "잠깐, 10분 지점에서 단서를 본 것 같아. 시간을 되돌려서 그 특정 프레임을 다시 보자"라고 말하는 것과 같습니다.
    • 에이전트형(Agentic): AI는 도구를 사용하여 화면을 확대하거나, 크롭하거나, 특정 타임스탬프를 검색합니다.
    • 비에이전트형(Non-Agent): AI는 자신이 본 증거를 입증하기 위해 타임스탬프와 설명을 답변에 자연스럽게 포함하도록 훈련받습니다.

특수 "영화"들 (하위 분야)

이 논문은 서로 다른 유형의 비디오에는 서로 다른 기술이 필요하다는 점도 언급합니다.

  • 에고센트릭(Egocentric, 1인칭 시점): 사람의 눈으로 촬영된 영상(예: 고프로)입니다. AI는 사람이 무엇을 하고 있는지와 무엇을 의도하고 있는지를 이해해야 합니다.
  • 스포츠(Sports): 스포츠는 빠르고 규칙이 가득합니다. AI는 심판이 왜 휘슬을 불었는지 이해하기 위해 경기의 규칙을 알아야 합니다.
  • 교육용(Instructional): 강의 등은 길고 밀도가 높습니다. AI는 수업의 단계들을 추적하고 교사의 목소리를 슬라이드와 매칭시켜야 합니다.
  • 의료(Medical): 의료는 매우 높은 수준의 정밀함이 요구됩니다. AI는 도구와 신체 부위에 대해 매우 정밀해야 하며, 종종 긴 수술 과정을 관찰해야 합니다.
  • 영화/스토리텔링(Movies/Storytelling): 이는 플롯과 캐릭터 관계에 의존합니다. AI는 캐릭터가 누구인지, 그리고 전체 이야기 속에서 어떻게 변했는지를 기억해야 합니다.

도구 모음: 데이터와 테스트

이 논문은 연구자들이 AI 모델을 훈련하고 테스트하는 데 사용하는 "교과서"(데이터셋)와 "시험"(벤치마크)을 나열합니다.

  • 데이터셋(Datasets): 질문과 답변이 포함된 방대한 비디오 모음이며, 일부는 왜 그 답이 정답인지에 대한 상세한 설명까지 갖추고 있습니다.
  • 벤치마크(Benchmarks): AI가 실제로 긴 비디오를 처리할 수 있는지, 특정 순간을 찾을 수 있는지, 혹은 혼란 없이 복잡한 이야기를 추론할 수 있는지 확인하는 테스트입니다.

미래: 다음 단계는 무엇인가?

논문은 우리가 진전을 보이고 있지만, 여전히 큰 장애물들이 남아 있다고 결론짓습니다.

  1. 공간 추론(Spatial Reasoning): AI는 여전히 3D 공간에서 물체가 정확히 어디에 있는지, 그리고 서로 상대적으로 어떻게 움직이는지 이해하는 데 서툽니다.
  2. 멀티 비디오(Multi-Video): 대부분의 AI는 한 번에 하나의 비디오만 처리할 수 있습니다. 실제 생활은 다양한 카메라 각도나 연관된 여러 비디오 사이를 전환하는 상황을 포함합니다.
  3. 한 시간 이상의 비디오: 줄거리를 놓치지 않고 몇 시간 길이의 비디오를 처리하는 것은 여전히 매우 어려운 일입니다.
  4. 효율성(Efficiency): 우리는 모든 프레임을 일일이 확인하지 않고도 진실을 찾아내어 시간과 에너지를 절약하는 AI가 필요합니다.
  5. 스트리밍(Streaming): AI가 라이브 스트리밍을 시청하고 실시간으로 반응하는, 즉 선제적인 조력자처럼 작동하게 만드는 것이 주요 목표입니다.

요약하자면, 이 논문은 AI가 진정으로 비디오를 이해하게 만들려면, 비디오를 정적인 이미지로 취급하는 것을 멈추고, 관찰, 기억, 논리라는 인간적인 요소가 결합된 역동적인 이야기로 다루어야 한다고 말합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →