← 최신 논문
🤖 AI

HPP: Hierarchical Programmatic Probing for Long Video Understanding by Decoupling Perception and Reasoning

이 논문은 계층적으로 분할된 비디오에 대해 LLM을 활용하여 프로그래밍 방식의 쿼리를 반복적으로 계획하고 실행함으로써, 긴 비디오 이해를 위한 표준 시각-언어 모델의 잠재적 다단계 계획의 한계를 극복하기 위해 의미론적 지각과 고차원적 시간적 추론을 분리하는 계층적 프로그래밍 방식의 프로빙(Hierarchical Programmatic Probing, HPP) 프레임워크를 제안한다.

원저자: Awais Rauf, Ahmed Hasssan, Greg Slabaugh

게시일 2026-06-23
📖 3 분 읽기☕ 가벼운 읽기

원저자: Awais Rauf, Ahmed Hasssan, Greg Slabaugh

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 백만 권의 책(수천 개의 프레임이 담긴 긴 비디오를 상징함)이 있는 도서관에서 미스터리를 풀려고 한다고 상상해 보세요.

과거의 방식 (전통적인 AI):
현재 대부분의 AI 모델은 도서관에 있는 모든 책의 모든 페이지를 한 번에, 거대한 한 입에 다 읽으려고 시도합니다. 그들은 전체 이야기를 통째로 암기하고, 단서를 찾고, 동시에 미스터리를 해결하려고 합니다.

  • 문제점: 도서관이 너무 큽니다. AI는 정보에 압도당하며, 끝에 도달할 때쯤이면 앞부분을 잊어버리고, 한 번에 너무 많은 정보를 처리하려다 보니 아주 작은 세부 사항들을 놓치게 됩니다. 이는 마치 빨대로 바다를 마시려는 것과 같습니다.

새로운 방식 (HPP - 계층적 프로그래밍 탐색):
이 논문의 저자들은 더 똑똑한 전략을 제안합니다. 하나의 AI가 모든 것을 하려고 하는 대신, 서로 대화하는 두 명의 전문 작업자로 역할을 나눕니다.

  1. 탐정 (코딩 LLM): 이 모델은 코드를 작성하고 전략을 세울 줄 아는 똑똑하고 논리적인 두뇌입니다. 그림을 보지는 않으며, 오직 생각만 합니다.
  2. 사서 (작은 VLM): 이 모델은 그림을 보고 보이는 것을 설명하는 데 매우 능숙하지만, 스스로 복잡한 퍼즐을 풀기에는 부족한 더 작고 빠른 AI입니다.

탐정이 미스터리를 해결하는 방법

탐정은 도서관 전체를 읽지 않습니다. 대신, 효율적으로 답을 찾기 위해 3단계 과정을 사용합니다.

1. 도서관 정리하기 (계층적 분할)

먼저, 탐정은 도서관이 무질서하다는 것을 깨닫습니다. 탐정은 도구를 사용하여 빠르게 책을 분류합니다.

  • 비유: 비디오를 긴 영화라고 상상해 보세요. 탐정은 영화 파일 자체(이미 장면 전환 마커가 내장되어 있음)를 사용하여 영화를 장면(Scenes), 샷(Shots), 그리고 마지막으로 **핵심 순간(Key Moments)**으로 잘게 나눕니다.
  • 도움이 되는 이유: 100,000개의 개별 프레임을 보는 대신, 이제 탐정은 100개의 "장면"만 보면 됩니다. 탐정은 지루하고 반복적인 부분(예: 캐릭터가 복도를 5분 동안 걷는 장면)은 무시하고, 실제로 액션이 일어나는 곳에만 집중합니다.

2. 올바른 질문 던지기 (시맨틱 검색)

탐정에게는 "캐릭터가 언제 빨간 사과를 떨어뜨렸는가?"와 같은 구체적인 질문이 있습니다.

  • 비유: 모든 통로를 돌아다니는 대신, 탐정은 스마트한 검색 엔진을 사용합니다. 키워드를 입력하여 사과가 포함되어 있을 법한 특정 "장면"을 찾아달라고 사서에게 요청합니다.
  • 기술: 탐정은 영리합니다. 단순히 "사과"라고만 묻지 않습니다. "빨간 과일", "떨어지는 과일", "캐릭터가 먹는 모습" 등을 한꺼번에 물어봅니다. 그런 다음 결과를 결합하여 놓친 것이 없는지 확인합니다.

3. 증거를 위해 확대하기 (표적 지각)

검색 엔진이 탐정에게 5개의 유력한 장면 목록을 제공하면, 탐정은 사서에게 영화 전체를 다시 설명하라고 요구하지 않습니다.

  • 비유: 탐정은 이렇게 말합니다. "좋아, 사서님. 나는 장면 42에서 사과가 떨어진 것 같아요. 그 순간 주변의 딱 5초 동안만 집중해서 무엇이 보이는지 정확히 알려주세요."
  • 결과: 사서는 정밀한 답변을 제공합니다. 그러면 탐정은 이 아주 작은 증거를 사용하여 퍼즐을 해결합니다.

이것이 왜 중요한가

이 논문은 이 방식이 긴 비디오를 이해하는 데 있어 세 가지 이유로 훨씬 더 뛰어나다고 주장합니다.

  • 생각과 보는 것을 분리함: "생각하기"(검색 계획 수립)와 "보기"(픽셀 관찰)가 분리됩니다. 똑똑한 두뇌는 수백만 장의 사진을 보느라 지치지 않고, 단지 눈이 어디를 향해야 할지를 지시할 뿐입니다.
  • 비용과 전력을 절약함: AI는 중요한 부분의 비디오만 보기 때문에, 전체 비디오를 한꺼번에 보려는 모델보다 훨씬 적은 컴퓨터 자원(토큰)을 사용합니다. 매우 긴 비디오의 경우, 이 방식은 최대 16배 더 효율적입니다.
  • 더 나은 도구와 함께 더 똑똑해짐: 시스템은 "탐정"에게 더 똑똑한 두뇌(더 나은 코딩 LLM)를 부여할수록 자동으로 더 좋아집니다. 논문은 AI의 코딩 능력이 향상됨에 따라 비디오 이해 능력도 함께 향상된다는 것을 보여줍니다.

핵심 요약

이 논문은 긴 비디오를 거대한 이미지의 벽이 아니라, 구조화된 문서로 취급하는 HPP를 소개합니다. HPP는 비디오를 탐색하는 코드를 작성하고, 관련 장면을 찾고, 그 특정 순간만을 자세히 살펴보라고 사서에게 요청하는 "탐정"을 활용합니다. 이를 통해 AI는 압도당하지 않고도 긴 범위의 복잡한 비디오 퍼즐을 해결할 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →