← 최신 논문
💻 computer science

Linear Scaling Video VLMs for Long Video Understanding

이 논문은 사전 학습된 비디오 시각-언어 모델이 고정 용량의 재귀적 상태를 통해 선형 시간 비디오 프리필링을 달atos할 수 있게 하여, 아키텍처 변경이나 미세 조정 없이도 기존의 스트리밍 근사 방식보다 확장성과 정확성을 크게 향상시키는 추론 시점 방법론인 StateKV를 소개한다.

원저자: Cristobal Eyzaguirre, Jiajun Wu, Juan Carlos Niebles

게시일 2026-06-01
📖 4 분 읽기☕ 가벼운 읽기

원저자: Cristobal Eyzaguirre, Jiajun Wu, Juan Carlos Niebles

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

문제점: AI의 "기억 과부하"

당신이 사진처럼 기억하는 능력을 가졌지만, 아주 독특한 방식으로 기억하는 친구와 함께 영화를 보고 있다고 상상해 보세요. 새로운 장면(프레임)이 나올 때마다, 당신의 친구는 단순히 새로운 장면만 보는 것이 아니라, 현재 장면이 이전 장면들과 어떻게 연결되는지 확인하기 위해 처음부터 모든 이전 장면들을 한꺼번에 다시 시청합니다.

  • 영화: 긴 영상 (예: 1시간 동안의 드라이브 또는 전체 스포츠 경기).
  • 친구: 비디오 비전-언어 모델(VLM), 즉 영상을 보고 질문에 답하는 AI.
  • 문제점: 영화가 10분짜리라면, 친구는 매 초마다 10분 분량의 영상을 다시 봐야 합니다. 만약 영화가 1시간이라면, 매 초마다 1시간 분량의 영상을 다시 봐야 합니다.

이를 **이차적 스케일링(Quadratic Scaling)**이라고 부릅니다. 영상이 길어질수록 친구가 해야 할 작업량은 폭발적으로 늘어납니다. 이는 마치 100페이지짜리 책을 읽을 때, 100페이지를 이해하기 위해 매번 1페이지부터 99페이지까지를 다시 읽어야 하는 것과 같습니다. 결국, 이 작업은 실시간으로 수행하는 것이 불가능해집니다.

기존의 해결책: "요약본"

이 문제를 해결하기 위해, 이전 방식들은 친구가 더 똑똑하게 요약하도록 만들려고 노력했습니다.

  • 접근 방식: "최근 5분만 기억하자"라거나, "프레임의 90%를 버리고 가장 중요한 것들만 남기자"라고 하는 식입니다.
  • 결함: 이것은 친구에게 영화의 요약본을 쓰라고 시키되, 가장 최근의 문장들만 남기는 것과 같습니다. 이 경우 친구는 지금 일어나고 일어나는 일을 설명해 줄 수 있는 20분 전의 결정적인 플롯 포인트를 놓칠 수 있습니다. 또는 너무 많은 프레임을 버리면, 까다로운 질문에 답하는 데 필요한 세부 정보를 잃게 됩니다. 즉, 시간을 절약하면 정확도를 잃게 되는 트레이드오프(Trade-off) 관계가 발생합니다.

새로운 해결책: StateKV (스마트한 비서)

저자들은 StateKV라는 새로운 방법을 소개합니다. AI에게 모든 것을 다시 보게 하거나 정보를 버리게 하는 대신, 두 부분으로 구성된 특별한 메모리 시스템을 가진 스마트한 비서를 붙여줍니다.

AI를 1시간짜리 보안 테이프를 보며 사건을 해결하는 탐정이라고 생각해 보세요.

1. "상세한 노트" (Red Cache)

AI는 지금까지 본 모든 프레임에 대한 전체적이고 상세한 노트를 보관합니다. 아무것도 버리지 않습니다. 탐정(AI)이 최종 보고서(질문에 대한 답)를 작성해야 할 때, 필요한 정확한 세부 정보를 찾기 위해 이 전체 노트를 넘겨볼 수 있습니다. 이는 최종 답변이 정확하도록 보장합니다.

2. "포켓 치트 시트" (Blue State)

여기 마법 같은 기술이 있습니다. AI가 영상을 보는 동안(스트림을 처리하는 동안), 머릿속에 전체 노트를 다 담아둘 수는 없습니다. 그래서 AI는 작은 **포켓 치트 시트(요약 메모)**를 사용합니다.

  • 작동 원리: 영상이 재생되는 동안, AI는 새로운 장면을 보며 다음과 같이 자문합니다. "과거의 어떤 부분이 이 새로운 장면을 이해하는 데 정말 중요한가?"
  • 선택: AI는 과거로부터 매우 중요한 순간들(temporal sinks)을 골라내어 치트 시트에 적습니다. 예를 들어 10분 전의 특정 캐릭터의 얼굴이나 특정 효과음 같은 것입니다.
  • 업데이트: 다음 장면이 도착하면, AI는 치트 시트를 업데이트합니다. 여전히 유효한 중요한 내용은 유지하고, 더 이상 필요 없는 내용은 교체하여 새로운 중요한 세부 사항을 위한 공간을 만듭니다.

결과: AI는 영상을 보는 동안 오직 이 작은 치트 시트와만 대조하면 됩니다. 이 덕분에 영상이 아무리 길어져도 작업량이 일정하게 유지됩니다. 이는 탐정이 전체 책을 다시 읽는 대신, 이야기에 연결되어 있기 위해 단 3인치 크기의 인덱스 카드만 힐끗 보는 것과 같습니다.

이것이 왜 중요한가

이 논문은 StateKV의 세 가지 주요 승리를 주장합니다.

  1. 빠르고 선형적입니다: AI가 보는 동안 작은 치트 시트만 확인하기 때문에, 영상을 처리하는 데 걸리는 시간은 선형적(Linear)으로 증가합니다 (1시간짜리 영상은 30분짜리보다 딱 두 배만 더 오래 걸립니다). 기존 방식처럼 폭발적으로 늘어나지 않습니다.
  2. 정확합니다: 데이터를 버리는 기존의 "요약" 방식과 달리, StateKV는 최종 답변을 위해 전체 노트를 보관합니다. 데이터 자체를 단순화하는 것이 아니라, 보는 과정을 단순화할 뿐입니다.
  3. "최신성"보다 똑똑합니다: 기존 방식들은 흔히 "최근 5분만 기억하라"고 말했습니다. 하지만 StateKV는 더 똑똑합니다. "설령 40분 전의 일이라도, 가장 중요한 순간을 기억하라"고 말합니다. 이 논문은 AI가 자연스럽게 이러한 특정 "앵커(Anchor)" 순간들에 집중하며, StateKV가 이를 완벽하게 포착한다는 것을 보여줍니다.

"예산" 비유

당신에게 자동차를 살 수 있는 고정된 금액(컴퓨팅 파워)이 있다고 상상해 보세요.

  • 기존 방식: 작고 저렴한 차(작은 AI 모델)를 삽니다. 이 차는 빠르게 달릴 수는 있지만 짐을 많이 실을 수는 없습니다(낮은 정확도).
  • StateKV 방식: StateKV는 매우 효율적이기 때문에, 당신은 아낀 돈을 사용하여 훨씬 크고 고급스러운 SUV(훨씬 더 크고 똑똑한 AI 모델)를 살 수 있습니다. 이 SUV는 같은 가격으로 훨씬 많은 양의 짐(높은 정확도)을 실을 수 있습니다.

요약

StateKV는 AI가 "브레인 포그(Brain Fog)" 없이 실시간으로 긴 영상을 볼 수 있게 해주는 방법입니다. 이는 영상을 보는 동안에는 이야기를 놓치지 않기 위해 작고 동적인 요약본을 사용하면서도, 나중에 질문에 답하기 위해 전체적이고 상세한 기록을 유지함으로써 가능해집니다. 이는 기존 방식보다 빠르며, 단순히 "최근 몇 분만 기억하는" 방식보다 더 똑똑합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →