← 최신 논문
🤖 machine learning

ProtoKV: Streaming Video Understanding under Delayed Query with Summary-State Memory

ProtoKV는 근접 윈도우 내의 정확한 KV 캐싱과 과거 콘텐츠를 위한 고정 용량의 요약 상태 메모리를 결합한 하이브리드 접근 방식을 통해 일정한 메모리 점유율을 유지함으로써 지연된 쿼리 문제를 해결하는 스트리밍 비디오 이해 프레임워크이며, 이를 통해 쿼리 지연이 증가함에 따라 토큰 유지 베이스라인 대비 정확도를 크게 향상시킨다.

원저자: Le Tu Ngoc Minh (KAIST), Jinyeong Lim (KAIST), Dongsu Han (KAIST)

게시일 2026-06-26
📖 4 분 읽기☕ 가벼운 읽기

원저자: Le Tu Ngoc Minh (KAIST), Jinyeong Lim (KAIST), Dongsu Han (KAIST)

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신은 아주 긴 연속 비디오 스트림, 예를 들어 24시간 보안 카메라 피드를 보고 있다고 상상해 보세요. 당신의 임무는 그 비디오에서 일어난 일에 대해 질문에 답하는 것입니다. 문제는? 당신은 아주 작은 뇌(제한된 컴퓨터 메모리)를 가지고 있으며, 비디오를 일시 정지하고 되감아서 다시 볼 수 없습니다. 당신은 누군가 질문을 던질 때까지 계속해서 영상을 지켜봐야 하며, 그 질문은 특정 사건이 발생한 지 몇 분 또는 몇 시간 후에 나올 수도 있습니다.

이것이 바로 **스트리밍 비디오 이해(Streaming Video Understanding)**의 과제입니다.

문제점: "망각하는" 뇌

현재 대부분의 시스템은 마지막 몇 분간의 비디오를 메모리에 유지하는 "슬라이딩 윈도우(sliding window)" 방식을 사용하여 이 문제를 해결하려고 합니다.

  • 비유: 당신이 물 양동이(당신의 기억)를 들고 있다고 상상해 보세요. 새로운 물(비디오 프레임)이 들어올 때마다, 양동이가 넘치는 것을 막기 위해 오래된 물을 흘려보내야 합니다.
  • 결함: 만약 중요한 사건(예: 도둑이 지갑을 훔치는 장면)이 발생한 후, 누군가 "도둑을 봤나요?"라고 묻기 전까지 20분 동안 지루한 영상이 이어진다면, 오래된 물(도둑)은 이미 양동이에서 버려진 상태입니다. 시스템은 정답을 잊어버립니다.

다른 시스템들은 그들이 저장한 "중요한 순간들(토큰)"의 목록을 보관하려고 시도합니다. 하지만 비디오가 길어지면, 새로운 순간들을 위한 공간을 만들기 위해 어떤 저장된 순간들을 버릴지 끊임없이 결정해야 합니다. 만약 그들이 잘못된 순간을 버린다면, 정답은 영원히 사라집니다.

해결책: ProtoKV (스마트한 요약 노트)

저자들은 ProtoKV라고 불리는 새로운 시스템을 제안합니다. 모든 프레임을 저장하거나 단지 몇 개의 특정 순간만을 저장하려고 애쓰는 대신, ProtoKV는 스마트한 노트처럼 작동하는 두 부분으로 된 메모리 시스템을 사용합니다.

1. "최근의 과거" (정밀한 윈도우)

비디오의 가장 최근 부분(예: 마지막 몇 분)에 대해서는, ProtoKV가 모든 것을 고해상도로 완벽하게 유지합니다.

  • 비유: 이것은 지난 5분 동안 일어난 일에 대한 선명하고 고해 resolution인 사진을 가지고 있는 것과 같습니다. 만약 지금 이 순간에 대해 질문한다면, 답은 바로 그곳에 아주 명확하게 존재합니다.

2. "먼 과거" (프로토타입 뱅크)

그 최근 윈도우보다 더 이전에 일어난 일들에 대해서, ProtoKV는 개별 프레임을 저장하는 것을 중단합니다. 대신, 그것들은 요약본을 만듭니다.

  • 비유: 당신이 퍼레이드를 보고 있다고 상상해 보세요. 당신은 2시간 전에 지나간 모든 사람의 얼굴을 기억하지 못합니다. 대신, 당신은 이렇게 기억합니다: "행진하는 밴드가 있었다", "거대한 고양이가 달린 퍼레이드 차량이 있었다", 그리고 "빨간 옷을 입은 사람들의 무리가 있었다."
  • 작동 방식: ProtoKV는 유사한 것들을 "프로토타입(Prototypes)"으로 그룹화합니다.
    • 만약 어떤 사람이 걷고 있다면, ProtoKV는 "걷는 사람"이라는 요약을 만듭니다.
    • 만약 그 사람이 10분 동안 걷는다면, 시스템은 10분 분량의 비디오를 저장하는 것이 아니라, 단지 "이 사람은 오랫동안 걷고 있다"라고 "걷는 사람" 요약을 업데이트합니다.
    • 또한, "대부분의 시간 동안 사람은 정상적으로 걷고 있었지만, 가끔씩 손을 흔들었다"와 같은 "잔차(residual)" 기록도 남깁니다. 이는 모든 발걸음을 저장하지 않고도 다양성을 포착합니다.

마법의 기술: "고스트 토큰(Ghost Token)"

마침 finally 질문이 도착했을 때(예: "30분 전에 빨간 셔츠를 입은 사람이 무엇을 했나요?"), 시스템은 이 정보를 AI 모델에 전달해야 합니다. 하지만 모델은 요약본이 아닌 실제 비디오 프레임을 기대합니다.

ProtoKV는 **의사 토큰(Pseudo-Tokens)**이라는 영리한 트릭을 사용합니다.

  • 비유: 당신에게 "거대한 고양이 퍼레이드 차량"이라고 적힌 요약 노트가 있다고 상상해 보세요. 이를 AI에게 보여주기 위해, ProtoKV는 요약 노트에 기반하여 그 "거대한 고양이 퍼레이드 차량"처럼 보이는 몇 개의 "고스트(유령)" 비디오 프레임을 만들어냅니다.
  • 이 고스트들은 실제 프레임이 아닙니다. 그것들은 요약의 수학적 재구성입니다. AI 모델은 이 고스트들을 보고 이를 실제 비디오 프레임처럼 취급합니다.
  • 결정적으로, 시스템은 얼마나 많은 실제 순간들이 그 요약에 포함되었는지 계산합니다. 만약 "거대한 고양이 퍼레이드 차량" 요약이 500초의 실제 비디오로부터 만들어졌다면, 시스템은 AI에게 "이 고스트는 500초의 증거를 나타낸다"라고 알려주어, AI가 그 부분에 더 집중하게 만듭니다.

왜 이것이 더 나은가

저자들은 ProtoKV가 아주 오래전에 일어난 일에 대한 질문(높은 "지연 시간")에 대해 다른 방법들보다 훨씬 더 뛰어나다고 주장합니다.

  • 기존 방식 (슬라이딩 윈도우): 만약 사건이 30분 전에 발생했다면, 시스템은 이미 그것을 삭제했습니다. 정확도는 0으로 떨어집니다.
  • 기존 방식 (토큰 보유): 시스템은 특정 순간들을 저장하려고 노력했지만, 새로운 공간을 만들기 위해 일부를 삭제해야 했습니다. 그 과정에서 도둑이 나타난 바로 그 순간을 삭제했을 수도 있습니다.
  • ProtoKV: 이것은 사건의 개념을 결코 삭제하지 않습니다. 단지 그것을 요약본으로 압축할 뿐입니다. 30분이 지난 후에도 "도둑" 요약은 여전히 존재하며, 새로운 세부 정보와 함께 업데이트되어, 질문에 답하기 위해 다시 "고스트" 프레임으로 변할 준비가 되어 있습니다.

결과

저자들은 여러 비디오 벤치마크에서 이를 테스트했습니다. 그들은 다음과 같은 사실을 발견했습니다:

  1. 정확도: ProtoKV는 오래전에 일어난 사건에 대한 질문에서 훨씬 더 높은 점수(최대 12.5점 더 높음)를 받았습니다.
  2. 안정성: 사건과 질문 사이의 시간 간격이 커짐에 따라, 다른 방법들은 성능이 급락한 반면 ProtoKV의 성능은 안정적으로 유지되었습니다.
  3. 속도: "요약"은 크기가 작고 컴퓨터 메모리에 쉽게 들어가기 때문에, ProtoKV는 다른 방법들만큼 빠르게 질문에 답합니다. 따라서 시스템을 느리게 만들지 않습니다.

요약하자면, ProtoKV는 모든 세부 사항을 기억하려고 애쓰는 대신 일어난 일의 이야기를 기억함으로써 "망각" 문제를 해결하며, 이를 통해 슈퍼컴퓨터의 메모리 없이도 먼 과거의 일에 대해 답할 수 있게 해줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →