← 최신 논문
💻 computer science

CoRDS: Coreset-based Representative and Diverse Selection for Streaming Video Understanding

본 논문은 고정된 메모리 예산 하에서 여러 비전-언어 모델과 벤치마크의 성능을 향상시키기 위해 이차 기준 목적 함수와 직교성 기반 다양성 기준을 통해 키-값 캐시의 컴팩트하고 다양하며 대표적인 부분 집합을 선택함으로써 토큰 단위 휴리스틱 가지치기를 개선하는 스트리밍 비디오 이해를 위한 코어셋 기반 방법인 CoRDS를 제안한다.

원저자: Ailar Mahdizadeh, Puria Azadi, Muchen Li, Xiangteng He, Leonid Sigal

게시일 2026-05-15
📖 4 분 읽기☕ 가벼운 읽기

원저자: Ailar Mahdizadeh, Puria Azadi, Muchen Li, Xiangteng He, Leonid Sigal

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

매우 긴 영화를 보고 있다고 상상해 보세요. 하지만 나중에 그 영화에 대한 질문에 답할 수 있도록 가장 중요한 부분만 적을 수 있는 아주 작은 스티커 노트 하나만 있습니다. 이것이 실시간으로 긴 영상을 이해하려는 현대 AI 모델 (비전 - 언어 모델) 이 직면한 과제입니다. 그들은 모든 것을 기억할 수 없으므로 영상을 더 작은 기억 공간으로 '압축'해야 합니다.

이 논문은 이를 해결하기 위해 CoRDS(Coreset-based Representative and Diverse Selection, 코어셋 기반 대표성 및 다양성 선택) 라는 새로운 방법을 소개합니다. 간단한 비유를 통해 작동 원리를 설명하겠습니다.

문제: '최근성'의 함정

현재 대부분의 AI 모델은 다음과 같은 단순한 규칙에 의존하는 '스티커 노트' 전략을 사용합니다.

  • "가장 최신 내용만 유지하기": 마지막 몇 초만 기억합니다.
  • "가장 큰 소리만 유지하기": 가장 눈에 띄거나 밝은 부분만 기억합니다.

저자들은 이는 전체 영화를 마지막 장면이나 가장 큰 폭발이 있는 장면만 기억하여 요약하려는 것과 같다고 주장합니다. 나중에 미스터리를 해결하는 데 필요한 20 분 전에 일어난 조용하지만 결정적인 단서들을 놓칠 수 있습니다.

해결책: '큐레이터' 접근법

CoRDS 는 게임의 규칙을 바꿉니다. 소리가 크거나 최신인지 여부에 따라 토큰 (작은 영상 데이터 조각) 을 하나씩 선택하는 대신, 박물관 큐레이터처럼 전체 컬렉션을 대표하는 작은 전시회를 구성하려는 역할을 합니다.

CoRDS 가 사용하는 세 가지 주요 전략은 다음과 같습니다.

1. '양손' 시야 (Joint KV 표현)
영상 데이터의 모든 조각에는 두 가지 측면이 있다고 상상해 보세요.

  • '키 (Key)' (라벨): AI 가 과거의 어디를 봐야 하는지 알려줍니다. (예: "이것은 빨간 차가 나오는 장면입니다.")
  • '밸류 (Value)' (내용): 실제 정보입니다. (예: "빨간 차가 나무에 충돌했습니다.")

기존 방법들은 종종 라벨이나 내용 중 하나만 보았습니다. CoRDS 는 둘을 동시에 봅니다. 이는 AI 가 올바른 기억을 찾을 수 있도록 하면서도, 그 기억에 실제로 올바른 세부 정보가 포함되어 있는지 보장합니다. 마치 위치의 지도 (키) 와 사진 (밸류) 중 하나만 있는 것이 아니라 둘 다 가지고 있는지 확인하는 것과 같습니다.

2. '방 전체를 덮기' 전략 (Coreset 선택)
가장 좋은 단일 항목을 선택하는 대신, CoRDS 는 이렇게 질문합니다. "방의 공간을 가장 많이 커버하는 소그룹의 항목은 무엇인가?"
만약 방이 가구로 가득 차 있다면, 가장 비싼 의자 하나만 고르는 것이 아니라, 방 전체의 스타일을 대표하는 의자, 테이블, 램프, 그리고 러그를 함께 고릅니다. CoRDS 는 전체 영상 역사의 기하학적 구조를 '덮는' 작은 영상 프레임 그룹을 수학적으로 선택하여, 주요 시각적 스타일이나 장면 유형이 빠지지 않도록 보장합니다.

3. '새로운 각도' 규칙 (직교 다양성)
때로는 매우 유사한 두 항목 (예: 똑같은 빨간 의자 두 개) 을 선택할 수 있습니다. 이는 공간을 낭비합니다. CoRDS 는 이를 방지하는 규칙이 있습니다. "이미 가지고 있는 것과 너무 비슷해 보이는 것은 선택하지 마세요."
이는 새로운 각도나 새로운 방향을 제공하는 항목을 찾습니다. AI 가 이미 빨간 차에 대한 기억을 가지고 있다면, 해당 영상 부분을 커버하는 유일한 방법이 아니라면 다른 빨간 차는 선택하지 않습니다. 기억을 다양하게 만들기 위해 독특하고 다른 순간들을 적극적으로 찾아냅니다.

결과: 더 많은 기억이 아닌 더 똑똑한 기억

이 논문은 네 가지 다른 AI 모델과 다섯 가지 다른 영상 벤치마크 (긴 영화와 라이브 스트림 포함) 에서 이를 테스트했습니다.

  • 경쟁사보다 우수함: CoRDS 는 '최근성'이나 '큰 소리' 규칙을 사용하는 기존 방법 (InfiniPot-V 및 StreamMem 등) 보다 일관되게 더 좋은 성과를 냈습니다.
  • 작음이 아름다움: AI 가 매우 작은 기억만 사용하도록 강제되었을 때 (영상 데이터의 1/16 만 유지), CoRDS 는 훨씬 더 큰 기억을 가진 기존 방법의 모델들보다 더 좋은 성능을 발휘했습니다.
  • '전체' 모델을 능가함: 어떤 경우에는 CoRDS 가 압축되지 않은 전체 영상을 기억하려는 AI 모델보다 더 좋은 성능을 보였습니다. 이는 영상의 '중복'이거나 '노이즈'가 많은 부분을 제거함으로써 AI 가 실제로 중요한 단서에 더 집중하게 되어 ('Haystack 속의 바늘' 문제를 해결하여) 성능이 향상되었음을 시사합니다.

요약

CoRDS 를 영상의 스마트 편집자로 생각하세요. 지루한 부분만 잘라내거나 최신 클립만 유지하는 대신, 전체 이야기를 포착하는 다양하고 대표적인 순간들의 손에 잡힐 만한 집합을 신중하게 선택합니다. 이를 통해 AI 는 전체 영상을 본 것과 마찬가지로 1 시간 분량의 영상에 대한 질문에 답할 수 있지만, 컴퓨터 메모리의 일부만 사용합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →