Accelerating Streaming Video Large Language Models via Hierarchical Token Compression
이 논문은 스트리밍 비디오 LLM의 연산 효율성을 높이기 위해 ViT 인코딩 단계의 중복을 줄이는 **STC-Cacher**와 LLM 입력 전 토큰을 압축하는 **STC-Pruner**로 구성된 계층적 토큰 압축 프레임워크(STC)를 제안하여, 정확도 손실을 최소화하면서도 처리 속도를 크게 향상시켰습니다.
당신은 지금 실시간으로 요리 과정을 보여주는 라이브 방송을 보고 있습니다. 요리사는 계속 움직이고, 재료는 계속 바뀌죠. 그런데 당신은 이 영상을 보고 실시간으로 "지금 소금을 넣었나요?" 같은 질문에 답해야 하는 **'AI 요리 관찰자'**입니다.
여기서 두 가지 큰 문제가 발생합니다.
눈의 피로 (ViT 인코딩 단계): 요리사가 1초에 30번씩 움직인다고 해서, 매 순간 모든 것을 새로 다 그려낼 필요는 없습니다. 배경(냄비, 가스레인지)은 가만히 있는데, 매번 "가스레인지는 그대로네, 냄비도 그대로네..."라고 새로 그리는 건 엄청난 에너지 낭비죠.
기억력의 과부하 (LLM 단계): 영상이 길어질수록 당신의 머릿속에는 "방금 본 재료들, 아까 본 도구들..."에 대한 정보가 산더미처럼 쌓입니다. 질문 하나에 답하려고 해도, 머릿속에 너무 많은 정보가 엉켜 있어서 답변 속도가 느려지고 머리가 터질 것 같습니다.
🚀 해결사: STC (Streaming Token Compression)
이 논문은 이 문제를 해결하기 위해 **'STC'**라는 두 단계의 스마트한 필터 시스템을 제안합니다.
1단계: STC-Cacher (똑똑한 눈: "바뀐 것만 그려!") 👁️✨
비유: 요리 영상을 볼 때, 배경은 사진처럼 딱 고정해두고 **'움직이는 재료'**만 눈으로 쫓는 기술입니다.
원리: 이전 장면과 지금 장면을 비교해서, 거의 똑같은 부분(정적인 배경 등)은 예전에 봤던 정보를 그대로 **'재사용(Cache)'**합니다. 오직 새로 움직이거나 변한 부분(동적인 토큰)만 집중해서 새로 계산합니다.
효과: 눈(비전 인코더)이 처리해야 할 일감이 확 줄어들어, 영상 처리 속도가 엄청나게 빨라집니다.
2단계: STC-Pruner (똑똑한 뇌: "중요한 것만 기억해!") 🧠✂️
비유: 머릿속에 쌓인 수만 가지 정보 중에서, **'방금 일어난 일'**과 **'지금 화면에 보이는 핵심'**이 아닌 쓸데없는 정보(예: 계속 똑같은 모양의 접시 정보)는 과감히 삭제하는 기술입니다.
원리: 두 개의 기준점(앵커)을 세웁니다.
과거 기준점: "아까랑 비슷한 건 버려!" (시간적 중복 제거)
현재 기준점: "지금 화면 전체 분위기랑 똑같은 건 버려!" (공간적 중복 제거)
효과: 뇌(언어 모델)로 들어가는 정보의 양이 확 줄어듭니다. 덕분에 질문을 받았을 때 훨씬 빠르게, 정확하게 대답할 수 있습니다.
📊 요약하자면?
이 논문의 핵심은 **"중복된 정보는 버리고, 변화된 정보에만 집중하자!"**입니다.
기존 방식: 영상의 모든 프레임을 처음부터 끝까지 다 새로 그리고, 모든 정보를 다 기억하려고 함 →너무 느리고 무거움.
STC 방식: 변한 것만 새로 그리고, 핵심만 골라 기억함 →엄청 빠르면서도 정확함.
결과적으로: 이 기술을 쓰면 AI가 실시간 스포츠 중계, AR 글래스(안경) 같은 서비스에서 끊김 없이, 아주 빠르게 영상을 이해하고 우리와 대화할 수 있게 됩니다!
[기술 요약] 계층적 토큰 압축을 통한 스트리밍 비디오 거대 언어 모델 가속화
1. 문제 정의 (Problem Statement)
최근 비디오 이해를 위한 거대 언어 모델(VideoLLMs)이 발전하고 있으나, 실시간 스트리밍 비디오 이해(Streaming Video Understanding, SVU) 환경에서는 다음과 같은 두 가지 핵심적인 병목 현상으로 인해 실시간 배포가 어렵습니다.
ViT 인코딩 단계의 중복성 (Temporal Redundancy in ViT): 스트리밍 비디오는 프레임 간 간격이 좁아 시각적으로 매우 유사한 프레임이 연속적으로 들어옵니다. 기존 모델은 매 프레임마다 Vision Transformer(ViT)를 전체 연산하므로, 정적인 배경이나 변화 없는 객체를 반복해서 계산하는 비효율이 발생합니다.
LLM 프리필링 단계의 부하 (Long Context Redundancy in LLM): 비디오가 진행됨에 따라 LLM에 입력되는 시각적 토큰의 수가 급격히 증가합니다. 이는 LLM의 Self-attention 연산량(제곱 복잡도)을 폭증시키고 메모리 오버헤드를 유발하여 응답 지연(Latency)을 심화시킵니다.
스트리밍의 제약 조건: 기존의 토큰 압축 방식들은 비디오 전체를 미리 알고 있거나(Global visibility), 사용자의 질문을 미리 알아야 하는(Instruction-aware) 경우가 많아, 프레임이 순차적으로 들어오고 질문이 나중에 발생하는 스트리밍 환경에는 적용하기 어렵습니다.
2. 제안 방법론 (Methodology: STC Framework)
본 논문은 플러그 앤 플레이(Plug-and-play) 방식의 계층적 가속 프레임워크인 **STC(Streaming Token Compression)**를 제안합니다. STC는 두 개의 상호 보완적인 모듈로 구성됩니다.
① STC-Cacher (ViT 인코딩 가속)
ViT 단계에서 시간적 중복성을 제거하기 위해 선택적 재계산(Selective Recomputation) 전략을 사용합니다.
Reference Frame (기준 프레임): 일정 간격(N)마다 기준 프레임을 설정하여 전체 Forward Pass를 수행하고, 각 레이어의 중간 표현(Key, Value, Attention, MLP 등)을 캐싱합니다.
Non-reference Frame (비기준 프레임): 새로운 프레임이 들어오면 캐싱된 기준 프레임의 Key 값과 현재 프레임의 Key 값을 코사인 유사도로 비교합니다.
동적 토큰 식별: 유사도가 낮은(즉, 시각적 변화가 큰) '동적 토큰'만 선별하여 Query와 Value를 계산합니다. 나머지 '정적 토큰'은 캐시된 값을 재사용(Reuse)함으로써 연산량을 획기적으로 줄입니다.
② STC-Pruner (LLM 프리필링 가속)
LLM에 입력되기 전, 시각적 토큰 시퀀스를 압축하기 위해 **이중 앵커 기반 프루닝(Dual-Anchor Pruning)**을 수행합니다. 질문(Query)을 모르는 상태에서도 작동하도록 설계되었습니다.
Temporal Context Anchor (TCA): 과거 프레임들의 평균값을 통해 '과거의 맥락'을 정의합니다.
Spatial Context Anchor (SCA): 현재 프레임 토큰들의 평균값을 통해 '현재의 공간적 맥락(배경 등)'을 정의합니다.
동적 점수(Dynamics Scoring): 각 토큰이 TCA(과거) 및 SCA(현재 공간)와 모두 이질적인(Dissimilar) 경우, 즉 "과거에도 없었고 현재 프레임 내에서도 특이한" 토큰에 높은 점수를 부여합니다.
프루닝: 점수가 높은 상위 k개의 토큰만 남기고 나머지는 제거하여 LLM에 전달합니다.
3. 주요 기여 (Key Contributions)
스트리밍 특화 분석: 스트리밍 비디오의 시간적 중복성과 인과적(Causal) 제약 조건을 실증적으로 분석하여 기존 압축 방식의 한계를 규명했습니다.
계층적 가속 프레임워크: ViT 인코딩과 LLM 프리필링 두 단계를 동시에 최적화하는 최초의 스트리밍 네이티브(Streaming-native) 설계를 제안했습니다.
플러그 앤 플레이 설계: 모델을 재학습할 필요 없이 기존의 다양한 VideoLLM(Dispider, LiveCC, ReKV 등)에 즉시 통합하여 사용할 수 있습니다.
효율성과 성능의 균형: 높은 정확도를 유지하면서도 연산 지연 시간을 대폭 단축했습니다.
4. 실험 결과 (Results)
다양한 벤치마크(OVO-Bench, StreamingBench, EgoSchema 등)를 통한 실험 결과는 다음과 같습니다.
성능 유지: ReKV 프레임워크 기준, 정확도 손실을 **1% 미만(99% 유지)**으로 억제하면서도 매우 높은 효율을 보였습니다.
지연 시간 단축:
ViT 인코딩 지연 시간: 24.5% 감소
LLM 프리필링 지연 시간: 45.3% 감소
범용성 입증: 온라인 전용 모델(End-to-end online)과 오프라인 모델을 스트리밍 방식으로 변환한 모델(Offline-to-online) 모두에서 성능 향상을 입증했습니다.
5. 의의 (Significance)
본 연구는 실시간성이 생명인 라이브 스포츠 중계, 증강 현실(AR) 글래스, 자율 주행 모니터링 등 실제 스트리밍 비디오 이해 서비스에 VideoLLM을 적용할 수 있는 실질적인 기술적 토대를 마련했습니다. 특히, 미래 정보나 질문에 의존하지 않고도 '인과적(Causal)'으로 동작하는 압축 방식을 제안함으로써 스트리밍 환경에서의 실시간 추론 문제를 효과적으로 해결했습니다.