← 최신 논문
💻 computer science

Accelerating Streaming Video Large Language Models via Hierarchical Token Compression

이 논문은 스트리밍 비디오 LLM의 연산 효율성을 높이기 위해 ViT 인코딩 단계의 중복을 줄이는 **STC-Cacher**와 LLM 입력 전 토큰을 압축하는 **STC-Pruner**로 구성된 계층적 토큰 압축 프레임워크(STC)를 제안하여, 정확도 손실을 최소화하면서도 처리 속도를 크게 향상시켰습니다.

원저자: Yiyu Wang, Xuyang Liu, Xiyan Gui, Xinying Lin, Boxue Yang, Chenfei Liao, Tailai Chen, Linfeng Zhang

게시일 2026-02-12
📖 2 분 읽기☕ 가벼운 읽기

원저자: Yiyu Wang, Xuyang Liu, Xiyan Gui, Xinying Lin, Boxue Yang, Chenfei Liao, Tailai Chen, Linfeng Zhang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

🎥 상황 설정: "끝없이 밀려오는 요리 영상 시청하기"

당신은 지금 실시간으로 요리 과정을 보여주는 라이브 방송을 보고 있습니다. 요리사는 계속 움직이고, 재료는 계속 바뀌죠. 그런데 당신은 이 영상을 보고 실시간으로 "지금 소금을 넣었나요?" 같은 질문에 답해야 하는 **'AI 요리 관찰자'**입니다.

여기서 두 가지 큰 문제가 발생합니다.

  1. 눈의 피로 (ViT 인코딩 단계): 요리사가 1초에 30번씩 움직인다고 해서, 매 순간 모든 것을 새로 다 그려낼 필요는 없습니다. 배경(냄비, 가스레인지)은 가만히 있는데, 매번 "가스레인지는 그대로네, 냄비도 그대로네..."라고 새로 그리는 건 엄청난 에너지 낭비죠.
  2. 기억력의 과부하 (LLM 단계): 영상이 길어질수록 당신의 머릿속에는 "방금 본 재료들, 아까 본 도구들..."에 대한 정보가 산더미처럼 쌓입니다. 질문 하나에 답하려고 해도, 머릿속에 너무 많은 정보가 엉켜 있어서 답변 속도가 느려지고 머리가 터질 것 같습니다.

🚀 해결사: STC (Streaming Token Compression)

이 논문은 이 문제를 해결하기 위해 **'STC'**라는 두 단계의 스마트한 필터 시스템을 제안합니다.

1단계: STC-Cacher (똑똑한 눈: "바뀐 것만 그려!") 👁️✨

  • 비유: 요리 영상을 볼 때, 배경은 사진처럼 딱 고정해두고 **'움직이는 재료'**만 눈으로 쫓는 기술입니다.
  • 원리: 이전 장면과 지금 장면을 비교해서, 거의 똑같은 부분(정적인 배경 등)은 예전에 봤던 정보를 그대로 **'재사용(Cache)'**합니다. 오직 새로 움직이거나 변한 부분(동적인 토큰)만 집중해서 새로 계산합니다.
  • 효과: 눈(비전 인코더)이 처리해야 할 일감이 확 줄어들어, 영상 처리 속도가 엄청나게 빨라집니다.

2단계: STC-Pruner (똑똑한 뇌: "중요한 것만 기억해!") 🧠✂️

  • 비유: 머릿속에 쌓인 수만 가지 정보 중에서, **'방금 일어난 일'**과 **'지금 화면에 보이는 핵심'**이 아닌 쓸데없는 정보(예: 계속 똑같은 모양의 접시 정보)는 과감히 삭제하는 기술입니다.
  • 원리: 두 개의 기준점(앵커)을 세웁니다.
    • 과거 기준점: "아까랑 비슷한 건 버려!" (시간적 중복 제거)
    • 현재 기준점: "지금 화면 전체 분위기랑 똑같은 건 버려!" (공간적 중복 제거)
  • 효과: 뇌(언어 모델)로 들어가는 정보의 양이 확 줄어듭니다. 덕분에 질문을 받았을 때 훨씬 빠르게, 정확하게 대답할 수 있습니다.

📊 요약하자면?

이 논문의 핵심은 **"중복된 정보는 버리고, 변화된 정보에만 집중하자!"**입니다.

  • 기존 방식: 영상의 모든 프레임을 처음부터 끝까지 다 새로 그리고, 모든 정보를 다 기억하려고 함 \rightarrow 너무 느리고 무거움.
  • STC 방식: 변한 것만 새로 그리고, 핵심만 골라 기억함 \rightarrow 엄청 빠르면서도 정확함.

결과적으로: 이 기술을 쓰면 AI가 실시간 스포츠 중계, AR 글래스(안경) 같은 서비스에서 끊김 없이, 아주 빠르게 영상을 이해하고 우리와 대화할 수 있게 됩니다!

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →