← 최신 논문
🤖 AI

Rethinking Video Token Compression with a Global Codebook: Learning Once, Compressing Everywhere

본 논문은 주파수 인지적 전역 코드북을 한 번 학습함으로써 비용이 많이 드는 압축 과정을 오프라인으로 전환하여, 비디오 이해 벤치마크 전반에서 경쟁력 있는 성능을 유지하면서도 추론 지연 시간을 크게 줄이는 효율적인 모델 불가지론적 온라인 압축을 가능하게 하는 플러그인 비디오 토큰 압축 프레임워크인 **ONCE**를 제안한다.

원저자: Jiayang He, Tianling Xu, Diancheng Kang, Huaide Jiang, Junyan Bai, Shaoming Zheng, Xuan Song

게시일 2026-08-04
📖 6 분 읽기🧠 심층 분석

원저자: Jiayang He, Tianling Xu, Diancheng Kang, Huaide Jiang, Junyan Bai, Shaoming Zheng, Xuan Song

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 영화를 이해하는 법을 가르치려 한다고 상상해 보세요. 이를 위해 당신은 영화의 모든 프레임을 의미를 담은 수천 개의 작은 디지털 "픽셀", 즉 토큰(token)으로 분해합니다. 그러면 로봇은 이 방대한 토큰 목록을 하나의 문장처럼 읽어서 무슨 일이 일어나고 있는지 파악합니다. 문제는 영화는 길고 반복되는 내용이 많다는 점입니다. 만약 캐릭터가 방 안에서 10초 동안 가만히 서 있다면, 로봇은 똑같은 "방 안에 서 있음"이라는 토큰을 수천 번 연속해서 읽어야 합니다. 이는 마치 공간을 채우기 위해 "the"라는 단어를 백만 번 반복해서 적어놓은 책을 읽는 것과 같습니다. 이는 로봇의 두뇌 에너지를 낭비하고 답변 속도를 매우 느리게 만듭니다. 과학자들은 로봇에게 지루한 부분을 건너뛰거나 비슷한 부분을 합치는 법을 가르쳐 이 문제를 해결하려 노력해 왔지만, 이는 보통 로봇이 보는 모든 영상마다 추가적인 수학 연산을 수행해야 하므로 여전히 매우 느리고 비용이 많이 듭니다.

이 논문은 ONCE라고 불리는 새로운 방식을 소개합니다. 로보가 새로운 영상을 볼 때마다 매번 분류하고 건너뛰는 힘든 작업을 하게 만드는 대신, 연구진은 로봇이 영상을 보기 전 단계에서 그 핵심적인 작업을 미리 수행하기로 했습니다. 그들은 "글로벌 코드북(Global Codebook)"을 만들었는데, 이는 수천 시간의 영상에서 발견되는 가장 흔한 시각적 패턴들을 모아둔 거대한 사전 제작 인덱스와 같습니다. 이것은 마치 모든 책이 완벽한 선반에 이미 분류되어 있는 도서관과 같습니다. 새로운 영화가 도착했을 때, 로봇은 처음부터 구조를 파악할 필요가 없습니다. 그저 사전 제작된 인덱스에서 패턴을 찾아내고, 관련 있는 "선반"을 가져와서 그것들을 평균화하기만 하면 됩니다. 이 방식은 복잡한 계산 대신 빠른 조회를 수행하기 때문에 로봇이 영상을 훨씬 더 빠르게 처리할 수 있게 해줍니다. 연구진은 이 방법이 매우 효과적이라는 것을 발견했습니다. 특히 아주 적은 수의 토큰만을 사용해야 하는 상황에서도, 로봇이 보고 있는 내용을 잊어버리지 않으면서도 속도를 유지할 수 있었습니다.

문제점: 과부하가 걸린 로봇의 두뇌

비디오 거대 언어 모델(Video-LLM)은 영상을 보고 그에 대한 질문에 답할 수 있는 초강력 탐정과 같습니다. 이를 위해 이들은 영상을 긴 디지털 토큰의 문자열로 변환합니다. 하지만 여기 함정이 있습니다. 만약 탐정에게 2시간짜리 영화를 입력하면, 토큰의 문자열이 너무 길어져서 탐정의 메모리를 압도하게 됩니다.

설상가상으로 영화는 중복된 내용으로 가득 차 있습니다. 만약 한 장면에서 고양이가 소파에 앉아 있는 모습이 5분 동안 지속된다면, 비디오 인코더는 모두 "소파 위의 고양이"라고 말하는 수천 개의 토큰을 생성합니다. 탐정은 이들이 모두 동일함에도 불구하고 하나하나 다 읽어야 합니다. 기존 방식들은 탐정이 영상을 보는 동안 이러한 토큰들을 "가지치기(pruning, 잘라내기)"하거나 "병합(merging, 결합)"하도록 하여 이 문제를 해결하려 합니다. 하지만 이는 탐정에게 매번 새로운 영화를 볼 때마다 멈춰 서서 자신의 노트를 재정리하라고 요구하는 것과 같습니다. 이는 매번 추가적인 시간과 에너지를 소모하며, 사용하는 탐정(모델)에 따라 정리 규칙이 달라집니다.

해결책: ONCE와 "글로벌 코드북"

이 논문의 저자인 지양 허(Jiayang He)와 그의 팀은 다른 접근 방식을 제안했습니다. 그들은 이렇게 물었습니다. "만약 우리가 매번 탐정에게 시키는 대신, 모두를 위해 한 번에 미리 정리해 놓는다면 어떨까?"

그들은 ONCE(Offline-to-Online Video Token Compression)라고 불리는 시스템을 구축했습니다. 이해를 돕기 위해 간단한 비유를 들어보겠습니다.

당신이 수백만 권의 책을 분류해야 하는 사서라고 상상해 보세요.

  • 기존 방식 (기존 방법들): 새로운 책 더미가 도착할 때마다, 당신은 멈춰 서서 모든 책을 읽고, 어떤 것들이 서로 유사한지 결정한 다음, 선반에 꽂기 전에 물리적으로 그룹화해야 합니다. 이는 매번 새로운 화물이 올 때마다 오랜 시간이 걸립니다.
  • ONCE 방식: 새로운 책들이 도착하기 전에, 당신은 이미 가지고 있는 방대한 양의 책들을 공부하는 데 시간을 보냅니다. 당신은 "마스터 인덱스(Global Codebook)"를 만드는데, 여기에는 당신이 본 모든 흔한 유형의 책(예: "액션 영웅", "요리 프로그램", "자연 다큐멘터리")이 나열되어 있습니다. 또한 당신은 규칙을 만듭니다: "만약 어떤 책이 '자연 다큐멘터리'처럼 보인다면, A 박스에 넣어라."

이제 새로운 책 더미(새로운 영상)가 도착하면, 당신은 모든 책을 주의 깊게 읽을 필요가 없습니다. 그저 각 책을 빠르게 훑어보고, 마스터 인덱스를 확인하여 어떤 박스에 속하는지 체크한 뒤, 그곳에 넣기만 하면 됩니다. 그런 다음 당신은 A 박스에 있는 모든 책을 하나의 요약된 노트로 만듭니다. 이는 당신이 새로운 화물이 올 때마다 정리 규칙을 새로 만드는 것이 아니라, 이미 배운 규칙을 사용하기 때문에 믿을 수 없을 정도로 빠릅니다.

상세 작동 원리

  1. 오프라인 학습 ("Once" 부분): 연구진은 방대한 영상 데이터셋(LLaVA-Video-178K)을 가져와 시각적 패턴을 분석했습니다. 그들은 단순히 무작위 패턴을 뽑은 것이 아니라, 영상의 다양한 시점(시계열적 층화)을 포착하고 나타나는 빈도에 따라 가중치를 두었습니다. 그런 다음 "최적 운송(optimal transport)"이라는 수학적 기법을 사용하여 8,192개의 대표적인 "프로토타입(또는 코드워드)"을 가진 글로벌 코드북을 맞추었습니다. 이 코드북은 시각적 세계의 지도 역할을 합니다.
  2. 온라인 압축 ("Everywhere" 부분): 새로운 영상이 들어오면, 시스템은 새로운 학습을 수행하지 않습니다. 그저 영상의 시각적 토큰을 살펴보고 다음과 같이 묻습니다. "이것은 나의 8,192개 프로토타입 중 무엇과 닮았는가?" 시스템은 영상에 가장 자주 등장하는 프로토타입을 선택하고, 모든 영상 토큰을 이 프로토타입들에 재할당한 뒤, 이를 평균화합니다. 이 과정은 수천 개의 토큰을 핵심 의미를 잃지 않으면서도 훨씬 작고 관리 가능한 숫자(예: 256 또는 512개)로 변환합니다.

연구 결과

팀은 두 가지 AI 모델(LLaVA-OneVision-7B 및 Qwen3.5-9B)을 사용하여 네 가지 서로 다른 비디오 이해 벤치마크(MVBench, EgoSchema, Video-MME, LongVideoBench)에서 ONCE를 테스트했습니다.

  • 속도: 결과는 놀라웠습니다. ONCE는 사전 계산(prefill FLOPs) 측면에서 언어 모델이 해야 할 작업량을 약 96% 줄였습니다. 실질적인 관점에서, 이는 압축 없이 실행할 때보다 평균 2.96배 더 빠르게 시스템을 구동했습니다.
  • 정확도: 보통 데이터를 깎아내어 시스템을 빠르게 만들면 성능이 떨어지기 마련입니다. 하지만 ONCE는 놀라울 정도로 똑똑했습니다. 토큰 예산이 매우 엄격할 때(32, 64, 또는 128개의 토큰만 허용될 때), ONCE는 실제로 다른 압축 방식들보다 더 높은 점수를 기록했습니다. 특히 사건 횟수를 세거나 상태 변화를 인식하는 작업에서 뛰어난 성능을 보였습니다.
  • 효율성: 이 시스템은 메인 AI 모델을 다시 학습시키지 않고도 이러한 속도 향상을 달자했습니다. 코드북은 한 번 학습된 후 모든 곳에 재사용되었습니다.

제외된 사항 (반증된 내용)

논문은 압축이 반드시 모든 영상마다 "온라인(영상 재생 중)"으로 이루어져야 한다는 생각에 대해 명시적으로 반박합니다. 그들은 추론 단계(영상을 보는 동안)에서 무거운 작업을 수행하는 것이 비효ef적이고 중복적이라는 것을 보여주었습니다. 또한 단순히 무작위 토큰을 선택하거나 모든 영상에 대해 고정된 토인 세트를 사용하는 것이 그들의 방식만큼 효과적이지 않다는 것도 입증했습니다. 그들의 방식은 그룹화 규칙은 고정하되, 특정 영상에 맞는 적절한 프로토타입을 동적으로 선택합니다.

나아가, 그들은 "글로벌 코드북"이 단순히 훈련 예시를 저장하는 것이 아니라, 재사용 가능한 구조를 학습한다는 것을 발견했습니다. 본 적 없는 영상(공개 영상 스트레스 테스트)에서도 코드북은 무작위 그룹화보다 더 나은 성능을 보였으며, 이는 코드북이 시각적 패턴의 근본적인 "문법"을 진정으로 포착했음을 시사합니다.

핵심 요약

저자들은 ONCE가 비디오 AI를 바라보는 새로운 관점을 제시한다고 주장합니다. 즉, 새로운 영상마다 AI가 더 힘들게 일하게 만드는 대신, 우리는 한 번에 보편적인 시각적 패턴의 언어를 가르치고, AI가 필요할 때마다 그 언어를 유창하고 빠르게 구사하도록 할 수 있다는 것입니다. 비록 이 방식이 각기 다른 AI 모델(서로 다르게 "보는" 방식이 다르기 때문)을 위한 별도의 코드북을 필요로 하기는 하지만, 결과는 이 "한 번 학습하여 어디서나 압축하는(learn once, compress everywhere)" 접근 방식이 시각적 이해 능력을 희생하지 않으면서도 비디오 AI를 더 빠르고 효율적으로 만드는 강력한 방법임을 보여줍니다. 이 논문은 이 방식이 긴 영상을 이해하는 기술을 일상적인 용도로 실용화하는 데 있어 유망한 단계라고 결론짓습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →