Adaptive Two-Stage Visual Token Pruning for Efficient Inference in Video-Language Models
본 논문은 중복된 프레임을 먼저 제거한 후 프레임 간 상관관계에 따라 토큰 유지량을 동적으로 조정하는 사후 처리 방식의 훈련이 필요 없는 2단계 적응형 토큰 프루닝 전략을 제안하며, 이를 통해 10%의 토큰 유지율에서 비디오 캡셔닝 정확도를 7% 향상시키는 동시에 연산량을 95% 절감하는 성과를 달성하였다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 초지능 로봇에게 세상을 이해하는 법을 가르치려 한다고 상상해 보세요. 당신은 로봇에게 카메라와 두뇌를 주고, 비디오를 보고 무엇이 일어나고 있는지 말해보라고 요청합니다. 이것이 바로 "시각-언어 모델(Vision-Language Models, VLMs)"의 세계입니다. 이 모델들을 하나의 팀이라고 생각하면 됩니다. 한 부분은 "눈"(비전 인코더)으로, 사진을 보고 그것을 "토큰"이라 불리는 아주 작은 퍼즐 조각들로 분해합니다. 다른 부분은 "두뇌"(대규모 언어 모델)로, 이 토큰들을 읽고 이야기(스토리)를 쓰거나 질문에 답합니다.
문제는 비디오가 매우 방대하다는 점입니다. 단 하나의 이미지도 수백 개의 퍼즐 조각으로 나뉠 수 있는데, 비디오는 이러한 이미지들이 겹겹이 쌓인 것입니다. 만약 비디오 전체를 로봇의 두뇌에 집어넣으려 한다면, 로봇은 과부하가 걸립니다. 이는 마치 천 페이지짜리 책을 1초 만에 읽으려는 것과 같습니다. 로봇은 느려지고, 지치며, 휴대폰이나 보안 카메라 같은 작은 기기에서는 제대로 작동할 수 없게 됩니다. 과학자들은 일부 퍼즐 조각을 버림으로써 이를 해결하려 노력해 왔지만, 대부분의 방법은 마치 쿠키 커터와 같습니다. 영상이 벽을 찍은 지루하고 정지된 장면이든, 긴박한 자동차 추격전이든 상관없이 항상 똑같은 양의 조각을 잘라내 버립니다. 이 논문은 더 나은 질문을 던집니다. "만약 우리가 무엇을 버릴지 더 똑똑하게 결정할 수 있다면 어떨까? 반복되는 부분에서는 더 많이 잘라내고, 흥미진진한 부분에서는 덜 잘라낸다면?"
스마트 비디오 커터의 이야기
아마존의 연구진으로 구성된 이 논문의 저자들은 현재 비디오 AI를 빠르게 만드는 방식들이 다소 투박하다는 점에 주목했습니다. 기존 방식들은 영상에서 실제로 어떤 일이 일어나고 있는지와 상관없이, 항상 고정된 수의 퍼즐 조각(토큰)을 잘라내어 모든 영상을 동일하게 취급합니다. 하지만 비디오는 특별합니다. 비디오에는 "시간적 중복성(temporal redundancy)"이 있는데, 이는 멋진 표현으로, 만약 고양이가 자고 있는 비디오라면 프레임 10은 프레임 11과 거의 똑같고, 프레임 11은 프레임 12와 거의 똑같다는 것을 의미합니다. 이 모든 동일한 프레임들에 로봇의 두뇌를 낭비하는 것은 어리석은 일입니다.
이를 해결하기 위해, 연구팀은 "2단계 적응형 시각 토큰 프루닝(Two-Stage Adaptive Visual Token Pruning)" 전략을 발명했습니다. 이것을 지저도한 방을 정리하는 2단계 청소부라고 생각해 보세요.
1단계: 프레임 필터 (The Frame Filter)
먼저, 이 방법은 비디오 전체를 살펴보고 "어떤 프레임이 실제로 새로운 정보를 담고 있는가?"라고 묻습니다. 사람이 걷고 있는 비디오라면, 처음 몇 프레임은 서로 동일할 수 있습니다. 이 알고리즘은 선택적인 편집자처럼 행동하여, 지루하고 반복되는 프레임들을 통째로 버립니다. 오직 가장 흥미로운 순간들, 즉 하이라이트 장면만을 남깁니다. 이것이 "프레임 수준(frame-level)"의 프루닝입니다.
2단계: 토큰 테이머 (The Token Tamer)
이제 로봇에게는 더 짧아진 비디오가 남았지만, 남은 각 프임은 여전히 수천 개의 작은 토큰들로 이루어져 있습니다. 여기서 마법이 일어납니다. 고정된 수의 토큰을 자르는 대신(예: "항상 50% 유지"), 이 방법은 비디오의 내용을 보고 얼마나 자를지 결정합니다.
비디오 안의 토큰들을 대화 중인 사람들의 무리라고 상상해 보세요. 만약 모든 사람이 똑같은 말만 하고 있다면(높은 중복성), 그룹을 이해하기 위해 단 한 명의 말만 들어도 충분합니다. 하지만 모두가 전혀 다른 말을 하고 있다면(높s은 다양성), 모든 사람의 말을 들어야 합니다. 논문의 방식은 정확히 이와 같이 작동합니다. 즉, 토큰 사이의 "상관관계"를 분석합니다. 이들은 "고유값 분해(eigen-decomposition)"라는 수학적 기법을 사용하여 토큰들이 서로 얼마나 반복되는지를 측정합니다.
만약 비디오가 정적이고 반복적이라면(예: 경사로를 따라 공이 굴러가는 장면), 수학적으로 "급격한 쇠퇴(steep decay)"를 보입니다. 이는 토큰들이 매우 유사하다는 뜻입니다. 그러면 시스템은 "좋아, 이 조각들은 많이 버려도 되겠어!"라고 판단하여 아주 적은 비율의 토가만 남깁니다. 반대로 비디오가 혼란스럽고 역동적이라면(예: 카메라 움직임이 많은 자동차 추격전), 수학적으로 "느린 쇠퇴(slow decay)"를 보입니다. 이는 토큰들이 모두 고유하다는 뜻입니다. 그러면 시스템은 "잠깐, 이 조각들은 거의 다 남겨둬야 해!"라고 판단하여 아주 조금만 자릅니다.
결과: 비틀거림 없는 속도 향상
연구팀은 LLaVA-Video, InternVL3, Qwen2.5VL을 포함한 여러 인기 AI 모델을 대상으로 테스트를 진행했습니다. 그들은 자신들의 스마트한 적응형 방식과 다른 "학습 불필요(training-free)" 방식들을 비교했습니다.
결과는 인상적이었습니다. 이 2단계 접근 방식을 사용함으로써, 컴퓨터가 수행해야 할 수학적 연산을 무려 최대 **95%**까지 줄이면서도 AI의 지능을 그대로 유지할 수 있었습니다. 실제로, 비디오 캡셔닝 벤치마크(AI가 본 것을 설명하는 작업)에서, 이 방식은 토큰의 단 **10%**만을 유지했을 때 오히려 정확도를 7% 향상시켰습니다.
이를 체감해 보자면, 보통 슈퍼컴퓨터로 한 시간 동안 처리해야 하는 비디오를 이 방식을 사용하면 단 몇 분 만에 처리할 수 있으며, 로봇은 소음 속에서 길을 잃는 대신 중요한 부분에 집중함으로써 오히려 영상을 더 잘 이해할 수도 있게 됩니다.
이것이 왜 중요한가
이 논문은 기존 방식들이 사용하는 "일률적인(one-size-fits-all)" 접근 방식에 대해 명시적으로 반박합니다. 그들은 고정된 비율(예: 항상 데이터의 30%를 유지하는 것)을 사용하는 것이 최적이 아니라는 점을 보여줍니다. 왜냐하면 비디오마다 필요한 데이터의 양이 다르기 때문입니다. 이들의 방식은 "사후적(post-hoc)"인 방식으로, 모델을 처음부터 다시 학습시킬 필요 없이 기존 모델에 바로 적용할 수 있어, 현재 기술에 플러그 앤 플레이(plug-and-play) 방식으로 업그레이드할 수 있는 도구가 됩니다.
저자들은 이 적응형 전략이 다양한 모델 크기와 비디오 유형에 걸쳐 일관되게 작동한다는 것을 발견했습니다. 그들은 또한 정보의 "쇠퇴(decay)"를 측정하는 다양한 수학적 방법들을 테스트했으며, 지수 곡선(exponential curve)이 데이터에 가장 잘 부합한다는 것을 찾아내어, 자신들이 중복성을 측정하는 방식이 가장 정확함을 확인했습니다.
요약하자면, 이 논문은 비디오를 이해하기 위해 더 크고 느린 두뇌를 만들 필요가 없다고 제안합니다. 대신, 우리는 그들에게 무엇을 먹일지 더 똑똑하게 결정하기만 하면 됩니다. 지루한 부분을 언제 잘라내고 흥미로운 부분을 언제 남길지 정확히 아는 노련한 편집자처럼 행동함으로써, 우리는 비디오 AI가 세상을 명확하게 보는 능력을 잃지 않으면서도 일상적인 기기에서 실행될 수 있을 만큼 빠르게 만들 수 있습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.