← 최신 논문
🤖 AI

OTT-Vid: Optimal Transport Temporal Token Compression for Video Large Language Models

본 논문은 프레임 쌍의 압축 가능성에 기반하여 동적으로 압축 예산을 할당하고, 비균일 토큰 질량과 지역성 인지 비용을 활용한 최적 수송을 적용하여 시각 토큰을 10% 만 유지하면서도 최첨단 성능을 달성하는 비디오 대형 언어 모델을 위한 학습 없는 시간적 토큰 압축 프레임워크인 OTT-Vid 를 소개합니다.

원저자: Minseok Kang, Minhyeok Lee, Jungho Lee, Minjung Kim, Donghyeong Kim, Dayeon Lee, Heeseung Choi, Ig-jae Kim, Sangyoun Lee

게시일 2026-05-13
📖 4 분 읽기☕ 가벼운 읽기

원저자: Minseok Kang, Minhyeok Lee, Jungho Lee, Minjung Kim, Donghyeong Kim, Dayeon Lee, Heeseung Choi, Ig-jae Kim, Sangyoun Lee

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

다음은 OTT-Vid 논문에 대한 설명으로, 간단한 개념과 일상적인 비유를 통해 정리한 것입니다.

큰 문제: 너무 많은 영상, 부족한 두뇌 능력

10 분짜리 영화를 보려고 하는데, 당신의 두뇌 (AI 모델) 는 한 번에 아주 적은 정보만 담을 수 있다고 상상해 보세요. 영화를 이해하기 위해 AI 는 매 프레임마다 수천 개의 작은 퍼즐 조각인 **"토큰 (tokens)"**으로 쪼갭니다.

영상이 길어지면 이 퍼즐 조각의 수가 폭발적으로 늘어납니다. 손수레로 산처럼 쌓인 벽돌을 옮기려는 것과 같죠. AI 는 압도당하고 속도가 느려지며, 실행 비용도 천문학적으로 늘어납니다.

구식 해결책: "똑같아 보이면 버려라"

이를 해결하기 위해 연구자들은 여분의 벽돌을 버리려 했습니다. 그들의 옛 규칙은 간단했습니다. "프레임 5 의 벽돌이 프레임 6 의 벽돌과 정확히 같다면, 프레임 6 의 것을 삭제하라."

결함: 이는 사람이 가만히 서 있는 영상을 보고 "움직이지 않았으니 삭제하자"라고 말하는 것과 같습니다. 하지만 그 사람이 주인공일 수도 있습니다! 그 사람을 삭제하면 AI 는 그 존재를 잊어버립니다.

  • 결과: AI 는 정지된 물체나 기다리는 사람처럼 변화하지 않는 것들을 따분한 중복으로 생각하여 그들을 놓쳐버립니다. 또한 무언가 얼마나 오래 지속되었는지 또는 언제 일어났는지에 대한 질문을 처리하는 데도 어려움을 겪습니다.

새로운 해결책: OTT-Vid (똑똑한 사서)

이 논문의 저자들은 단순히 사물이 비슷한지 여부만 보는 것이 아니라, **"이 조각이 중요한가?"**를 묻는 새로운 영상 압축 방식인 OTT-Vid를 제안합니다.

그들은 무엇을 남기고 무엇을 버릴지 결정하기 위해 **최적 수송 (Optimal Transport)**이라는 수학적 개념 (초지능 물류 계획가로 생각하세요) 을 사용합니다. 작동 원리는 세 단계로 나뉩니다.

1. "형광펜" (공간 가지치기)

먼저 AI 는 단일 프레임을 보고 가장 흥미로운 부분을 강조합니다.

  • 비유: 선생님이 시험지를 채점한다고 상상해 보세요. 그들은 모든 단어를 똑같은 주의로 읽지 않습니다. 핵심 문장에 형광펜을 칠하죠. OTT-Vid 도 매 프레임마다 이를 수행하여 "형광펜"이 칠해진 토큰만 남기고 지루한 배경 소음은 무시합니다.

2. "중요도 점수" (질량 할당)

이것이 비밀 무기입니다. AI 는 남은 모든 토큰에 "질량 (무게)"을 부여합니다.

  • 반전: 이 시스템에서는 중요함 = 가벼운 무게이고 중요하지 않음 = 무거운 무게입니다.
  • 이유: 배송 트럭을 생각해 보세요. 깨지기 쉽고 가치 있는 물건 (중요한 토큰) 을 안전하게 보관하고 싶죠. 부숴버리고 싶지 않습니다. 그래서 그들에게 "가벼운" 상태를 부여하여 시스템이 그들을 버리지 않도록 합니다. 지루한 배경 요소는 "무거운" 상태를 부여받아 쉽게 떨어뜨리거나 병합할 수 있게 됩니다.
  • 결과: 사람이 10 초 동안 가만히 서 있어도, AI 는 그들이 중요 (가벼운 무게) 하다는 것을 알고 이전 프레임과 똑같이 생겼더라도 삭제하지 않습니다.

3. "물류 계획" (최적 수송)

이제 AI 는 프레임 1 과 프레임 2 사이, 프레임 2 와 프레임 3 사이 등의 영상을 어떻게 압축할지 결정해야 합니다.

  • 비유: 집을 옮긴다고 상상해 보세요. 당신은 제한된 수의 상자 (예산) 만 가지고 있습니다.
    • 구식 방식: 중복된 것만 버립니다.
    • OTT-Vid 방식: AI 는 "수송 난이도"를 계산합니다.
      • 두 프레임이 매우 비슷하고 지루한 것으로 가득 차 있다면 "난이도"는 낮습니다. AI 는 "좋아, 이걸 하나의 상자에 담아서 공간을 절약하자!"라고 말합니다.
      • 두 프레임에 중요한 변화 (예: 차가 움직이기 시작함) 가 있다면 "난이도"는 높습니다. AI 는 "이건 건드리지 마! 우리는 이 부분을 위해 상자를 아껴야 해!"라고 말합니다.
  • 동적 예산 관리: AI 는 모든 프레임 쌍에 동일한 수의 상자를 주지 않습니다. 영상의 흥미로운 부분에는 더 많은 상자를, 지루한 부분에는 적은 상자를 할당합니다.

더 나은 이유 (결과)

연구자들은 다음을 포함한 여섯 가지 다른 영상 과제에서 이를 테스트했습니다.

  1. 영상 질문 답변: "영상에서 무슨 일이 일어났나요?"
  2. 시간적 근거 (Temporal Grounding): "정확히 언제 사람이 케이크를 잘랐나요?"

결과:

  • 그들은 영상 데이터의 **90%**를 버렸습니다 (토큰의 10% 만 유지).
  • 영상 질문: AI 는 전체 영상을 본 것과 비교해 **95.8%**의 정답률을 유지했습니다.
  • 타이밍 질문: AI 는 타이밍 작업에서 **73.9%**의 정확도를 유지했습니다.

핵심 교훈:
이전 방법들은 사건이 얼마나 오래 지속되었는지를 증명하는 실제로는 "지루한" 정지된 부분을 삭제했기 때문에 타이밍 작업에서 실패했습니다. OTT-Vid 는 단순한 유사성이 아니라 중요성을 이해하기 때문에 그 부분들을 유지합니다.

요약

OTT-Vid는 단순히 똑같이 보이는 반복 장면을 잘라내는 것이 아니라, "이 장면이 스토리에 중요한가?"를 묻는 똑똑한 편집자와 같습니다. 만약 캐릭터가 가만히 서 있더라도 줄거리에서 결정적이라면, 편집자는 그들을 유지합니다. 배경이 지루하고 반복적이라면 편집자는 그것을 잘라냅니다. 이를 통해 AI 는 중요한 세부 사항을 잊지 않고 긴 영상을 빠르게 시청할 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →