← 최신 논문
💻 computer science

EarlyTom: Early Token Compression Completes Fast Video Understanding

본 논문은 정확도를 전체 토큰 기준과 동등하게 유지하면서 시간당 첫 번째 토큰 지연과 계산 비용을 크게 줄이기 위해 비전 인코더 내부에서 초기 단계의 시각 토큰 압축을 수행하는 학습이 없는 프레임워크인 EarlyTom을 제안합니다.

원저자: Hesong Wang, Xin Jin, Lu Lu, Chenhaowen Li, Jian Chen, Qiang Liu, Huan Wang

게시일 2026-05-29
📖 3 분 읽기☕ 가벼운 읽기

원저자: Hesong Wang, Xin Jin, Lu Lu, Chenhaowen Li, Jian Chen, Qiang Liu, Huan Wang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

30 분짜리 영화를 매우 똑똑하지만 매우 바쁜 친구 (AI) 에게 설명한다고 상상해 보세요. 이 친구는 질문에 답하기 전에 먼저 영화를 전체적으로 봐야 합니다.

문제: "느린 시작"
현재 AI 가 비디오를 이해하려고 할 때, 교과서의 모든 페이지를 한 장씩 읽은 후에야 비로소 하나의 질문에 답하려는 고집 센 학생처럼 행동합니다.

  • 옛날 방식: AI 는 비디오의 모든 프레임을 하나씩 시청하고, 이를 수천 개의 작은 조각 (토큰) 으로 분해한 다음, 그 거대한 더미를 처리하기 위해 "뇌"(대형 언어 모델) 에 전달합니다.
  • 병목 현상: 해당 논문은 가장 큰 지연이 AI 의 사고 시간이 아니라, 처음에 비디오를 단순히 시청하고 정리하는 데 소요되는 시간이라고 발견했습니다. 마치 게임을 시작하기 전에 40 분 동안 카드 덱을 정리하는 것과 같습니다. 다른 방법들이 나중에 카드 일부를 버리려 시도했더라도, 초기 정렬 과정은 여전히 느렸습니다.

해결책: EarlyTom(스마트 편집자)
저자들은 EarlyTom이라는 새로운 방법을 개발했습니다. EarlyTom 을 마치 비디오가 시청되는 동안이 아니라 시청이 끝난 후에 개입하는 초효율적인 영화 편집자처럼 생각하세요.

비디오가 완전히 처리된 후에 무엇을 유지할지 결정하는 대신, EarlyTom 은 시청 과정 중에 비디오를 편집합니다. 이는 두 가지 주요 트릭을 사용합니다:

1. "병합" 트릭 (시간 압축)
한 사람이 10 초 동안 가만히 서서 말하는 비디오를 시청한다고 상상해 보세요. 이 비디오에는 같은 사람의 300 개의 프레임이 포함되어 있습니다.

  • 옛날 방식: AI 는 300 개의 프레임을 모두 개별적으로 처리합니다.
  • EarlyTom: "이 300 개의 프레임은 거의 동일하군"이라고 알아차립니다. 모두를 처리하는 대신, 이를 하나의 고품질 요약 프레임으로 병합합니다. 마치 10 분간의 독백을 전달하기 전에 한 문장으로 요약하는 것과 같습니다. 이는 카메라 렌즈(비전 인코더) 내부에서 발생하므로, 중노동이 훨씬 빠르게 처리됩니다.

2. "스포트라이트" 트릭 (공간 선택)
이제 AI 가 비디오 속 군중을 바라봐야 한다고 상상해 보세요.

  • 함정: 논문은 AI 가 "Attention Sinking(주의 침하)"이라는 이상한 습관을 가지고 있음을 발견했습니다. 마치 빈 벽이나 로고와 같은 몇몇 특정 지점에 고정되어 너무 밝게 빛나고 다른 곳의 실제 동작을 무시하는 스포트라이트와 같습니다. 단순히 "가장 밝은" 지점만 선택한다면 중요한 동작을 놓칠 수 있습니다.
  • EarlyTom 의 해결책: 군중을 두 그룹으로 나눕니다:
    • "움직이는" 그룹: 무언가가 변하는 (동작이 있는) 비디오 부분에서는 전역적으로 가장 중요한 세부 사항을 선택합니다.
    • "고정된" 그룹: 무언가가 정적인 부분에서는 고정된 스포트라이트에 산만해지지 않도록 지역적 "창" 접근법을 사용합니다. 이는 AI 가 그 고정된 지점들에 편향되지 않고 장면의 균형 잡힌 시각을 보도록 보장합니다.

결과: 지능을 잃지 않는 속도
이 편집을 프로세스의 초기에 수행함으로써 EarlyTom 은 두 가지 놀라운 성과를 달성합니다:

  1. 초고속 시작: 첫 번째 답변을 얻는 데 걸리는 시간 (Time-to-First-Token) 을 최대 2.65 배 단축합니다. 옛날 방식이 900 밀리초가 걸렸다면, 이는 약 336 밀리초가 걸립니다.
  2. 작업 감소: 필요한 총 컴퓨팅 파워를 최대 61% 줄입니다.

핵심 결론
해당 논문은 EarlyTom 이 비디오 AI 를 재학습 없이도 매우 빠르고 효율적으로 만들며, 비디오를 정확하게 이해하는 능력을 잃지 않게 한다고 주장합니다. 이 논문은 이야기를 이해하기 위해 모든 프레임을 볼 필요가 없으며, 단지 언제 시청을 멈추고 사고를 시작해야 하는지 알면 된다는 것을 증명합니다.

요약하자면: EarlyTom 은 비디오가 시청되는 동안 편집하는 학습이 불필요한 도구로, 비디오 AI 를 더 빠르고 저렴하게 실행하면서도 답변의 지능은 그대로 유지합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →