← 최신 논문
💻 computer science

LiteFrame: Efficient Vision Encoders Unlock Frame Scaling in Video LLMs

이 논문은 비싼 프레임별 처리를 우회하도록 압축 토큰 증류로 훈련된 효율적인 비디오 인코더인 LiteFrame 을 소개하여, 비디오 LLM 이 지연 시간을 줄이면서도 이해 정확도를 향상시키면서 훨씬 더 많은 프레임을 처리할 수 있게 합니다.

원저자: Jihwan Kim, Nikhil Parthasarathy, Danfeng Qin, Junhwa Hur, Deqing Sun, Bohyung Han, Ming-Hsuan Yang, Boqing Gong

게시일 2026-05-19
📖 4 분 읽기☕ 가벼운 읽기

원저자: Jihwan Kim, Nikhil Parthasarathy, Danfeng Qin, Junhwa Hur, Deqing Sun, Bohyung Han, Ming-Hsuan Yang, Boqing Gong

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

컴퓨터로 매우 긴 영화를 보려고 하는데 컴퓨터가 따라가지 못한다고 상상해 보세요. 이것이 구글 딥마인드와 서울대학교 연구진이 새로운 시스템인 LiteFrame으로 해결하려는 문제입니다.

간단한 비유를 사용해 그들이 어떻게 이 문제를 해결했는지 그 이야기를 풀어보겠습니다.

문제: "과로한 요리사"와 "느린 웨이터"

비디오 AI(영화를 보고 이해하는 컴퓨터) 를 두 명의 주요 직원이 있는 식당 주방으로 생각하세요:

  1. 비전 인코더 (요리사): 이 직원은 비디오의 모든 프레임을 하나씩 살펴보고 자신이 보는 것을 매우 자세히 설명합니다.
  2. 언어 모델 (웨이터): 이 직원은 요리사의 설명을 받아 영화에 대한 질문에 답합니다.

기존 방식 (병목 현상):
이전에는 긴 영화를 보고 싶다면 요리사가 모든 프레임을 극도로 자세히 설명했습니다. 이로 인해 웨이터가 읽어야 할 방대한 분량의 메모 (시각 토큰) 가 쌓였습니다. 웨이터가 압도당하자 사람들은 웨이터가 읽도록 해결책을 모색했습니다. 그들은 웨이터에게 "메모를 대충 훑어보고 지루한 부분은 무시해라"라고 말했습니다.

새로운 문제:
연구진들은 이것이 웨이터에게는 도움이 되었지만 요리사에게는 도움이 되지 않았음을 깨달았습니다. 요리사는 여전히 모든 프레임을 고해상도로 설명하는 무거운 작업을 계속했기 때문에 엄청난 시간과 에너지를 소모했습니다. 웨이터가 빨라지더라도 전체 과정은 여전히 요리사가 작업을 끝마치기를 기다리며 멈춰 있었습니다. "병목 현상"은 웨이터에서 요리사로 이동했을 뿐입니다.

해결책: LiteFrame (효율적인 요리사)

LiteFrame은 처음부터 초고효율로 설계된 새로운 유형의 요리사입니다. 모든 프레임을 고해상도로 설명한 뒤 지루한 부분을 나중에 버리는 대신, 이 요리사는 영화를 보면서 요약하는 법을 알고 있습니다.

이 새로운 요리사를 훈련시킨 방법은 다음과 같습니다:

1. "마스터 요리사"와 "학생 요리사" (압축 토큰 증류)

그들은 새로운 요리사를 처음부터 훈련시키지 않았습니다. 대신 거대하고 강력하지만 느린 AI 인 "마스터 요리사"를 이용해 "학생 요리사 (LiteFrame)"를 가르쳤습니다.

  • 비법: 보통 학생에게 마스터의 상세한 메모를 복사하도록 가르칩니다. 하지만 여기서는 학생에게 마스터의 요약된 메모를 복사하도록 가르쳤습니다.
  • 비유: 마스터 요리사가 영화 장면에 대해 100 페이지 분량의 보고서를 쓴다고 상상해 보세요. 학생에게 100 페이지 분량의 보고서를 쓰게 하는 대신, "마스터의 100 페이지 보고서를 보되, 전체 이야기를 포착하는 가장 중요한 문장 10 개만 적어라"라고 지시했습니다.
  • 결과: 학생 요리사는 지루하고 반복적인 부분 (예: 10 초 동안 방을 가로지르는 사람) 을 건너뛰고 중요한 변화만 기록하는 법을 배웁니다. 이로 인해 엄청난 시간이 절약됩니다.

2. "스마트 요약" (가중 평균 풀링)

학생에게 무엇을 남기고 무엇을 건너뛸지 가르치기 위해 **가중 평균 풀링 (Weighted Average Pooling, WAP)**이라는 특수 도구를 사용했습니다.

  • 비유: 비디오에서 가져온 사진 한 무더기가 있다고 상상해 보세요. 모든 사진을 하나씩 보는 대신, 사진들을 쌓아 "가중 평균"을 취합니다. 화면을 천천히 가로지르는 차가 있다면, 사진들은 거의 똑같이 보입니다. 이 도구는 같은 차의 흐릿한 사진 100 장을 유지하는 대신, 차의 경로를 명확하게 보여주는 하나의 이미지로 합칩니다. 이렇게 하면 훨씬 작지만 모든 중요한 정보를 유지하는 "압축된" 비디오 버전이 생성됩니다.

3. "최종 튜닝" (언어 모델 적응)

학생 요리사가 이러한 스마트 요약을 작성하는 법을 배운 뒤, 웨이터 (언어 모델) 가 이를 이해할 수 있도록 해야 했습니다. 그들은 웨이터가 이러한 새롭고 짧은 요약을 읽는 연습을 하는 빠른 "튜닝" 작업을 수행했습니다. 이를 통해 웨이터가 새로운 메모 스타일에 혼란을 느끼지 않도록 했습니다.

결과: 더 빠르고, 더 똑똑하며, 더 길게

이 논문은 이 새로운 시스템이 세 가지 구체적인 방식으로 게임의 판을 바꾼다고 주장합니다:

  1. 훨씬 더 빠릅니다: 새로운 시스템은 이전 최고 모델보다 전체적으로 35% 더 빠릅니다.
  2. 더 많이 봅니다: 요리사가 매우 효율적이기 때문에 시스템은 동일한 시간 동안 8 배 더 많은 프레임의 비디오를 처리할 수 있습니다. 기존 시스템이 1 분짜리 클립을 볼 수 있었다면, LiteFrame 은 동일한 속도로 8 분짜리 클립을 볼 수 있습니다.
  3. 더 똑똑해졌습니다: 놀랍게도 더 많은 비디오를 보는 것이 실제로 AI 를 더 똑똑하게 만들었습니다. 영화의 더 많은 부분 (더 많은 프레임) 을 봄으로써 AI 는 이야기를 더 잘 이해하게 되었고, 비디오 이해에 관한 테스트에서 더 높은 점수를 받았습니다.

결론

이전까지 AI 로 긴 영상을 보려는 시도는 단어 사이의 공백까지도 모든 글자가 풀 컬러로 작성된 책을 읽으려는 것과 같았습니다. 너무 느렸습니다.

LiteFrame은 책을 쓰는 새로운 방식과 같습니다. 빈 공간은 건너뛰고 중요한 단어만 쓰지만, 그렇게 잘 수행하기 때문에 단 하나의 세부 사항도 놓치지 않습니다. 이로 인해 컴퓨터들은 지치지 않고 훨씬 더 긴 영화를 보고 이해할 수 있게 되었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →