← 최신 논문
💻 computer science

A Survey of Token Compression for Efficient Multimodal Large Language Models

이 논문은 효율적인 멀티모달 거대 언어 모델을 위한 토큰 압축 기술에 관한 첫 번째 체계적인 조사로서, 현재의 진척 상황을 통합하고 향후 연구를 안내하기 위해 기존 방법들을 대상 모달리티(이미지, 비디오, 오디오)와 그 기저 메커니즘에 따라 분류한다.

원저자: Kele Shao, Keda Tao, Kejia Zhang, Sicheng Feng, Mu Cai, Yuzhang Shang, Haoxuan You, Can Qin, Yang Sui, Huan Wang

게시일 2026-02-03
📖 4 분 읽기☕ 가벼운 읽기

원저자: Kele Shao, Keda Tao, Kejia Zhang, Sicheng Feng, Mu Cai, Yuzhang Shang, Haoxuan You, Can Qin, Yang Sui, Huan Wang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게 텍스트를 읽고, 사진을 보고, 영상을 시청하며, 오디오를 들을 수 있는 아주 똑똑한 비서(멀티모달 거대 언어 모델, 즉 MLLM)가 있다고 상상해 보세요. 이 비서는 매우 유능하지만, 한 가지 큰 문제가 있습니다. 너무 많은 정보를 한꺼번에 주면 과부하가 걸린다는 점입니다.

비서가 받는 정보를 "토큰"(데이터의 작은 조각들)의 흐름이라고 생각해 봅시다.

  • 텍스트 프롬프트는 짧은 편지와 같습니다.
  • 고해상도 사진은 편지가 거대하고 상세한 벽화로 확대된 것과 같습니다.
  • 영상은 매초 변화하는 저 벽화 수천 개가 모인 도서관과 같습니다.
  • 오디오는 고속으로 흐르는 연속적인 음파와 같습니다.

만약 당신이 이 비서에게 90분짜리 영화를 입력한다면, 비서는 단순히 "영화 한 편"을 보는 것이 아닙니다. 비서는 5,400만 개의 토큰을 보게 됩니다. 이것은 마치 단 한 번의 호흡에 도서관에 있는 책들을 모두 읽으려는 것과 같습니다. 비서의 두뇌("셀프 어텐션" 메커니즘)는 모든 토큰을 다른 모든 토큰과 비교해야 합니다. 이 계산량은 너무나 방대하고 빠르게 늘어나서, 컴퓨터의 메모리가 바닥나거나 답변을 내놓는 데 영원히 걸리게 만듭니다.

해결책: 토큰 압축 (Token Compression)
이 논문은 이 비서가 지능을 잃지 않으면서도 어떻게 더 효율적으로 작동하도록 가르칠 것인가에 대한 거대한 가이드북(서베이 논문)입니다. 저자들은 이를 토큰 압축이라고 부릅니다.

토큰 압축을 여행을 위해 캐리어를 싸는 것에 비유해 봅시다.

  • 문제: 캐리어에 옷이 가득 차 있지만, 그중 80%는 중복된 것이거나(예: 똑같은 흰색 티셔츠 50장), 필요 없는 것들입니다(예: 해변 여행을 가는데 챙긴 두꺼운 겨울 코트).
  • 목표: 실제로 필요한 물건을 하나도 빠뜨리지 않으면서, 더 작은 가방에 중요한 것들만 담아 더 빠르게 여행하고 싶습니다.

이 논문은 데이터를 "짐 싸는" 현재의 방법들을 두 가지 관점으로 정리합니다: 데이터의 종류는 무엇인가? 그리고 어떻게 짐을 싸는가?

1. 데이터 유형별 분류 (무엇인가?)

데이터의 종류마다 서로 다른 종류의 "불필요한 정보(중복성)"가 존재합니다.

  • 이미지 (정지된 사진):
    • 불필요한 정보: 파란 하늘 사진에는 모두 똑같이 생긴 수백만 개의 파란색 픽셀이 있습니다.
    • 해결책: 모든 파란 픽셀을 하나하나 보내는 대신, 컴퓨터는 이들을 하나로 묶습니다. "이 영역 전체는 그냥 파란 하늘이다"라고 말하며, 하나의 토큰으로 그 구역 전체를 대표하게 합니다.
  • 영상 (움직이는 그림):
    • 불필요한 정보: 사람이 말하는 영상에서 배경(벽이나 나무)은 사람이 약간 움직이는 동안 10초 동안 똑같이 유지됩니다.
    • 해결책: 컴퓨터는 "배경을 초당 30번씩 보낼 필요는 없다"는 것을 깨닫습니다. 배경은 한 번만 유지하고, 움직이는 부분에 대한 업데이트 정보만 보냅니다. 이는 장면 전체를 매번 다시 보내는 대신 "변경 로그"를 보내는 것과 같습니다.
  • 오디오 (음파):
    • 불필려한 정보: 목소리 녹음에는 종종 긴 침묵, 무음, 또는 의미를 더하지 않는 배경 소음이 포함됩니다.
    • 해결책: 컴퓨터는 침묵 구간을 잘라내고 유사한 소리들을 병합하여, 실제로 목소리가 나오거나 음악이 변하는 부분만을 남깁니다.

2. 방법론별 분류 (어떻게 하는가?)

논문은 이 짐 싸기 기술들을 네 가지 주요 전략으로 분류합니다.

  • "축소 광선" (변환 기반 - Transformation-based):
    고해상도 사진을 단순히 작게 줄인다고 상상해 보세요. 세부 사항은 일부 잃겠지만, 전체적인 형태와 색상은 유지할 것입니다. 이는 데이터를 수학적으로 압착(풀링이나 평균화 등)하여 토큰 목록을 짧게 만드는 방식입니다.
  • "그룹 만들기" (유사성 기반 - Similarity-based):
    빨간색 레고 블록 1,000개가 쌓여 있다고 상상해 보세요. 1,000개를 일일이 나열하는 대신, "여기 빨간 블록 하나가 있고, 똑같은 것이 999개 더 있다"라고 말하는 것입니다. 컴퓨터는 서로 매우 비슷하게 생겼거나 소리가 비슷한 토큰들을 찾아내어 하나의 "대표" 토큰으로 합칩니다.
  • "스포트라이트" (어텐션 기반 - Attention-based):
    교실을 바라보는 선생님을 상상해 보세요. 선생님은 손을 들고 있는 학생들(중요한 토큰)에게만 관심을 기울이고, 뒤에서 자고 있는 학생들은 무시합니다. 컴퓨터는 자신의 "어텐션 점수"(각 데이터에 얼마나 집중하는지)를 살펴보고, 이미 무시하고 있는 토큰들을 제거합니다.
  • "질문 가이드" (쿼리 기반 - Query-based):
    건초더미에서 특정 바늘을 찾는 상황을 상상해 보세요. 모든 건초 조각을 다 뒤지는 대신, "바늘은 어디에 있는가?"라고 질문합니다. 컴퓨터는 당신의 질문(쿼리)을 사용하여 질문과 일치하지 않는 모든 것을 걸러내고, 관련 있는 토큰들만 남깁니다.

이것이 왜 중요한가

저자들은 이것이 단순히 컴퓨터를 더 빠르게 만드는 문제가 아니라고 설명합니다. 이것은 사용 가능하게 만드는 문제입니다.

  • 압축이 없다면, 90분짜리 영화를 실시간으로 처리하는 것은 현재의 모델들에게 불가능합니다.
  • 압축이 있다면, 모델은 영화를 "시청"하고, 줄거리를 이해하며, 질문에 답할 수 있는 동시에 메모리의 아주 적은 부분만을 사용할 수 있습니다.

주의점 (과제)

논문은 이것이 마법이 아니라는 점도 경고합니다. 만약 캐리어를 너무 꽉 채우면 다음과 같은 문제가 발생합니다.

  • 세부 사항을 놓칠 수 있습니다: 사진을 너무 많이 압축하면, 배경에 있는 아주 작지만 중요한 표지판을 놓칠 수 있습니다.
  • 흐름이 끊깁니다: 영상에서 너무 많은 프레임을 합쳐버리면, 움직임이 뚝뚝 끊기거나 혼란스러워 보일 수 있습니다.
  • 맞추기 어렵습니다: 이러한 "짐 싸기" 기술 중 일부는 오늘날 가장 빠른 컴퓨터 칩들과 함께 사용하기 어렵습니다. 왜냐하면 컴퓨터가 동작 방식을 다르게 계산하도록 요구하기 때문입니다.

요약하자면:
이 논문은 연구자들을 위한 지도입니다. "우리는 문제가 있습니다: 우리의 AI가 너무 많은 데이터에 빠져 죽어가고 있습니다. 여기 그것을 필터링하고, 그룹화하고, 축소하여 실제로 현실 세계에서 기능하게 만들 수 있는 다양한 방법들이 있습니다."라고 말합니다. 이 논문은 이러한 방법들을 이미지가, 영상이, 혹은 소리가 어떤 것인지에 따라, 그리고 그 일을 수행하기 위해 사용하는 구체적인 수학적 기법에 따라 정리하고 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →