← 최신 논문
💻 computer science

Spectral Evolution-Guided Token Pruning in Multimodal Large Language Models

본 논문은 주파수 영역에서 층간 스펙트럼 진화를 정량화하여 의미론적으로 활성화된 시각적 토큰을 식별하고 보존함으로써, 추론 성능을 유지하거나 향상시키는 동시에 멀티모달 거대 언어 모델의 속도를 가속화하는 학습이 필요 없는 토큰 프루닝 프레임워크인 CLSE를 제안한다.

원저자: Bin Chen, Yuxiang Cai, Yadan Luo, Yi Zhang, Jianwei Yin, Zhi Chen

게시일 2026-06-24
📖 3 분 읽기☕ 가벼운 읽기

원저자: Bin Chen, Yuxiang Cai, Yadan Luo, Yi Zhang, Jianwei Yin, Zhi Chen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 복잡한 퍼즐을 풀려고 노력 중이라고 상상해 보세요. 그런데 퍼즐 상자 안에는 1,000개의 조각이 들어있는데, 그중 800개는 그저 파란 하늘이나 빈 테이블을 찍은 사진입니다. 일반적인 컴퓨터(멀티모달 거대 언 언어 모델, MLLM)는 이 퍼즐을 풀기 위해 1,000개의 조각 하나하나를 모두 살펴보려고 시도합니다. 이는 시간이 오래 걸리고 많은 에너지를 소모하지만, 사실 그 조각들 대부분은 퍼즐을 푸는 데 전혀 도움이 되지 않습니다.

이 논문은 컴퓨터가 별도의 재학습 없이도 쓸모없는 조각들(중복된 토큰)을 빠르게 버리고 중요한 것에만 집중할 수 있게 해주는 새로운 "학습이 필요 없는(training-free)" 방법을 소개합니다.

저자들이 제안한 **CLSE (Cross-Layer Spectral Evolution, 교차 계층 스펙트럼 진화)**라는 이 새로운 방법이 어떻게 작동하는지, 쉬운 비유를 통해 설명해 드리겠습니다.

1. 문제점: "스포트라이트"의 편향성

기존 방식들은 컴퓨터의 두뇌 내부에서 "스포트라이트"(어텐션 점수라고 불림)를 살펴봄으로써 어떤 퍼즐 조각이 중요한지 결정하려고 합니다.

  • 결함: 논문은 이 스포트라이트가 다소 결함이 있다고 주장합니다. 이 스포트라이트는 실제 중요도와 상관없이, 단순히 리스트의 뒷부분에 위치해 있다는 이유만으로 뒤쪽에 있는 조각들을 더 밝게 비추는 경 Tendency(경향)가 있습니다. 이는 마치 시험을 채점하는 선생님이 답이 맞았는지와 상관없이, 단순히 종이 하단에 적힌 답들에 더 높은 점수를 주는 것과 같습니다.
  • 결과: 컴퓨터는 중요한 조각을 버리고 쓸모없는 배경 조각을 남기는 실수를 범할 수 있습니다.

2. 해결책: 조각들의 "춤"을 관찰하기

저자들은 단 한 번의 스냅샷으로 중요도를 판단하는 대신, 조각들이 컴퓨터의 계층(레이어)을 통과하며 어떻게 변화하는지(마치 이어달리기에서 공을 전달하는 것처럼) 관찰할 것을 제안합니다.

  • 비유: 시각적 토큰(퍼즐 조각)들을 무용수라고 상상해 보세요.
    • 배경 조각들(하늘 같은 것)은 지루한 무용수입니다. 이들은 노래가 시작될 때부터 끝날 때까지 똑같은 동작을 하며 가만히 서 있습니다. 이들은 변하지 않습니다.
    • 중요한 조각들(묘기를 부리는 오토바이 같은 것)은 역동적인 무용수입니다. 이들은 처음에는 단순한 포즈(낮은 수준의 세부 사항)로 시작하여, 노래가 진행됨에 따라 복잡하고 의미 있는 루틴(높은 수준의 의미)으로 변모합니다.
  • 방법: 저자들은 **스펙트럼 진화(Spectral Evolution)**라는 수학적 도구(변화 감지기라고 생각하세요)를 사용하여, 한 계층에서 다음 계층으로 넘어갈 때 무용수의 루틴이 얼마나 변하는지를 측정합니다.
    • 만약 토큰이 많이 변한다면(진화한다면), 그것은 중요한 역할을 하고 있는 것이므로 유지합니다.
    • 만약 토큰이 변하지 않는다면(정적이라면), 그것은 단순한 배경 소음이므로 버립니다.

3. 왜 "주파수"가 중요한가

이 논문은 "주파수"(음악이나 라디오 파동에서 유래)라는 개념을 사용하여 이를 설명합니다.

  • 저주파: 부드럽고 느린 웅웅거림을 생각해보세요. 이는 변하지 않는 지루한 배경을 나타냅니다.
  • 고주파: 날카롭고 빠른 드럼 비트를 생각해보세요. 이는 이미지의 흥미로운 부분을 구성하는 미세한 디테일과 급격한 변화를 나타냅니다.
  • 기술: 새로운 방식은 "부드러운 웅웅거림"(지루한 배경)을 걸러내고, 진화 과정에서 나타나는 "드럼 비트"(변화하는 중요한 디테일)에만 집중합니다.

4. 결과: 더 빠르고 더 똑똑하게

저자들은 다양한 모델과 작업(이미지 및 비디오에 대한 질문 답변 등)에 대해 이 방법을 테스트했습니다.

  • 결과: "지루한 무용수"를 버리고 "역동적인 무용수"만을 남김으로써, 컴퓨터는 이미지를 이해하는 능력을 잃지 않으면서도 훨씬 더 빨라졌습니다(에너지와 메모리 사용량 감소). 실제로, 결함이 있는 "스포트라이트"(어텐션)를 사용하여 중요도를 추측하려 했던 다른 방법들보다 성능이 더 좋았던 경우도 많았습니다.
  • 비디오: 이 방식은 프레임 사이에 "지루한" 반복이 훨씬 더 많은 비디오 작업에서 특히 효과적이었습니다. 이 방법은 컴퓨터가 처리해야 할 조각의 수를 90% 이상 줄이면서도 영상 속의 동작을 완벽하게 이해할 수 있었습니다.

요약

요약하자면, 이 논문은 다음과 같이 말합니다: 어떤 조각이 중요한지 결정하기 위해 단 한 번만 보지 마세요. 그 조각이 시스템을 통과하며 어떻게 변하는지를 관찰하세요. 만약 그대로 머물러 있다면, 그것은 아마도 배경 소음일 것입니다. 만약 진화하고 변모한다면, 그것이 바로 이미지를 이해하는 핵심입니다. 이를 통해 AI는 혼란에 빠지지 않고 훨씬 더 빠르게 작동할 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →