← 최신 논문
🤖 AI

Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin

이 논문은 샘플별 최적의 어텐션 레이어를 동적으로 식별하고 이를 경량 예측기로 증류하여 언어 모델 처리 전 시각적 토큰을 제거하는 방식인 Middle-layer Attention Prediction (MAP)을 제안하며, 이를 통해 LLaVA-NeXT-7B에서 성능의 97.5%를 유지하면서 3.09배의 엔드투엔드 속도 향상을 달성한다.

원저자: Yuyao Sun, Tao Deng, Shuang Li, Deqing Wang, Hao Geng, Minjun Yu

게시일 2026-08-10
📖 5 분 읽기🧠 심층 분석

원저자: Yuyao Sun, Tao Deng, Shuang Li, Deqing Wang, Hao Geng, Minjun Yu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 초지능형 로봇에게 세상을 보고 동시에 말하는 법을 가르치려 한다고 상상해 보세요. 이것이 바로 **멀티모달 거대 언어 모델(Multimodal Large Language Models, MLLMs)**의 세계입니다. 이 모델들을 사진을 보고 "강아지의 목줄 색깔은 무엇인가요?" 또는 "사람이 왜 달리고 있나요?"와 같은 질문에 답할 수 있는 명석한 탐정이라고 생각해 보세요. 이를 위해 로봇은 단순히 이미지를 '보는' 것이 아니라, 이미지를 **시각적 토큰(visual tokens)**이라는 수천 개의 작은 디지털 퍼즐 조각으로 분해합니다. 각 토큰은 이미지의 한 부분에 대한 작은 정보 덩어리입니다.

문제는 이 로봇들이 엄청나게 식탐이 많다는 점입니다. 사진을 제대로 보기 위해 로봇은 수천 개의 토큰을 처리해야 할 수도 있습니다. 이는 마치 고양이의 모자에 대한 간단한 질문의 답을 찾기 위해 백과사전 전체를 읽어야 하는 것과 같습니다. 이는 많은 시간과 에너지(컴퓨팅 파워)를 소모하며, 로봇을 느리고 비싸게 만듭니다. 과학자들은 이 로봇들이 읽기 시작하기도 전에 쓸모없는 퍼즐 조각들을 미리 버림으로써 더 빠르게 만드는 방법을 찾아내기 위해 노력해 왔습니다. 이것을 **시각적 토큰 가지치기(visual token pruning)**라고 부릅니다. 핵심은 어떤 조각을 남기고 어떤 조각을 버릴지 아는 것입니다. 만약 잘못된 조각을 버리면 로봇은 혼란에 빠집니다. 반대로 너무 많은 조각을 남기면 여전히 느려집니다. 큰 질문은 이것입니다. "특정 질문에 대해 어떤 이미지 조각이 가장 중요한지 어떻게 정확히 알 수 있을까?"


문제점: 하나가 모두에게 맞지는 않는다 (One Size Does Not Fit All)

Yuyao Sun과 Tao Deng이 이끄는 이 연구진은 우리가 현재 로봇이 무엇을 남길지 결정하도록 돕는 방식에 교묘한 결함이 있다는 것을 발견했습니다.

이전에는 과학자들이 로봇의 '주의력(attention)'(로봇이 무엇에 집중하고 있는지를 나타내는 멋진 표현)을 특정 중간 레이어(layer)에서 관찰하면 가장 중요한 이미지 조각을 찾을 수 있다고 생각했습니다. 이는 마치 "헤이 로봇, 네 생각이 진행되는 과정 중 중간 단계에서 무엇을 생각하고 있었는지 보고, 그 이미지 조각들을 유지해"라고 말하는 것과 같았습니다.

하지만 저자들은 이러한 "일률적인(one-size-fits-all)" 접근 방식이 잘못되었다는 것을 발견했습니다. 당신이 해변 사진을 보고 있다고 상상해 보세요.

  • 만약 누군가 "모래의 색깔은 무엇인가요?"라고 묻는다면, 로봇의 뇌는 사고 과정 중간에 모래에 불이 들어옵니다.
  • 만약 누군가 "하늘의 색깔은 무엇인가요?"라고 묻는다면, 로봇의 뇌는 하늘에 불이 들어오지만, 아마도 다른 단계에서 그럴 것입니다.

연구진은 어떤 레이어가 특정 질문에 대해 "최선"인지는 전적으로 질문에 따라 달라진다는 것을 보여주었습니다. 때로는 답이 10번 레이어에 있고, 때로는 20번 레이어에 있습니다. 고정된 레이어를 사용하는 것은 건물의 모든 문에 단 하나의 열쇠를 사용하려는 것과 같습니다. 어떤 문에는 작동하지만, 다른 문에는 실패합니다.

게다가 두 번째로 더 큰 문제가 있었습니다. 특정 질문에 대해 어떤 레이어가 "최선"인지 알아내기 위해서, 로봇은 먼저 그 모든 레이어를 통해 전체 이미지를 실제로 처리해야만 했습니다. 이는 마치 가장 좋은 등굣길을 찾기 위해 일단 학교까지 차를 몰고 끝까지 가본 다음에야 어느 길로 꺾는 것이 좋았는지 확인하는 것과 같습니다. 당신이 어떤 조각을 남길지 결정할 때쯤이면, 이미 아끼려고 했던 시간과 에너지를 모두 낭비해 버린 상태가 됩니다!

해결책: "질문 대비" 탐정 (The "Question Contrast" Detective)

이 팀은 MAP(Middle-layer Attention Prediction, 중간 레이어 주의력 예측)라고 불리는 새로운 방법을 제안했습니다. 로봇이 실제 대화를 수행하는 동안 무거운 작업을 수행하게 하는 대신, 그 로봇이 무엇에 집중했을지를 추측하는 작고 매우 빠른 조수를 가르쳤습니다.

이 조수를 훈련시킨 방법은 다음과 같습니다:

  1. "대비(Contrast)" 기술 (QCTS): 그들은 각 질문에 대해 적절한 "선생님"을 뽑아내는 영리한 방법을 고안했습니다. 그들은 이미지를 가져와 로봇에게 두 가지를 물었습니다.

    • 질문 A: 실제 질문 (예: "보트의 색깔은 무엇인가요?")
    • 질문 B: 지루하고 일반적인 질문 (예: "이 이미지에는 무엇이 있나요?")

    그 후, 두 질문에 대한 로봇의 주의력을 비교했습니다. 두 질문 사이에서 로봇의 집중도가 가장 많이 변한 레이어들이 바로 보트의 구체적인 세부 사항에 정말로 신경을 쓰고 있는 레이어였습니다. **질문 대비적 선생님 선택(Question Contrastive Teacher Selection, QCTS)**이라 불리는 이 방법은 마치 스포트라이트처럼, 특정 질문에 대해 로봇의 뇌 중 어느 부분이 가장 흥분하는지를 즉각적으로 식별해 줍니다.

  2. 경량화된 예측기 (The Light-Weight Predictor): 어떤 레이어가 특정 질문의 "스타"인지 알게 된 후, 그 무거운 레이어를 그대로 유지하지 않았습니다. 대신, 그 스타 레이어의 행동을 흉내 내는 아주 작고 가벼운 예측기를 가르쳤습니다. 이 예측기는 너무 작고 빨라서, 거대한 로봇이 생각을 시작하기도 전에 이미지와 질문을 보고 즉시 이렇게 말할 수 있습니다. "이 이미지 조각의 5%만 남기고 나머지는 버려."

결과: 빠르고, 가볍고, 똑똑하게

팀은 이 새로운 시스템을 여러 가지 로봇 뇌(MLLM)와 다양한 까다로운 질문들에 대해 테스트했습니다. 결과는 인상적이었습니다.

  • 속도: 그들의 테스트 모델 중 하나(LLaVA-NeXT-7B)에서, MAP는 처음부터 끝까지 로봇을 3.09배 더 빠르게 만들었습니다. 이는 10분 걸리는 산책을 3분짜리 조깅으로 바꾸는 것과 같습니다.
  • 효율성: 그들은 **94.4%**의 시각적 토큰을 버렸음에도(단 5.56%만 유지), 전체 이미지를 사용했을 때 얻을 수 있었던 정답의 **97.5%**를 여전히 맞혔습니다.
  • 스마트한 선택: 단순히 추측하거나 고정된 규칙을 사용하는 다른 방법들과 달리, MAP의 "다양성" 규칙은 아주 적은 수의 토큰만을 유지할 때도 서로 비슷하게 생긴 조각들만 뽑지 않도록 보장했습니다. 대신 서로 다르면서도 질문과 관련이 있는 조각들을 뽑아내어, 로봇이 중요한 세부 사항을 놓치지 않도록 했습니다.

이것이 중요한 이유

이 논문은 단순히 멋진 아이디어를 제안하는 데 그치지 않고, 실질적인 병목 현상을 해결하는 작동하는 도구를 제공합니다. "최선의" 레이어가 매 질문마다 달라지며, 무거운 작업을 먼저 수행하지 않고도 이를 예측할 수 있다는 것을 증명함으로써, MAP는 이 강력한 AI 모델들이 표준 컴퓨터에서도 훨씬 빠르게 실행될 수 있도록 합니다. 이는 마치 사서에게 도서관의 모든 책을 일일이 훑어보고 나서야 책을 꺼내는 것이 아니라, 도서관에 들어가기도 전에 정확히 어떤 책을 꺼내야 할지 알려주는 마법의 인덱스 카드를 주는 것과 같습니다.

저자들은 이 방법을 통해 우리가 지능을 높게 유지하면서도 훨씬 더 빠르고 저렴하게 운영할 수 있다는 것을 보여줍니다. 이는 AI의 미래가 단순히 더 크고 무거운 뇌를 만드는 것이 아니라, 무엇에 주의를 기울일지 더 똑똑하게 가르치는 것에 달려 있음을 시사합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →