Capturing Token Tendencies for Training-Free Token Pruning in Multimodal Large Language Models
이 논문은 중요한 시각적 단서의 조기 손실을 방지하기 위해 레이어 전반에 걸친 토큰 중요도의 동적 진화를 모델링함으로써 효율성을 개선하고, 경쟁력 있는 성능을 유지하면서도 77.8% 이상의 토큰 감소를 달축하는 멀티모달 거대 언어 모델을 위한 학습 불필요(training-free) 프레임워크인 트렌드 인식 프루닝(Trend-aware Pruning)을 제안한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 초지능형 로봇에게 사진을 보여주고 질문을 던지며 세상을 이해하는 법을 가르치려 한다고 상상해 보세요. 이 분야를 멀티모달 거대 언어 모델(MLLM)이라고 부릅니다. 이 모델들을 텍스트를 읽는 동시에 이미지를 볼 수 있는 뛰어난 탐정이라고 생각하면 됩니다. 이미지를 '보기' 위해서, 로봇은 이미지를 '토큰'이라 불리는 수천 개의 아주 작은 퍼즐 조각으로 분해합니다. 각 토큰은 파란 하늘의 한 조각이나 자동차의 바퀴처럼 이미지의 작은 단편입니다. 문제는, 로봇에게 고해상도 사진을 보여주면 너무 많은 조각 때문에 로봇이 압도당한다는 점입니다. 로봇은 모든 조각에 주의를 기울이려 노력하는데, 이는 로봇을 느리게 만들고, 실행 비용을 높이며, 때로는 수많은 노이즈 때문에 혼란에 빠지게 만듭니다.
이를 해결하기 위해 과학자들은 아주 간단한 기술을 시도했습니다. 바로 시작 단계에서 중요해 보이지 않는 조각들을 그냥 버려버리는 것입니다. 이것은 마치 클럽의 보안 요원이 군중을 훑어보고 특정 색깔의 셔츠를 입지 않은 사람들을 즉시 쫓아내는 것과 같습니다. 하지만 여기에는 함정이 있습니다. 때때로 방 안에서 가장 흥미로운 사람은 처음에는 평범한 셔츠를 입고 있다가, 몇 분 뒤에 춤을 추기 시작하며 파티의 주인공이 되는 사람일 수도 있습니다. 만약 보안 요원이 너무 일찍 그들을 쫓아낸다면, 파티는 망쳐지게 됩니다. 이 논문은 한 가지 큰 질문을 던집니다. 단 한 번의 찰나의 눈길만으로 무엇을 남길지 최종 결정을 내리는 것이 안전할까요, 아니면 우리는 사물이 시간이 지남에 따라 어떻게 변하는지 관찰해야 할까요?
이 논문의 저자인 Jie Ma와 그의 팀은 기존의 '보안 요원' 방식이 너무 경직되어 있다고 말합니다. 그들은 **트렌드 인지 프루닝(Trend-aware Pruning)**이라는 새로운 사고방식을 제안합니다. 단순히 지금 당장 어떤 토큰이 중요한지를 보는 대신, 이들의 방식은 토큰의 '경향성'을 보기 위해 시간을 두고 관찰하는 인내심 있는 관찰자처럼 행동합니다. 그들은 어떤 토큰들이 '늦게 피는 꽃'과 같다는 사실을 깨달았습니다. 이 토큰들은 로봇의 뇌의 초기 레이어에서는 조용하고 중요하지 않아 보일 수 있지만, 로봇이 이미지를 더 깊게 처리함에 따라 갑자기 장면을 이해하는 데 결정적인 역할을 하게 됩니다.
팀은 이러한 토큰들의 '모멘텀(운동량)'을 추적하는 시스템을 구축했습니다. 어떤 바위들은 그냥 가만히 놓여 있지만, 어떤 바위들은 서서히 중심 전류를 향해 떠내려가는 강물을 상상해 보세요. 기존 방식은 이 바위들이 아직 중심에 있지 않다는 이유로 무시할 것입니다. 하지만 새로운 방식은 그 흐름을 포착합니다. 이 방식은 토큰이 '상승 추세'를 보이는 경우, 즉 아직 최우선 순위는 아니더라도 중요도가 높아지고 있는 경우를 계속 주시합니다. 만약 어떤 토큰이 로봇이 더 깊이 파고들수록 더 흥미로워 보인다면, 시스템은 그 토큰을 '구조'하여 너무 늦기 전에 다시 대화에 참여시킵니다. 또한 그들은 토큰이 '변동(오르락내리락)'하거나 '하락 추세(사라져 감)'인 경우를 감시하며, 이들을 각각 다르게 취급하여 모두 버리지 않고 다르게 처리합니다.
그들이 LLaV나 Qwen과 같은 인기 있는 로봇 두뇌에 이 아이디어를 테스트했을 때, 결과는 인상적이었습니다. 새로운 방식은 단순히 시간을 절약했을 뿐만 아니라, 실제로 로봇의 성능을 향상시켰습니다. 실험에서 그들은 시각적 토큰의 수를 77.8% 이상 줄여, 최종 레이어에는 약 23개의 토큰만을 남겼습니다. 이토록 많은 데이터를 버렸음에도 불구하고, 토큰을 절반으로 줄였을 때 원래 성능의 **98.89%**를 유지했으며, 심지어 거의 **78%**를 줄였을 때도 **96.03%**라는 강력한 성능을 유지했습니다. 이는 처음에 '상위' 토큰만을 선택하는 다른 방식들이 이토록 공격적으로 데이터를 깎아낼 때 중요한 세부 사항을 놓치는 것과 비교하면 매우 큰 성과입니다.
저자들은 이 접근 방식이 효과적인 이유가 이미지를 이해하는 것은 단 한 번의 순간이 아니라 하나의 '여정'임을 존중하기 때문이라고 제안합니다. 로봇이 처음에 간과했던 토큰을 다시 '활성화'할 수 있도록 허용함으로써, 중요한 단서를 놓치는 것을 방지합니다. 그들은 이 동적인 접근 방식이 이미지 속 텍스트를 읽거나(OCR) 작은 세부 사항을 포착하는 것과 같이 까다로운 작업에서 특히 유용하다는 것을 발견했습니다. 즉, 정적인 방식들이 흔히 실패하는 부분에서 말입니다. 비록 그들의 시스템이 고정된 관찰 창에 의존하고 있어 더 긴 시퀀스를 처리하도록 개선될 여지가 있다고 인정하지만, 그들의 연구는 주의(attention)의 '추세'를 관찰하는 것이서부터 다시 학습할 필요 없이 스마트한 로봇을 더 빠르고 예리하게 만드는 강력한 방법임을 보여줍니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.