TOPS: First-Principles Visual Token Pruning via Constructing Token Optimal Preservation Sets for Efficient MLLM Inference
이 논문은 작업 관련성, 정보 범위, 그리고 의미적 다양성을 기반으로 최적의 보존 집합을 구축하여, 성능을 유지하거나 심지어 향상시키면서도 MLLM의 추론 효율성을 크게 개선하는 학습이 필요 없고 모델에 구애받지 않는 시각적 토큰 프루닝 방법인 TOPS를 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
거대한 도서관(시각적 토큰)이 있고, 초지능 로봇(멀티모달 거대 언어 모델)이 질문에 답하기 위해 이 책들을 읽어야 한다고 상상해 보세요. 문제는 도서관이 너무 방대해서 로봇이 압도당하고, 읽는 데 시간이 너무 오래 걸리며, 페이지를 넘기는 데만 모든 에너지를 다 써버린다는 점입니다.
오랫동안 사람들은 로봇에게 "지루한 페이지는 그냥 건너뛰어!"라고 말하며 도와주려 노력했습니다. 하지만 기존의 방식들은 다소 서툴렀습니다:
- "어텐션(Attention)" 방식은 마치 가장 크고 굵은 글씨가 적힌 페이지만 쳐다보는 로봇과 같았습니다. 이 방식은 작은 글씨로 적힌 중요한 세부 정보를 놓치거나, 비슷한 내용의 문단을 다섯 번씩이나 반복해서 읽기도 했습니다.
- "다양성(Diversity)" 방식은 서로 달라 보이는 페이지들을 고르려고 애쓰는 로봇과 같았습니다. 이 방식은 고양이 페이지와 자동차 페이지를 골라낼 수는 있었지만, 정작 사용자의 특정 질문에 답이 될 수 있는 페이지를 실수로 버릴 수도 있었습니다.
TOPS: 스마트한 사서의 등장
이 논문은 TOPS(Token Optimal Preservation Sets)라는 새로운 방법을 소개합니다. 단순히 어떤 페이지를 남길지 추측하는 대신, TOPS는 마치 원칙을 중시하는 매우 체계적인 사서처럼, 페이지를 보관할지 결정하기 전에 세 가지 구체적인 질문을 던집니다:
- "이 페이지가 질문과 관련이 있는가?" (과업 관련성 - Task Relevance)
- 비유: 만약 사용자가 "자동차 색깔이 뭐야?"라고 묻는다면, 사서는 자동차가 있는 페이지는 즉시 챙기고 하늘에 관한 페이지는 버려야 한다는 것을 바로 알아챕니다.
- "이 페이지가 새로운 정보를 담고 있는가?" (정보 커버리지 - Information Coverage)
- 비유: 이미 자동차의 빨간색 페인트에 대해 설명하는 페이지가 있다면, 똑같은 말을 하는 두 번째 페이지는 필요 없습니다. 우리는 자동차의 번호판처럼 '새로운 것'을 알려주는 페이지가 필요합니다.
- "이 페이지가 우리가 선택한 다른 페이지들과 차별화되는가?" (의미론적 다양성 - Semantic Diversity)
- 비유: 우리는 "자동차는 빨갛다"라고 말하는 페이지 다섯 장을 모으고 싶지 않습니다. 대신 하나는 "빨갛다", 하나는 "빠르다", 하나는 "오래되었다"라고 말하는 페이지를 원합니다. 이를 통해 중복 없이 전체적인 그림을 얻을 수 있습니다.
실제 적용 방식
논문은 TOPS가 별도의 학습이 필요 없는("training-free") 방식임을 보여줍니다. TOPS는 다양한 로봇의 두뇌(LLaVA, Qwen, InternVL 등)에 즉시 연결하여 사용할 수 있습니다.
- "2단계" 정리 작업: 로봇이 긴 영상을 읽고 있다고 상상해 보세요.
- 1단계: TOPS는 로봇이 깊이 생각하기도 전에, (빈 프레임이나 흐릿한 장면 같은) 명백한 쓰레기들을 빠르게 훑으며 버립니다.
- 2단계: 로봇이 읽는 동안, TOPS는 대화 내용을 예의주시합니다. 만약 로봇이 특정 세부 사항에 대해 이야기하기 시작하면, TOPS는 가장 관련성 높은 시각적 페이지들이 여전히 남아 있도록 관리하며, 질문에 딱 맞게 선택 과정을 정교하게 다듬습니다.
결과: 적을수록 풍요롭다 (Less is More)
논문은 이 스마트한 세 가지 질문 접근법을 사용함으로써, 시각적 페이지(토큰)를 최대 90%까지 버릴 수 있음에도 불구하고 로봇이 모든 것을 다 읽었을 때와 다름없이 잘 답변한다는 것을 보여줍니다.
- 마법 같은 수치: 한 특정 모델(LLaVA-NeXT)에서, TOPS는 시각적 데이터의 **77.8%**를 제거했지만, 오히려 로봇의 성능을 약간 **향상(100.6%)**시켰습니다.
- 이유는 무엇일까요? 논문은 로봇이 "불필요한 내용(fluff)"과 중복된 페이지를 무시하도록 강제함으로써, 로봇이 혼란을 겪거나 사실을 지어내는 현상(환각/hallucination)을 막아준다고 설명합니다. 이는 마치 어질러진 책상을 정리하는 것과 같습니다. 때로는 종이가 적을 때 원하는 것을 더 빨리 찾고 더 명확하게 생각할 수 있습니다.
요약하자면
TOPS는 더 엄격하고 스마트한 편집자가 되어 AI 모델을 더 빠르고 똑똑하게 만드는 새로운 방법입니다. 단순히 가장 "목소리가 큰" 혹은 가장 "다른" 시각적 단서를 고르는 대신, 질문에 관련되고, 필요한 정보를 모두 포함하며, 서로 중복되지 않는 완벽하고 압축된 단서 세트를 구축합니다. 그 결과, 로봇은 더 빠르게 생각하고, 메모리를 적게 사용하며, 더 나은 답변을 제공하게 됩니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.