How Many Visual Tokens Do Multimodal Language Models Need? Scaling Visual Token Pruning with F^3A
본 논문은 가지치기를 작업 조건부 증거 탐색으로 간주하여 고정된 토큰 예산을 동적으로 할당하는 추가 학습 없이 멀티모달 모델의 추론 비용을 줄이고 원래 디코딩 파이프라인을 방해하지 않는 학습 불필요 시각 토큰 가지치기 라우터인 F^3A를 소개합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
이 논문은 간단한 언어와 창의적인 비유를 사용하여 설명합니다.
핵심 질문: 우리는 실제로 이미지의 얼마나 많은 부분을 필요로 할까?
상상해 보세요. 어떤 수수께끼를 풀려고 하는데, 누군가 정답을 찾는 데 도움이 되도록 거대한 고해상도 사진을 건네줍니다. 이 사진은 수백만 개의 작은 픽셀로 이루어져 있을 정도로 디테일이 풍부합니다.
AI 세계에서는 이러한 "픽셀"을 **시각 토큰 (visual tokens)**이라고 부릅니다. 현재의 AI 모델 (다중 모달 대규모 언어 모델) 은 실마리를 놓치지 않도록 그 사진의 모든 단일 픽셀을 확인하고 싶어 하는 천재 탐정들과 같습니다. 하지만 수백만 개의 픽셀을 살펴보는 데는 시간이 오래 걸리고 배터리 (컴퓨팅 자원) 를 많이 소모합니다.
연구자들은 단순한 질문을 던졌습니다. 시간과 에너지가 제한되어 있다면, 정답을 얻기 위해 실제로 유지해야 하는 픽셀은 몇 개나 될까?
기존 방법의 문제점: "원샷 (One-Shot)" 추측
현재 대부분의 AI 시스템은 "원샷" 규칙을 사용하여 픽셀 수를 줄이려고 시도합니다. 그들은 사진을 한 번 보고 "오, 이 부분은 밝으니 중요해"라고 말하거나 "이 부분은 흐릿하니 버리자"라고 결정합니다.
저자들은 이것이 건초더미 속의 특정 바늘을 찾기 위해 건초의 최상층만 살펴보는 것과 같다고 주장합니다. 바늘이 깊숙이 숨겨져 있거나 색이 dull(무채색) 한 경우, 단순한 "밝기" 확인으로는 이를 놓치게 됩니다. 그들은 이를 **정적 순위 매기기 (static ranking)**라고 부릅니다. 이는 구체적인 질문이 무엇인지 상관없이 일반적인 규칙에 기반하여 추측할 뿐입니다.
해결책: F3A (초파리 전략)
이 논문은 F3A(Fruit-Fly-Foraging Algorithm, 초파리 채식 알고리즘)라는 새로운 방법을 소개합니다. 이를 이해하기 위해 썩은 과일을 찾는 초파리를 상상해 보세요.
냄새 (Odor Field): 초파리는 과일만 보는 것이 아니라 공기의 냄새를 맡습니다. 냄새가 가장 강한 곳의 "지도"를 작성합니다.
- AI 에서는: 이미지만 보는 것이 아니라, AI 가 먼저 질문을 읽습니다. 질문이 무엇을 묻고 있는지에 기반하여 "냄새 지도"를 작성합니다. 질문이 "모자의 색깔은 무엇인가?"라면, AI 는 밝은 점뿐만 아니라 모자를 "냄새 맡을" 줄 압니다.
3 단계 사냥: 초파리는 무작위로 착륙하지 않습니다. 지능적인 전략을 사용합니다.
- 단계 1: 대략적 탐색 (Wide Net): 초파리는 높이 날아 냄새가 강한 일반적인 영역을 찾습니다. 아직 단일 나뭇잎을 고르는 것이 아니라, 전체 가지를 선택합니다.
- AI 에서는: 시스템이 질문과 관련된 일반적인 영역을 찾기 위해 이미지의 큰 덩어리들을 살펴봅니다.
- 단계 2: 시각적 잠금 (The Zoom): 유망한 가지를 찾으면 착륙하여 과일이 실제로 있는지, 아니면 과일 냄새가 나는 나뭇잎인지 확인합니다. 바로 옆에 있는 두 개의 나뭇잎을 모두 고르는 것 (중복) 을 피합니다.
- AI 에서는: 시스템이 해당 특정 영역으로 확대하여 정확한 최상의 토큰을 선택하고, 같은 것을 두 번 선택하지 않도록 보장합니다.
- 단계 3: 구조 점프 (The Safety Net): 때로는 과일이 초파리가 놓친 이상한 곳에 숨겨져 있습니다. 초파리는 다음과 같은 규칙을 따릅니다. "아직 충분한 과일을 찾지 못했다면, 혹시 모르니 무작위 위치로 점프하자."
- AI 에서는: 시스템이 작은 텍스트 레이블이나 작은 물체와 같은 작지만 결정적인 세부 사항을 놓쳤음을 깨닫으면, 그 토큰들을 "구조"하여 손실되지 않도록 합니다.
- 단계 1: 대략적 탐색 (Wide Net): 초파리는 높이 날아 냄새가 강한 일반적인 영역을 찾습니다. 아직 단일 나뭇잎을 고르는 것이 아니라, 전체 가지를 선택합니다.
왜 중요한가: 결과
연구자들은 이 "초파리" 전략을 20 억 파라미터의 작은 모델부터 2350 억 파라미터의 거대 모델에 이르기까지 다양한 AI 모델에서 테스트했습니다.
- "고정 예산" 테스트: 그들은 AI 에게 "이미지의 20% 만 볼 수 있다"고 말했습니다.
- 결과: 초파리 AI(F3A) 는 전체 이미지를 보는 것과 비교해 정답을 **93.86%**의 확률로 맞혔습니다. 다른 방법들 (예: "원샷" 추측자들) 은 훨씬 낮은 확률로 정답을 맞혔습니다.
- "고정 목표" 테스트: 그들은 AI 에게 "최소한의 픽셀을 사용하면서 정답을 97% 이상 맞춰야 한다"고 말했습니다.
- 결과: 초파리 AI 는 그 목표에 도달하기 위해 픽셀의 **39.9%**만 필요로 했습니다. 그 다음으로 좋은 방법은 픽셀의 **50.1%**가 필요했습니다.
결론
이 논문은 모델의 크기보다 주의를 어떻게 배분하느냐가 더 중요하다고 주장합니다.
일반적인 규칙에 기반하여 이미지를 맹목적으로 줄이는 대신, F3A 는 이미지를 보물 지도처럼 다룹니다. 질문을 사용하여 지능적인 3 단계 탐색 (냄새 맡기, 잠금, 구조) 을 안내하여 필요한 정확한 단서들을 찾습니다. 이를 통해 AI 는 세상을 이해하는 능력을 잃지 않으면서도 훨씬 더 빠르고 메모리를 적게 사용할 수 있게 됩니다.
간단히 말해: "중복되어 보인다는 이유로" 이미지의 절반을 버리지 마십시오. 초파리가 과일을 사냥하듯, 질문을 사용하여 필요한 구체적인 증거를 사냥하십시오.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.