OccamToken: Efficient VLM Inference with Training-Free and Budget-Adaptive Token Pruning
OccamToken 은 취약한 절대 토큰 순위 매기기를 레지스터에 고정된 상대적 증거 테스트로 대체함으로써 비전 - 언어 모델 추론 효율성을 향상시키는 학습이 불필요하고 예산에 적응 가능한 프레임워크로, 원래 정확도의 93% 이상을 유지하면서 2,880 개의 토큰을 약 40 개로 줄이는 등 극단적인 토큰 압축을 가능하게 합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
OccamToken 논문에 대한 설명을 일상적인 비유와 함께 간단한 개념으로 나누어 정리합니다.
커다란 문제: 부엌의 과도한 소음
고객의 주문 (텍스트 질문) 과 거대한 재료 더미 (이미지) 를 바탕으로 요리를 하려는 셰프 (AI) 를 상상해 보세요.
현대 AI 에서는 이미지를 보여주면 컴퓨터가 이를 **"토큰 (tokens)"**이라고 불리는 수천 개의 작은 조각으로 분해합니다. 고해상도 사진이라면 이는 2,880 개의 재료 더미와 같습니다. 셰프는 요리를 시작하기 전에 그 모든 조각 하나하나를 살펴봐야 합니다. 이 과정은 대부분의 재료가 조리대 위의 먼지 한 점이나 흐릿한 하늘 조각과 같은 배경 소음일지라도 엄청난 시간과 에너지 (연산 능력) 를 소모하게 만듭니다.
구식 방법: "상위 10 개" 규칙
과거에는 시간을 절약하기 위해 "가장 덜 중요한" 재료를 버리려 했습니다. *"가장 흥미로운 재료 상위 100 개만 남기고 나머지는 버린다"*는 규칙을 사용했습니다.
이 논문은 이 규칙이 두 가지 이유로 깨져 있다고 주장합니다:
- "울고 있는 아기" 효과: 때로는 지루한 재료 (예: 빈 벽) 가 컴퓨터의 계산 방식 때문에 우연히 매우 큰 "중요도 점수"를 받습니다. 이 큰 소음은 조용하지만 중요한 재료 (예: 사진 속 작은 디테일) 를 가려버려, 컴퓨터가 지루한 내용을 실제로 가장 중요한 것으로 오인하게 만듭니다.
- "일률적 적용" 문제: "100 개만 남긴다"와 같은 고정된 규칙은 모든 사진에 적용되지 않습니다.
- 숲속 사진에서 *"고양이가 있나요?"*라고 묻는다면, 몇 군데만 확인하면 됩니다. 100 군데를 유지하는 것은 낭비입니다.
- 스웨터 사진에서 *"직물의 질감은 무엇인가요?"*라고 묻는다면, 훨씬 더 많은 곳을 살펴봐야 할 수도 있습니다. 100 개만 유지하면 정답을 놓칠 수 있습니다.
새로운 해결책: OccamToken
저자들은 OccamToken이라는 새로운 방법을 개발했습니다. *"상위 100 개는 무엇인가?"*라고 묻는 대신, *"이 재료가 우리의 '참조 항아리'보다 더 유용한가?"*라고 묻습니다.
다음은 단계별 작동 원리입니다:
1. "참조 항아리" (Register Token)
부엌 조리대에는 "부엌의 모든 것"에 대한 일반적이고 평균적인 샘플이 들어 있는 특별한 항아리가 있다고 상상해 보세요. 이 항아리는 특정 고양이 나 스웨터에 대해 알지 못하며, 단순히 방의 "배경 분위기"만 담고 있습니다.
- 도움 되는 이유: 구식 시스템에서는 "울고 있는 아기" (지루한 소음) 가 모든 주의를 훔쳐갔습니다. 하지만 이 새로운 시스템에서는 "참조 항아리"가 그 소음을 흡수합니다. 쓸모없고 시끄러운 신호를 흡수하는 스펀지 역할을 합니다.
- 결과: 이제 소음이 차단되었기 때문에 컴퓨터는 실제로 어떤 재료가 특별한지 명확하게 볼 수 있습니다.
2. 1 단계: "이미지 정리" (중복성 가지치기)
셰프가 고객의 주문을 읽기 전에 주방 직원이 빠르게 수색을 합니다.
- 모든 재료를 참조 항아리와 비교합니다.
- 재료가 항아리에 있는 일반적 배경과 똑같다면 버립니다.
- 비유: 사진이 번잡한 거리라면, 직원은 "하늘"이나 "흐릿한 아스팔트"에 불과한 2,000 개의 토큰을 버립니다. 참조 항아리가 이미 그 모습을 알고 있기 때문입니다. 항아리와 다른 모양을 한 토큰 (자동차, 사람들) 만 유지합니다.
- 이점: 이는 모든 이미지에 대해 자동으로 발생합니다. 단순한 사진은 많이 정리되고, 복잡한 사진은 덜 정리됩니다.
3 단계: "고객 주문" 확인 (관련성 가지치기)
이제 셰프가 구체적인 질문을 읽습니다: "왼쪽에 있는 남자가 서 있나요?"
- 셰프는 남은 재료들을 살펴봅니다.
- 이번에는 참조 항아리와 다시 비교하지만, *"이 재료가 일반적 배경보다 구체적인 질문에 답하는 데 더 도움이 되는가?"*라고 묻습니다.
- 비유: 질문이 남자에 관한 것이라면, 셰프는 남자와 그가 서 있는 땅을 보여주는 토큰을 유지합니다. 질문이 구석에 있는 고양이에 관한 것이라면, 셰프는 그 토큰들을 유지하고 남자는 버립니다.
- 이점: 유지되는 재료의 수는 질문에 따라 달라집니다. 간단한 질문은 10 개의 토큰만 필요할 수 있고, 어려운 질문은 50 개가 필요할 수 있습니다.
결과: 적은 노력, 같은 맛
이 논문은 LLaVA 와 Qwen 과 같은 여러 AI 모델에서 이를 테스트했습니다.
- 주장: 그들은 재료의 **98.6%**를 버리고 (2,880 개의 토큰에서 약 40 개로 줄임) 도 여전히 **93%**의 확률로 정답을 얻었습니다.
- 비유: 냄비 속 모든 쌀알을 맛볼 필요 없이 소금기를 알 수 있다는 것을 깨닫는 것과 같습니다. 올바른 숟가락 몇 개만 맛보면 됩니다.
- 학습 불필요: 가장 좋은 점은 셰프에게 요리를 다시 가르칠 필요가 없다는 것입니다. 셰프가 재료를 선택하는 규칙만 바꾸면 됩니다. 이는 "박스에서 꺼내 바로 사용" 가능합니다.
요약
OccamToken은 AI 가 지루한 배경 소음을 보며 시간을 낭비하지 않도록 막는 지능형 필터입니다. "상위 100 개 유지"와 같은 경직된 규칙 대신, 질문된 특정 내용에 대해 실제로 새롭고 유용한 것이 무엇인지 파악하기 위해 "참조 항아리"를 사용합니다. 이는 AI 를 더 "바보스럽게" 만들지 않으면서 더 빠르고 저렴하게 실행되도록 합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.