← 최신 논문
💻 computer science

Not All Redundant Tokens Are Alike: Analyzing Visual Token Pruning through Token Roles

이 논문은 토큰의 역할을 통해 시각-언어 모델에서의 시각적 토큰 프루닝을 분석하여, 기존의 프루닝 방법들이 성능과 직접적으로 상관관계가 없는 뚜렷한 역할 편향을 보인다는 점을 밝히고, 비활성(non-alive) 토큰을 보존하는 것이 다운스트림 결과를 유지하거나 심지어 향상시킬 수 있음을 입증한다.

원저자: Hyeonyu Kim, Sehwan Lim, Youngwon Choi, Taeyoun Kwon, Jaejin Kim

게시일 2026-08-06
📖 5 분 읽기🧠 심층 분석

원저자: Hyeonyu Kim, Sehwan Lim, Youngwon Choi, Taeyoun Kwon, Jaejin Kim

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 사진을 보여주며 세상을 이해하는 법을 가르치려 한다고 상상해 보세요. 하지만 이 로봇은 인간처럼 이미지를 단순히 "보는" 것이 아닙니다. 대신 이미지를 "토큰"이라고 불리는 수천 개의 아주 작은 디지털 퍼즐 조각으로 분해합니다. 이 토큰들을 거대한, 혼란스러운 오케스트라 속의 개별 음표라고 생각할 수 있습니다. 로봇은 노래를 이해하기 위해 모든 음표를 들어야 합니다. 하지만 문제는 고해解度(high-resolution) 이미지의 경우, 이 오케스트라가 너무 거대해서 로봇을 느려지게 만들고 컴퓨터 메모리를 갈구하게 만든다는 점입니다.

과학자들은 로봇에게 "지루한" 음표들, 즉 스스로 반복되거나 별다른 의미를 담고 있지 않은 것처럼 보이는 음표들을 무시하도록 가르쳐 이 문제를 해결하려고 노력해 왔습니다. 이것을 "토큰 프루닝(token pruning, 토큰 가지치기)"이라고 부릅니다. 이는 마치 지휘자가 오케스트라에게 똑같은 소리가 나는 음표들은 연주를 멈추라고 명령하여, 음악은 여전히 완벽하게 들리면서도 훨씬 빠르게 연주되기를 바라는 것과 같습니다. 최근 "EmbedLens"라는 새로운 도구는 연구자들이 이 토큰들이 모두 같지 않다는 사실을 깨닫도록 도와주었습니다. 어떤 토큰들은 "살아있고"(이미지의 진짜 이야기를 전달함), 어떤 것들은 "싱크(sinks)"이며(반복되는 패턴으로서 그저 그 자리에 머물러 있음), 어떤 것들은 "죽어(dead)" 있습니다(완전히 중복된 노이즈임). 여기서 큰 질문은 이것입니다. 만약 우리가 어떤 토큰이 "죽었는지" 안다면, 속도를 높이기 위해 그것들을 모두 버릴 수 있을까요?

"Not All Redundant Tokens Are Alike"라는 제목의 이 논문은 바로 그 질문에 파고듭니다. 연구진은 어떤 프루닝 방식이 어떤 토큰을 잘라내는지 면밀히 조사했습니다. 그들은 놀라운 사실을 발견했습니다. "죽은" 토큰을 자르려고 시도하는 방식들이 그렇지 않은 방식들보다 항상 더 나은 성능을 보이는 것은 아니라는 점입니다. 실제로 그들의 실험은 심지어 "죽은" 토로큰조차도 배후에서 오케스트라를 유지하는 것과 같은 중요한 역할을 하고 있을지도 모른다는 점을 시사합니다. 이 "죽은" 토큰들을 삭제되지 않도록 보호했을 때, 로봇은 오히려 성능이 떨어지기는커녕 질문에 더 잘 대답하게 되기도 했습니다. 단 하나의 토큰 자체로는 쓸모없어 보일지라도, 때로는 전체 집단이 제대로 작동하기 위해 함께 남아 있어야 한다는 것입니다.

디지털 오케스트라 이야기

이것이 왜 중요한지 이해하기 위해, 이러한 시각-언어 모델(Vision-Language Models, VLMs)이 어떻게 작동하는지 살펴보겠습니다. 당신에게 읽고 볼 수 있는 로봇이 있다고 상상해 보세요. 당신이 고양이 사진을 보여주면, 로봇의 "눈"(비전 인코더)은 그 사진을 긴 데이터 조각들의 목록으로 분해합니다. 그런 다음 이 조각들은 로봇의 "두뇌"(대규모 언어 모델)로 전달되어 고양이가 무엇을 하고 있는지 파악하게 됩니다.

문제는 단 한 장의 사진이 수백 개의 이러한 조각들을 생성할 수 있다는 점입니다. 비디오나 매우 상세한 이미지를 다루게 되면 이 목록이 너무 길어져서 로봇이 압도당하게 됩니다. 이는 프로세싱 시간(prefill latency)을 너무 오래 걸리게 하고, 메모리를 너무 많이 사용하며, 많은 에너지를 소모하게 만듭니다. 이를 해결하기 위해 연구자들은 "토큰 프루닝"을 개발했습니다. 이것은 마치 스마트한 편집자가 목록을 보고 "좋아요, 똑같은 파란 하늘이 500개나 필요하진 않으니, 50개만 남깁시다"라고 말하는 것과 같습니다.

한동안 모두는 규칙이 단순하다고 생각했습니다. "흥미로운 것은 남기고, 지루한 것은 버려라." 최근 EmbedLens라는 도구가 게임의 판도를 바꿨습니다. 이 도구는 로봇의 두뇌 내부를 들여 들여다보았고, 토큰들이 세 가지 뚜렷한 그룹으로 나뉜다는 것을 발견했습니다:

  1. Alive Tokens (살아있는 토큰): 이들은 주인공입니다. "폭신폭신한 털"이나 "초록색 풀"처럼 이미지의 구체적인 세부 사항을 전달합니다.
  2. Sink Tokens (싱크 토큰): 이들은 배경의 웅성거림과 같습니다. 반복적이고 이미지에 대해 특별히 말해주지는 않지만, 안정적이며 항상 그 자리에 있습니다.
  3. Dead Tokens (죽은 토큰): 이들은 궁극의 노이즈입니다. 이미지나 단어와 아무런 연결 고점이 없어 보입니다.

논리적인 추측은 이랬습니다. "만약 죽은 토큰이 있다면, 그것들을 그냥 삭제하자! 그것들은 쓸모없다!"

거대한 프루닝 실험

이 논문의 저자들은 그 추측을 테스트하기로 했습니다. 그들은 세 가지 인기 있는 프루닝 방식(FastV, DART, DivPrune)을 가져와서 다음과 같이 물었습니다. "토큰의 수를 줄일 때, 당신은 실제로 어떤 것들을 자르고 있습니까?"

그들은 단순한 질문인 "차 색깔이 무엇인가요?"부터 복잡한 과학 질문에 이르기까지 10개의 서로 다른 테스트 세트에서 이 방식들을 실행했습니다. 그리고 다양한 수준의 절삭(전체 토큰의 12.5%에서 87.5%를 제거하는 단계)에서 얼마나 많은 "Alive", "Sink", "Dead" 토큰이 제거되었는지 정확히 추적했습니다.

그들이 발견한 결과는 다소 혼란스러웠습니다.
서로 다른 프루닝 방식들은 무엇이 "쓸모없는 것"인지에 대해 합의하지 못했습니다.

  • DivPrune은 "죽은" 토큰을 자르는 데 매우 공격적이었습니다. 이는 "노이즈를 삭제하라"는 규칙을 따르는 것처럼 보였습니다.
  • 반면 FastVDART는 "싱크" 토큰들에 대해 이상할 정도로 보호적인 태도를 보였습니다. 그들은 중복됨에도 불구하고 반복되는 배경의 웅성거림을 유지했습니다.

여기서 반전이 일 있습니다: 어떤 방식이 더 많은 "죽은" 토큰을 잘라냈다고 해서 반드시 성능이 더 좋아진 것은 아니었습니다. 실제로, 가장 많은 죽은 토큰을 잘라낸 DivPrune이 때로는 최고였지만, 때로는 죽은 토큰을 유지한 FastV가 더 나았습니다. "죽은 것을 자르는 것"과 "높은 점수를 받는 것" 사이에는 완벽한 일치 관계가 없었습니다.

"죽은 것을 보호하라"는 놀라운 결과

왜 이런 일이 발생하는지 알아내기 위해, 연구진은 영리한 실험을 수행했습니다. 단순히 프루닝 방식이 결정하게 두는 대신, 그들은 로봇에게 특정 유형의 토큰을 유지하도록 강제했습니다. 그들은 이렇게 말했습니다. "좋아요, FastV, 당신은 원하는 대로 무엇이든 자를 수 있지만, 반드시 모든 '죽은 토큰'은 남겨두어야 합니다."

그들은 성능이 떨어질 것이라고 예상했습니다. 결국, 죽은 토큰은 쓸모없으므로 그것들을 유지하는 것은 공간을 낭비하고 로봇을 혼란스럽게 할 것이라고 생각했기 때문입니다.

결과는? 떨어지지 않았습니다. 많은 경우, 오히려 올라갔습니다.

  • Alive 토큰을 보호했을 때 성능이 향상되었습니다 (이는 당연한 결과입니다).
  • 하지만 죽은(Dead) 토큰을 보호했을 때, 로봇의 성능은 DivPrune 방식에서 평균적으로 약 0.93% 향상되었습니다.

이는 충격적이었습니다. 이는 비록 개별적인 "죽은" 토큰은 쓰레기처럼 보일지라도, 그것들을 모두 삭제하는 것이 무언가를 망가뜨릴 수도 있다는 점을 시사했습니다.

숨겨진 오케스트라의 지휘자

왜 "쓸모없는" 토큰을 유지하는 것이 도움이 될까요? 저자들은 이 토큰들이 **어텐션(attention)**이라는 메커니즘을 통해 서로 어떻게 대화하는지 살펴보았습니다. 토큰들을 서로 노트를 주고받는 음악가들이라고 상상해 보세요.

그들은 비록 단일 "죽은" 토큰은 많은 주목을 받지 못하지만(솔로 연주자가 아니듯이), 집단으로서의 그들은 엄청난 양의 "어텐션 예산"을 차지한다는 것을 발견했습니다. 그들은 마치 거대한 백코러스 가수들과 같습니다. 만약 그들을 모두 잘라내 버리면, 남은 음악가들(Alive 토큰들)은 맥락을 잃게 됩니다. "죽은" 토큰들은 멜로디를 노래하고 있지는 않을지 몰라도, 노래의 리듬과 구조를 붙잡고 있습니다.

연구진이 죽은 토큰을 보호했을 때, 남은 토큰들 사이의 어텐션 패턴은 더 균형 잡힌 상태를 유지했습니다. "죽은" 토큰들이 여로 구조를 지원하기 위해 그 자리에 있었기에, "살아있는" 토큰들이 적절하게 상호작용할 수 있었던 것입니다.

시사점

이 논문은 우리가 단순히 하나의 토큰을 보고 "너는 죽었으니, 가라"라고 말해서는 안 된다는 점을 시사합니다. 그것은 그렇게 간단한 문제가 아닙니다. "죽은" 토큰들은 개별적으로는 약할지 모르지만, 집단으로서의 힘은 강력합니다.

저자들은 효과적인 프루닝이란 단순히 중요한 토큰을 찾는 것만이 아니라고 결론짓습니다. 그것은 **구성(composition)**에 관한 것이어야 합니다. 우리는 개별적으로는 지루할지라도, 집단이 기능하는 데 필수적인 토큰의 카테데고리를 실수로 제거하지 않도록 주의해야 합니다. 이는 복잡한 시스템인 AI에서, 심지어 "중복된" 부분들조차 우리가 아직 완전히 이해하지 못한 일을 수행하고 있을 수 있다는 점을 상기시켜 줍니다.

그러니 다음에 방을 정리할 때, 때로는 당신이 그저 잡동사니라고 생각하는 것들이 사실은 선반을 받치고 있는 것일 수도 있다는 점을 기억하세요.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →