← 최신 논문
🤖 AI

Combating Textual Noise and Redundancy: Entropy-Aware Dense Visual Token Pruning

이 논문은 통계적 엔트로피를 통해 텍스트 노이즈를 필터링하고, 밀집된 지시 사항 하에서도 미세한 단서들을 보존하기 위해 서브모듈러 최대화(submodular maximization)를 통해 시각적 토큰 선택을 최적화함으로써 시각 언어 모델의 효율성을 향상시키는 새로운 프레임워크인 엔트로피 인식 밀집 가지치기(Entropy-Aware Dense Pruning, EADP)를 제안한다.

원저자: Xuehui Wang, Xuankun Yang, Wei Shen

게시일 2026-07-03
📖 3 분 읽기☕ 가벼운 읽기

원저자: Xuehui Wang, Xuankun Yang, Wei Shen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게 아주 똑똑하지만 약간은 과부하가 걸린 비서(시각-언어 모델, Vision-Language Model)가 있다고 상상해 보세요. 이 비서는 사진에 대한 질문에 답하려고 노력 중입니다. 이 사진은 수천 개의 아주 작은 퍼즐 조각(토큰)들로 이루어져 있습니다. 비서는 답을 찾아내기 위해 모든 조각을 하나하나 살펴봅니다.

문제는 무엇일까요? 모든 조각을 다 살펴보는 데는 시간이 너무 오래 걸리고, 비서는 금방 지쳐버립니다. 그래서 우리는 보통 "지루한" 조각들은 버리고 중요한 조각들만 남기려고 노력합니다. 이것을 **토큰 프루닝(Token Pruning)**이라고 부릅니다.

하지만 이 논문의 저자들은 기존의 방식들이 두 가지 특이하고 재미있는 방식으로 고장 나 있다는 것을 발견했습니다. 그들은 이를 해결하기 위해 EADP(Entropy-Aware Dense Pruning)라는 새로운 시스템을 만들었습니다.

이들이 어떻게 해결했는지, 쉬운 비유를 통해 설명해 드리겠습니다.

두 가지 큰 문제점

1. "정적 노이즈" 문제 (텍al Noise)
당신이 "이미지에 개가 있나요?"라는 설명을 듣고 북적이는 방 안에서 특정 인물을 찾으려고 한다고 상상해 보세요.

  • 기존 방식: 비서는 문장 전체를 하나의 커다란 덩어리로 듣습니다. "개"라는 단어도 듣지만, "있나요", "가", "에" 같은 단어도 함께 듣습니다. 문장을 하나의 덩어리로 취급하기 때문에, 지루한 단어들("있나요", "가" 등)이 엄청난 배경 소음(static)을 만들어냅니다. 이 소음은 중요한 단어("개")를 가려버려서, 비서가 개가 있는 곳이 아니라 엉뚱한 곳(예: 빈 바닥)을 보게 만듭니다.
  • 논문의 해결책: 저자들은 어떤 단어들(예: "있나요"나 문장 부호)은 이미지의 특정 부분을 가리키지 않기 때문에 "노이즈"가 된다는 사실을 깨달았습니다. 그들은 엔트로피(Entropy)(혼돈이나 무작위성을 측정하는 수학적 도구)라는 수학적 기법을 사용하여 이러한 노이즈 단어를 감지했습니다. 만약 어떤 단어의 주의력(attention)이 마치 배경 소음처럼 방 안 여기저기에 흩어져 있다면, 그것을 걸러냅니다. 반대로 집중되어 있다면(예: "개"), 그것을 유지합니다. 이를 통해 지시 사항을 깨끗하게 정리하여 비서가 정확히 무엇을 찾아야 할지 알게 해줍니다.

2. "한 점 집중" 문제 (중복성)
이제 비서가 드디어 개를 찾아낼 준비가 되었습니다.

  • 기존 방식: 비서는 "Top-K" 규칙을 사용합니다. 비서는 개의 코와 가장 닮은 퍼즐 조각 하나를 찾아내고 그것을 남깁니다. 그다음 또 다른 개의 코처럼 보이는 조각을 찾아내고 그것도 남깁니다. 결국 비서는 개의 코 모양만 담긴 조각 10개를 모으게 되고, 귀와 꼬리, 몸통은 버리게 됩니다. 비서는 코는 기가 막히게 잘 보겠지만, 개의 나머지 부분은 전혀 알 수 없게 됩니다.
  • 논문의 해결책: 저자들은 우리가 "최고의 뷰"가 아닌 "균형 잡힌" 시야를 가져야 한다는 것을 깨달았습니다. 그들은 선택 과정을 **"시설 입지 선정(Facility Location)"**이라는 게임으로 바꾸었습니다.
    • 비유: 도시의 곳곳에 소방서를 배치한다고 상상해 보세요. 단순히 불이 가장 많이 나는 한 동네에만 소방서 10개를 몰아넣지는 않을 것입니다(이것이 "Top-K"의 실수입니다). 대신, 모든 지역이 소방서와 가까울 수 있도록 배치할 것입니다.
    • EADP는 이미지에 대해서도 이와 같이 작동합니다. 이 방식은 중복되는 데 시간을 낭비하지 않으면서, 전체 개(코, 귀, 꼬리)를 골고루 커버할 수 있는 토큰들을 선택합니다. 이를 통해 최종적으로 선택된 작은 토큰 집합이 아주 작은 디테일만이 아니라 전체 이야기를 들려줄 수 있도록 보장합니다.

EADP의 작동 단계

  1. 지시 사항 정제: 텍스트 프롬프트를 스캔하여 "노이즈"가 되는 단어들(예: "있나요", "?")을 식별하고 제거합니다. 그리고 실제로 이미지의 사물을 가리키는 "강력한" 단어들(예: "오븐" 또는 "코끼리")을 유지합니다.
  2. 지도 만들기: 이미지의 중요한 부분이 어디인지 보여주는 히트맵(heat map)을 만듭니다. 이때 단 하나의 픽셀만 강조되지 않도록 매끄럽게 처리합니다.
  3. 스마트한 선택: 단순히 지도에서 가장 뜨거운 지점들만 뽑는 대신, "소방서 배치" 게임을 수행합니다. 이미지를 전체적으로 커버할 수 있도록 충분히 분산된 작은 토큰 그룹을 선택하여, 중요한 부분이 뒤처지지 않도록 합니다.

결과

저자들은 이 시스템을 다양한 AI 모델과 어려운 질문들(예: 이미지 속 아주 작은 텍스트 찾기 또는 까다로운 비디오 관련 질문 답변하기)에 테스트했습니다.

  • 속도: 쓸모없는 이미지 조각의 80~90%를 버림으로써, AI는 2배에서 5배 더 빠르게 실행됩니다.
  • 지능: 다른 방법들이 복잡한 그림이나 까다로운 질문 앞에서 혼란을 겪는 것과 달리, EADP는 AI를 똑똑하게 유지합니다. EADP는 노이즈 때문에 발생하는 방해 요소를 차단함으로써, 때로는 원래의 (프루닝을 하지 않은) AI보다 더 높은 점수를 기록하기도 했습니다.

요약하자면: EADP는 AI 시각을 위한 스마트한 편집자와 같습니다. 지시 사항에서 지루한 단어들을 잘라내고, AI가 다양하고 완전한 이미지 조각들을 유지하도록 하여, 세부 사항을 놓치지 않으면서도 훨씬 빠르게 실행되도록 만듭니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →