← 최신 논문
💬 NLP

Do All Visual Tokens Matter Equally? Object-Evidence Preserving Token Merging for Vision-Language Retrieval

이 논문은 학습 과정에서 중요한 객체 수준의 증거를 보존함으로써 시각-언어 검색을 위한 이미지 측 토큰을 크게 압축하고, 추론 시 정답 바운딩 박스를 요구하지 않으면서도 저장 비용을 줄이고 검색 성능을 향상시키는 객체 인지형 토큰 병합 프레임워크인 SaMer를 제안한다.

원저자: Suhyeong Park, Junha Jung, Jungwoo Park, Jaewoo Kang

게시일 2026-07-14
📖 3 분 읽기☕ 가벼운 읽기

원저자: Suhyeong Park, Junha Jung, Jungwoo Park, Jaewoo Kang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게 엄청난 양의 사진 라이브러리가 있고, 그중에서 "모자를 쓴 고양이"가 찍힌 사진 한 장을 찾아야 한다고 상상해 보세요. 옛날에는 컴퓨터가 사진 전체를 보고 하나의 '분위기 점수'를 매겼습니다. 하지만 그것은 피자 전체를 냄새로만 판단하는 것과 같습니다. 당신이 간절히 원하는 그 페퍼로니 조각을 놓칠 수도 있기 때문입니다.

현대의 AI는 더 똑똑하게 행동하려고 노력합니다. 이들은 모든 사진을 수백 개의 작은 퍼즐 조각(이를 "토큰"이라고 부릅니다)으로 나누고, 각 조각의 세부 사항을 별도로 저장합니다. 당신이 질문을 하면, 컴퓨터는 가장 잘 맞는 것을 찾기 위해 모든 퍼즐 조각을 당신의 단어와 대조합니다. 이는 특정 세부 사항을 찾는 데는 매우 훌륭하지만, 저장 공간 측면에서는 악몽입니다. 휴대폰에 있는 모든 사진마다 1,000개의 작은 퍼즐 조각을 들고 다니려고 노력한다고 상상해 보세요. 그것은 너무 많은 공간을 차지하고 검색을 고통스러울 정도로 느리게 만듭니다.

그래서 연구자들은 질문했습니다: 그 모든 시각적 토큰이 똑같이 중요한가?

이 논문에 따르면 정답은 명확한 "아니오"입니다. 하지만 까다로운 점이 있습니다. 만약 단순히 "지루한" 조각들을 버리거나 비슷하게 생긴 조각들을 하나로 뭉쳐버린다면, 털 모양이 비슷하다는 이유로 "고양이" 조각을 "강아지" 조각에 붙여버릴 수도 있습니다. 그렇게 되면 당신의 컴퓨터는 당신이 요청한 특정 "고양이"를 더 이상 찾을 수 없게 됩니다. 이것은 빨간색 레고 브릭과 파란색 레고 브릭을 섞어서 보라색으로 만드는 것과 같습니다. 이제 더 이상 빨간 성을 쌓을 수 없게 되는 것이죠.

해결책: SaMer (의미론적 인지 병합, Semantic-aware Merging)

저자들은 SaMer라고 불리는 새로운 방법을 제안합니다. SaMer를 당신이 질문을 던지기도 전에 퍼즐 조각을 정리하는 아주 똑똑한 사서라고 생각해보세요.

  1. 학습의 비결: 컴퓨터가 학습하는 동안, SaMer는 실제 객체가 어디에 있는지 알려주는 비밀 치트 시트(객체 라벨)를 사용합니다. 이를 통해 시스템에 다음과 같이 가르칩니다: "이봐, 설령 비슷해 보이더라도 고양이의 귀를 강아지의 꼬리에 붙이지 마!" 이는 시스템이 서로 다른 객체들을 하나로 뭉칠 때조차도 서로 분리된 상태를 유지하도록 강제합니다.
  2. 마법 같은 병합: 퍼즐 조각의 93%를 그냥 삭제하는 대신, SaMer는 그것들을 64개의 초대표적인 "센트로이드(centroids)"로 부드럽게 혼합합니다. 이것들은 단순히 무작위로 평균을 낸 것이 아닙니다. 원래 객체의 정체성을 온전히 유지하면서도 정교하게 만들어진 요약본입니다.
  3. 결과: 당신이 "고양이"를 찾을 때, 시스템은 "강아지" 요약본이 바로 옆에 있더라도 이를 무시하고 직접 "고고양이" 요약본을 가리킬 수 있습니다.

숫자 (증거)

이 논문은 단순히 추측하는 것이 아니라, 실제 데이터를 통해 테스트했습니다. 결과는 다음과 같습니다:

  • 엄청난 공간 절약: 원래의 수천 개 토큰 대신 64개의 토큰만을 사용함으로써, ColPali 시스템에 필요한 저장 공간을 16.09배 줄였습니다. 이는 263.7 GB의 도서관을 단 16.4 GB로 줄인 것과 같습니다.
  • 속도 향와: 비교해야 할 조각이 적기 때문에 검색이 훨씬 빨라졌습니다. 한 데이터셋에서는 속도(초당 쿼리 수, QPS)가 4.3배 뛰었고, 다른 데이터셋에서는 거의 9.1배 더 빨라졌습니다.
  • 더 나은 정확도: 놀랍게도, 라이브러리를 작게 만드는 것이 오히려 올바른 사진을 찾는 데 더 효과적이었습니다. Flickr30K 데이터셋에서 성공률(R@1)은 77.0에서 82.4로 높아졌습니다. MSCOCO에서는 47.4에서 51.6으로 상승했습니다.

그들이 배제한 것들

저자들은 무엇이 효과가 없는지도 매우 신중하게 밝혔습니다. 그들은 단순히 조각을 버리는 것(pruning)이나, 단순히 색상이 비슷하다는 이유로 모두 섞어버리는 것(feature-only pooling)은 컴퓨터가 특정 객체를 놓치게 만든다는 것을 보여주었습니다. 만약 서로 다른 객체에 속해 있다는 것을 모른 채 비슷한 패치들을 그냥 섞어버린다면, 나중에 그것들을 구별할 능력을 잃게 됩니다. SaMer는 핵심이 단순히 토큰의 수를 줄이는 것이 아니라, 미래의 질문이 선택할 수 있는 '증거'를 보존하는 데 있다는 점을 시사합니다.

얼마나 확실한가?

저자들은 Flickr30K, MSCOCO, ImageCoDe, DocVQA와 같은 실제 환경의 데이터셋을 통해 이를 측정했습니다. 그들은 SaMer가 다른 압축 방식들을 일관되게 능가한다는 것을 발견했습니다. 또한 시스템이 텍ized 텍스트에 언급된 이미지의 정확한 부분을 얼마나 잘 가리키는지(grounding)도 측정했습니다. SaMer는 다른 방식들보다 "구절 수준의 증거(phrase-level evidence)"를 훨씬 더 잘 유지했으며, 관련성이 올바른 객체 내에 머무르는 정도를 나타내는 "BoxMass" 점수가 41.3에서 54.2로 급증했습니다.

결론

이 논문은 AI가 이미지를 효율적으로 검색하기 위해서 필요한 것은 정보를 삭제하는 것이 아니라, 정보를 더 잘 조직하는 것이라고 제안합니다. 객체의 경계를 존중하는 방식으로 토큰을 병합함으로써, SaMer는 세부 사항을 잃지 않으면서도 이미지 데이터베이스를 16배나 줄일 수 있으며, 실제로 이전보다 더 잘 찾아낼 수 있다는 것을 증명했습니다. 이는 속도, 저장 공간, 그리고 정확도 모두에서의 승리입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →