← 최신 논문
🤖 machine learning

AsymVLM: Asymmetric Token Pruning for Efficient Vision-Language Model Inference

AsymVLM 은 공간적으로 중복된 비전 토큰에 대해 공격적이고 적응형 가지치기를 적용하고 텍스트 토큰에는 임계값 기반의 시계열 제거를 적용하여 비전 및 텍스트 모달리티의 고유한 특성을 활용하는 효율적인 비전 - 언어 모델 추론 프레임워크로, 문서 및 차트 이해 작업에서 최첨단 방법을 능가하는 성능을 유지하면서 최대 54% 의 FLOPs 를 절감합니다.

원저자: Yilin Feng, Ahmed Burak Gulhan, Mahmut Taylan Kandemir

게시일 2026-05-29
📖 4 분 읽기☕ 가벼운 읽기

원저자: Yilin Feng, Ahmed Burak Gulhan, Mahmut Taylan Kandemir

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

비전-언어 모델 (VLM) 을 매우 지능적이지만 약간 압도된 조수로 상상해 보세요. 당신은 그에게 사진 (복잡한 문서나 차트와 같은) 을 보여주고 질문을 합니다. 사진을 이해하기 위해 조수는 사진을 **"비전 토큰 (vision tokens)"**이라고 불리는 수천 개의 작은 퍼즐 조각으로 분해합니다. 질문을 이해하고 답변을 구성하기 위해, 그는 **"텍스트 토큰 (text tokens)"**이라고 불리는 더 작은 세트를 사용합니다.

문제는 조수의 "작업 기억" (GPU 메모리) 이 막혀버린다는 것입니다. 그는 생성한 모든 단어와 모든 퍼즐 조각을 붙잡으려 하기 때문에 실행 속도가 느리고 비용이 많이 듭니다.

기존 방법들은 사진 조각과 단어를 정확히 같은 방식으로 처리함으로써 이 문제를 해결하려 합니다. 즉, 모든 것의 고정된 비율을 버리는 것입니다 (예: "퍼즐 조각의 50% 와 단어의 50% 를 삭제"). 이 논문의 저자인 AsymVLM은 이것이 실제로 그들이 무엇을 하는지 생각하지 않고 책의 절반과 책갈피의 절반을 버림으로써 도서관을 정리하려는 것과 같다고 주장합니다.

간단한 비유를 사용하여 AsymVLM이 어떻게 작동하는지 설명합니다:

1. 두 가지 다른 문제

이 논문은 사진 조각과 단어가 근본적으로 다르다고 지적합니다:

  • 비전 토큰 (퍼즐 조각): 이들은 모두 독립적입니다. 사진에서 하늘 부분을 제거하더라도 그 옆에 있는 나무 조각은 상관하지 않습니다. 이들은 "공간적으로 중복적"이어서, 많은 조각들이 단순히 배경 잡음일 뿐입니다.
  • 텍스트 토큰 (이야기): 이들은 연쇄 반응입니다. 두 번째 단어는 첫 번째 단어에 의존하고, 세 번째 단어는 두 번째 단어에 의존합니다. 문장 중간에 단어를 삭제하면 나머지 이야기가 의미가 없어질 수 있습니다.

2. 해결책: 양면 전략

모든 것에 하나의 규칙을 적용하는 대신, AsymVLM 은 각 토큰 유형에 맞춘 두 가지 다른 전략을 사용합니다.

전략 A: 사진을 위한 "스마트 편집자" (비전 토큰 가지치기)

조수가 생각하기 시작하기 전에, AsymVLM 은 사진을 보는 스마트 편집자처럼 행동합니다.

  • 옛날 방식: "픽셀의 50% 를 무작위로 삭제"하거나 "질문과 가장 관련 없어 보이는 것들을 삭제".
  • AsymVLM 방식: 이는 **학습된 점수 부여기 (Learned Scorer)**를 사용합니다. 수천 경기를 지켜보며 어떤 선수 (토큰) 가 실제로 경기 승리에 기여하는지 정확히 아는 코치라고 상상해 보세요. 이 점수 부여기는 사진만 보는 것이 아니라, 당신이 한 특정 질문과 사진이 어떻게 연결되는지 봅니다.
  • "적응형 예산 (Adaptive Budget)": 이것이 가장 교묘한 부분입니다. 논문은 어떤 질문은 이미지의 전체 스캔이 필요하다고 지적합니다 (예: "이 과수원에 사과가 몇 개나 있나요?"). 반면 다른 질문은 아주 작은 부분만 필요로 합니다 (예: "빨간 사과의 가격은 얼마인가요?").
    • 질문이 특정 작은 영역에 국한된 경우, 중요하고 중요하지 않은 조각 사이의 "간격"은 매우 큽니다. 시스템은 "좋습니다, 공격적으로 사진의 75% 를 버릴 수 있습니다!"라고 말합니다.
    • 질문이 전체 이미지가 필요한 경우, "간격"은 작습니다. 시스템은 "알겠습니다, 안전을 위해 사진의 90% 를 유지하겠습니다"라고 말합니다.
    • 비유: 이는 여행 가방을 싸는 것과 같습니다. 하루 동안 해변으로 가는 경우 가볍게 싸고, 한 달 동안 여행하는 경우 더 많이 싸는 것입니다. AsymVLM 은 모든 사람에게 같은 가방 크기를 사용하는 대신 특정 여행에 맞춰 "패킹"을 조정합니다.

전략 B: 텍스트를 위한 "메모리 청소부" (텍스트 토큰 퇴출)

조수가 답변을 생성하기 시작하면, 그는 한 단어씩 글을 씁니다. 대화가 길어지면 메모리가 가득 찹니다.

  • 옛날 방식: 텍스트 전용 AI 를 위한 표준 방법 (H2O 나 StreamingLLM 등) 은 새로운 단어를 위한 공간을 만들기 위해 가장 오래되거나 가장 "중요하지 않은" 단어를 삭제하려 합니다.
  • AsymVLM 방식: 저자들은 이러한 비전 조수들에서 대화는 보통 짧으며, 사진이 가장 중요한 맥락임을 깨달았습니다.
    • 그들은 고정된 예산을 설정합니다. 조수는 한계 (예: 500 단어) 에 도달할 때까지 글을 씁니다.
    • 한계에 도달하면, 그는 가장 오래 생성된 단어 (즉시 다음 문장에 더 이상 필요 없는 단어) 를 삭제하기 시작하지만, 원래 사진이나 원래 질문은 절대 삭제하지 않습니다.
    • 비유: 친구에게 이야기를 들려준다고 상상해 보세요. 현재 문장을 끝내기 위해 10 분 전에 말한 첫 문장을 기억할 필요는 없습니다. AsymVLM 은 새로운 문장을 위한 공간을 만들기 위해 화이트보드에서 오래되고 관련 없는 초안들을 치우는 청소부처럼 행동하지만, 원래 프롬프트와 사진은 영원히 벽에 고정해 둡니다.

3. 결과: 더 빠르고 더 똑똑함

이 논문은 이러한 두 가지 유형의 데이터를 다르게 처리함으로써 AsymVLM 이 다음을 달성한다고 주장합니다:

  • 엄청난 속도 향상: 모델 실행에 필요한 연산 능력 (FLOPs) 을 최대 54% 절약합니다. 이는 수학 계산 중 단순히 무시하는 것이 아니라, 무거운 수학 계산이 시작되기 전에 불필요한 사진 조각을 물리적으로 제거하기 때문입니다.
  • 더 나은 정확도: 문서 읽기나 차트 이해와 같은 작업에서 이전 방법들보다 실제로 2~3% 더 좋은 성능을 보입니다. 이는 질문에 답하는 특정 사진 조각을 유지하고 나머지는 폐기하기 때문이며, 다른 방법들은 실수로 중요한 조각을 삭제할 수 있기 때문입니다.
  • 메모리 효율성: 모델 실행에 필요한 메모리를 줄여, 전체 가지치기되지 않은 모델을 처리할 수 없었던 작고 저렴한 컴퓨터 칩에서도 실행할 수 있게 합니다.

요약

AsymVLM은 "하나의 크기가 모두에게 맞지 않는다"는 것을 깨닫는 시스템입니다. 이는 특정 질문에 기반하여 이미지에서 불필요한 부분을 다듬기 위한 스마트하고 적응형 필터를 사용하고, 원래 맥락을 잃지 않으면서 텍스트 메모리를 관리하기 위한 신중한 청소부를 사용합니다. 그 결과, 문서와 차트를 읽는 데 더 빠르고, 메모리를 덜 사용하며, 놀랍도록 더 정확한 비전 - 언어 모델이 됩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →