UniPrune: Unified Progressive Visual Token Pruning with Information-Aware Budget Allocation for Efficient LLaVA-Style Vision Language Models
UniPrune은 인코더 단계의 의미적 중요도-다양성 프루닝과 LLM 단계의 피라미드형 드롭핑을 시너지 효과를 내도록 결합하고, 정보 인지 예산 할당 및 교차 단계 정보 연속성 메커니즘에 의해 강화됨으로써, 극단적인 압축 비율에서도 LLaVA 스타일의 시각-언어 모델에서 탁월한 효율성과 성능을 달성하는 통합 점진적 시각 토큰 프루닝 프레임워크이다.
원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
보고 듣고 말할 수 있는 현대의 인공지능 시스템은 놀라운 능력을 갖추어 가고 있지만, 막대한 계산적 부담을 안고 있습니다. 이러한 시각-언어 모델(vision-language models)은 이미지를 작은 디지털 조각들인 '토큰(tokens)'이라는 긴 시퀀스로 변환하는 방식으로 작동하며, 이 토큰들은 그림의 서로 다른 부분들을 나타냅니다. 일반적인 사진 한 장은 수백 개의 이러한 조각들로 분해될 수 있습니다. 시스템은 마치 사람이 도표를 보면서 문장을 읽는 것처럼, 이 전체 시퀀스를 텍스트와 함께 처리합니다. 문제는 이 조각들을 연결하는 데 필요한 수학적 연산이 조각의 수가 증가함에 따라 기하급급적으로 늘어난다는 점입니다. 만약 이미지가 576개의 토큰을 생성한다면, 컴퓨터는 비록 그중 많은 토큰이 빈 벽이나 하늘의 일부 같은 중요하지 않은 배경 세부 사항을 나타낼지라도, 이들이 서로 어떻게 연관되어 있는지 이해하기 위해 엄청난 양의 작업을 수행해야 합니다. 이러한 비효로성은 이러한 강력한 시스템을 표준 하드웨어에서 실행하거나 비디오 분석과 같은 실시간 작업에 사용하는 것을 어렵게 만듭니다.
연구자들은 시스템이 본격적으로 작업을 시작하기 전에 불필요한 조각들을 제거함으로써 이 문제를 해결하려고 오랫동안 노력해 왔습니다. 어떤 방법들은 매우 초기에 필터처럼 작동하여, 순수하게 이미지의 모습만을 근거로 토큰을 버립니다. 또 다른 방법들은 시스템이 텍텍스트와 이미지를 함께 처리하기 시작할 때까지 기다렸다가, 질문 중인 특정 내용과 관련이 없어 보이는 조각들을 제거합니다. 그러나 두 접근 방식 모두 사각지대가 있습니다. 초기 필터들은 사용자가 무엇을 묻고 있는지 알지 못하기 때문에 중요한 세부 사항을 버리는 경우가 많고, 후기 필터들은 무언가를 삭제하기도 전에 이미지 전체를 처리하는 데 에너지를 낭비합니다. 새로운 연구는 두 방법의 강점을 결합하여 이 지능형 시스템이 따를 수 있는 더 효율적인 경로를 만드는 통합된 접근 방식을 소개합니다.
Jianhua Cui와 Meizhou Ding이 이끄는 연구진은 토큰 감소를 단일 이벤트가 아닌 '두 단계의 여정'으로 취급하는 UniPrune이라는 프레임워크를 개발했습니다. 여행을 위해 짐을 싸는 상황을 상상해 보십시오. 당신은 아직 정확한 날씨를 모른다고 해서 모든 것을 다 집어넣고 운에 맡기지도 않을 것이고, 그렇다고 가방을 다 싼 후에 무엇을 남길지 결정하지도 않을 것입니다. 대신, 먼저 비슷한 물건들을 그룹별로 묶고 가장 대표적인 것들을 남긴 다음, 목적지를 알게 되었을 때 더 정밀한 선택을 할 수 있습니다. 이것이 본질적으로 UniPrune이 하는 일입니다. 이 시스템은 먼저 시각적 패턴을 사용하여 이미지 데이터를 광범적으로 정리한 다음, 시스템이 질문의 맥락을 이해하기 시작함에 따라 두 번째의 더 날카로운 정리를 수행합니다.
이 과정의 첫 번째 단계는 이미지를 스캔한 직후, 언어 모델이 개입하기 전에 일어납니다. 시스템은 시각적 토큰들을 유사성에 따라 클러스터(군집)로 그룹화하는데, 이는 마치 섞여 있는 사진 더미를 일반적인 주제별로 분류하는 것과 같습니다. 각 그룹에서 가장 중요한 토큰 하나를 남기고 나머지는 버립니다. 이를 통해 동일한 파란 하늘의 조각을 나타내는 여러 토큰과 같은 명백한 중복성을 제거합니다. 그러나 연구진은 이 단계에서 토큰 수를 단순히 절반으로 줄이는 것은 위험할 수 있다는 점을 깨달았습니다. 만약 시스템이 너무 공격적으로 너무 일찍 잘라낸다면, 나중에 특정 질문에 답하는 데 필수적인 토큰을 잃을 수도 있기 때문입니다. 이를 해결하기 위해 그들은 '동적 예산 책정 전략(dynamic budgeting strategy)'을 도입했습니다. 첫 번째 단계에서 유지할 토큰의 수를 고정된 규칙으로 정하는 대신, 시스템은 이미지의 복잡도를 측정합니다. 명확한 피사체가 있는 단순한 이미지는 더 엄격한 예산을 할당받고, 복잡하고 번잡한 장면은 더 많은 토큰을 유지할 수 있도록 허용됩니다. 이는 시스템이 단순한 질문에는 에너지를 낭비하지 않으면서도 어려운 질문을 처리할 수 있을 만큼 충분한 세부 사항을 유지하도록 보장합니다.
이 초기 선택이 완료되면, 남은 토큰들은 대규모 언어 모델로 전달되어 텍스트와 함께 처리되기 시작합니다. 여기서 시스템은 피라미드처럼 작동하는 두 번째 프루닝(pruning, 가지치기) 전략을 채택합니다. 데이터가 모델의 더 깊은 층을 통과함에 따라, 시스템은 토큰을 점진적으로 제거합니다. 모델이 질문의 맥락 속에서 이미지를 더 잘 이해하게 될수록, 어떤 정보 조각이 더 이상 필요 없는지가 더 명확해진다는 논리입니다. 연구진은 이 두 단계 사이의 작업 분담을 가장 효과적으로 하는 방법이 토큰을 균등하게 나누는 것이 아니라, 특정한 수학적 균형을 따르는 것임을 발견했습니다. 그들은 첫 번째 단계 이후에 유지해야 할 이상적인 토로의 수는 시작 토큰 수와 최종 목표 토큰 수의 곱의 제곱근에 가깝다는 것을 발견했습니다. 그들이 '정보 인식 예산(information-aware budget)'이라고 부르는 이 경험칙은, 시스템이 정확도를 희생하지 않으면서도 충분한 컴퓨팅 파워를 절약할 수 있는 최적의 지점을 찾을 수 있게 해줍니다.
첫 번째 단계가 두 번째 단계에서 유용했을 토큰을 실수로 삭제하지 않도록 하기 위해, 연구진은 세 번째 지능 계층을 추가했습니다. 그들은 이미지 인코더 내부에서 시각적 토큰들이 서로 어떻게 상호작용하는지 분석했습니다. 그들은 일부 토큰이 이미지 전체에 걸쳐 정보를 연결하는 '글로벌 통합자(global integrators)' 역할을 하는 반면, 다른 토근들은 단순히 국소적인 탐지기 역할을 한다는 것을 발견했습니다. 첫 번째 절단 과정에서 이러한 글로벌 통합자들에게 더 많은 가중치를 부여함으로써, 시스템은 언어 모델로 전달되는 토큰들이 고품질의 토대를 형성하도록 보장합니다. 이러한 '교차 단계 연속성(cross-stage continuity)'은 두 번째 단계가 더 나은 출발점을 갖게 하여, 나중에 무엇을 제거할지에 대해 더 현명한 결정을 내릴 수 있게 합니다.
두 가지 주요 시각-언어 모델 제품군에 대해 이 프레임워크를 테스트한 결과는 놀라웠습니다. 연구진이 시스템을 극한까지 밀어붙여 원래 토큰의 아주 적은 부분, 때로는 576개 중 단 24개만을 유지했을 때, 이 새로운 방법은 기존 기술들을 크게 압도했습니다. 한 번에 모든 절단을 시도하는 단일 단계 방식들은 이러한 조건에서 정확도가 급격히 떨어졌습니다. 반면, 두 단계 방식인 UniPrune은 높은 성능을 유지하며 다른 방법들이 놓친 객체와 장면에 대한 질문에 정확히 답했습니다. 예를 들어, 표준적인 시각적 이해 테스트에서 이 새로운 방법은 전체 압축되지 않은 모델 성능의 90% 이상을 유지하면서도 컴퓨기 파워는 극히 일부만 사용했습니다.
정확도 외에도, 연구는 실제 하드웨어에서 이 모델들을 실행하는 데 따른 실질적인 이점을 측정했습니다. 프로세스 초기에 토큰 수를 줄임으로써, 시스템은 모델을 실행하는 데 필요한 피크 메모리(peak memory)를 획기적으로 낮췄습니다. 이는 자원이 제한된 장치에 이러한 기술을 배포하는 데 있어 매우 중요한 요소입니다. 연구진은 이 새로운 방법이 토큰을 마지막에 자르는 방식보다 훨씬 더, 그리고 아무런 프루닝 없이 모델을 실행할 때보다도 절반 이상의 총 계산량을 줄였다고 계산했습니다. 스마트한 예산 책정 및 점수 매기기 메커니즘에 의해 추가된 오버헤드는 미미하여 전체 시간의 1% 미만을 차지했으며, 이는 효율성 이득이 거의 순수하다는 것을 의미합니다.
이 연구는 효율적인 인공지능의 핵심이 단순히 요령을 피우는 것이 아니라, 어디에서 언제 잘라야 하는지를 이해하는 데 있다는 점을 시사합니다. 시각적 중복성이 이미지 자체에 기반한 형태와 작업에 기반한 형태라는 두 가지 다른 형태로 존재한다는 점을 인정함으로써, 연구진은 두 가지를 모두 처리하는 시스템을 만들었습니다. 연구 결과는 통합된 다단계 접근 방식이 문제를 단일 단계로 해결하려는 시도보다 우월하다는 것을 보여줍니다. 이 연구는 강력한 시각-언의 모델을 더 빠르고 접근 가능하게 만드는 명확한 경로를 제공하며, 적절한 전략이 있다면 본질을 잃지 않고도 불필요한 부분을 제거할 수 있음을 증명합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.