← 최신 논문
💻 computer science

CRISP: Pre-LLM Yet Text-Driven Visual Token Pruning for Efficient LVLM Inference

CRISP는 지시어 관련 토큰을 식별하고 의미론적 다양성을 강화하기 위해 2단계 파이프라인을 활용하여, 대규모 시각-언어 모델(Large Vision-Language Models)의 추론 지연 시간을 2배 이상 단축하면서도 99.5% 이상의 정확도 유지를 달 nhận하는, LLM 이전 단계의 텍스트 주도형 시각 토큰 프루닝 프레임워크입니다.

원저자: Xu Li, Yi Zheng, Mengyang Zhao, Yuxuan Liang, Zhe Liu, Rui Zhu, Xiaolei Chen, Wei Zhou, Baoquan Zhao, Juncen Guo

게시일 2026-07-21
📖 3 분 읽기☕ 가벼운 읽기

원저자: Xu Li, Yi Zheng, Mengyang Zhao, Yuxuan Liang, Zhe Liu, Rui Zhu, Xiaolei Chen, Wei Zhou, Baoquan Zhao, Juncen Guo

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 미스터리를 풀려고 노력 중인데, 몇 개의 단서 대신 수백만 권의 책이 담긴 도서관을 통째로 건네받았다고 상상해 보세요. 모든 책이 동시에 펼쳐져 있는 상태 말이죠. 이것이 현대의 "대규모 시각-언어 모델(Large Vision-Language Models, LVLMs)"이 작동하는 방식입니다. 이들은 사진을 보고 그에 대한 질문에 답할 수 있는, 마치 디지털 탐정처럼 매우 똑똑한 컴퓨터 프로그램입니다. 이를 위해 이들은 이미지를 '토큰(token)'이라고 불리는 수천 개의 아주 작은 디지털 조각들로 나눕니다. 이 토큰들을 퍼즐 조각이라고 생각하면 됩니다. 문제는 컴퓨터가 당신의 질문을 확인하기도 전에, 파란 하늘이나 빈 바닥 같은 부분까지 포함하여 퍼즐의 모든 조각을 하나하나 다 읽으려 한다는 점입니다. 이는 마치 고양이 목걸이 색깔이 무엇인지 알아내기 위해 백과사전 전체를 읽어야 하는 것처럼, 과정을 믿을 수 없을 정도로 느리고 많은 컴퓨터 자원을 소모하게 만듭니다.

오랫동안 과학자들은 이 속도를 높이기 위해, 퍼즐 조각을 무작위로 버리거나(이 과정에서 가끔 고양이의 목걸이가 삭제되기도 했습니다), 혹은 컴퓨터가 책 전체를 읽기 시작한 후에야 무엇을 건너뛸지 결정하도록 기다리는 방식(이는 시간을 아끼기에는 너무 늦은 방법이었습니다)을 시도해 왔습니다. 핵심적인 질문은 이것이었습니다. "컴퓨터에게 질문을 먼저 읽게 한 뒤, 질문에 답하는 데 필요한 특정 퍼즐 조각들만 골라내도록 가르칠 수 있을까? 그러면서도 전체 시스템의 속도를 늦추지 않고 말이다."

여기서 CRISP라고 불리는 새로운 방법이 등장합니다. CRISP를 탐정이 글을 읽기 전부터 미리 일하는 매우 효율적인 사서라고 생각해 보세요. CRISP는 도서관 전체를 테이블 위에 쏟아붓는 대신, 당신의 질문을 먼저 듣습니다. 만약 당신이 "핸드백 색깔이 뭐야?"라고 묻는다면, CRISP는 즉시 이미지를 스캔하여 핸드백과 그 주변 영역을 보여주는 퍼즐 조각들만을 집어냅니다. 하지만 여기서 그치지 않고, 배경 맥락(예를 들어 거리나 핸드백을 들고 있는 사람)이 유실되지 않도록 몇 개의 추가 조각들도 함께 챙깁니다.

CRISP의 연구진은 이러한 "먼저 묻고, 그다음에 본다"는 접근 방식이 기존의 "먼저 보고, 그다음에 묻는다"는 방식보다 훨씬 더 영리하다는 것을 발견했습니다. 테스트 결과, CRISP는 시각적 퍼즐 조각의 최대 88.9%를 버리면서도(이미지를 수백 개의 토큰에서 단 64개 또는 128개로 줄임) 이미지 전체를 보았을 때와 거의 동일한 정확도를 유지할 수 있음을 보여주었습니다. 사실, 어떤 테스트에서는 적절한 단서를 찾는 능력이 매우 뛰어나서, AI가 존재하지 않는 것을 만들어내는 현상인 "환각(hallucinations)"까지 줄여주기도 했습니다.

이 논문은 오늘날 행해지는 두 가지 일반적인 방식에 대해 명시적으로 반박합니다. 한 가지 방식은 질문과 상관없이 이미지에서 가장 "중요해 보이는" 조각들을 고르는 것(텍스트 불가지론적 방식, text-agnostic)인데, 저자들은 이것이 무엇을 찾으려 하는지도 모른 채 그림을 응시하는 것과 같다고 말합니다. 다른 방식은 컴퓨터가 사고 과정 깊숙이 들어간 후에야 조각을 삭제하기 시작하는 것인데, 저자들은 이것이 컴퓨터가 이미 모든 것을 읽는 힘든 작업을 마친 후이기에 에너지를 낭비하는 일이라고 지적합니다. CRISP는 이 두 가지 방식을 모두 거부하며, 본격적인 사고가 시작되기 전(before the heavy thinking begins)에 가지치기를 함으로써 빠르면서도 똑똑해질 수 있다는 것을 증명했습니다.

결과는 측정되었으며 매우 구체적입니다. LLaVA-1.5라는 인기 있는 모델에서, CRISP는 기존의 576개 토큰 대신 단 128개의 토큰만을 사용하면서도 원래 성능의 99.5%를 유지했습니다. 더 최신 모델인 LLaVA-NeXT에서는 320개의 토큰만으로 성능의 96.9%를 유지했습니다. 아마도 가장 인상적인 점은, 이 속도 향상이 단순히 정확도를 지킨 것에 그치지 않고 답변을 얻는 데 걸리는 시간을 절반 이상 단축했다는 것입니다. 저자들은 이 방법이 이러한 똑똑한 이미지 읽기 컴퓨터를 훨씬 더 빠르고 저렴하게 운영할 수 있게 만드는, 실용적이고 즉시 사용 가능한 해결책이라고 제안합니다. 특히 막대한 전력을 보유하지 않은 기기에서 더욱 그렇습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →