← 최신 논문
💻 computer science

Hybrid Token Compression for Vision-Language Models

이 논문은 연속적인 패치 특징과 이산적인 의미론적 앵커를 융합함으로써 미세한 외관 세부 사항의 보존과 고수준의 의미론적 정보 사이의 균형을 효과적으로 맞추어, 기존의 연속형 베이스라인들과 비교하여 우수한 성능 유지 및 효율성을 달성하는 하이브리드 시각적 토큰 압축 프레임워크인 HTC-VLM을 소개한다.

원저자: Jusheng Zhang, Xiaoyang Guo, Tongyu Mo, Qinhan Lv, Wenhao Chai, Jian Wang, Keze Wang, Liang Lin

게시일 2026-08-12
📖 5 분 읽기🧠 심층 분석

원저자: Jusheng Zhang, Xiaoyang Guo, Tongyu Mo, Qinhan Lv, Wenhao Chai, Jian Wang, Keze Wang, Liang Lin

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

시각적 과부하의 시대: 왜 AI에게 더 나은 요약이 필요한가

당신이 아주 똑똑하지만 배가 매우 고픈 학생에게 사진을 이해하는 법을 가르치고 있다고 상상해 보세요. 인공지능의 세계에서 이 학생은 "시각-언어 모델(Vision-Language Model, VLM)"이라고 불립니다. 이는 이미지를 보고 "강아지가 무엇을 입고 있나요?" 또는 "왜 하늘이 파란색인가요?"와 같은 질문에 답할 수 있는 일종의 컴퓨터 두뇌입니다. 이를 위해 컴퓨터는 이미지를 "패치(patch)"라고 불리는 수백 개의 작은 사각형으로 나누고, 각 사각형을 컴퓨터가 읽을 수 있는 긴 숫자 리스트(토큰)로 변환합니다.

문제는 컴퓨터가 과부하에 걸린다는 점입니다. 만약 576개의 작은 사각형을 입력하면, 컴퓨터의 두뇌는 그림을 이해하기 위해 모든 사각형을 다른 모든 사각형과 비교해야 합니다. 이는 마치 도서관의 책들을 한꺼번에 읽으려는 것처럼 엄청난 양의 작업을 만들어냅니다. 이는 속도를 늦추고 엄청난 양의 컴퓨터 메모리를 잡아먹습니다. 과학자들은 이미지를 단 하나 또는 몇 개의 "요약 토큰(summary tokens)"으로 요약하여 이 문제를 해결하려 노력해 왔지만, 여기에는 함정이 있습니다. 만약 모든 세부 정보를 하나의 평균값으로 뭉뚱그려 버리면, 중요한 이야기(예: 그것이 강아지라는 사실)를 놓치게 됩니다. 반대로 특정 "키워드"를 선택하여 이야기를 유지하려고 하면, 미세한 디테일(예: 강아지의 털 질감)을 놓치게 됩니다. 이는 좌절스러운 절충안입니다. 전체적인 맥락(gist)은 얻되 세부 사항을 놓치거나, 세부 사항은 얻되 핵심적인 의미를 잊어버리거나 둘 중 하나를 선택해야 합니다. 이 논문은 단순한 질문을 던집니다. "둘 다 가질 수는 없을까?"

하이브리드 영웅: HTC-VLM

이 논문의 저자인 장주생(Jusheng Zhang)과 그의 팀은 그 답이 "그렇다"라고 말합니다. 단, 단 하나의 도구로 모든 것을 해결하려고 강요하는 것을 멈출 때만 가능합니다. 그들은 HTC-VLM(Vision-Language Models를 위한 하이브리드 토큰 압축)이라는 새로운 방법을 소개합니다. 이것은 복잡한 이야기를 줄거리나 캐릭터의 디테일을 놓치지 않고 요약하는 영리한 방법이라고 생각하면 됩니다.

이들의 "하이브리드" 기술이 어떻게 작동하는지 간단한 비유를 통해 설명하겠습니다:

당신이 소리만 들을 수 있는 친구에게 공원의 혼란스러운 장면을 설명하고 있다고 상상해 보세요.

  • 기존 방식 (연속적 압축 - Continuous Compression): 당신은 모든 것을 한 문장으로 짜내려고 노력합니다: "많은 것들이 색깔과 모양을 가지고 움직이고 있어." 친구는 소음은 듣지만 실제로 무슨 일이 일어나고 있는지는 알지 못합니다. 친구는 무언가 분주하다는 것은 알지만, 무엇이 분주한지는 모릅니다. 이것이 AI가 이미지를 하나의 평균값으로 압축하려고 할 때 발생하는 현상입니다. 즉, "높은 수준의 의미"(예: "강아지다")가 "노이즈"(예: 풀과 하늘)에 의해 씻겨 내려가 버리는 것입니다.
  • 또 다른 기존 방식 (이산적 양자화 - Discrete Quantization): 당신은 정밀하게 말하려고 노력합니다: "강아지. 풀. 나무." 친구는 주요 등장인물은 알지만, 강아지가 어떻게 생겼는지, 달리고 있는지, 혹은 털 색깔이 무엇인지는 전혀 모릅로 됩니다. 그들은 질감과 동작을 놓치게 됩니다.
  • HTC-VLM 방식 (하이브리드 솔루션): 연구진은 2단계 접근 방식을 제안합니다. 먼저, 당신은 친구에게 정확히 무엇이 있는지 알려주는 네 개의 특별한 "앵커(anchor)" 카드를 줍니다 (예: "강아지", "풀", "나무"). 이것들이 **이산적 토큰(discrete tokens)**입니다. 이들은 뼈대나 지도 역할을 합니다. 그다음, 모든 지저리하고 미세한 디테일(강아지의 털 질감, 풀 사이의 바람, 강아지의 자세 등)을 담고 있는 단 하나의 "요약(summary)" 토큰을 줍니다.

마법은 컴퓨터가 "요약 토큰"을 읽는 방식을 안내하기 위해 "앵커 카드"를 사용하도록 훈련받는 데서 일어납니다. 앵커는 컴퓨터에게 "이봐, 여기서 강아지를 찾아봐!"라고 알려주어, 요약 토큰이 다른 모든 디테일 때문에 혼란에 빠지지 않도록 돕습니다. 이렇게 함으로써 AI는 큰 그림(의미론)과 미세한 디테일(외형)을 마지막 순간까지 분리하여 유지한 뒤, 완벽하게 결합합니다.

연구 결과

연구팀은 이미지에 대한 질문에 답하는 것부터 과학 도표를 이해하는 것까지, 7가지의 서로 다른 도전적인 테스트를 통해 이 아이디어를 테스트했습니다. 그들은 자신들의 새로운 방법과 기존의 가장 뛰어난 이미지 압축 방식들을 비교했습니다.

  • 결과: 전체 이미지를 단 하나의 토큰(궁극의 압축)으로 압축했을 때, 이들의 하이브리드 방식은 원래 성능의 **87.2%**를 유지했습니다. 이전의 최고 방식(평균값을 사용하는 방식)은 **81.0%**만을 유지했습니다. 수치상으로는 작은 차이처럼 보일 수 있지만, AI의 세계에서 거의 모든 데이터를 버린 상태에서 그 정도의 지능을 유지한다는 것은 엄청난 성과입니다.
  • 작동 원리: 연구진은 컴퓨터의 "주의(attention)"가 어떻게 작동하는지 분석했습니다. 그들은 단 하나의 요약 토큰이 먼저 네 개의 "앵커" 카드를 적극적으로 바라보고 있다는 것을 발견했습니다. 즉, 요약 토큰은 나머지 이미지를 이해하기 위한 가이드로서 앵커를 사용하고 있었습니다. 이는 앵커가 의미를 온전히 유지하는 데 핵심적인 역할을 한다는 것을 증명했습니다.
  • 트레이드오프 (Trade-off): 이 방법은 네 개의 앵커 카드를 생성하기 위해 약간의 추가 작업이 필요하지만, 연구진은 수백 개의 토큰을 처리할 필요가 없어 절약되는 시간이 워낙 막대하기 때문에 전체적인 속도는 여전히 매우 빠르다는 것을 보여주었습니다. 이는 훌륭한 개요를 쓰는 데 5초를 투자함으로써, 형편없는 에세이를 쓰는 데 드는 5시간을 아끼는 것과 같습니다.

이 논문이 주장하지 않는 것

이 논문이 주장하지 않는 바를 명시하는 것도 중요합니다. 연구진은 단순히 모든 것을 "평균" 낸다고 해서 극단적인 압축 상황에서 잘 작동할 것이라는 생각에 명시적으로 반대합니다. 그들은 단 하나의 연속적인 숫자가 "이야기"와 "디테일"을 모두 담도록 강요하는 것이 어떻게 이야기를 붕괴시키는지 보여주었습니다. 또한, 이미지의 일부를 무작위로 선택하거나 기존의 "가지치기(pruning, 일부를 잘라내는 방식)" 방법을 사용하는 것이 단 하나 또는 두 개의 토큰만 남았을 때만큼 효과적이지 않다는 점도 보여주었습니다.

이 논문은 이 하이브리드 접근 방식이 극단적인 압축 문제에 대한 강력한 해결책임을 제안하지만, 이것이 AI의 모든 문제를 해결한다고 주장하는 것은 아닙니다. 예를 들어, 단일 이미지에는 매우 효과적이지만, 더 긴 영상이나 복잡한 다중 이미지 대화에는 조정이 필요할 수 있다고 언급했습니다.

결론

요약하자면, HTC-VLM은 AI를 똑똑하고 빠르게 만들기 위해서 이미지를 단순히 작은 점으로 줄이는 것이 아니라, AI에게 지도(이산적 앵커)와 브리핑(연속적 디테일)을 제공하고 이들이 함께 작동하게 해야 한다고 제안합니다. "무엇인지(what)"와 "어떠한지(how)"를 분리함으로써, 컴퓨터는 단 하나의 토큰만으로도 노이즈에 빠지지 않고 명확한 의미와 선명한 디테일을 유지하며 이미지를 이해할 수 있습니다. 이는 때때로 공간을 절약하기 위해 무언가를 버릴 필요가 있는 것이 아니라, 더 잘 조직해야 한다는 점을 상기시켜 줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →