Visual Token Compression Enhances Robustness of MLLMs
이 논문은 정렬되지 않았거나 분포 외(out-of-distribution)에 있는 시각적 토큰을 식별하여 제거함으로써 멀티모달 거대 언어 모델의 탈옥 공격 및 환각 현상에 대한 강건성을 향상시키는 동시에 추론 비용을 절감하는 시각적 토큰 프루닝 방법을 제안한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
컴퓨터가 단순히 단어를 읽는 것을 넘어 사진을 '보고', 이를 결합하여 질문에 답하거나 이야기를 들려주고 문제를 해결하는 세상을 상상해 보세요. 이러한 모델을 멀티모달 거대 언어 모델(Multimodal Large Language Models, MLLMs)이라고 부릅니다. 이들을 도서관의 모든 책을 읽었을 뿐만 아니라 사진을 보고 맥락을 이해할 수 있는 아주 똑똑한 학생이라고 생각하면 됩니다. 하지만 어떤 학생과 마찬가지로, 이들도 혼란을 겪을 수 있습니다. 때때로 까다로운 사진을 보여주거나 교묘한 질문을 던지면, 이들은 위험한 발언을 하도록 유도당하거나(탈옥, jailbreak), 사실처럼 들리지만 실제로는 완전히 틀린 내용을 지어낼(환각, hallucination) 수도 있습니다.
이런 현상이 왜 발생하는지 이해하려면 모델이 정보를 처리하는 방식을 살펴봐야 합니다. 모델은 이미지를 가져와서 '시각적 토큰(visual tokens)'이라는 아주 작은 디지털 조각들로 쪼갠 뒤, 이를 텍스트 토큰과 섞습니다. 문제는 컴퓨터의 '눈'과 '귀'가 항상 완벽하게 같은 언어로 말하지 않는다는 점입니다. 때때로 어떤 시각적 토큰은 너무 엉뚱하거나 혼란스러워서 라디오 신호의 잡음(static noise)처럼 작용하기도 합니다. 이 잡음은 모델의 균형을 무너뜨려 공격에 취약하게 만들거나 거짓 정보를 꿈꾸게 만듭니다. 과학자들은 오랫동안 이 잡음을 제거하는 것이 도움이 된다는 것을 알고 있었지만, 대개는 이것이 안전의 문제가 아니라 단순히 컴퓨터를 더 빠르게 만드는 데 관한 문제라고 생각했습니다.
이 논문은 시각적 토큰 압축(Visual Token Compression), 특히 OOD-VTP(Out-of-Distribution Visual Token Pruning, 분포 외 시각적 토큰 가지치기)라는 이름의 영리한 기술을 소개합니다. 연구진은 '이상한' 시각적 토큰들, 즉 텍스트와 잘 어울리지 않는 토큰들을 식별하고 제거함으로써 모델이 훨씬 더 강력해지고 거짓말을 덜 하게 된다는 것을 발견했습니다. 이는 마치 클럽의 보안 요원이 어울리지 않는 무례한 손님들을 쫓아내어 파티를 안전하고 질서 있게 만드는 것과 같습니다. 연구는 이것이 단순한 이론이 아님을 보여줍니다. 일곱 가지의 서로 다른 인기 있는 벤치마크에서 테스트했을 때, 모델은 훨씬 더 속기 어려워졌고 더 정확해졌으며, 동시에 더 빠르게 작동했습니다.
소음이 가득한 방 이야기
당신이 거대한, 소음이 가득한 방 안에 있다고 상상해 보세요. 그곳에서는 친구들(텍스트)이 진지한 대화를 나누려고 노력 중입니다. 갑자기 낯선 사람들(시각적 토큰)이 들이닥칩니다. 대부분의 낯선 이들은 도움이 됩니다. 그들은 간식을 가져오거나 대화 내용과 일치하는 방 안의 사물들을 가리킵니다. 하지만 몇몇은 장난꾸러기들입니다. 그들은 가면을 쓰고 있거나, 횡설수설 소리를 지르거나, 대화 내용과 전혀 맞지 않는 표지판을 들고 있습니다.
AI의 세계에서 이 장난꾸러기들은 **불일치하는 시각적 토큰(misaligned visual tokens)**입니다. 컴퓨터의 시각 시스템과 언어 시스템이 완벽하게 동기화되지 않았기 때문에, 이 토큰들은 분포 외(Out-of-Distribution, OOD) 입력값으로 작용합니다. 쉽게 말해, 이들은 "제 자리에 있지 않은" 존재들입니다. AI가 이들을 처리하려고 하면 혼란에 빠집니다. 이 혼란이야말로 해커들이 AI를 '탈옥'시키거나(안전 규칙을 무시하도록 속임), AI가 '환각'을 일으키게(사실을 지어냄) 만드는 원인이 됩니다.
보안 요원의 전략
이 논문의 저자들은 기존 방식들이 단순히 무작위로 토큰을 제거하거나 혹은 '중복된' 토큰(조용한 사람들을 쫓아내는 것과 같은)을 제거하려고 했다는 점을 깨달았습니다. 하지만 그들은 이런 방식이 AI를 더 안전하게 만들지는 못한다는 것을 발견했습니다. 사실, 때로는 상황을 더 악화시키기도 했습니다!
그들의 새로운 방법인 OOD-VTP는 초능력을 가진 보안 요원처럼 행동합니다. 작동 방식은 다음과 같습니다:
- 거리 측정: 보안 요원은 모든 시각적 토큰(이미지의 모든 조각)을 확인하며 "이 사람은 대화로부터 얼마나 떨어져 있는가?"라고 묻습니다. 그들은 시각적 토큰과 "언어 특징 공간(language feature space, 텍스트 토큰 그룹)" 사이의 거리를 측정합니다.
- 장난꾸러기 식별: 텍스트와 가장 멀리 떨어져 있는 토큰들, 즉 완전히 동기화되지 않은 토록들을 OOD 토큰으로 표시합니다. 이들이 바로 문제를 일으키는 주범입니다.
- 완벽한 타이밍: 연구진은 토큰을 아무 때나 쫓아내서는 안 된다는 것을 발견했습니다. 토큰을 제거하기 가장 좋은 특정 "강건한 가지치기 레이어(robust-pruning layers)"가 존재합니다. (이는 대화 중의 특정 순간들과 같습니다.) 너무 일찍 혹은 너무 늦게 제거하면 도움이 되지 않습니다. 하지만 적절한 순간(테스트 결과 레이어 13 또는 17 등)에 제거하면, AI는 갑자기 훨씬 더 견고해집니다.
결과: 더 안전하고, 더 똑똑하며, 더 빠르게
연구팀은 이 보안 요원 전략을 두 가지 유명한 AI 모델인 LLaVA-OneVision과 Qwen-2.5-VL에 테스트했습니다. 모델이 얼마나 잘 작동하는지 확인하기 위해 일곱 가지 벤치마크를 사용했습니다.
- 탈옥 차단: AI를 속여서 나쁜 짓(예: 폭탄 제조법 설명이나 악성 코드 삽입 등)을 하게 만들려고 했을 때, OOD-VTP 방식은 큰 성공을 거두었습니다. 평균적으로 모델이 "안 됩니다, 할 수 없습니다"라고 말하는 능력(거절 능력)을 13.29% 향상시켰습니다. 특히 Qwen-2.5-VL 모델의 경우, '답변 거부율(Refuse-to-Answer Rate, 나쁜 요청을 성공적으로 차단하는 비율)'이 **20.38%**에서 **33.67%**로 급증했습니다.
- 환각 차단: 이 방법은 AI가 사실을 지어내는 것도 막아주었습니다. HallusionBench에서 Qwen 모델의 정확도가 8.00% 향상되었습니다.
- 속도: 보너스로, 일부 토큰을 제거했기 때문에 AI는 더 빠르게 실행되었습니다. 모델은 더 적은 수의 토큰을 처리하게 되었고(16,128개에서 10,512개로 감소), 연산량(TFlops)도 줄어들어(4.29에서 2.78로 감소) 지능을 유지하면서도 더 효율적으로 변했습니다.
하지 않은 일 (그리고 배제한 것들)
이 논문에서 중요한 점은 이 연구가 하지 않은 일들입니다. 그들은 AI를 처음부터 다시 학습시키지 않았습니다. 새로운 안전 규칙을 추가하거나 모델의 뇌 가중치(weights)를 변경하지도 않았습니다. 그들은 단지 프로세스 도중에 나쁜 시각적 토큰을 '가지치기(pruning, 잘라내기)'했을 뿐입니다.
또한 그들은 모든 토큰 가지치기가 AI를 더 안전하게 만든다는 아이디어를 명시적으로 부정했습니다. 실제로, 잘못된 토큰(즉, 잘 정렬되어 있고 도움이 되는 토큰들)을 가지치기하면 AI가 오히려 덜 안전해진다는 것을 보여주었습니다. 그들은 "가장 거리가 가까운(smallest distance)" 토큰들(좋은 토큰들)을 가지치기하는 실험을 했고, 그 결과 모델의 안전 성능이 폭락했습니다. 이는 단순히 무언가를 깎아내는 것이 중요한 게 아니라, 문제를 일으키는 특정한 잡음을 골라내는 것이 중요하다는 것을 증명합니다.
핵심 요약
이 논문은 멀티모달 AI를 더 안전하게 만드는 열쇠가 시각적 잡음을 정리하는 것만큼 간단할 수 있다는 점을 시사합니다. 시각적 토큰 중 텍스트와 어울리지 않는 것들을 식별하고 제거함으로써, 모델은 더 안정적이고, 속이기 어려워지며, 사실을 지어낼 가능성이 낮아집니다. 이는 "플러그 앤 플레이(plug-and-play)" 솔루션으로, 대대적인 개편 없이도 기존 모델에 바로 적용할 수 있습니다. 이 논문은 이러한 결과가 여러 테스트에서 일관되게 나타났음을 보여주지만, 이것이 세상의 모든 보안 문제를 해결하는 마법의 탄환이라기보다는 견고함을 강화하는 방법임을 명시하고 있습니다. 하지만 호기심 많은 십 대(혹은 안전을 중시하는 AI 개발자)에게, 약간의 가지치기가 우리의 디지털 친구들을 안전하게 지키는 데 얼마나 큰 차이를 만드는지 보여주는 매우 흥미로운 연구입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.