← 최신 논문
🤖 AI

Not All Visual Tokens Are Equally Safe to Remove:Consequence-Sensitive Visual Token Compression

이 논문은 오류의 잠재적 비용에 따라 계산 자원을 동적으로 할당함으로써, 기존의 콘텐츠 기반 또는 균등 할당 전략에 비해 고위험 실수를 유의미하게 줄이고 전체 비용 가중 오류율을 낮추는 시각-언어 모델을 위한 결과 민감형 시각 토큰 압축 방법을 소개한다.

원저자: Jingbo Wen, Liang He, Mingyu Cao, Haoyu Wang, Minxuan Hu, Kangning Cui, Xilu Wang

게시일 2026-08-11
📖 3 분 읽기☕ 가벼운 읽기

원저자: Jingbo Wen, Liang He, Mingyu Cao, Haoyu Wang, Minxuan Hu, Kangning Cui, Xilu Wang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 바쁜 레스토랑의 헤드 셰프라고 상상해 보세요. 하지만 당신에게는 엄격한 규칙이 하나 있습니다. 어떤 요리를 만들더라도 반드시 정해진 양의 식재료만을 사용해야 한다는 것입니다. 보통의 셰프들은 식재료를 고르게 분배함으로써 모든 요리의 '평균적인' 맛을 최대한 좋게 만들려고 노력합니다. 하지만 만약 어떤 요리는 단순한 감자튀김이고, 다른 요리는 환자를 위한 생명을 구하는 약이라면 어떨까요? 감자튀김을 망치는 것은 짜증스러운 일이지만, 약을 망치는 것은 재앙입니다. 이미지를 보고 질문에 답하는 대부분의 컴퓨터 프로그램(시각-언어 모델이라고 불림)은 이 기존 방식의 셰프처럼 행동합니다. 그들은 모든 실수가 동일한 양의 에너지를 소모한다고 가정하고, 이미지의 '지루한' 부분을 무시함으로써 컴퓨팅 파워를 아끼려 합니다. 하지만 현실 세계에서 실수는 단순히 실수가 아닙니다. 실수에는 가격표가 붙습니다. 이 논문은 아주 간단하면서도 혁명적인 질문을 던집니다. "만약 우리가 평균적인 식사를 완벽하게 만드는 데 집중하는 대신, 우리의 한정된 식재료를 실수의 대가가 가장 큰 요리에 집중한다면 어떻게 될까?"

징보 웬(Jingbo Wen)과 량 허(Liang He)가 이끄는 연구진은 이 새로운 방식의 모델 처리법을 "결과 민감형 시각 토큰 압축(consequence-sensitive visual token compression)"이라 명명했습니다. 이들의 비결을 이해하려면, 이미지를 하나의 사진이 아니라 '토큰'이라고 불리는 수천 개의 아주 작은 타일로 이루어진 모자이크라고 생각해보세요. 컴퓨터가 사진을 볼 때, 이 모든 타일을 처리합니다. 시간과 비용을 아끼기 위해, 현재의 방식들은 자동차 사진 속의 파란 하늘처럼 덜 중요해 보이는 타일들을 버리려고 시도합니다. 그들은 무엇을 남길지 결정하기 위해 사진 자체를 들여다봅니다. 저자들은 이것이 마치 책의 표지만 보고 판단하는 것과 같다고 주장합니다. 때로는 '지루한' 배경 타일이 특정 질문에 답하는 데 있어 매우 결정적일 수 있기 때문입니다.

저자들은 단순히 사진을 보는 대신, 질문이나 과업을 먼저 살펴보는 방식을 제안합니다. 그들은 어떤 질문은 "고위험"(예: "이 송장의 총액은 얼마인가?")이고, 어떤 질문은 "저위험"(예: "배경 색깔은 무엇인가?")이라는 점을 깨달았습니다. 그들의 방법은 두 단계로 작동합니다. 첫째, 오프라인에서 모델을 테스트하여 고위험 질문과 저위험 질문을 정확히 맞히기 위해 모델이 정확히 몇 개의 타일(토큰)을 필요로 하는지 확인하는 '캘리브레이션(조정)' 단계를 거칩니다. 그다음, 실제 사용자가 질문을 던지면 시스템은 그 질문을 틀렸을 때의 '결과(consequence)'를 확인합니다. 만약 질문이 고위험이라면, 시스템은 해당 이미지에 엄청난 양의 타일 예산을 할당하여 컴퓨터가 모든 세부 사항을 볼 수 있도록 보장합니다. 반대로 질문이 저위험이라면 훨씬 적은 예산을 할당하여 중요한 곳을 위해 자원을 아낍니다.

연구팀은 고위험 질문과 저위험 질문이 정확히 같은 이미지에 대해 던져지는 까다로운 설정에서 이를 테스트했습니다. 이는 개선의 원인이 이미지가 달라서가 아니라, 순수하게 컴퓨터가 에너지를 어떻게 쓰기로 결정했느냐에서 왔음을 증명하는 데 매우 중요했습니다. 그들은 예산을 전환함으로써, 전체 컴퓨팅 파워를 더 많이 사용하지 않고도 값비싼 고위험 오류를 절반 이상(0.300에서 0.133으로) 줄일 수 있다는 것을 발견했습니다. 실제로 쉬운 질문에 드는 시간을 줄였기 때문에, 전체 시스템은 약 21% 더 빠르게 실행되었습니다.

또한 이 논문은 '임계점'을 발견했습니다. 모든 질문에 대해 실수의 비용이 동일할 때는 여전히 모두를 평등하게 대하는 것이 최선의 전략입니다. 하지만 실수의 비용이 달라지는 순간(예를 들어, 의료 보고서의 오답이 날씨 보고서의 오답보다 5배 더 치명적인 경우), 시스템은 위험한 질문 쪽으로 자원을 집중적으로 투입하기 시작해야 합니다. 연구진은 이 방식이 다양한 유형의 문서, 차트, 그리고 서로 다른 컴퓨터 모델에서도 작동함을 보여주었습니다. 그들은 우리가 모델의 성능을 단순히 '평균적인 정확도'로 측정해서는 안 되며, 현실 세계에서 가장 중요하고 비용이 많이 드는 특정 실수들을 얼마나 잘 방지하는지로 측정해야 한다고 결론지었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →