← 최신 논문
💻 computer science

Why and When Visual Token Pruning Fails? A Study on Relevant Visual Information Shift in MLLMs Decoding

이 논문은 멀티모달 대규모 언어 모델의 복잡한 시각 추론 작업에서 기존 시각 토큰 가지치기 방법이 실패하는 주된 원인을 '해석 단계 중 발생하는 관련 시각 정보의 이동 (RVIS)'으로 규명하고, 이를 해결하기 위해 학습 없이 적용 가능한 '해석 단계 이동 인식 토큰 가지치기 (DSTP)' 프레임워크를 제안하여 성능을 크게 향상시켰음을 보여줍니다.

원저자: Jiwan Kim, Kibum Kim, Wonjoong Kim, Byung-Kwan Lee, Chanyoung Park

게시일 2026-04-16
📖 3 분 읽기☕ 가벼운 읽기

원저자: Jiwan Kim, Kibum Kim, Wonjoong Kim, Byung-Kwan Lee, Chanyoung Park

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

🎬 비유: "명화 감상회"와 "수학 시험"

상상해 보세요. AI 는 거대한 도서관에 있는 **수만 장의 그림 (Visual Tokens)**을 한 번에 훑어보면서 질문에 답하는 학생입니다.

1. 기존 기술의 문제: "처음에 정해둔 메모만 믿는 학생"

기존의 '시각 토큰 가지치기 (Visual Token Pruning)' 기술은 다음과 같이 작동했습니다.

"문제 (질문) 를 처음 받았을 때, 가장 중요한 그림 조각 30% 만 골라내서 나머지는 버려버리자! 그래야 계산 속도가 빨라지고 메모리도 아껴지지!"

이 방법은 **단순한 그림 보기 (예: "이 그림에 고양이가 있나요?")**에는 아주 잘 작동했습니다. 고양이는 그림 한 구석에 딱 있고, 처음에 그걸 찾아두면 끝이니까요.

**하지만, 복잡한 수학/논리 문제 (예: "이 도형의 각도를 구해라")**에서는 완전히 망쳤습니다. 왜일까요?

2. 핵심 발견: "시각 정보의 이동 (RVIS)"

논문 저자들은 AI 가 문제를 풀면서 일어나는 놀라운 현상을 발견했습니다.

  • 단순 문제: 처음에 본 '고양이' 위치를 끝까지 기억하면 됩니다. (고정된 시선)
  • 복잡한 추론 문제: 문제를 풀면서 시선이 계속 이동합니다.
    • 1 단계: "아, 이 변의 길이가 3 이네." (A 부분 집중)
    • 2 단계: "그럼 이 각도를 구하려면 저기서 5 를 빼야지." (B 부분 집중)
    • 3 단계: "아! 정답 보기를 고르려면 C 부분의 글자를 봐야 해!" (C 부분 집중)

기존 기술은 처음에 A 부분을 골라 B, C 부분은 영원히 버려버렸기 때문에, 2 단계와 3 단계에서 AI 는 "어? 필요한 정보가 없어!"라며 당황하고 틀린 답을 내놓았습니다.

저자들은 이를 **'시각 정보의 이동 (Relevant Visual Information Shift, RVIS)'**이라고 불렀습니다. 즉, 문제를 풀어가면서 필요한 그림 정보가 계속 바뀌는데, 기존 기술은 그걸 못 따라가는 것입니다.

3. 해결책: "DSTP (해석 단계 지능형 토큰 교체)"

이제 저자들이 제안한 새로운 기술 DSTP를 소개합니다. 이는 마치 현명한 비서처럼 작동합니다.

  • 기존 방식: 처음에 30% 만 골라놓고, 나머지는 쓰레기통에 버림.
  • DSTP 방식:
    1. 감시 (RISD): AI 가 문제를 풀면서 "어? 지금 시선이 처음 본 곳과 달라졌어!"라고 감지합니다. (예: "아, 이제 저쪽 구석을 봐야겠네!")
    2. 교체 (CPTS): "잠깐! 지금 필요한 저쪽 구석의 그림 조각을 쓰레기통에서 다시 꺼내와!"라고 명령합니다.
    3. 유지: 중요한 정보는 계속 유지하되, 필요한 순간에 필요한 그림 조각만 실시간으로 교체해 줍니다.

이 방식은 **처음에 모든 그림을 다 보는 것 (비효율적)**과 처음에 일부만 보고 끝까지 버리는 것 (틀림) 사이의 완벽한 균형을 잡습니다.

📊 결과는 어떨까요?

  • 복잡한 추론 문제 (수학, 논리): 기존 기술은 점수가 50 점대로 뚝 떨어졌지만, DSTP 를 적용하니 80~90 점대로 급상승했습니다.
  • 단순한 그림 보기: 점수는 그대로 유지되거나 아주 조금 더 좋아졌습니다.
  • 속도: 모든 그림을 다 보는 것보다는 훨씬 빠르고, 메모리도 적게 쓰면서 정확도만 높였습니다.

💡 한 줄 요약

"AI 가 그림을 보고 문제를 풀 때, 처음에 중요한 부분만 골라두는 건 위험해요. 문제를 풀어가면서 '지금 이 부분이 중요해!'라고 외치면, AI 가 그때그때 필요한 그림 조각을 다시 꺼내와서 맞춰주는 게 정답입니다!"

이 연구는 AI 가 더 똑똑하고 빠르게 복잡한 문제를 풀 수 있게 해주는 중요한 디딤돌이 되었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →