← 최신 논문
🤖 AI

Reroute, Don't Remove: Recoverable Visual Token Routing for Vision-Language Models

이 논문은 비가역적인 토큰 제거를 복구 가능한 라우팅 메커니즘으로 대체하여, 지연된 시각적 토큰이 이후 디코더 단계에서 다시 처리 풀에 재진입할 수 있도록 함으로써 효율성을 유지하면서도 그라운딩 성능을 향상시키는, 시각-언어 모델을 위한 학습이 필요 없는 플러그인인 "Reroute"를 제안한다.

원저자: Cheng-Yu Yang, Shao-Yuan Lo, Yu-Lun Liu

게시일 2026-06-11
📖 3 분 읽기☕ 가벼운 읽기

원저자: Cheng-Yu Yang, Shao-Yuan Lo, Yu-Lun Liu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게 거대한 시각 정보의 도서관(이미지)이 있고, 똑똑한 로봇(시각-언어 모델)이 질문에 답하기 위해 이를 읽어야 한다고 상상해 보십시오. 로봇은 이미지를 하나의 전체 그림으로 읽는 것이 아니라, 수천 개의 작은 "시각적 토큰(visual tokens)", 즉 개별 퍼즐 조각처럼 분해하여 읽습니다.

문제는 수천 개의 조각을 읽는 데 엄청난 에너지와 메모리가 소모되어 로봇의 속도를 늦춘다는 점입니다.

기존 방식: "순위 매기기 및 제거 (Rank and Remove)"

이전에는 이를 빠르게 하기 위해 **"순위 매기기 및 제거"**라는 방법을 사용했습니다.
이것은 마치 엄격한 사서가 당신의 퍼즐 조각들을 보고 이렇게 말하는 것과 같습니다. "지금 이 100개의 조각은 중요해 보이니 남겨두세요. 나머지 900개의 조각은 영원히 버리겠습니다."

사서는 그 순간의 모습만을 바탕으로 이 결정을 내립니다. 문제는 로봇의 뇌가 층층이 쌓인 건물처럼 여러 층(layers)으로 구성되어 있다는 점입니다.

  • 지상층 (초기 레이어): 로봇은 혼란스러운 상태이며 모든 것을 막연하게 바라봅니다. 그래서 하늘의 한 조각이 중요하지 않다고 생각할 수도 있습니다.
  • 꼭대기 층 (깊은 레이어): 로봇은 갑자기 깨닫습니다. "잠깐! 저 하늘 조각은 내가 찾고 있는 사람의 배경이 되는 부분이잖아!"

하지만 지상층의 사서가 그 조각을 이미 버려버렸다면, 꼭대기 층의 로봇은 결코 그 조각을 볼 수 없습니다. 조각을 버리기로 한 결정은 되돌릴 수 없는(irreversible) 것이었습니다. 만약 로봇이 나중에 그 조각을 필요로 하게 된다면, 이미 너무 늦은 것입니다. 이 때문에 "초록색 셔츠를 입은 남자"가 정확히 어디에 있는지 지목하는 것과 같이 정밀한 위치 파악이 필요한 작업에서 로봇은 실패했습니다.

새로운 방식: "제거 대신 경로 재설정 (Reroute, Don't Remove)"

이 논문의 저자들은 **"경로 재설정(Reroute)"**이라는 새로운 방법을 제안합니다. 조각들을 버리는 대신, 그들을 "대기실"로 보내는 것입니다.

작동 방식은 다음과 같습니다:

  1. 체크포인트: 건물의 바닥에서 사서는 여전히 조각들을 점검합니다. 그들은 상위 10%의 조각을 골라 상세한 작업을 위해 다음 층으로 바로 보냅니다.
  2. 대기실: 나머지 90%는 쓰레기통에 던져지는 것이 아닙니다. 그들은 현재 층의 무거운 작업들을 건너뛰는 **우회 통로(bypass hallway, 잔차 경로)**로 보내집니다.
  3. 재진입: 로봇이 다음 층의 체크포인트에 도달하면, 사서는 대기실에 있던 조각들을 포함하여 전체 컬렉션을 다시 한번 살펴봅니다.
  4. 두 번째 기회: 만약 첫 번째 층에서 무시되었던 조각이 두 번째 층에서 갑자기 매우 중요해 보인다면, 사서는 그 조각을 대기실에서 꺼내어 작업에 합류시킬 수 있습니다.

이것이 왜 중요한가

이 논문은 조각을 삭제하는 대신 시스템 안에 계속 유지하는 것이 얼마나 큰 차이를 만드는지 보여줍니다. 특히 로봇이 매우 효율적이어야 하는 상황(조각의 아주 적은 부분만 유지해야 할 때)에서 더욱 그렇습니다.

  • "초록색 셔츠를 입은 남자"의 비유: 논문의 예시에서, 로봇이 "초록색 셔츠를 입은 남자"를 찾아야 할 때, 기존 방식은 셔츠 토큰이 아직 중요해 보이지 않는다는 이유로 초기에 버려버렸습니다. 그 결과 로봇은 남자를 찾는 데 실패했습니다. 새로운 방식은 셔츠 토큰을 대기실에 보관했습니다. 로봇이 더 깊은 추론 단계에 들어섰을 때, 셔츠가 중요하다는 것을 깨닫고 이를 다시 불러들여 성공적으로 남자를 찾아냈습니다.
  • 추가 비용 없음: 가장 좋은 점은 이 방식이 로봇에게 새로운 것을 배우게 하거나 더 많은 에너지를 쓰게 하지 않는다는 것입니다. "대기실"에 있는 조각들은 현재 층의 무거운 작업을 건너뛰기 때문에, 전체 에너지 사용량은 기존의 "버리기" 방식과 거의 동일하게 유지됩니다. 단지 조각을 관리하는 더 똑똑한 방법일 뿐입니다.

결론

이 논문은 시각 정보를 줄이는 것을 일회성 "삭제" 버튼으로 보아서는 안 된다고 주장합니다. 대신, 이를 하나의 **"경로 지정 시스템(routing system)"**으로 보아야 합니다. AI가 더 똑똑해짐에 따라 "보류된" 정보가 다시 돌아올 수 있도록 허용함으로써, 우리는 모델이 나중에 발견할지도 모르는 중요한 세부 사항들을 놓치지 않으면서도 훨씬 빠르게 만들 수 있습니다.

저자들은 이를 여러 다른 AI 모델에 테스트했으며, 이 방식이 모델의 일반적인 질문 답변 능력을 해치지 않으면서도 물체의 위치를 파악하는 능력(grounding)을 일관되게 향상시킨다는 것을 발견했습니다. 또한 컴퓨터를 효율적으로 구동하면서도 말입니다.

핵심 요약

이 논문은 시각 정보를 줄이는 것을 단순한 삭제가 아닌, 경로 지정의 관점으로 보아야 한다고 주장합니다. 정보가 더 똑똑해짐에 따라 다시 평가될 수 있도록 허용함으로써, 우리는 AI가 나중에 발견할 중요한 디테일에 대해 "눈이 멀지" 않게 하면서도 모델을 훨씬 더 빠르게 만들 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →