← 최신 논문
🤖 machine learning

ReToken: One Token to Improve Vision-Language Models for Visual Retrieval

ReToken은 사전 채워진 KV 캐시로부터 쿼리와 관련된 시각적 토큰을 효율적으로 검색하는 가볍고 단일한 학습 가능한 임베딩으로, 단일 GPU에서도 계산적으로 실행 가능하면서 롱 컨텍스트 이미지 및 비디오 검색 작업에 대한 시각-언어 모델의 성능을 크게 향상시킵니다.

원저자: Yao Xiao, Reuben Tan, Zhen Zhu, Yuqun Wu, Jianfeng Gao, Derek Hoiem

게시일 2026-07-31
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yao Xiao, Reuben Tan, Zhen Zhu, Yuqun Wu, Jianfeng Gao, Derek Hoiem

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대한, 혼란스러운 건초더미 속에서 특정한 바늘 하나를 찾으려고 노력하고 있다고 상상해 보세요. 이제, 단순히 건초 더미가 아니라 수천 권의 책이 있는 거대한 도서관이라고 상상해 보세요. 그리고 당신은 초지능적인 로봇 사서에게 당신의 질문에 답이 될 단 하나의 문장을 찾기 위해 도서관 전체를 읽어달라고 요청하고 있습니다. 이것이 바로 시각-언어 모델(Vision-Language Models, VLMs)의 세계입니다. 이는 이미지와 텍文本을 함께 이해하려고 시도하는 인공지능의 한 분야입니다.

오랫동안 이 로봇들은 단일 사진이나 짧은 클립을 보는 데는 뛰어난 성능을 보여왔습니다. 하지만 한 시간짜리 긴 영상이나 백 장의 사진 뭉치를 주면, 그들은 압도당합니다. 마치 인간에게 한꺼번에 천 권의 책을 읽으라고 요구하는 것과 같습니다. 그들의 뇌(이 경우에는 컴퓨터의 메모리)는 그 모든 것을 담아낼 수 없으며, 결국 혼란에 빠지게 됩니다. 그들은 모든 것을 동시에 처리하려고 하다가 엉뚱한 페이지를 보거나 단서를 완전히 놓쳐버릴 수도 있습니다. 과학자들이 던져온 핵심적인 질문은 이것입니다: 어떻게 하면 이 로봇들이 자신의 기억을 더 잘 "검색"하도록 가르칠 수 있을까? 어떻게 하면 집 한 채 크기의 슈퍼컴퓨터를 필요로 하지 않으면서도, 지루한 부분은 무시하고 중요한 순간이나 사진에만 집중할 수 있도록 도울 수 있을까?

여기서 ReToken이라는 새로운 아이디어가 등장합니다. 시각-언어 모델을 증거를 보고 범죄를 해결하도록 훈련된 탐정이라고 생각해 보세요. 보통 당신이 "빨간 자동차가 어디 있어?"와 같은 질문을 던지면, 탐정은 모든 증거(이미지)를 살펴보고 자신이 얼마나 주의를 기울이느냐(attention)에 따라 어떤 것이 중요한지 추측합니다. 연구진들은 이 "주의(attention)" 방식이 비디오나 대규모 이미지 모음에서는 상당히 신뢰할 수 없다는 사실을 발견했습니다. 이는 마치 탐정이 배경에 있는 반짝이는 물체에 정신이 팔려 빨간 자동차를 놓치는 것과 같습니다.

연구팀은 로봇의 현재 검색 방식이 다소 고장 나 있다는 것을 발견했습니다. 그들은 테스트를 통해 로봇이 표준적인 "주의" 신호를 사용하여 비디오에서 올바른 프레임을 선택할 때, 성공률이 약 5%에 불과하다는 것을 찾아냈습니다. 이는 본질적으로 암흑 속에서 추측하는 것과 같습니다. 또한 그들은 로봇의 "주의"가 이미지를 찾는 것이 아니라 문장의 다음 단어를 예측하도록 훈련되어 있다는 이상한 점을 발견했습니다. 즉, 사서 역할을 하기에는 적합하지 않았던 것입니다.

이를 해결하기 위해 저자들은 ReToken을 발명했습니다. 여러분에게 질문에 붙일 수 있는 마법 같은 단 하나의 "검색 버튼"이 있다고 상상해 보세요. 로봇에게 도서관 전체를 스캔하라고 요청하는 대신, 이 특별한 버튼을 주는 것입니다. 이 버튼은 로봇이 특정 이미지를 찾아내기 위해 특별히 사용하도록 훈련된, 학습 가능한 아주 작은 코드 조각입니다. 이것은 로봇이 보통 사용하는 "레이블(labels)"이나 "키(keys)"가 아니라, 이미지의 "콘텐츠"(논문에서 말하는 "값(value)" 공간)를 바라봄으로써 작동합니다.

여기에는 마법 같은 트릭이 있습니다. 연구진은 이 단 하나의 "검색 버튼"을 소수의 이미지 질문 세트를 통해 훈련시켰습니다. 그들은 이 버튼이 노이즈를 무시하고 질문에 답이 되는 정확한 프레임을 포착하도록 가르쳤습니다. 일단 훈련되면, 이 작은 토큰은 매우 효율적인 검색기가 됩니다. 로봇이 긴 영상에 대해 질문을 받으면, 이 토큰은 레이저 포인터처럼 작동하여 수천 개의 프레임 중 관련 있는 몇 개만을 즉각적으로 찾아내고 나머지는 무시합니다.

결과는 놀라울 정도로 강력했습니다. 그들이 "시각적 건초더미(Visual Haystack)" 챌린지(많은 이미지 중 관련 있는 하나를 찾는 과제)에서 테스트했을 때, ReToken을 사용하는 로봇은 이전의 최고 기록보다 정확도가 13포인트 이상 향상되었습니다. 더욱 인상적인 것은, 그들이 오직 정지된 이미지만으로 이를 훈련시켰음에도 불구하고, 긴 영상을 보여주었을 때 여전히 작동했다는 점입니다! 기술이 완벽하게 전이되어, LVBench라는 까다로운 벤치마크에서 비디오 이해 점수를 8포인트 높였습니다.

가장 좋은 점은 무엇일까요? 이 솔루션은 믿을 수 없을 정도로 가볍습니다. 로봇 전체를 다시 만들거나 거대한 슈퍼컴퓨터를 필요로 하지 않습니다. 훈련부터 긴 영상을 시청하는 과정까지의 모든 프로세스가 단 하나의 고성능 그래픽 카드(H100)에서 실행됩니다. 저자들은 이 단순한 단일 토큰 접근 방식이, AI가 세부 사항에 길을 잃지 않고 수 시간의 영상이나 방대한 이미지 모음을 진정으로 이해할 수 있게 만드는 열쇠가 될 수 있다고 제안합니다. 이는 로봇이 나무가 아닌 숲을 보게 만드는 작은 변화이며, 때로는 더 큰 뇌가 필요한 것이 아니라 더 나은 보는 방법이 필요하다는 것을 증명합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →