← 최신 논문
💬 NLP

Revisit What You See: Revealing Visual Semantics in Vision Tokens to Guide LVLM Decoding

이 논문은 비전 토큰에서 관련 시각적 의미를 동적으로 프로젝트하여 텍스트 생성 과정에 통합함으로써 대형 비전 언어 모델의 환각 현상을 완화하는 학습이 불필요한 디코딩 방법인 ReVisiT 를 소개하며, 이는 계산 비용을 줄이면서도 뛰어난 성능을 달성합니다.

원저자: Beomsik Cho, Jaehyung Kim

게시일 2026-05-14
📖 4 분 읽기☕ 가벼운 읽기

원저자: Beomsik Cho, Jaehyung Kim

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

"ReVisiT: Revealing Visual Semantics in Vision Tokens to Guide LVLM Decoding"라는 논문에 대한 설명을 간단한 언어와 창의적인 비유로 제시합니다.

큰 문제: "공상"하는 화가

당신이 한 명의 천재 화가 (대형 시각 - 언어 모델, LVLM) 를 고용하여 보여준 사진을 묘사하게 했다고 상상해 보세요. 당신은 책상 위에 있는 빨간 사과의 사진을 보여줍니다.

이상적으로는 화가가 사진을 보고 "그것은 빨간 사과입니다"라고 말합니다.
하지만 때로는 화가가 자신의 내면적 생각에 산만해집니다. 그들은 "그것은 빨간 사과입니다... 그리고 또한 바나나피자도 있습니다"라고 말할 수 있습니다. 비록 그 것들이 사진에 없더라도요. 이를 **환각 (hallucination)**이라고 부릅니다.

이 논문은 묻습니다: 왜 이런 일이 일어날까요?
연구자들은 화가가 실제로는 그들의 "마음의 눈" (시각 데이터) 에서 사과를 올바르게 보고 있음을 발견했습니다. 하지만 그들이 말을 시작할 때, 자신의 어휘에서 오는 소음에 혼란을 겪습니다. 그들은 진실을 알고 있지만, 실제로 사진에 있는 것보다는 보통 어떤 단어들이 함께 쓰이는지 (예: "사과"와 "파이") 에 너무 집중하기 때문에 그것을 말하기를 잊어버립니다.

발견: "숨겨진 메모"

팀원들은 이러한 AI 모델이 어떻게 작동하는지 면밀히 조사했습니다. 그들은 모델이 이미지를 **비전 토큰 (vision tokens)**이라고 불리는 작은 조각들로 분해한다는 사실을 발견했습니다. 이러한 토큰을 이미지의 다른 부분에 붙여진 작은 스티커 메모라고 생각하세요.

  1. 스티커 메모는 똑똑합니다: AI 가 실수를 할 때 (바나나를 환각으로 보일 때) 도, 이미지 위의 스티커 메모에는 여전히 사과에 대한 정확한 정보가 담겨 있습니다. 시각적 진실은 거기에 있지만, 묻혀 있을 뿐입니다.
  2. 번역 문제: AI 가 이러한 스티커 메모를 단어로 변환하려고 할 때, 혼란이 발생합니다. 규칙 없이 AI 에게 "이 스티커 메모는 어떤 단어를 나타냅니까?"라고 묻는다면, 그것은 "하늘", "파란색", 또는 "질감"이라고 추측할 수 있습니다. 너무 모호합니다.
  3. 마법 같은 필터: 연구자들은 질문 위에 필터를 두는 경우, 즉 AI 에게 "오직 '사과', "과일", "빨간색"과 같은 관련 단어의 특정 목록에서만 선택하도록" 요청하면, 스티커 메모가 갑자기 매우 명확해진다는 사실을 발견했습니다. AI 는 마침내 "아! 이 메모는 분명히 '사과'를 의미합니다!"라고 말할 수 있게 됩니다.

해결책: ReVisiT (비전 토큰 참조)

이러한 사실에 기반하여, 저자들은 ReVisiT라는 새로운 방법을 만들었습니다. 이는 화가를 다시 교육하거나 새로운 화가를 고용할 필요 없이, 화가가 말하는 동안 그들에게 "요약 노트"를 제공하는 것과 같습니다.

다음은 ReVisiT 가 작동하는 단계별 과정입니다:

  1. 맥락 확인: AI 가 문장을 쓰기 시작할 때, ReVisiT 는 AI 가 현재 무엇을 생각하고 있는지 살펴봅니다.
  2. 필터: ReVisiT 는 해당 맥락에 기반하여 작은 관련 단어 목록을 생성합니다 (예: 문장이 부엌에 관한 것이라면 목록에는 "컵", "수저", "사과"가 포함되지만 "비행기"는 포함되지 않습니다).
  3. 매칭: ReVisiT 는 이미지에서 온 모든 "스티커 메모" (비전 토큰) 를 살펴보고 질문합니다: "이 메모들 중 어떤 것이 우리의 현재 단어 목록과 가장 잘 맞습니까?" 그것은 가장 좋은 단일 매칭을 선택합니다.
  4. 부드러운 유도: ReVisiT 는 그 승리한 스티커 메모를 가져와 AI 의 다음 단어 선택을 그쪽으로 부드럽게 밀어붙입니다. 마치 속삭이는 것처럼, "hey, 그 메모를 기억해? 그것은 '바나나'가 아니라 '사과'라고 적혀 있어."라고 말합니다.

왜 이것이 멋진가요

  • 학습 불필요: AI 에게 새로운 것을 가르칠 필요가 없습니다. AI 가 말하는 동안 말하는 방식을 바꾸기만 하면 됩니다.
  • 매우 빠름: 그것은 단지 빠른 수학 확인과 "부드러운 유도"일 뿐이므로 AI 의 속도를 늦추지 않습니다. 사실, 그것은 표준적인 말하는 방식과 거의一样 빠릅니다.
  • 어디서나 작동함: 그들은 작고 매우 큰 다양한 AI 모델들과 이미지 설명, 질문 답변, 객체 감지 등 다양한 작업에 대해 이를 테스트했습니다. 그것은 일관되게 "공상" (환각) 을 줄이고 설명을 더 정확하게 만들었습니다.

비유: 사서와 책

AI 를 시험을 보는 학생이라고 상상해 보세요.

  • 비전 토큰은 학생이 책상 위에 펼쳐 둔 교과서들입니다. 학생은 책 안에 정답을 가지고 있습니다.
  • 환각은 학생이 책을 무시하고 기억으로 답을 추측하거나, 책이 잘못된 페이지로 열려 있을 때 발생합니다.
  • ReVisiT는 질문을 보고 교과서의 정답이 있는 정확한 페이지를 가리키며 "이 부분을 읽어라"라고 말하는 사서입니다. 학생은 이제 추측하는 대신 책에서 정답을 읽습니다.

요약

이 논문은 AI 모델들이 이미 시각 데이터 안에 진실을 "보고" 있지만, 자신의 단어 연관성에 빠져 길을 잃기 때문에 그것을 말하지 못하는 경우가 많음을 증명합니다. ReVisiT는 모델이 자신의 시각적 메모를 보고 그것을 사용하여 자신의 말을 수정하도록 강요하는 단순하고 무료인 도구로서, 거짓말을 줄이고 더 정확한 설명을 이끌어냅니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →