GazeVLM: Active Vision via Internal Attention Control for Multimodal Reasoning
GazeVLM 은 4B 파라미터 규모의 다중 모달 모델로, 메타인지 제어를 내재화하여 동적으로 시선 토큰을 생성함으로써 고해상도 추론을 강화하고, 외부 컷팅 도구나 과도하게 확장된 컨텍스트 윈도우에 의존하지 않고도 모델이 능동적인 중심시 주의를 자율적으로 시뮬레이션하며 관련 없는 시각적 특징을 억제할 수 있게 합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
복잡한 퍼즐을 풀려고 한다고 상상해 보세요. 하지만 전체 그림을 한 번에 보는 대신, 거대한 그림을 잃지 않으면서도 특정 작은 조각에 초점을 맞출 수 있게 해주는 마법의 안경을 쓰고 있다고 가정해 봅시다. 이것이 바로 GazeVLM이 컴퓨터를 위해 수행하는 일입니다.
다음은 일상적인 비유를 사용하여 이 논문의 아이디어를 간단히 분해한 것입니다:
문제: "흐릿하게 읽는" 컴퓨터
이미지를 보는 현재 AI 모델들 (비전 - 언어 모델) 은 누군가 귀에 천 가지의 무작위 사실을 외치면서 책을 읽으려는 학생과 비슷합니다.
- 현재 작동 방식: 그들은 전체 이미지를 한 번에 처리하려고 시도하며, 모든 단일 픽셀을 거대한 단어 목록 (토큰) 으로 변환합니다. 그들이 생각하기 시작하고 답변을 작성할 때, 그 모든 추가 단어들의 "소음"이 중요한 세부 사항을 압도해 버립니다.
- 결과: 그들은 종종 혼란을 겪거나, 사실을 왜곡하여 만들어 내거나 (환각), 전체 세계를 한 번에 머릿속에 담으려다 보니 작지만 결정적인 세부 사항을 놓칩니다.
해결책: "능동적인 시선"
이 논문의 저자, GazeVLM 은 AI 가 인간처럼 이미지를 보도록 가르치고자 했습니다: 능동적으로.
범죄 현장을 해결하는 인간 형사를 생각해 보세요:
- 전체 시야: 그들은 먼저 방 전체를 바라보며 배치에 대한 감각을 얻습니다.
- 중앙 시야 집중: 그들은 무언가 흥미로운 것 (예: 진흙 발자국) 을 발견하고 나머지 방을 잠시 무시하면서 그 지점에 눈을 집중합니다.
- 전체 시야로 복귀: 발자국을 조사한 후, 다음 단서로 이동하기 전에 그것이 전체 장면에서 어떻게 들어맞는지 다시 보기 위해 물러섭니다.
현재 AI 는 2 단계와 3 단계를 자연스럽게 수행하지 못합니다. 그들은 전체 이미지를 멍하니 바라보거나, 사진의 일부를 물리적으로 잘라내어 다시 스캔하는 로봇 팔과 같은 어색한 외부 도구 (느리고 비쌈) 를 사용합니다.
GazeVLM 은 규칙을 바꿉니다: 외부 도구 없이 자신의 뇌 내부에서 이러한 "줌인"을 수행하도록 AI 를 가르칩니다.
작동 원리: 마법의 "시선" 토큰
연구자들은 AI 에게 비밀 언어와 같은 특별한 일련의 지시를 제공했습니다:
<LOOK>: AI 가 특정 세부 사항을 확인해야 한다고 깨닫는 순간,<LOOK>을 입력하고 이미지 해당 영역에 상자를 그립니다.- "침묵" 버튼: 이것이 마법 같은 부분입니다. AI 가
<LOOK>이라고 말하면 실제로 이미지를 자르는 것이 아닙니다. 대신 이미지 나머지 부분에 "음소거 버튼"을 누릅니다. 자신의 주의 시스템에게 이렇게 말합니다: "잠시 동안 이 상자 밖의 모든 것을 무시하세요. 여기에만 집중하세요." </LOOK>: 해당 지점 확인이 끝나면</LOOK>을 입력하고 "음소거"를 해제하여 다음 움직임을 계획하기 위해 다시 전체 이미지를 볼 수 있게 됩니다.
훈련: 행동하며 배우기 (그리고 보상 받기)
AI 에게 "더 열심히 보라"고 말만 해서는 안 됩니다. 어떻게 해야 하는지 배워야 합니다. 연구자들은 두 단계 훈련 과정을 사용했습니다:
- 보여주고 말하기 (SFT): 그들은 AI 에게 이미지를 단계별로 보는 수천 가지 예를 보여주어
<LOOK>과<THINK>의 구문을 가르쳤습니다. - 게임 (강화 학습): 그들은 AI 와 게임을 했습니다. 올바른 지점을 보고 정답을 맞히면 "간식" (보상) 을 받았습니다. 잘못된 곳을 보거나, 너무 많이 보거나, 단순히 추측하면 "시간 제한" (페널티) 을 받았습니다.
시간이 지남에 따라 AI 는 전체 이미지를 멍하니 바라보는 것이 아니라, 필요한 단서에 전략적으로 초점을 맞추는 것이 이기는 가장 현명한 방법임을 배웠습니다.
결과: 더 똑똑하고 빠름
이 논문은 이 새로운 방법이 엄청난 개선이라고 주장합니다:
- 더 나은 정확도: 고해상도 이미지 (차트의 작은 텍스트나 사진 속 작은 물체 등) 와 관련된 어려운 테스트에서 GazeVLM 은 다른 최상위 모델보다 훨씬 높은 점수를 받았습니다. 약 4% 에서 5% 더 높은 점수를 기록했는데, 이는 AI 세계에서 엄청난 도약입니다.
- 낭비 감소: 다른 "줌인" 도구들이 하듯이 이미지를 잘라내어 다시 스캔할 필요가 없기 때문에, 훨씬 적은 컴퓨팅 파워를 사용합니다. 동일한 문제를 해결하는 데 약 5 배 적은 단어를 생성하여 훨씬 빠르고 저렴하게 실행됩니다.
- 내재화된 기술: 흥미롭게도 AI 가 이 기술을 배우면, 최종 테스트 중에도 "음소거 버튼" (편향) 을 켜둘 필요가 없었습니다. 인간 형사가 눈을 집중하는 방법을 알려주는 매뉴얼이 필요하지 않듯이, AI 는 집중하는 습관을 그렇게 잘 배워서 자연스럽게 수행할 수 있게 되었습니다.
요약
GazeVLM 은 컴퓨터에게 한 번에 전체 바다를 삼키려 하지 말고 올바른 컵에서 한 모금 마시는 법을 배우게 하는 것과 같습니다. AI 에게 자신의 내부 주의를 사용하여 자발적으로 "줌인"하고 "줌아웃"할 수 있는 능력을 부여함으로써, 시각적 퍼즐을 더 정확하게, 더 빠르게, 그리고 소음에 압도되지 않고 해결합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.