Logit Lens Supervision for Patch-Level Explanations in Vision-Language Models
이 논문은 구조적 변경이나 광범위한 재학습 없이도 시각적 토큰 임베딩을 그에 상응하는 텍스트 개념과 정렬함으로써 시각-언어 모델의 패치 수준 설명력을 향상시키고, 이를 통해 접지(grounding) 능력을 개선하며 환각 현상을 줄이는 경량 보조 목적 함수인 로짓 렌즈 손실(Logit Lens Loss, LLL)을 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신에게 사진을 보고 그에 대한 이야기를 들려줄 수 있는 아주 똑똑한 로봇 친구가 있다고 상상해 보세요. 이 로봇은 두 가지 매우 다른 부분으로 만들어졌습니다. 바로 사진을 작은 색상 사각형(패치)의 격자로 보는 '눈'과, 단어를 사용하여 이야기를 쓰는 데 전문가인 '두뇌'입니다. 당신이 "고양이가 어디 있니?"라고 물으면, 로봇의 눈은 사진 속의 모든 개별 사각형에 대한 신호를 두뇌로 보냅니다. 그러면 두뇌는 이 그림 신호와 자신의 단어 신호를 혼합하여 정답을 찾아냅니다.
문제는 이 그림 신호가 두뇌를 통과하면서 군중 속에서 조금씩 길을 잃는다는 점입니다. 두의는 말을 하는 데 너무 능숙해서 때때로 사진 사각형의 구체적인 세부 사항을 무시하기 시작하거나, 더 심하게는 그림 신호를 단어 신호와 너무 철저하게 뒤섞어서 로봇이 어떤 사각형이 실제로 고양이에게 속하는 것인지 잊어버리기도 합니다. 로봇은 단순히 "고양이"라고 정답을 맞힐 수는 있지만, 그것은 사진 속의 고양이를 실제로 '보고' 맞히는 것이 아니라 단어를 바탕으로 추측하는 것일 뿐입니다. 이것은 매우 중요한 문제입니다. 왜냐하면 우리가 이 로봇들을 신뢰하고 싶거나, 로면이 왜 사진 속에 고양이가 있다고 생각하는지 알고 싶을 때, 우리는 로봇이 사진의 정확히 어느 부분을 보고 있는지 볼 수 있어야 하기 때문입니다. 만약 로봇이 고양이를 가리키지 못한다면, 그것은 환각(hallucination)을 일으키고 있는 것, 즉 없는 것을 지어내고 있는 것일 수 있습니다.
이 논문은 바로 그 문제를 다룹니다. 저자인 파르사 에스마엘카니(Parsa Esmaeilkhani)와 롱인 얀 라테키(Longin Jan Latecki)는 현대의 "시각-언어 모델(VLM)"에서 특정 이미지 패치와 그것을 설명하는 단어 사이의 연결이 시스템을 통해 데이터가 이동함에 따라 약해지고 흐릿해진다는 점에 주목했습니다. 이를 해결하기 위해 그들은 **로짓 렌즈 손실(Logit Lens Loss, LLL)**이라는 새로운 학습 기술을 발명했습니다.
로봇의 두뇌를 모든 책이 하나의 단어를 나타내는 거대한 도서관이라고 생각해 보세요. 보통 로봇은 다음에 말할 올바른 책을 고르는 법(예: 질문에 답하기)만 배웁니다. 저자들은 만약 로봇이 고양이의 패치를 보고 있다면, 로봇이 말을 하기 전이라도 그 특정 패치가 도서관에 "고양이"라는 단어를 속삭이고 있어야 한다는 점을 깨달았습니다. 그들은 새로운 학습 규칙을 만들었습니다. 로봇이 고양이를 포함하는 패치를 볼 때마다, 그 패치가 도서관의 어휘 목록에서 "고양이"라는 단어를 강력하게 예측하도록 강제하는 것입니다. 그들은 로봇의 내부를 들여다보고 이미지 패치들이 비밀리에 어떤 단어들을 생각하고 있는지 확인하는 도구인 "로짓 렌즈(Logit Lens)"를 사용했기 때문에 이를 "로짓 렌즈 손실"이라고 부릅니다.
가장 멋진 점은 로봇을 다시 만들거나 새로운 부품을 추가할 필요가 없었다는 것입니다. 그들은 단지 학습 규칙을 약간 수정했을 뿐입니다. 그들이 이 새로운 규칙을 두 가지 인기 있는 로봇(LLaVA-v1.5 및 Qwen2.5-VL)에 테스트했을 때, 결과는 마치 조명을 켜는 것과 같았습니다. 이전에는 로봇의 "신뢰도 지도(confidence map, 객체가 어디에 있다고 생각하는지 보여주는 히트맵)"가 안개 낀 창문처럼 흐릿하고 흩어져 있었습니다. 새로운 규칙을 사용한 후, 지도는 선명하고 정밀해졌으며, 고양이가 있는 곳을 정확하게 비추었습니다.
이 논문은 이 간단한 수정 작업이 얼마나 큰 역할을 하는지 보여줍니다. 이는 로봇이 사진 속 객체를 찾는 능력(그라운딩, grounding)을 훨씬 향상시키고, 존재하지 않는 객체를 지어내는 경우(환각)를 줄이며, 심지어 한 번도 본 적 없는 새로운 사진 속의 객체를 가리키는 데에도 도움을 줍니다. 놀랍게도, 이 방식은 로봇의 질문 답변 능력이나 이야기하기 능력을 저하시키지 않았습니다. 사실, 로봇의 언어 능력은 그대로 유지되었습니다. 저자들은 그림 신호를 원래의 의미와 계속 연결해 둠으로써, 로봇이 더 똑똑해질 뿐만 아니라 자신이 보고 있는 것에 대해 더 정직해진다고 제안합니다. 이것은 학생에게 단순히 정답을 암기하는 것이 아니라, 보고 있는 지도를 실제로 이해하도록 가르치는 것과 같습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.