← 최신 논문
💻 computer science

Tell Model Where to Look: Mitigating Hallucinations in MLLMs by Vision-Guided Attention

이 논문은 MLLM 의 환각 현상을 완화하기 위해 시각 토큰의 의미 정보를 활용해 정확한 시각적 기반을 구축하고 이를 생성 과정에서 동적으로 적용하는 훈련 없는 방법인 '비전 가이드 어텐션 (VGA)'을 제안하며, 이를 통해 다양한 벤치마크에서 최첨단 성능을 달성함을 보여줍니다.

원저자: Jianfei Zhao, Feng Zhang, Xin Sun, Chong Feng, Zhixing Tan

게시일 2026-03-25
📖 3 분 읽기☕ 가벼운 읽기

원저자: Jianfei Zhao, Feng Zhang, Xin Sun, Chong Feng, Zhixing Tan

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

🕵️‍♂️ 핵심 비유: "눈이 멀어 보이는 학생"과 "현명한 선생님"

생각해 보세요. AI 모델은 사진을 보고 설명하는 학생입니다. 그런데 이 학생은 사진 속의 중요한 부분 (예: '개', '자전거') 을 정확히 찾아내지 못하고, 머릿속에만 있는 상상으로 "아마 저기 개가 있겠지?"라고 말하며 엉뚱한 소리를 합니다. 이것이 바로 환각입니다.

기존의 방법들은 이 학생에게 더 많은 사진을 보여주거나 (데이터 학습), 더 엄격하게 채점하는 (손실 함수) 식으로 해결하려 했습니다. 하지만 이는 시간이 너무 오래 걸리고, 새로운 모델이 나올 때마다 다시 시작해야 하는 번거로움이 있습니다.

이 논문이 제안한 **VGA(Vision-Guided Attention)**는 "학생이 스스로 사진을 잘 볼 수 있도록 도와주는 현명한 선생님" 같은 역할을 합니다.

1. 학생의 '눈'을 찾아주는 기술 (VSC: 시각적 의미 신뢰도)

일반적으로 AI 는 사진을 여러 조각 (토큰) 으로 나누어 봅니다. 그런데 이 조각들 중 어떤 것이 '개'에 해당하는지, 어떤 것이 '하늘'에 해당하는지 AI 스스로도 잘 모를 때가 많습니다.

이 연구팀은 **"AI 가 사진을 입력받았을 때, 각 조각이 어떤 의미를 담고 있는지 스스로 계산한 점수"**를 발견했습니다. 이를 **VSC(Visual Semantic Confidence)**라고 부릅니다.

  • 비유: 학생이 사진을 볼 때, "여기엔 개가 있을 것 같아 (점수 90)", "저기엔 그냥 하늘이야 (점수 10)"라고 스스로에게 속삭이는 것입니다.
  • 이 점수를 이용하면, AI 가 "아, 내가 진짜로 '개'를 본 건 이쪽 조각이구나!"라고 정확한 위치를 파악할 수 있게 됩니다.

2. 주의를 집중시키는 지시 (VGA: 시야 유도 주의)

이제 학생이 "개"가 어디에 있는지 알았습니다. 하지만 AI 는 여전히 그 '개' 조각에 집중하지 않고, 주변 잡동사니를 보며 망설일 수 있습니다.

여기서 VGA가 등장합니다. VGA 는 **"지금 '개'가 있는 이 조각에 집중해!"**라고 AI 의 주의를 강제로 끄집어내는 역할을 합니다.

  • 비유: 시험을 치는 학생이 중요한 문제 (사진 속 개) 를 놓치지 않도록, 선생님이 **"이 부분만 집중해서 봐!"**라고 손가락으로 가리켜 주는 것과 같습니다.
  • 이 과정은 학습 없이도 가능하며, AI 가 한 번만 사진을 보면 (Forward Pass) 바로 적용할 수 있어 매우 빠릅니다.

3. 그림 설명할 때의 '동작 조절' (PVG: 프로그래밍된 시야 유도)

특히 **사진 설명 (Image Captioning)**을 할 때는 상황이 다릅니다. "개"를 설명했으면, 이제 "자전거"나 "나무"를 설명해야 하죠. 계속 '개'만 보면 설명이 반복됩니다.

이 논문은 PVG라는 기술을 추가했습니다.

  • 비유: 선생님이 학생에게 "지금 '개'에 대해 다 설명했으니, 이제 개 부분을 지우고 '자전거'가 있는 쪽으로 시선을 옮겨!"라고 동적으로 지시하는 것입니다.
  • 이미 말한 내용은 무시하고, 아직 말하지 않은 새로운 부분으로 주의를 자연스럽게 이동시켜, 빠짐없고 중복되지 않는 설명을 만들어냅니다.

🚀 왜 이 방법이 특별한가요?

  1. 학습 불필요 (Training-Free): AI 를 다시 가르칠 필요가 없습니다. 이미 만들어진 모델에 바로 끼워 넣으면 (Plug-and-play) 효과가 납니다.
  2. 매우 빠름: AI 가 사진을 한 번만 보면 되므로, 속도가 느려지지 않습니다. (기존 방법들은 여러 번 계산해야 해서 느렸습니다.)
  3. 최신 기술 호환: 최신 AI 가속 기술 (FlashAttention) 과도 완벽하게 잘 어울립니다.
  4. 정확도 향상: 실험 결과, AI 가 "없는 것을 있는 것처럼" 말하는 실수 (환각) 가 크게 줄어들었고, 사진 설명의 정확도도 높아졌습니다.

💡 한 줄 요약

**"AI 가 사진을 볼 때, 스스로 "어디에 무엇이 있는지"를 계산해서, 중요한 부분에 집중하도록 눈가리개를 해주는 똑똑한 보조 도구"**입니다.

이 기술 덕분에 AI 는 이제 더 이상 환상에 사로잡히지 않고, 실제 사진에 있는 것을 정확하게 보고 말할 수 있게 되었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →