← 최신 논문
💻 computer science

VGS-Decoding: Visual Grounding Score Guided Decoding for Hallucination Mitigation in Medical VLMs

이 논문은 의료용 시각 - 언어 모델의 환각 현상을 완화하기 위해, 이미지 왜곡에 따른 토큰 확률 변화를 분석하여 시각적 의존도를 기반으로 생성 확률을 동적으로 재가중하는 훈련 없는 추론 방법인 'VGS-Decoding'을 제안합니다.

원저자: Govinda Kolli, Adinath Madhavrao Dukre, Behzad Bozorgtabar, Dwarikanath Mahapatra, Imran Razzak

게시일 2026-03-24
📖 3 분 읽기☕ 가벼운 읽기

원저자: Govinda Kolli, Adinath Madhavrao Dukre, Behzad Bozorgtabar, Dwarikanath Mahapatra, Imran Razzak

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

의료 AI 가 "망상"을 멈추게 하는 새로운 방법: VGS-Decoding

이 논문은 의료용 인공지능 (AI) 이 환자를 진단할 때, 눈으로 본 사실 대신 머릿속의 상상으로 거짓말을 하는 '환각 (Hallucination)' 현상을 해결하기 위해 개발된 새로운 기술을 소개합니다.

이 기술을 쉽게 이해할 수 있도록 맛있는 요리와 요리사에 비유해 설명해 드리겠습니다.


1. 문제: AI 요리사의 "상상력 과다"

의료 AI 는 엑스레이나 MRI 같은 **사진 (재료)**을 보고 의사가 질문하면 **답 (요리 레시피)**을 만들어냅니다.
하지만 문제는 AI 가 사진을 제대로 보지 않고, **"아마도 이런 병이 있을 거야"라는 과거의 경험 (언어적 편견)**만 믿고 대답할 때가 많다는 것입니다.

  • 비유: 마치 눈을 감고 요리를 하는 요리사처럼요.
    • 실제 접시에는 '감자'가 있는데, 요리사는 "아, 보통은 '고기'가 나오니까 고기라고 말해!"라고 상상해서 대답합니다.
    • 환자에게는 치명적인 실수가 될 수 있습니다. "왼쪽 폐에 문제가 있다"고 말했는데, 실제로는 "오른쪽"에 문제가 있을 수도 있으니까요.

2. 해결책: "VGS-Decoding" (시각적 근거 점수)

이 논문은 AI 가 대답을 할 때, **"이 단어가 진짜 사진에 기반한 것일까, 아니면 그냥 상상의 산물일까?"**를 실시간으로 체크하는 새로운 방법을 제안합니다. 이를 VGS-Decoding이라고 부릅니다.

핵심 아이디어: "사진을 흐리게 해보자"

이 방법은 AI 가 대답을 내기 직전, 원본 사진을 일부러 흐리게 (노이즈를 섞어) 변형시켜 봅니다.

  • 진짜 근거가 있는 단어 (시각적 근거):
    • 사진을 흐리게 하면 AI 는 "아, 이 부분은 흐려서 못 봤네"라고 생각해서 그 단어를 말할 확률이 떨어집니다.
    • 비유: 진짜 감자가 접시에 있다면, 불빛을 어둡게 하면 "감자"라고 말하기가 어려워집니다.
  • 망상 (환각) 이 있는 단어:
    • 사진을 흐리게 해도 AI 는 "아무튼 고기가 나오겠지"라고 생각해서 그 단어를 말할 확률이 변하지 않거나 오히려 늘어납니다.
    • 비유: 접시에 감자가 없어도, 요리사가 "고기가 있어야지"라고 고집하면, 불빛이 어두워져도 여전히 "고기"라고 말합니다.

이 차이를 이용해 **시각적 근거 점수 (VGS)**를 계산합니다.

  • 점수가 높음 (양수): 사진에 진짜로 있는 것 → 확신을 가지고 강조!
  • 점수가 낮음 (음수): 사진과 상관없는 상상 → 억누르고 삭제!

3. 작동 원리: AI 의 "실시간 수정"

AI 가 한 글자씩 말을 만들어갈 때, 이 시스템은 다음과 같이 작동합니다.

  1. 원본 사진흐린 사진을 동시에 AI 에게 보여줍니다.
  2. AI 가 "다음 단어는 뭐지?"라고 고민할 때, 두 가지 경우의 확률을 비교합니다.
  3. 비유: AI 는 "내가 지금 '고기'라고 말하고 싶은데, 사진을 흐리게 했을 때 '고기'라고 말하고 싶은 마음이 줄어들지 않았네? 이건 내 상상일 거야!"라고 판단합니다.
  4. 그래서 AI 는 '고기'라는 단어를 선택할 확률을 낮추고, 사진에 진짜로 있는 '감자'라는 단어를 선택할 확률을 높여줍니다.

이 과정은 AI 를 훈련시키는 것이 아니라, **대화를 나누는 순간 (추론 단계)**에 자동으로 적용되는 '보정 장치'입니다.

4. 왜 이 방법이 특별한가요?

기존의 방법들은 AI 의 대답을 무작위로 깎아내거나, 복잡한 수학적 공식을 써서 수정하려 했지만, 의료 분야에서는 오히려 성능을 떨어뜨리기도 했습니다. (의료용어는 짧고 정확해야 하기 때문입니다.)

하지만 이 VGS-Decoding은:

  • 훈련이 필요 없습니다: 이미 만들어진 AI 를 그대로 쓸 수 있습니다.
  • 하나하나 조절합니다: 문장 전체를 막는 게 아니라, '망상'인 단어만 골라서 수정합니다.
  • 성능이 좋습니다: 실험 결과, 기존 AI 들의 정확도를 최대 9% 이상 끌어올렸습니다. (이는 의료 현장에서 매우 큰 차이입니다.)
  • 빠릅니다: 계산량이 두 배로 늘어나지만, 여전히 실시간으로 쓸 수 있을 정도로 빠릅니다.

5. 결론

이 기술은 의료 AI 가 "눈을 뜨고" 환자를 보게 만드는 안경과 같습니다.

AI 가 "아마도 그럴 거야"라고 상상하는 대신, **"이 사진에 진짜로 보이니까 이렇게 답해야지"**라고 생각하게 만들어줍니다. 이는 잘못된 진단을 막고, 환자에게 더 안전한 의료 서비스를 제공하는 데 큰 도움이 될 것입니다.

한 줄 요약:

"AI 가 사진을 흐리게 했을 때 변하지 않는 대답은 '상상'이고, 변하는 대답은 '사실'이다. 이 차이를 이용해 AI 가 거짓말을 못 하게 막는 기술!"

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →