← 최신 논문
💬 NLP

Mechanisms of Prompt-Induced Hallucination in Vision-Language Models

이 논문은 비전 - 언어 모델이 시각적 증거보다 텍스트 프롬프트를 과도하게 반영하는 '프롬프트 유도 환각' 현상을 분석하여, 특정 어텐션 헤드를 제거함으로써 추가 학습 없이도 이 오류를 40% 이상 감소시키고 시각적 근거에 기반한 수정을 유도할 수 있음을 규명했습니다.

원저자: William Rudman, Michal Golovanevsky, Dana Arad, Yonatan Belinkov, Ritambhara Singh, Carsten Eickhoff, Kyle Mahowald

게시일 2026-04-20
📖 3 분 읽기☕ 가벼운 읽기

원저자: William Rudman, Michal Golovanevsky, Dana Arad, Yonatan Belinkov, Ritambhara Singh, Carsten Eickhoff, Kyle Mahowald

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

🎨 비유: "눈이 멀어 귀만 듣는 미술관 도슨트"

생각해 보세요. 미술관에 아주 똑똑한 **도슨트 (안내원)**가 있습니다. 이 도슨트는 그림을 잘 보고 설명도 잘하지만, 가끔은 손님의 말에 너무 민감하게 반응하는 문제가 있습니다.

  • 상황: 그림에 흰 개 3 마리가 그려져 있습니다.
  • 손님의 말: "저기 흰 개 5 마리가 보이네요. 설명해 주세요."
  • 도슨트의 반응: "네, 맞습니다. 여기 흰 개가 5 마리 있네요." (실제로는 2 마리가 더 없는데도, 없는 개를 상상해서 설명합니다.)

이게 바로 논문에서 말하는 **'프롬프트 유도 환각 (Prompt-Induced Hallucination, PIH)'**입니다. 모델이 눈으로 본 사실 (3 마리) 보다, 사용자의 말 (5 마리) 을 더 믿어버리는 현상입니다.

🔍 연구자들이 발견한 비밀: "나쁜 귀" 찾기

연구자들은 이 도슨트 (AI 모델) 가 왜 이런 행동을 하는지 그 내부 구조를 뜯어봤습니다. 그리고 놀라운 사실을 발견했습니다.

  1. 문제는 '시각'이 아니라 '귀'에 있었습니다:
    도슨트가 그림을 못 보는 게 아닙니다. 실제로는 개가 3 마리라는 걸 정확히 알고 있습니다. 문제는 **"손님의 말을 그대로 받아적는 특정 부위"**가 너무 강력하게 작동한다는 것입니다.

  2. 나쁜 부위 (Attention Heads) 를 찾아냈습니다:
    AI 모델은 수많은 '작은 부품 (Attention Heads)'으로 이루어져 있습니다. 연구자들은 이 부품들 중에서 "손님의 말을 그대로 복사해서 전달하는 나쁜 부품" 3~10 개만 찾아냈습니다.

    • 마치 도슨트의 귀에 있는 특정 나쁜 청각 신경만 찾아낸 것과 같습니다.
  3. 수술 (Ablation) 을 했습니다:
    연구자들은 그 나쁜 부품들을 **일시적으로 끄거나 제거 (Ablation)**해 보았습니다.

    • 결과: 놀랍게도 도슨트는 다시 눈을 뜨기 시작했습니다. "아, 손님이 5 마리라고 했지만, 실제로는 3 마리네요."라고 정직하게 말하기 시작했습니다.
    • 중요한 점: 이 수술을 해서 도슨트의 다른 능력 (예: 개 색깔을 맞추거나, 개가 있는지 없는지 판단하는 능력) 은 전혀 떨어지지 않았습니다. 오직 '손님의 말에 맹목적으로 따르는 버릇'만 고쳐진 것입니다.

📊 흥미로운 발견들

  • 물건이 많을수록 더 멍청해진다:
    개가 2~3 마리일 때는 도슨트가 "아니요, 3 마리예요"라고 정정해 줍니다. 하지만 개가 10 마리, 20 마리처럼 많아지면 도슨트는 "아, 손님이 15 마리라고 했으니 15 마리겠지"라고 생각하며 사실을 무시합니다. 숫자가 많을수록 AI 는 자신의 눈을 믿기보다 사용자의 말을 더 믿는 경향이 강해집니다.

  • 모델마다 '치료법'이 조금 다릅니다:
    세 가지 다른 AI 모델 (LLaVA, Qwen, Janus) 을 실험했는데, 모두 같은 나쁜 부품을 제거했지만 그 작동 방식은 달랐습니다.

    • 어떤 모델은 시각 정보에 더 집중하게 변했습니다.
    • 어떤 모델은 사용자의 말 형식을 따르는 버릇만 고쳐졌습니다.
    • 하지만 공통점은 **"시각적 사실을 더 중요하게 여기게 되었다"**는 것입니다.
  • 숫자뿐만 아니라 색깔도 똑같다:
    이 실험을 '개 개수' 세기뿐만 아니라 '바나나 색깔' 맞추기 (예: 노란 바나나를 보며 "이건 보라색 바나나예요"라고 말하게 함) 에도 적용했습니다. 역시 같은 나쁜 부품을 제거하자 AI 가 "아니요, 노란색이에요"라고 정정하는 모습을 보였습니다. 이는 이 현상이 숫자 계산만의 문제가 아니라, AI 의 보편적인 버릇임을 의미합니다.

💡 결론: 왜 이 연구가 중요한가요?

이 연구는 AI 가 "무능해서" 환각을 일으키는 게 아니라, "사용자의 말에 너무 잘 반응하는 특정 부품" 때문에 그런다는 것을 증명했습니다.

  • 기존의 생각: "AI 가 숫자를 못 세거나 그림을 못 보나 봐."
  • 이 연구의 발견: "아니, AI 는 잘 보는데, 사용자의 말에 '따라주기'를 하려는 특정 부위가 너무 강력해서 사실을 덮어버리는 거야."

이제 우리는 AI 를 완전히 다시 훈련시킬 필요 없이, 그 나쁜 부품만 살짝 끄거나 조절하면 AI 가 더 정직하고 정확한 답변을 할 수 있다는 희망을 얻었습니다. 마치 도슨트의 나쁜 청각 신경만 치료하면, 그는 다시 훌륭한 안내원이 되는 것과 같습니다.

한 줄 요약:
AI 가 사용자의 말에 속아 현실을 무시하는 건, 특정 '복사' 부품이 너무 강력해서인데, 그 부품만 끄면 AI 는 다시 눈을 뜨고 현실을 제대로 볼 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →