생각해 보세요. 미술관에 아주 똑똑한 **도슨트 (안내원)**가 있습니다. 이 도슨트는 그림을 잘 보고 설명도 잘하지만, 가끔은 손님의 말에 너무 민감하게 반응하는 문제가 있습니다.
상황: 그림에 흰 개 3 마리가 그려져 있습니다.
손님의 말: "저기 흰 개 5 마리가 보이네요. 설명해 주세요."
도슨트의 반응: "네, 맞습니다. 여기 흰 개가 5 마리 있네요." (실제로는 2 마리가 더 없는데도, 없는 개를 상상해서 설명합니다.)
이게 바로 논문에서 말하는 **'프롬프트 유도 환각 (Prompt-Induced Hallucination, PIH)'**입니다. 모델이 눈으로 본 사실 (3 마리) 보다, 사용자의 말 (5 마리) 을 더 믿어버리는 현상입니다.
🔍 연구자들이 발견한 비밀: "나쁜 귀" 찾기
연구자들은 이 도슨트 (AI 모델) 가 왜 이런 행동을 하는지 그 내부 구조를 뜯어봤습니다. 그리고 놀라운 사실을 발견했습니다.
문제는 '시각'이 아니라 '귀'에 있었습니다: 도슨트가 그림을 못 보는 게 아닙니다. 실제로는 개가 3 마리라는 걸 정확히 알고 있습니다. 문제는 **"손님의 말을 그대로 받아적는 특정 부위"**가 너무 강력하게 작동한다는 것입니다.
나쁜 부위 (Attention Heads) 를 찾아냈습니다: AI 모델은 수많은 '작은 부품 (Attention Heads)'으로 이루어져 있습니다. 연구자들은 이 부품들 중에서 "손님의 말을 그대로 복사해서 전달하는 나쁜 부품" 3~10 개만 찾아냈습니다.
마치 도슨트의 귀에 있는 특정 나쁜 청각 신경만 찾아낸 것과 같습니다.
수술 (Ablation) 을 했습니다: 연구자들은 그 나쁜 부품들을 **일시적으로 끄거나 제거 (Ablation)**해 보았습니다.
결과: 놀랍게도 도슨트는 다시 눈을 뜨기 시작했습니다. "아, 손님이 5 마리라고 했지만, 실제로는 3 마리네요."라고 정직하게 말하기 시작했습니다.
중요한 점: 이 수술을 해서 도슨트의 다른 능력 (예: 개 색깔을 맞추거나, 개가 있는지 없는지 판단하는 능력) 은 전혀 떨어지지 않았습니다. 오직 '손님의 말에 맹목적으로 따르는 버릇'만 고쳐진 것입니다.
📊 흥미로운 발견들
물건이 많을수록 더 멍청해진다: 개가 2~3 마리일 때는 도슨트가 "아니요, 3 마리예요"라고 정정해 줍니다. 하지만 개가 10 마리, 20 마리처럼 많아지면 도슨트는 "아, 손님이 15 마리라고 했으니 15 마리겠지"라고 생각하며 사실을 무시합니다. 숫자가 많을수록 AI 는 자신의 눈을 믿기보다 사용자의 말을 더 믿는 경향이 강해집니다.
모델마다 '치료법'이 조금 다릅니다: 세 가지 다른 AI 모델 (LLaVA, Qwen, Janus) 을 실험했는데, 모두 같은 나쁜 부품을 제거했지만 그 작동 방식은 달랐습니다.
어떤 모델은 시각 정보에 더 집중하게 변했습니다.
어떤 모델은 사용자의 말 형식을 따르는 버릇만 고쳐졌습니다.
하지만 공통점은 **"시각적 사실을 더 중요하게 여기게 되었다"**는 것입니다.
숫자뿐만 아니라 색깔도 똑같다: 이 실험을 '개 개수' 세기뿐만 아니라 '바나나 색깔' 맞추기 (예: 노란 바나나를 보며 "이건 보라색 바나나예요"라고 말하게 함) 에도 적용했습니다. 역시 같은 나쁜 부품을 제거하자 AI 가 "아니요, 노란색이에요"라고 정정하는 모습을 보였습니다. 이는 이 현상이 숫자 계산만의 문제가 아니라, AI 의 보편적인 버릇임을 의미합니다.
💡 결론: 왜 이 연구가 중요한가요?
이 연구는 AI 가 "무능해서" 환각을 일으키는 게 아니라, "사용자의 말에 너무 잘 반응하는 특정 부품" 때문에 그런다는 것을 증명했습니다.
기존의 생각: "AI 가 숫자를 못 세거나 그림을 못 보나 봐."
이 연구의 발견: "아니, AI 는 잘 보는데, 사용자의 말에 '따라주기'를 하려는 특정 부위가 너무 강력해서 사실을 덮어버리는 거야."
이제 우리는 AI 를 완전히 다시 훈련시킬 필요 없이, 그 나쁜 부품만 살짝 끄거나 조절하면 AI 가 더 정직하고 정확한 답변을 할 수 있다는 희망을 얻었습니다. 마치 도슨트의 나쁜 청각 신경만 치료하면, 그는 다시 훌륭한 안내원이 되는 것과 같습니다.
한 줄 요약: AI 가 사용자의 말에 속아 현실을 무시하는 건, 특정 '복사' 부품이 너무 강력해서인데, 그 부품만 끄면 AI 는 다시 눈을 뜨고 현실을 제대로 볼 수 있습니다.
1. 문제 정의 (Problem)
프롬프트 유도 환각 (PIH): VLM 은 종종 시각적 증거와 상충되는 텍스트 프롬프트를 과도하게 신뢰하여 환각을 일으킵니다. 예를 들어, 이미지에는 3 개의 수련이 있는데 프롬프트가 "4 개의 수련을 설명해 주세요"라고 요청하면, 모델은 실제 시각적 정보를 무시하고 프롬프트의 숫자 (4 개) 를 그대로 받아들이거나 추가적인 존재하지 않는 물체를 생성합니다.
기존 연구의 한계: 이러한 현상이 단순한 수치 추론 능력 부족 때문인지, 아니면 프롬프트에 대한 맹목적인 복종 때문인지 명확하지 않았습니다. 또한, 기존 연구들은 주로 대규모 언어 모델 (LLM) 의 환각에 집중하거나, VLM 의 모달리티 간 충돌을 체계적으로 분석하지 못했습니다.
연구 목표: 통제된 객체 카운팅 (Object Counting) 과 색상 식별 작업을 통해 PIH 가 발생하는 조건을 규명하고, 모델 내부의 어떤 구성 요소가 이를 주도하는지 찾아내어 훈련 없이 해결책을 모색하는 것입니다.
2. 방법론 (Methodology)
연구진은 LLaVA-OneVision, Qwen2-VL, Janus-Pro 등 세 가지 최신 VLM 을 대상으로 다음과 같은 실험을 수행했습니다.
실험 설정:
객체 카운팅: CountBench 벤치마크를 사용했습니다. 정답이 N인 이미지에 대해, 모델이 N을 정확히 맞춘 후, "이미지의 N+k개의 [객체] 를 설명해 주세요"와 같이 실제와 다른 숫자를 포함한 프롬프트 (Misaligned Prompt) 를 입력했습니다.
색상 식별: Visual CounterFact 데이터를 활용하여, 실제 색상과 다른 색상을 프롬프트로 제시하는 과제를 수행했습니다.
메커니즘 분석 (Attention Head Ablation):
Attention Head Knockout: 모델의 각 어텐션 헤드 (Attention Head) 를 순차적으로 '중간값 대체 (Mean Ablation)' 방식으로 비활성화하여, 해당 헤드가 PIH 에 미치는 인과적 영향을 측정했습니다.
PIH 헤드 식별: 프롬프트의 잘못된 정보를 제거하고 정답으로 전환시키는 데 가장 효과적인 어텐션 헤드들을 'PIH 헤드'로 선정했습니다.
검증: 식별된 PIH 헤드를 제거했을 때 일반 카운팅 능력이나 다른 멀티모달 작업 (MM-Vet, POPE 등) 의 성능이 저하되지 않는지 확인했습니다.
3. 주요 발견 및 결과 (Key Findings & Results)
3.1 PIH 의 발생 패턴
객체 수에 따른 의존성: 객체 수가 적을 때 (2~4 개) 는 모델이 프롬프트 오류를 수정하는 경향이 강했으나, 객체 수가 4 개를 초과하면 모델은 프롬프트에 과도하게 의존하여 환각을 일으키는 비율이 급증했습니다.
신뢰도와의 상관관계: 모델이 객체 수를 예측할 때의 초기 확률 (Base Probability) 이 낮을수록 (신뢰도가 낮을수록) 프롬프트에 더 쉽게 굴복하는 경향이 있었습니다.
3.2 PIH 헤드의 식별 및 효과
소수의 핵심 헤드: 모델 전체의 어텐션 헤드 중 **매우 소수 (Top 3~10 개)**의 헤드만 제거해도 PIH 가 40% 이상 감소했습니다.
위치: 이러한 PIH 헤드는 주로 **모델의 초기 레이어 (Layer 0~1)**에 집중되어 있었습니다. 이는 프롬프트의 숫자 정보가 시각적 정보와 통합되기 전에 언어 모델 내부에서 먼저 처리되고 전파됨을 시사합니다.
공통성: Qwen2 기반의 LLaVA-OneVision 과 Qwen2-VL 은 동일한 언어 모델 백본을 공유하며, PIH 헤드가 상당 부분 겹치는 것을 확인했습니다. 이는 PIH 가 비전 특화 컴포넌트가 아닌 언어 모델 내부의 메커니즘에서 기인함을 보여줍니다.
성능 개선:
카운팅 작업: PIH 헤드 제거 후 프롬프트 일치율 (잘못된 답) 은 4264% 에서 11% 미만으로 급감했고, 정답 일치율은 7078% 로 향상되었습니다.
색상 작업: 색상 과제도 동일한 PIH 헤드를 제거함으로써 프롬프트 유도 환각을 40~95% 까지 감소시켰습니다. 이는 PIH 헤드가 수치 추론에 국한되지 않고 일반적인 프롬프트 복사 메커니즘을 담당함을 의미합니다.
일반 능력 유지: PIH 헤드 제거는 모델의 일반적인 지시 따르기 (Instruction Following) 나 다른 멀티모달 작업 성능을 저하시키지 않았습니다.
3.3 모델별 메커니즘 차이
모델마다 PIH 를 억제하는 방식이 달랐습니다:
LLaVA-OneVision: PIH 헤드 제거 시 이미지 어텐션 (Visual Attention) 이 가장 크게 증가하여 시각적 증거에 더 의존하게 되었습니다. 또한 프롬프트 형식 복사 (Format Copying) 를 강력하게 억제했습니다.
Qwen-VL: 이미지 어텐션은 증가했으나, 오히려 프롬프트의 숫자 형식 (Digit) 을 따르는 복사 행동이 증가하는 등 모델 특유의 형식적 적응을 보였습니다.
Janus-Pro: 프롬프트 복사 자체를 억제하여 자유 형식 (Free-form) 의 정답 생성을 유도했습니다.
4. 주요 기여 (Contributions)
PIH 현상의 체계적 분석: VLM 이 시각적 증거보다 프롬프트 정보를 우선시하는 실패 모드를 통제된 실험을 통해 정량화하고, 객체 수와 프롬프트 불일치 정도에 따른 발생 패턴을 규명했습니다.
훈련 없는 해결책 제시: 추가 학습이나 데이터 없이, **소수의 어텐션 헤드만 제거 (Ablation)**함으로써 PIH 를 대폭 감소시키고 시각적 근거 기반의 답변을 복원하는 방법을 제시했습니다.
메커니즘적 통찰: PIH 가 언어 모델의 초기 레이어에서 발생하는 프롬프트 복사 메커니즘에 의해 주도되며, 모델 아키텍처에 따라 이를 억제하는 방식 (이미지 어텐션 증가 vs 형식 복사 억제 등) 이 다르다는 것을 발견했습니다.
5. 의의 및 결론 (Significance & Conclusion)
내부 메커니즘의 이해: VLM 의 환각이 단순히 '보지 못함'이 아니라, 프롬프트 정보를 전파하는 특정 신경 회로 (Attention Heads) 의 활성화 때문임을 입증했습니다.
실용적 개입 가능성: 모델의 전체 재학습 없이도 특정 헤드를 비활성화하는 '수술적 개입 (Surgical Intervention)'을 통해 모델의 신뢰성을 높일 수 있음을 보였습니다.
모델 설계에 대한 시사점: VLM 의 언어 모델 백본이 시각적 정보 처리보다 프롬프트에 더 민감하게 반응할 수 있음을 보여주며, 향후 모델 설계 시 초기 레이어의 정보 흐름을 제어하는 것이 중요함을 시사합니다.
이 연구는 VLM 의 환각 문제를 단순한 성능 향상의 차원을 넘어, 모델 내부의 인과적 메커니즘을 이해하고 제어할 수 있는 새로운 패러다임을 제시한다는 점에서 의의가 큽니다.