← 최신 논문
💬 NLP

Towards Mitigating Hallucinations in Large Vision-Language Models by Refining Textual Embeddings

본 논문은 텍스트 임베딩을 정교화하여 언어적 사전 지식에 대한 과도한 의존도를 줄이고 시각적 단서의 보다 균형 잡힌 통합을 촉진함으로써 대규모 시각-언어 모델(Large Vision-Language Models)의 환각 현상을 완화하는 방법을 제안하며, 이를 통해 여러 환각 벤치마크에서 상당한 성능 향상을 달성한다.

원저자: Aakriti Agrawal, Gouthaman KV, Rohith Aralikatti, Gauri Jagatap, Jiaxin Yuan, Sarvesh Baskar, Vijay Kamarshi, Andrea Fanelli, Furong Huang

게시일 2026-06-09
📖 3 분 읽기☕ 가벼운 읽기

원저자: Aakriti Agrawal, Gouthaman KV, Rohith Aralikatti, Gauri Jagatap, Jiaxin Yuan, Sarvesh Baskar, Vijay Kamarshi, Andrea Fanelli, Furong Huang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

문제점: "지나치게 자신만만한 이야기꾼"

당신에게 도서관의 모든 책을 다 읽었지만, 실제 사진은 한 번도 본 적 없는 아주 똑똑한 이야기꾼(대규모 언어 모델, 즉 LLM)이 있다고 상상해 보세요. 당신이 이 이야기꾼에게 텅 빈 주방 조리대 사진을 보여주며 "무엇이 보이나요?"라고 묻습니다.

이 이야기꾼은 주방에 관한 이야기를 너무 많이 읽었기 때문에, 즉시 추측을 시작합니다. 조리대가 완전히 비어 있음에도 불구하고, "김이 모락모락 나는 커피 한 잔과 과일 그릇이 보입니다"라고 말할 수도 있습니다. 이들은 단어에 대한 기억에 의존하고 있을 뿐, 사진을 보고 있는 것이 아닙니다.

AI의 세계에서는 이를 **환각(Hallucination)**이라고 부릅니다. 모델은 유창하고 똑똑하게 들리지만, 시각적 증거보다 텍스트 학습을 더 신뢰하기 때문에 사실을 지어내고 있는 것입니다.

현재의 설정: "두 개의 궤도가 있는 기차"

이미지를 보는 대부분의 현재 AI 모델(LVLMs)은 마지막에 하나로 합쳐지는 두 개의 별개 궤도를 가진 기차처럼 작동합니다:

  1. 궤도 A (텍스트): 이야기꾼의 단어들.
  2. 궤도 B (시각): 사진의 데이터.

문제는 기차 엔진(AI)이 궤도 A(텍스트)에서 달리도록 설계되었다는 점입니다. 두 궤도가 만날 때, 엔진은 자연스럽게 궤도 A라는 매끄럽고 익숙한 길을 선호하게 됩니다. 엔진은 궤도 B(사진)에 있는 울퉁불퉁한 부분이나 세부 사항을 무시합니다. 모델은 사진을 주요 사실이 아닌 부차적인 제안 정도로 취급합니다.

해결책: "VisAlign" – "그려진 지도"

연구진은 VisAlign이라는 새로운 방법을 제안합니다. 단순히 마지막에 궤도를 합치는 대신, 이야기가 시작되기도 전에 그림을 단어 위에 직접 그려 넣기로 결정했습니다.

그들이 이 작업을 수행하는 방법은 다음과 같습니다:

  1. 전역 스냅샷 (The Global Snapshot): 먼저, AI는 전체 사진을 빠르게 훑어봅니다 (마치 그림의 전반적인 분위기를 파악하기 위해 눈을 가늘게 뜨고 보는 것처럼).
  2. 주입 (The Injection): 이 "분위기"를 AI가 말하려는 모든 단어의 DNA에 직접 섞습니다.
  3. 결과: 이제 AI가 "컵"이라는 단어를 생각할 때, 그 단어는 더 이상 단순한 텍스트 정의가 아닙니다. 그 단어는 실제로 보고 있는 이미지의 "질감"을 품게 됩니다.

비유:
친구에게 길을 안내한다고 상상해 보세요.

  • 기존 방식: 당신은 "빵집에서 왼쪽으로 도세요"라고 말하지만, 정작 보고 있는 지도는 그곳에 빵집이 없는 지도입니다. 당신은 그저 대본을 읊고 있는 것입니다.
  • VisAlign 방식: 당신은 손에 지도를 들고 있으며, "빵집"이라고 말할 때마다 지도의 그 지점을 물리적으로 가리키고 있습니다. 단어와 이미지가 하나로 융합된 것입니다. 당신은 지도를 보지 않고서는 "빵집"이라고 말할 수 없습니다.

이를 해결하면 어떤 일이 벌어질까요?

연구진은 이 방법을 Video-LLaVA(비디오를 보고 질문에 답하는 모델)라는 모델에 테스트했습니다. 그들은 AI의 "주의력(Attention)"(뇌의 에너지를 어디에 집중하는지)이 어떻게 변했는지 살펴보았습니다.

  • VisAlign 적용 전: AI는 문장의 시작과 끝(텍스트)에 크게 집중했고, 사진 데이터가 존재하는 중간 부분은 거의 쳐다보지 않았습니다. 이는 마치 학생이 시험 문제를 읽으면서 도표는 무시하는 것과 같았습니다.
  • **Vis

결과: 만들어낸 사실의 감소

연구팀은 이 새로운 방법을 여러 "환각 벤치마크"(AI가 거짓말을 하도록 유도하도록 설계된 테스트)에서 테스트했습니다. 결과는 명확했습니다:

  • 정확도 향상: 모델은 존재하지 않는 것(예: 존재하지 않는 개)을 찾아내거나 존재하는 것을 묘사하는 능력이 현저히 좋아졌습니다.
  • 구체적인 성과:
    • MMVP-MLLM 테스트에서 정확도가 9.33% 상승했습니다.
    • POPE(객체 환각 테스트)에서 정확도가 거의 3% 가까이 올랐습니다.
    • Merlin(객체의 존재 여부를 확인하는 테스트)에서 최대 3.4% 개선되었습니다.
  • 일반화: 이 기술을 LLaVA 1.5Open-Qwen2VL과 같은 다른 AI 모델에도 적용해 보았으며, 그곳에서도 효과가 있었습니다. 이는 "텍스트 과잉-시각 부족" 문제를 해결하는 보편적인 해결책입니다.

트레이드오프: 작은 대가

논문은 한 가지 작은 한계점을 언급합니다. AI가 이제 사진에 더 의존하고 일반적인 세상 지식에는 덜 의존하게 되므로, 일반적인 지식만을 필요로 하는 질문(예: "유명한 배우는 누구인가요?")에는 성능이 약간 떨어질 수 있습니다. 하지만 이미지를 보고 수행해야 하는 작업에 있어서는 그 개선 효과가 매우 큽니다.

요약

이 논문은 AI 모델이 환각을 일으키는 이유가 "텍스트는 무겁고 시각은 가볍기" 때문이라고 주장합니다. AI가 생각을 시작하기 전에 텍스트 단어 속에 시각 정보를 직접 섞음으로써, 모델이 사진을 보도록 강제하는 것입니다. 이 간단한 수정은 일종의 접지선(grounding wire) 역할을 하여, AI가 상상의 이야기 속으로 떠돌지 않고 시각적 현실에 단단히 고정되도록 돕습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →