← 최신 논문
💬 NLP

Learning from Fine-Grained Visual Discrepancies: Mitigating Multimodal Hallucinations via In-Context Visual Contrastive Optimization

본 논문은 기존의 시각적 선호도 방식의 한계를 해결함으로써 시각적 대비 증류(Visual Contrast Distillation)와 정밀한 하드 네거티브 생성(hard negative generation)에 의해 강화된 수학적으로 엄밀한 프레임워크인 인컨텍스트 시각적 대비 최적화(In-Context Visual Contrastive Optimization, IC-VCO)를 제안하며, 이를 통해 시각-언어 모델의 멀티모달 환각 현상을 효과적으로 완화한다.

원저자: Haolin Deng, Xin Zou, Zhiwei Jin, Chen Chen, Haonan Lu, Xuming Hu

게시일 2026-06-01
📖 4 분 읽기☕ 가벼운 읽기

원저자: Haolin Deng, Xin Zou, Zhiwei Jin, Chen Chen, Haonan Lu, Xuming Hu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

문제점: "공상에 빠진" AI

매우 똑똑한 학생(AI)이 사진에 관한 시험을 보고 있다고 상상해 보세요. 이 학생은 읽고 말하는 능력은 뛰어나지만, 가끔 사진을 볼 때 주의력이 흐트러져서 "공상"에 빠지곤 합니다. 사진에 없는 것을 설명하거나, 실제 사진에 무엇이 있는지 관찰하는 대신 보통 그런 상황에서 일어날 법한 일을 바탕으로 추측하곤 하죠. 이것을 **멀티모달 환각(multimodal hallucination)**이라고 부릅니다.

오랫동안 선생님들(연구자들)은 단순히 학생의 을 교정하는 방식으로 이를 해결하려 노력했습니다. "너는 고양이가 있다고 말했지만, 사진에는 개가 있어. 다시 해봐."라고 말하는 식이었죠. 하지만 이 논문은 선생님들이 학생에게 사진을 자세히 보라고 강요하지 않고, 단지 텍스트만 교정했을 뿐이기 때문에 이것만으로는 충분하지 않다고 주장합니다.

기존 방식: "교체하고 잊기(Swap and Forget)" 방식

이전의 시도들은 "시각적 선호도(visual preference)" 방식을 사용했습니다. 학생에게 서로 다른 두 장의 사진을 보여주는 상황을 상상해 보세요:

  1. 사진 A: 개의 실제 사진.
  2. 사진 B: 완전히 다른 고양이 사진.

선생님은 " '개가 있다'라는 문장에 맞는 사진은 무엇인가요?"라고 묻습니다.

  • 결함 1 (수학적 문제): 기존 방식은 사진 A에 대한 학생의 답변을 사진 B와 비교하려고 했습니다. 하지만 두 사진이 너무나 달랐기 때문에, 훈련 과정의 수학적 계산이 "엉망"이 되었습니다. 이는 마치 사과의 가격과 자동차의 가격를 비교하며 어떤 것이 더 좋은 과일인지 결정하려는 것과 같았습니다. 비교 자체가 공정하지 않았고 수학적으로 타당하지 않았습니다.
  • 결함 2 (치트키): "잘못된" 사진(사진 B)은 종종 너무 확연하게 달랐습니다(예: 스타일, 조명, 배경이 완전히 다름). 이로 인해 학생은 속임수를 쓸 수 있었습니다. 학생은 개를 식별하는 법을 배우는 대신, "아, 사진이 이상하게 생겼거나 배경이 다르면 틀린 답이구나"라고 학습해 버렸습니다. 즉, 세부 사항을 배우는 대신 지름길을 택한 것입니다.

새로운 해결책: IC-VCO

저자들은 IC-VCO(In-Context Visual Contrastive Optimization)라는 새로운 프레임워크를 제안합니다. 이것을 더 똑똑하고 엄격한 훈련 캠프라고 생각하세요.

1. "나란히 놓기" 비교 (In-Context Visual Contrast)

IC-VCO는 학생에게 서로 다른 날에 두 번의 시험을 치르게 하는 대신, 두 장의 사진을 같은 책상 위에 동시에 올려놓습니다.

  • 설정: 학생은 사진 A(개)와 사진 B(고양이)를 나란히 봅니다.
  • 지시: 선생님은 손가락으로 가리키며 "이 특정 질문에 대해서는 첫 번째 사진만 보세요"라고 말합니다. 그다음 질문에서는 "이제 두 번째 사진만 보세요"라고 말합니다.
  • 효과: 두 사진이 동일한 "컨텍스트(맥락, 즉 같은 책상 위)"에 있기 때문에 수학적 계산이 완벽하게 작동합니다. 학생은 배경 스타일을 보고 속임수를 쓸 수 없습니다. 왜냐하면 배경이 동일하기 때문입니다. 따라서 학생은 선생님이 가리킨 특정 대상에 집중해야만 합니다. 이것이 "엉망인 수학" 문제를 해결합니다.

2. "정밀한 편집" (Contrastive Sample Editing)

학생이 지름길을 택하지 못하도록, 저자들은 "잘못된" 사진을 만드는 새로운 방법을 만들었습니다.

  • 기존 방식: 아예 처음부터 새로운 이미지를 생성했습니다. 이는 마치 교실 전체를 다른 곳으로 바꾸는 것과 같았습니다. 학생은 쉽게 "여기는 원래 있던 방이 아니야"라고 알아챌 수 있었습니다.
  • 새로운 방식 (정밀한 편집): 원본 사진을 가져와서 아주 미세하고 정밀한 변화를 줍니다.
    • 예시: 만약 사진에 빨간 사과가 있다면, 테이블, 조명, 배경은 정확히 그대로 둔 채 사과만 초록색 사과로 정밀하게 바꿉니다.
    • 결과: 학생은 배경을 보고 속임수를 쓸 수 없습니다. 학생은 반드시 사과가 빨간색이 아니라 초록색이라는 것을 확인하기 위해 아주 자세히 들여다봐야만 합니다. 이는 AI가 일반적인 분위기로 때려 맞히는 것이 아니라 **미세한 디테일(fine-grained details)**을 학습하도록 강제합니다.

3. "가교" (Visual Contrast Distillation)

한 가지 걸림돌이 있습니다. 훈련은 책상 위에 두 장의 사진을 놓고 진행되지만, 실제 세상에서 AI는 보통 한 번에 하나의 사진만 봅니다.

  • 문제: 만약 학생을 "나란히 놓기" 비교 방식으로만 훈련시킨다면, 혼자 있을 때 사진 한 장만 마주하면 혼란을 느낄 수 있습니다.
  • 해결책 (증류/Distillation): 저자들은 "가교" 단계를 추가했습니다. 그들은 "나란히 놓기" 테스트에서의 학생의 성과를 가이드로 삼아, "단일 사진" 테스트에서의 성과를 개선하도록 돕습니다. 이는 마치 코치가 파트너와 함께 연습하는 학생을 지켜본 뒤, 혼자 연습할 때도 그 기술을 어떻게 적용할 수 있는지 팁을 주는 것과 같습니다.

결과

이 논문은 새로운 방법론을 테스트하기 위해 다섯 가지 서로 다른 "시험(벤치마크)"을 실시했습니다.

  • 결과: IC-VCO 방식은 이전의 모든 방식보다 뛰어난 성능을 보였습니다.
  • 비법: "정밀한 편집(사진의 아주 작은 디테일을 수정하는 것)"이 핵심이었습니다. AI에게 거의 똑같아 보이지만 단 하나의 작은 차이만 있는 "어려운" 예시들을 제공했을 때, AI가 훨씬 더 세부 사항에 집중하여 학습한다는 것이 증명되었습니다.

요약

요약하자면, 이 논문은 AI가 사진에 대해 헛소리를 하는 것을 막으려면 단순히 다른 사진들을 보여주기만 해서는 안 된다고 말합니다. 두 장의 사진을 나란히 놓고 서로 비교하게 해야 합니다. 또한, 잘못된 사진을 만들 때는 전체를 바꾸는 것이 아니라 원래 사진의 아주 작은 디테일을 수정해야 합니다. 이렇게 함으로써 AI가 추측하는 것을 멈추고 실제로 제대로 보게 만드는 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →