Vision-driven Preference Synthesis for Mitigating Hallucinations in VLMs
이 논문은 시각적으로 근거가 있고 정책에 부합하는 선호 데이터를 합성하여 시각-언어 모델의 환각 현상을 크게 완화하고, 환각 벤치마크에서 새로운 최고 성능을 달성하는 동시에 일반적인 시각 능력을 향상시키는 2단계 프레임워크인 ViPSy를 제안한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
시각-언어 모델(VLM)을 눈이 가려진 채 친구가 설명해 주는 그림을 듣고 있는, 매우 똑똑하고 박학다식한 미술 비평가라고 상상해 보세요. 문제는 이 비평가가 자신의 예술사에 대한 지식에 너무 몰입한 나머지, 실제 그림에는 없는 것을 묘사하기 시작한다는 점입니다. 예를 들어, "정원에는 보통 독수리가 있다"라는 식의 학습 데이터 때문에 조용한 정원 그림을 보고도 황금 독수리가 있다고 주장하는 식이죠. 이것을 **환각(Hallucination)**이라고 부릅니다.
이 논문은 이를 해결하기 위해 ViPSy(Vision-driven Preference Synthesis)라는 새로운 방법론을 소개합니다. ViPSy를 비평가가 자신의 상상력에 의존하는 대신 실제 그림을 제대로 보도록 훈련하는 영리한 훈련 캠프라고 생각하면 됩니다.
ViPSy가 어떻게 작동하는지 두 가지 간단한 단계로 나누어 설명하겠습니다.
1단계: "현실 점검" (자기 캡션 기반 의미 합성)
사진 속에 정확히 무엇이 있는지 알고 싶지만, 자신의 기억이 틀리지 않았는지 확신이 서지 않는 상황을 상상해 보세요.
- 설명: 먼저, AI는 원본 사진을 보고 그 사진에 대한 상세한 설명(캡션)을 작성합니다.
- 재구상: 그다음, 그 설명을 바탕으로 다른 AI(텍스트-이미지 생성기)에게 오직 그 단어들에만 기반하여 새로운 그림을 그려달라고 요청합니다.
- 비교: 이 과정을 여러 번 반복하여, 원본 사진을 바탕으로 한 몇 가지 약간씩 다른 "재구상" 결과물들을 만듭니다.
- 공통 분모 찾기: 시스템은 원본 사진과 이 새로운 그림들을 비교합니다. 그리고 다음과 같이 질문합니다. "원본 사진에 등장하면서 동시에 거의 모든 새로운 그림에도 나타나는 물체는 무엇인가?"
- 만약 원본 사진에 빨간 트럭이 있고, 설명을 바탕으로 만든 새로운 그림들에서도 계속 빨간 트럭이 나타난다면, 그것은 확실한 사실입니다.
- 만약 원본 사진에는 나무가 있지만, 새로운 그림들에서는 나무를 계속 잊어버리거나 형태를 바꾼다면, 시스템은 그 세부 사항이 불확실할 수 있다는 것을 알게 됩니다.
이 단계의 결과물은 **"시각적 단서(Visual Cue)"**가 됩니다. 이 단서는 가장 부정할 수 없고 확실한 물체들의 신뢰할 수 있는 체크리스트(예: "빨간 트럭", "나무", "파란 하늘")라고 생각하면 됩니다. 이는 추측을 제거합니다.
2단계: "유도된 연습" (단서 조건부 자기 증류)
이제 AI는 이 신뢰할 수 있는 체크리스트를 가지고 다시 사진을 묘사하는 연습을 합니다.
- 연습 실행: AI는 다시 사진을 묘사하려고 시도하지만, 이번에는 "시각적 단서" 체크리스트를 반드시 염두에 두어야 합니다. 이는 마치 비평가에게 *"너는 반드시 빨간 트럭과 나무를 언급해야 하며, 아무것도 지어내지 마라"*라고 말하는 것과 같습니다.
- 옵션 생성: AI는 이 가이드에 따라 여러 가지 다른 설명들을 생성합니다. 어떤 것은 매우 정확하겠지만, 어떤 것은 여전히 실수하여 존재하지 않는 물체(예: 없는 "파란 자동차")를 추가할 수도 있습니다.
- 심판: 매우 똑똑한 "심판" AI가 이 옵션들을 살펴봅니다. 심판은 이 옵션들을 원본 사진와 비교하여 다음을 선택합니다.
- 승자: 체크리스트와 사진을 완벽하게 준수하며 설명한 것.
- 패자: 환각 현상을 일으켜 내용을 지어낸 설명.
최종 학습 (선호도 정렬)
시스템은 이러한 "승자 대 패자" 쌍을 가져와 메인 AI 모델에게 가르칩니다. "다음번에는 패자가 아니라 승자처럼 말해야 한다."
이 과정을 통해 AI는 자신의 내부적 편향(무엇이 있어야 한다고 '생각'하는 것)보다 시각적 증거(체크리스트)를 더 신뢰하는 법을 배웁니다.
왜 기존 방식보다 더 나은가요?
이 논문은 기존 방식들에 두 가지 주요 결함이 있다고 주장합니다.
- "편집" 방식: 어떤 방식들은 틀린 답을 가져온 뒤 이를 수동으로 수정합니다. 논문은 이것이 마치 교사가 학생의 에세이를 대신 써주는 것과 같아서, 학생이 스스로 쓰는 법을 배우지 못하며 결과물이 부자연스럽다고 말합니다.
- "무작위 추측" 방식: 다른 방식들은 단순히 AI에게 여러 번 추측하게 한 뒤 가장 좋은 것을 고르는 방식입니다. 논문은 AI가 사진을 자세히 보는 대신 여전히 자신의 상상력에 의존하기 때문에 이 방식이 자주 실패한다고 말합니다.
ViPSy는 특별합니다. AI의 "상상력"(자연스러운 말투)을 사용하면서도 엄격한 시각적 체크리스트로 이를 유도하기 때문입니다. 이를 통해 AI가 자연스럽게 말하면서도 진실되도록 유지합니다.
결과
논문에 따르면, 이 방법을 사용했을 때 AI는 무언가를 지어내는 능력이 훨씬 좋아졌습니다.
- 한 테스트에서는 환각(물체를 지어내는 것)을 약 35%, 다른 테스트에서는 24% 줄였으며, 이는 이전의 모든 방법들을 능가하는 수치입니다.
- 또한 복잡한 장면을 이해하거나 물체를 인식하는 것과 같은 일반적인 작업에서도 성능이 향상되었습니다. 이는 AI에게 단순히 입을 다물게 하는 것이 아니라, 실제로 "눈"을 더 날카롭게 만들었음을 증명합니다.
요약하자면, ViPSy는 묘사하고, 다시 그리고, 비교하는 영리한 루프를 사용하여 AI가 추측을 멈추고 관찰을 시작하도록 가르칩니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.