Context Blindness in DPO: Mitigating Object Hallucination in MLLMs via Context-Calibrated Preference Optimization
이 논문은 표준적인 직접 선호 최적화(DPO)가 문맥 정보를 충분히 활용하지 못하여 멀티모달 거대 언어 모델에서 객체 환각 현상을 유발한다는 점을 식별하고, 일반적인 추론 능력을 유지하면서도 환각을 유의미하게 감소시키기 위해 문맥적 선호 이득(Contextual Preference Gain)을 명시적으로 최대화하는 방법론인 문맥 보정 DPO(C²-DPO)를 제안한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 초지능 로봇에게 주변 세상을 묘사하는 법을 가르치고 있다고 상상해 보세요. 당신은 로봇에게 강아지 사진을 보여주며 "무엇이 보이나요?"라고 묻습니다. 이상적인 경우, 로봇은 "강아지가 보입니다"라고 말해야 합니다. 하지만 때때로 이 AI 모델들은 너무 창의적으로 변하곤 합니다. 사진에 없는 빨간 모자를 쓰고 있는 강아지라고 말할 수도 있죠. 이것을 "환각(hallucination)"이라고 부릅니다. 마치 로봇이 실제 있는 것을 보는 대신 백일몽을 꾸는 것과 같습니다.
이를 해결하기 위해 과학자들은 "선호도 최적화(Preference Optimization)"라는 훈련 방법을 사용합니다. 이것은 "뜨겁다 또는 차갑다(Hot or Cold)" 게임과 비슷합니다. 당신은 로봇에게 두 가지 답변을 보여줍니다. 하나는 진실된 것("뜨거운" 답변)이고, 다른 하나는 지어낸 것("차가운" 답변)입니다. 로봇은 뜨거운 답변을 선택하는 법을 배웁니다. 최근 연구자들은 이를 더 개선하기 위해 사진에 대한 텍-설명과 같은 추가적인 단서를 제공하여, 로봇이 환각을 멈추고 그 단서를 사용하도록 만들고자 했습니다. 하지만 여기서 중요한 질문이 생깁니다. 로봇이 실제로 그 단서를 사용하고 있는 것일까요, 아니면 그냥 단서를 무시하고 추측하고 있는 것일까요?
이것이 바로 "C2-DPO에서의 문맥 맹목성(Context Blindness in DPO)" 논문이 조사하는 내용입니다. 고려대학교와 KAIST 연구진인 저자들은 추가적인 단서가 있음에도 불구하고 많은 AI 모델이 "문맥 맹목성"을 겪고 있다는 사실을 발견했습니다. 그들은 표준적인 훈련 방식이 모델에게 추가 정보에 주의를 기울이도록 가르치지 못한다는 것을 발견했습니다. 이를 해결하기 위해 그들은 C2-DPO(Context-Calibrated Direct Preference Optimization)라는 새로운 훈련 기법을 발명했습니다. 단순히 어떤 답변이 더 나은지 알려주는 대신, C2-DPO는 로봇이 추가 단서가 있을 때 정답에 대해 훨씬 더 확신을 갖게 하고, 단서가 없을 때도 확신을 유지하도록 가르칩니다. 그들의 실험 결과에 따르면, 이 새로운 방법은 로봇의 백일몽을 유의미하게 줄여주어, 로봇을 훨씬 더 신뢰할 수 있는 관찰자로 만들어 주었습니다.
문제점: 로봇의 백일몽 습관
멀티모달 거대 언어 모델(MLLM)은 뇌를 가진 초강력 카메라와 같습니다. 사진을 보고 그것에 대해 이야기할 수 있습니다. 하지만 이들은 짜증 나는 습로가 있습니다. 종종 세부 사항을 지어내곤 합니다. 만약 당신이 평범한 흰 접시 사진을 보여준다면, 모델은 자신 있게 "접시 위에 피자 한 조각이 있습니다"라고 말할 수도 있습니다. 문장은 완벽하게 들리겠지만, 그것은 거짓말입니다. 이것이 "객체 환각(object hallucination)"입니다.
이를 막기 위해 과학자들은 **직접 선호도 최적화(Direct Preference Optimization, DPO)**라는 방법을 사용합니다. 당신이 학생의 에세이를 채점하는 선생님이라고 상상해 보세요. 당신에게는 두 가지 버전이 있습니다. 하나는 정확하고, 다른 하나는 거짓말로 가득 차 있습니다. 당신은 학생에게 "나는 정확한 것을 선호한다"라고 말합니다. 시간이 지나면서 학생은 정확한 것처럼 쓰는 법을 배웁니다. AI 세계에서 연구자들은 모델에게 한 쌍의 답변(하나의 진실된 답변과 하나의 환각된 답변)을 주고 항상 진실된 것을 선택하도록 훈련합니다.
최근 일부 연구자들은 AI를 더 돕기 위해 시도했습니다. 질문을 하기 전에 사진에 "도움 텍스트"(캡션과 같은 것)를 추가했습니다. 아이디어는 이렇습니다. "만약 로봇이 캡션을 읽고 사진을 본다면, 무언가를 지어내지 않을 것이다." 하지만 이 논문의 저자들은 의심스러운 질문을 던졌습니다. 로봇이 정말로 캡션을 읽고 있는 것일까요, 아니면 그냥 무시하고 추측하고 있는 것일까요?
발견: "눈먼" 로봇
답을 찾기 위해 저자들은 **문맥적 선호도 이득(Contextual Preference Gain, CPG)**이라는 간단한 테스트를 만들었습니다. CPG를 "확신 측정기(Confidence Meter)"라고 생각하세요.
테스트 방식은 다음과 같습니다:
- 전체 문맥(Full Context): 로봇에게 사진 플러스 도움이 되는 캡션을 보여줍니다. "접시 위에 피자가 있나요?"라고 묻습니다. 로봇은 "아니요, 비어 있습니다"라고 답합니다. 이때 로봇이 얼마나 확신하는지 확인합니다.
- 저하된 문맥(Degraded Context): 캡션을 제거합니다. 로봇에게 캡션 없이 사진 만 보여주고 똑같은 질문을 합니다. 로봇은 "아니요, 비어 있습니다"라고 답합니다. 이때 다시 한번 로봇의 확신도를 확인합니다.
만약 로봇이 정말로 주의를 기울이고 있다면, 캡션이 있을 때 훨씬 더 확신을 가져야 합니다. "확신 측정기"(CPG) 수치가 올라가야 합니다. 이것이 똑똑하고 근거 있는 로봇이 해야 할 일입니다.
하지만 저자들이 표준 AI 모델(일반적인 DPO 훈련 사용)을 테스트했을 때, 충격적인 사실을 발견했습니다. 확신 측정기가 거의 움직이지 않았습니다. 캡션이 있든 없든, 로봇은 똑같은 수준의 확신을 느꼈습니다. 로봇은 **문맥 맹목적(context-blind)**이었습니다. 로봇은 사용해야 할 추가 정보를 무시하고 자신의 추측에 의존하고 있었으며, 이것이 바로 성가신 환각으로 이어졌습니다.
저자들은 강력한 연관성을 발견했습니다. 추가 단서를 주었을 때 확신 측정기가 더 많이 올라갈수록(높은 CPG), 거짓말을 하는 횟수는 줄어들었습니다. 하지만 표준 모델들은 CPG가 0에 가까웠습니다. 그들은 본질적으로 사용하기로 되어 있는 문맥에 대해 "눈이 먼" 상태였습니다.
해결책: C2-DPO (문맥 교정 트레이너)
그렇다면 눈먼 로봇에게 보는 법을 어떻게 가르칠 수 있을까요? 저자들은 C2-DPO라고 불리는 새로운 훈련 방법을 제안했습니다.
단순히 "정답을 골라라"라고 말하는 대신, C2-DPO는 게임의 규칙을 바꿉니다. 이는 로봇에게 특정한 교훈을 얻도록 강제합니다: "추가 단서가 있을 때는, 단서가 없을 때보다 답변에 대해 훨씬 더 확신해야 한다."
그들은 확신 수준 사이의 격차를 넓히는 데 보상을 주는 특별한 수학적 트릭(손실 함수)을 사용하여 이를 수행합니다.
- 시나리오 A (전체 문맥): 로봇은 사진과 캡션을 봅니다. 로봇은 정답에 대해 매우 확신해야 합니다.
- 시나리오 B (저하된 문맥): 로봇은 사진만 봅니다. 여전히 확신을 가져야 하지만, 훈련 과정에서 "전체 문맥"에서의 확신도가 현저히 높아야 함을 보장합니다.
이것은 탐정을 훈련시키는 것과 같습니다. 일반적인 탐정은 목격자가 있든 없든 사건을 해결할 수 있습니다. 하지만 C2-DPO 탐정은 이렇게 말하도록 훈련받습니다. "목격자가 있다면, 나는 100% 확신합니다! 목격자가 없다면, 여전히 꽤 확신하지만, 더 많은 증거가 필요하다는 것을 알고 있습니다." 이는 AI가 추론을 강화하기 위해 추가 정보(목격자/캡션)를 실제로 사용하도록 강제합니다.
결과: 적은 백일몽, 더 많은 진실
저자들은 LLaVA-v1.5-7B와 Qwen2-VL-Instruct-2B를 포함한 여러 유명 AI 모델을 대상으로 이 새로운 방법을 테스트했습니다. 그들은 Object HalBench(객체를 지어내는 로봇을 잡아내기 위해 설계됨)라는 테스트에서 C2-DPO를 기존의 표준 방식과 비교했습니다.
결과는 인상적이었습니다:
- Qwen2-VL-Instruct-2B 모델의 경우, C2-DPO는 환각된 응답 비율을 36% 감소시켰고, 환각된 언급(특정 단어) 비율을 60% 감소시켰습니다.
- AMBER 벤치마크에서 환각 점수는 기존 방식의 39.9에서 C2-DPO 적용 시 16.1로 떨어졌습니다.
- 결정적으로, 모델들이 다른 작업에서 "멍청해지지는" 않았습니다. 그들은 여전히 일반적인 질문에 답하고 논리 퍼즐을 푸는 능력을 이전만큼 잘 유지했습니다. 단지 무언가를 지어내는 것만 멈췄을 뿐입니다.
저자들은 또한 사진 없이도 이 트릭이 작동한다는 것을 보여주었습니다. 질문과 답변만을 사용하는 텍-전용 모델에 동일한 로직을 적용했을 때도 정확도가 향상되었습니다. 이는 문제가 단순히 이미지를 "보는" 것에 관한 것이 아니라, 모델이 주어진 정보를 어떻게 가치 있게 여기는지에 관한 것임을 시사합니다.
이것이 왜 중요한가
이 논문은 우리가 AI를 "정직하게" 만들기 위해 현재 사용하는 훈련 방식이 핵심적인 요소를 놓치고 있을 수 있음을 시사합니다. 우리는 그들에게 추가적인 단서를 주고 그것을 사용하기를 바랐지만, 훈련 방식은 그들에게 주의를 기울이도록 강제하지 않았습니다. 단순히 "문맥 인식 확신"에 보상을 주는 방식으로 훈련을 조정함으로써, 저자들은 거대한 새로운 데이터셋이나 복잡한 새로운 구조 없이도 AI 모델을 훨씬 더 신뢰할 수 있게 만들 수 있음을 보여주었습니다.
이는 때때로 로봇의 백일몽을 멈추는 가장 좋은 방법은 더 많은 데이터를 주는 것이 아니라, 이미 가지고 있는 데이터를 어떻게 가치 있게 여길지 가르치는 것임을 상기시켜 줍니다. 저자들이 발견했듯이, 문맥을 존중하도록 모델을 교정하면 환각은 사라지고 로봇은 진실을 말하기 시작합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.