Rethinking CD: A Reproducibility Study and Extension on the Ineffectiveness of Contrastive Decoding at Mitigating Object Hallucinations in MLLMs
이 논문은 대조적 디코딩(contrastive decoding)이 POPE와 같은 벤치마크에서 보이는 외견상의 성능 향상이 종종 가짜이며 개선된 시각적 접지(visual grounding)를 반영하지 못한다는 점을 입증하기 위해 이전 연구를 재현 및 확장함으로써, 대조적 디코딩이 멀티모달 거대 언어 모델의 객체 환각을 진정으로 완화하는 데 실패함을 보여준다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 로봇에게 사진을 보고 보이는 것을 설명하도록 가르치고 있다고 상상해 보세요. 당신은 로봇이 정직하게, 실제로 그곳에 있는 것만을 말하기를 바랍니다. 하지만 때때로, 이 초지능적인 로봇들은 지나치게 창의적이 되곤 합니다. 그들은 조용한 해변 사진을 보고도 자신 있게 "강아지가 공놀이를 하고 있어요!"라고 말할 수 있습니다. 실제 사진에는 강아지가 없는데도 말이죠. 인공지능의 세계에서 이것을 "환각(hallucination)"이라고 부릅니다. 로봇이 의도적으로 거짓말을 하는 것이 아니라, 강아지에 관한 이야기를 너무 많이 읽어서 사진에 증거가 없더라도 당연히 강아지가 있을 것이라고 가정해 버리는 것입니다.
이를 해결하기 위해, 과학자들은 로봇에게 자신의 생각을 "재확인(double-check)"하도록 가르치기 위해 노력해 왔습니다. **대조적 디코딩(Contrastive Decoding)**이라고 불리는 한 가지 인기 있는 아이디어는 "틀린 그림 찾기" 게임과 같습니다. 로봇에게 사진을 두 가지 방식으로 상상하도록 요청하는 것입니다. 하나는 선명하고 날카로운 ("전문가"의 시선) 방식이고, 다른 하나는 흐릿하거나 노이즈가 섞인 ("아마추어"의 시선) 방식입니다. 이론은 만약 로봇이 선명한 뷰보다 흐릿한 뷰에서 "강아지"라고 말할 확률이 더 높다면, 그것은 사진에 기반한 것이 아니라 단지 상상에 근로한 추측일 가능성이 높다는 것입니다. 따라서 이 방법은 로봇이 진실에 집착하도록 하기 위해 그 "흐릿한 뷰"의 추측들을 억제하려고 노력합니다. 이는 마치 선생님이 학생에게 "명확하게 보이지 않는다면 적지 마라"라고 말하는 것과 같습니다.
하지만 여기에 반전이 있습니다. 새로운 연구는 이 영리한 "재확인" 기술이 우리를 속이고 있을 수도 있다고 제안합니다. 연구진은 이 방법이 로봇의 시력을 실제로 개선하는 대신, 대상이 실제로 거기에 있든 없든 상관없이 로봇이 더 자주 "예(Yes)"라고 말하도록 유도한다는 것을 발견했습니다. 이는 마치 학생이 공부를 열심히 하는 대신, 선생님이 긍정적인 답변을 좋아한다는 것을 알고 모든 질문에 그냥 "예"라고 답하기 시작하는 것과 같습니다. 이 연구는 이 인기 있는 해결책이 로봇의 시력을 고치는 것이 아니라, 단지 로봇의 기분을 바꾸고 있을 뿐이라는 것을 밝혀내기 위해 깊이 파고들었습니다.
거대한 "예(Yes)"의 환상
당신이 읽게 될 논문은 인도 공과대학교 루르키(IIT Roorkee) 연구팀이 쓴 탐정 이야기입니다. 그들은 "대조적 디코딩" 방법을 현미경 아래에 두고 이것이 광고된 대로 정말 작동하는지 조사하기로 했습니다. 그들의 주요 목표는 다음과 같은 뜨거운 질문에 답하는 것이었습니다: 이 방법이 실제로 로봇의 환각을 멈추고 있는가, 아니면 그저 결과를 조작하고 있는 것인가?
연구진은 이전 연구(Yin et al., 2026)의 실험을 반복하면서도, 더 강력한 로봇의 뇌(구체적으로 LLaVA와 Qwen이라 불리는 모델들)를 사용했습니다. 그들은 "대조적 디코딩"의 마법이 새로운 데이터로 테스트했을 때도 유지되는지 확인하고 싶었습니다. 그들이 발견한 것은 이 방법의 팬들에게는 다소 실망스러운 일이었지만, 정직한 로봇을 원하는 사람들에게는 매우 흥ًا되는 일이었습니다.
"예(Yes)" 편향
첫 번째 큰 발견은 대조적 디코딩이 실제로 로봇이 사진을 더 주의 깊게 보게 만드는 것이 아니라는 점입니다. 대신, 이 방법은 로봇이 "예"라고 훨씬 더 자주 말하도록 밀어붙입니다. 로봇이 사진 속에 "고양이가 있습니까?"와 같은 질문에 "예" 또는 "아니오"로 답해야 하는 시험을 상상해 보세요. 만약 로봇이 (고양이가 있음에도 불구하고) "아니오"라고 너무 자주 말한다면, 이 방법은 로봇이 "예"라고 말하도록 밀어붙입니다.
연구진은 이러한 변화가 로봇이 우연히 더 많은 질문에 맞춤으로써 서류상으로는 더 똑똑해 보이게 만든다는 것을 발견했습니다. 하지만 여기에는 함정이 있습니다. 로봇은 고양이가 없는 사진에도 "예"라고 답하며 새로운 실수를 만들어내고 있습니다. 이는 학생이 내용을 학습하는 대신, 그냥 모든 질문에 "예"라고 답하기로 결정한 것과 같습니다. 그들은 운 좋게 몇 문제를 맞힐 수는 있지만, 사실이 아닌 답을 지어내기도 합니다. 연구는 아무런 화려한 디코딩 기술을 사용하지 않고도, 단지 로봇에게 "'예'라고 더 자주 말해봐"라고 말하는 것만으로도 정확히 똑같은 "개선된" 점수를 얻을 수 있음을 보여주었습니다.
"탐욕스러운(Greedy)" 함정
두 번째 미스터리는 "적응형 타당성 제약(Adaptive Plausibility Constraint)"이라는 안전 밸브와 관련이 있습니다. 이것은 로봇이 터무니없고 불가능한 말을 하는 것을 막기 위한 규칙입니다. 그러나 연구진은 이 규칙이 너무 엄격해서 기본적으로 로봇을 "탐욕스러운" 사고방식으로 만든다는 것을 발견했습니다.
"샘플링(sampling)"을 로봇이 다음 단어를 선택하기 위해 주사위를 던져서 창의성을 발휘하고 다양한 옵션을 탐색하는 것이라고 생각해 보세요. "탐욕스러운(greedy)" 접근 방식은 로봇이 다른 모든 가능성을 무시하고 항상 단 하나의 가장 뻔한 단어만을 선택하는 것과 같습니다. 연구는 이 안전 규칙이 로봇이 주사위를 던지는 것을 멈추고 매번 가장 뻔한 단어를 선택하도록 강제한다는 것을 발견했습니다. 따라서 이 방법이 효과가 있는 것처럼 보일 때, 그것은 실제로 로봇이 더 잘 보는 것이 아니라, 로봇이 위험을 감수하기를 두려워하여 창의성을 잃고 지루할 정도로 예측 가능해졌기 때문입니다. 이 "개선"은 로봇이 더 잘 보기 때문이 아니라, 위험을 감수할 용기가 없기 때문에 발생하는 것입니다.
"노이즈(Noise)" 실험
이 방법의 "아마추어" 부분(흐릿한 뷰)이 실제로 아무런 역할을 하지 않는다는 것을 증명하기 위해, 연구진은 기발한 시도를 했습니다. 그들은 "아마추어" 로봇을 순수한 무작위 노이즈(마치 라디오의 잡음 신호 같은 것)로 교체했습니다. 그들은 아마추어 로봇 없이는 이 방법이 완전히 실패할 것이라고 예상했습니다. 하지만 결과는 놀랍게도, 방법은 거의 똑같이 작동했습니다!
이것은 요리사가 비밀 재료를 넣어 스프 맛을 더 좋게 만들려고 노력하는 것과 같습니다. 만약 그 비밀 재료를 빼고 평범한 물로 바꿨는데도 스프 맛이 똑같다면, 그 비밀 재료는 전혀 아무런 역할도 하지 않았다는 것을 깨닫게 됩니다. 연구진은 "아마추어" 뷰가 로봇이 진실을 보게 도와주는 것이 아니라, 단지 중요하지 않은 무작위 노이즈를 더하고 있을 뿐이라는 결론을 내렸습니다. 점수가 올라가는 진짜 이유는 단지 "예" 편향과 "탐욕스러운" 규칙 때문입니다.
심층 분석: 뇌 내부에서는 무슨 일이 일어나고 있는가?
연구진은 표면에 머물지 않았습니다. 그들은 로봇의 "뇌"(신경망 계층) 내부를 들여다보며 마법이 어디에서 일어나는지 확인했습니다. 그들은 로봇이 객체가 있는지 없는지를 내부 계층에서 이미 알고 있다는 것을 발견했습니다. 정보는 이미 가지고 있습니다! 하지만 대조적 디코딩 방법이 작동할 때, 로봇은 그 정보를 오류를 수정하는 데 사용하지 않습니다. 대신, 그것은 잘못된 답변에 대해서도 "예" 버튼을 더 세게 누를 뿐입니다.
이는 학생이 정답이 "아니오"라는 것을 알고 있지만, 선생님(디코딩 방법)이 계속 어깨를 툭툭 치며 "예라고 말해!"라고 속삭이는 것과 같습니다. 학생은 결국 알고 있는 것에도 불구하고 "예"라고 말하게 됩니다. 이 방법은 학생의 지식을 고치는 것이 아니라, 단지 모든 것에 대해 균일하게 "예"를 향하도록 밀어붙임으로써 지식을 덮어쓰는 것입니다.
최종 판결
그렇다면 이 연구의 최종 결론은 무엇일까요? 연구진은 자신들의 발견에 대해 매우 확신하고 있습니다. 그들은 인기 있는 "대조적 디코딩" 방법이 상당 부분 환상임을 보여주었습니다. 이 방법은 실제로 로봇이 세상을 더 명확하게 보게 하거나 무언가를 지어내는 것을 막아주지 못합니다. 대신, 단지 로봇이 더 자주 "예"라고 말하도록 행동을 바꾸고 창의적인 위험을 감수하지 않도록 만들 뿐입니다.
이것은 중요한 문제입니다. 왜냐-냐면 많은 사람들이 이 방법을 사용하여 더 안전하고 신뢰할 수 있는 AI를 구축하려고 노력해 왔기 때문입니다. 이 연구는 우리가 가짜 승리를 축하하고 있을지도 모른다고 경고합니다. 만약 우리가 환각을 일으키지 않는 로봇을 원한다면, 단순히 단어를 선택하는 방식을 수정하는 것이 아니라, 로봇이 보고 있는 사진을 실제로 이해하도록 돕는 방법을 찾아야 합니다. 그때까지 "대조적 디코딩" 기술은 로봇이 주의를 기울이고 있는 것처럼 보이게 만드는 영리한 속임수일 뿐이며, 실제로는 온 세상에 대고 "예, 보여요!"라고 게임을 하고 있는 것에 불과합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.