VADER: Adaptive Debiasing for Hallucination Mitigation in Video Large Language Models
본 논문은 비디오 증거에 대한 어텐션을 동적으로 재할당하고 시각적 토큰을 선택적으로 삭제하여 강건한 대조적 디코딩 분기(contrastive decoding branch)를 구축함으로써 비디오 거대 언어 모델의 환각 현상을 완화하는 학습이 필요 없는 프레임워크인 VADER를 제안한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 수백만 편의 영화를 관람하고 완벽한 문장으로 묘사할 수 있는 아주 똑똑한 로봇과 대화하고 있다고 상상해 보세요. 이 로봇은 지치지 않는 이야기꾼인 '비디오 거대 언어 모델(VideoLLM)'입니다. 하지만 이 로봇에게는 까다로운 습관이 하나 있습니다. 가끔 자신의 목소리에 너무 자신만만해진 나머지, 실제로 존재하지 않는 세부 사항을 지어내곤 한다는 점입니다. 영상에서는 그저 걷고 있었을 뿐인데도, 영화에서 흔히 일어나는 일이라는 이유로 캐릭터가 "울타리를 뛰어넘었다"라고 말하기도 합니다. 이를 '환각(hallucination)'이라고 부릅니다.
이 문제는 특히 비디오에서 매우 까다롭습니다. 단일 사진과 달리, 비디오는 긴 프레임의 흐름이기 때문입니다. 만약 로봇이 한 프레임에서 세부 사항을 놓치더라도, 앞뒤 프레임이 매우 유사하기 때문에 이를 통해 내용을 추론해 버릴 수 있습니다. 이는 마치 노래에서 단어 하나를 놓쳤을 때, 다음 몇 마디가 비슷하기 때문에 그 단어를 짐려 맞히는 것과 같습니다. 이 때문에 로봇의 거짓말을 막기 위해 사용되었던 기존의 기술들, 예를 들어 그림의 일부를 흐릿하게 처리하는 방식 등은 효과가 없는 경우가 많습니다. 로봇이 주변 프임을 이용해 빈칸을 채워버리기 때문입니다. 과학자들은 로봇을 처음부터 다시 가르치는 데 드는 엄청난 시간과 비용을 들이지 않고도 이 문제를 해결하고 싶어 합니다. 그들은 로봇이 말을 하는 바로 그 순간에, 실제로 보고 있는 것에 더 집중하게 만들 방법을 찾고 있습니다.
여기서 VADER라는 새로운 방법이 등장합니다. 이는 비디오 로봇을 위한 스마트한 편집자 역할을 합니다. VADER는 로봇에게 새로운 규칙을 강요하는 대신, 대화 도중에 개입하여 로봇의 주의력을 부드럽게 유도합니다. VADER는 두 가지 영리한 기술을 사용하여 로봇이 사실을 지어내는 것을 방지합니다.
첫째, VADER는 **시각적 초점 재할당(Visual Focus Reallocation, VFR)**이라는 도구를 사용합니다. 로봇의 뇌를 여러 명의 요리사(레이어)가 동시에 일하는 바쁜 주방이라고 생각해 보세요. 어떤 요리사들은 영상을 보고 있고, 다른 요리사들은 레시피에 대해 수다를 떨고 있습니다. 때때로 수다를 떠는 요리사들이 너무 시끄러워져서 영상에 집중하는 요리사들의 소리를 덮어버리곤 합니다. VFR은 역동적인 볼륨 조절기 역할을 합니다. VFR은 특정 영상과 질문을 분석하여, 정확히 어떤 요리사가 영상에 대해 이야기하고 있는지 파악한 뒤, 영상에 집중하는 요리사의 볼륨은 높이고 수다 떠는 소리는 줄입니다. 이는 모든 영상에 동일한 설정을 적용하는 것이 아니라, 상황을 진단하여 "좋아, 이 장면에서는 영상 증거에 20% 더 집중해야 해"라고 결정하는 방식입니다.
둘째, VADER는 **선택적 증거 삭제(Selective Evidence Erasure, SEE)**라는 기술을 사용합니다. 이 부분은 훨씬 더 유희적입니다. 당신이 영화의 줄거리를 추측하려고 하는데, 배경 풍경만 볼 수 있고 주인공은 볼 수 없다고 가정해 봅시다. 만약 당신이 여전히 줄거리를 맞힌다면, 그것은 당신이 영화에서 흔히 일어나는 일에 기반해 추측(당신의 '사전 편향')했다는 뜻입니다. 반대로 틀린다면, 당신이 실제 배우(영상 정보)에 의존하고 있었다는 증거가 됩니다. VADER는 로봇의 뇌 내부에서 프레임 단위로 가장 중요한 시각적 단서(예: 주요 인물)를 몰래 "삭제"함으로써 이 작업을 수행합니다. 이는 핵심 증거 없이 추측해야 하는 "만약에" 버전의 이야기를 만들어냅니다. 만약 로봇이 이 "삭제된" 버전에서도 여전히 같은 답을 내놓는다면, VADER는 로봇이 실제 영상이 아닌 습관에 기반해 추측하고 있다는 것을 알게 됩니다.
마지막으로, VADER는 로봇의 '실제' 답변과 '삭제된' 상태의 답변을 비교합니다. 만약 로봇이 두 경우 모두에서 확신을 가진다면, VADER는 그 답변이 환각일 가능성이 높다고 판단하여 이를 억제합니다. 만약 증거가 제거되었을 때 답변이 바뀐다면, VADER는 로봇이 실제로 영상을 주의 깊게 보고 있었다는 것을 알게 됩니다.
결과는 인상적입니다. 연구진이 이 방법을 인기 있는 로봇인 LLaVA-Video-7B에 테스트했을 때, 이 로봇은 실제 사건을 포착하고 타임라인을 유지하는 능력이 훨씬 향상되었습니다. EventHallusion이라는 특정 테스트에서 로봇의 정확도는 **72.60%**까지 치솟았습니다. 이는 값비싼 재학습이 필요한 다른 방법들을 능가하는 놀라운 성과입니다. 이 논문은 로봇이 주의를 기울이는 방식을 조정하고 스스로의 편향을 실시간으로 테스트하는 것만으로도, 로봇에게 새로운 언어를 가르칠 필요 없이 비디오 AI를 훨씬 더 정직하게 만들 수 있음을 보여줍니다. 이는 때때로 거짓말쟁이를 막는 가장 좋은 방법은 눈을 감고 이야기를 해보라고 요구하는 것임을 상기시켜 줍니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.