Accuracy Without Grounding: Diagnosing Visual Dependency Dissociation in Video LLM Benchmarks
이 논문은 비디오 거대 언어 모델의 높은 벤치마크 정확도가 진정한 시각적 이해보다는 언어적 사전 지식에서 기인하는 경우가 많음을 입증하기 위해 시각적 의존 격차(Visual Dependency Gap, VDG)를 도입하며, 이를 통해 시간적 순서가 성능에 기여하는 바는 미미한 반면 프레임의 다양성이 대부분의 이득을 주도한다는 점을 밝힌다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 로봇에게 세상을 이해하는 법을 가르치려 한다고 상상해 보세요. 당신은 로봇에게 카메라와 두뇌를 주고, 로봇이 보고 있는 것에 대해 질문을 던집니다. 오랫동안 과학자들은 이 로봇들이 얼마나 "똑똑한지" 측정하기 위해 한 가지 테스트를 실시했습니다. 비디오를 보여주고, 질문을 던진 뒤, 로봇이 정답을 맞히는지 확인하는 것입니다. 만약 로봇이 높은 점수를 받는다면, 우리는 그 로로봇이 비디오를 진정으로 "보고" 있으며 이해하고 있다고 가정합니다. 하지만 여기 함정이 있습니다. 로봇이 정답을 맞혔다고 해서 그것이 반드시 그림을 보았다는 뜻은 아닙니다. 마치 선생님이 화요일마다 항상 "고양이"에 대해 질문한다는 것을 알고, 칠판을 보지도 않은 채 그냥 "고양이"라고 답하는 학생처럼, 로봇은 단지 질문 속의 단어들을 바탕으로 추측했을 수도 있습니다. 이 논문은 "비디오 거대 언어 모델(Video Large Language Models)"이라는, 텍스트를 읽고 비디오를 시청할 수 있는 초지능형 컴퓨터들의 복잡하고 혼란스러운 세계를 파고들어 다음과 같은 무서운 질문을 던집니다. 이 로봇들은 정말로 영화를 보고 있는 것일까요, 아니면 단지 텍스트만을 이용해 정답을 맞히는 데 매우 능숙한 것일까요?
연구진은 크기가 아주 작은 것부터 거대한 두뇌를 가진 거대한 모델에 이르기까지, 20가지의 서로 다른 비디오 시청 로봇들을 대상으로 작은 속임수를 써보기로 했습니다. 그들은 MVBench라는 수백 개의 비디오 관련 질문이 담긴 표준 테스트를 가져왔고, 모든 질문에 대해 테스트를 두 번씩 실시했습니다. 첫 번째는 로봇에게 실제 비디오를 보여주었습니다. 두 번째는 로봇에게 똑같은 질문을 보여주되, 비디오를 검은색 화면으로 대체했습니다. 만약 로봇이 진정으로 "보고" 있다면, 비디오가 사라졌을 때 점수가 0에 가깝게 떨어져야 합니다. 만약 검은 화면에서도 계속 정답을 맞힌다면, 그것은 로봇이 전혀 보고 있지 않았으며, 단지 언어적 기술을 이용해 추측하고 있었다는 것을 의미합니다.
결과는 다소 충격적이었습니다. 연구팀은 많은 질문에서 로봇이 실제 비디오를 보고 있을 때와 검은 공허를 바라보고 있을 때의 성적이 거의 동일하다는 것을 발견했습니다. 그들은 "시각 의존성 격차(Visual Dependency Dependency Gap, VDG)"라고 불리는 새로운 측정 방식을 도입했는데, 이는 기본적으로 비디오가 있을 때와 없을 때 로봇이 수행하는 능력의 차이를 말합니다. 그들은 "자동차 색깔은 무엇인가요?"(속성 인지)와 같은 유형의 질문에 대해서는 로봇이 정답을 맞히기 위해 실제로 비디오가 필요하다는 것을 발견했습니다. 하지만 "다음에 무슨 일이 일어날까요?"(시간적 추론)와 같은 다른 유형의 질문에서는, 화면이 검은 상태에서도 로봇이 정답을 맞혔습니다. 이는 테스트 질문들이 로봇에게 시간이나 순서를 이해하는 능력을 테스트한 것이 아니라, 단지 질문의 문구에 기반해 정답을 추측하는 능력을 테스트했다는 것을 의미합니다.
연구진은 또한 로봇들이 왜 이런 답을 내놓는지 알아내기 위해 노력했습니다. 그들은 비디오를 여러 부분으로 나누었습니다: 단 하나의 프레임만 있는 경우, 여러 프레임을 순서 없이 섞어 놓은 경우, 그리고 시간이 흐르는 대로 움직이는 전체 비디오인 경우입니다. 그들은 로봇이 사건의 순서에는 전혀 신경 쓰지 않는다는 것을 발견했습니다. 비디오가 정방향으로 재생되든, 역방향으로 재생되든, 혹은 사진들이 뒤섞인 엉망진창인 상태이든, 로봇은 모두 동일한 점수를 받았습니다. 유일하게 도움이 된 것은 순서가 아니라 '다양한' 사진들을 보는 것(프레임 다양성)이었습니다. 실제로 가장 최신의 가장 발전된 모델들의 경우, 비디오 입력이 오히려 그들을 혼란스럽게 만들어, 비디오를 완전히 무시하고 텍스트를 바탕으로 추측했을 때보다 성능이 약간 더 떨어지는 것처럼 보이기도 했습니다.
가장 흥สนใจ로운 발견 중 하나는 이 로봇들이 압축을 어떻게 처리하는지에 관한 것이었습니다. 보통 비디오 파일을 작게 만들기 위해 압축하면 품질이 떨어집니다. 연구진은 만약 로봇이 진정으로 "보고" 있다면, 흐릿하고 압축된 비디오가 그들을 실패하게 만들 것이라고 예상했습니다. 하지만 로봇의 점수는 비디오가 심하게 압축되었음에도 불구하고 평탄하고 일정하게 유지되었습니다. 연구팀은 이것이 로봇이 매우 견고하기 때문이 아니라, 질문들이 텍스트로부터 추측하기에 너무 쉬웠기 때문에 로봇이 시각적 세부 사항을 전혀 필요로 하지 않았기 때문이라는 것을 깨달았습니다. 그들이 본 "견고함"은 나쁜 테스트 질문이 만들어낸 환상이었습니다.
마지막으로, 그들은 이 로봇들이 커지고 똑똑해짐에 따라 어떻게 변하는지 살펴보았습니다. 그들은 모델이 커질수록 일반적으로 비디오를 사용하는 능력이 좋아지지만, 일부 아주 최신 모델들은 오히려 시각 정보에 의존하는 능력이 더 나빠진다는 것을 발견했습니다. Qwen3-VL이라는 모델은 비디오 프레임을 효과적으로 사용하는 법을 잊어버린 듯 보였으며, 전체적인 테스트 점수는 좋아 보였음에도 불구하고 거의 전적으로 텍스트를 통한 추측에 의존하고 있었습니다. 논문은 결론적으로, 우리는 더 이상 리더보드 점수만을 신뢰해서는 안 된다고 말합니다. 높은 점수가 로봇이 훌륭한 관찰자라는 것을 의미하지는 않습니다. 그것은 단지 로봇이 훌륭한 추측가라는 것을 의미할 수도 있습니다. 로봇이 진정으로 보고 있는지 알기 위해서는, 화면이 검게 변했을 때 실패하는지를 확인해야 합니다. 만약 실패하지 않는다면, 애초에 보고 있었던 것이 아닙니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.