What Does a Temporal Benchmark Score Measure? Decomposing Channel Use in Video VLM Evaluation
이 논문은 레이블이 필요 없는 "reversal-drop" 지표를 도입하여 시간적 비디오 VLM 벤치마크 점수를 분해함으로써, 모델들이 시각적 콘텐츠보다는 위치 인코딩에 의존하는 경우가 많다는 점을 밝히고, 총점(aggregate scores)이 위치 지배적 구조와 시각적 시퀀스 지배적 구조 사이의 구별되며 상호 교환 불가능한 실패 모드들을 가린다는 것을 입증한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
위대한 비디오 탐정의 착각: 왜 점수가 같은 두 모델이 실제로는 다른가
당신이 Molmo2와 Qwen3-VL이라는 두 명의 탐정을 데리고 누가 비디오 미스터리를 더 잘 해결하는지 테스트하고 있다고 상상해 보세요. 당신은 그들에게 짧은 영상 클립들을 주고 "고양이가 개가 짖기 전인가요, 아니면 후인가요?"와 같은 질문을 던집니다. 두 탐정 모두 높은 점수, 예를 들어 0.96(또는 96% 정확도)을 받았습니다. 당신은 "훌륭해! 둘 다 시간을 완벽하게 이해하고 있군"이라고 생각할지도 모릅니다.
하지만 이 논문은 당신의 테스트가 사실 일종의 속임수라고 주장합니다. 그것은 마치 탐정에게 "사건을 해결했습니까?"라고 묻되, 어떻게 해결했는지는 묻지 않는 것과 같습니다. 이 논문은 두 탐정이 모두 정답을 맞혔지만, 그 정답에 도달하기 위해 완전히 다르고 정반대인 방법을 사용했다는 사실을 밝혀냅니다. 한 명은 눈에 보이는 것을 무시하는 "시간 여행자"이고, 다른 한 명은 자신의 눈을 믿는 "현실주의자"입니다.
하나의 점수에 숨겨된 두 가지 질문
저자들은 표준적인 비디오 테스트 점수가 사실 두 가지 서로 다른 질문이 뒤섞인 복잡한 칵테일이라고 말합니다.
- 태스크 질문(The Task Question): 질문이 실제로 영상을 순서대로 볼 필요가 있는가? (예: "공이 튀었나요?"는 한 프레임만 있어도 될 수 있지만, "공이 튀고 나서 굴러갔나요?"는 순서가 필요합니다.)
- 채널 질문(The Channel Question): 모델이 순서 정보가 필요할 때, 그 정보를 어디에서 얻는가? 모델은 픽셀(화면상의 실제 움직임)을 읽는가, 아니면 컴퓨터에게 이것이 1번, 2번, 3번 프레임임을 알려주는 보이지 않는 라벨인 **위치 번호(position numbers)**를 읽음으로써 속임수를 쓰는가?
대부분의 테스트는 첫 번째 질문만을 확인합니다. 그들은 프레임을 섞은 뒤 점수가 떨어지는지 봅니다. 만약 점수가 떨어진다면, 그들은 "좋아, 모델이 순서를 필요로 하는군"이라고 말합니다. 하지만 그들은 모델의 어느 부분이 핵심적인 역할을 하고 있는지는 확인하지 않습니다.
마법의 기술: "역전 드롭(Reversal-Drop)"
모델이 실제로 어떻게 작동하는지 알아내기 위해, 저자들은 **역전 드롭(reversal-drop)**이라는 마법의 기술을 수행했습니다.
풍선이 부풀어 오르는 영상을 상상해 보세요.
- 픽셀(The Pixels): 시각적 프레임은 풍선이 점점 커지는 모습을 보여줍니다.
- 위치 라벨(Position Labels/RoPE): 이것들은 각 프레임에 붙어 있는 "프레임 1", "프레임 2", "프레임 3"이라고 적힌 보이지 않는 태그입니다.
저자들은 영상을 가져와서, 픽셀은 역순으로 만들었지만(풍선이 커지는 게 아니라 작아지며 줄어드는 모습), 위치 라벨은 정방향으로 유지했습니다(컴퓨터는 여전히 1번, 2번, 3번 프레임을 보고 있다고 생각함).
이제 픽셀은 "줄어들고 있음"을 말하지만, 라벨은 "부풀어 오름"을 말합니다. 두 채널이 서로 싸우고 있는 것입니다.
- Molmo2 (위치 지배형 탐정): 픽셀과 라벨이 충돌할 때, Molmo2는 픽셀을 무시합니다. 라벨을 보고 "프레임 1, 2, 3"을 확인한 뒤, 풍선이 부풀어 오르는 것처럼 대답합니다. 비록 줄어드는 풍선을 보고 있음에도 불구하고, 라벨이 시키는 대로 "부풀어 오르고 있다!"라고 말하는 것입니다.
- 결과: 정확도가 거의 변하지 않았습니다. 영상이 역전되었다는 사실에 신경 쓰지 않았습니다. 이 모델은 **위치 인덱스(position indices)**를 읽고 있었던 것입니다.
- Qwen3-VL (시각적 순서 지배형 탐정): 픽셀과 라벨이 충돌할 때, Qwen3-VL은 라벨을 무시합니다. 픽셀을 보고 풍선이 줄어드는 것을 확인한 뒤, "줄어들고 있다!"라고 대답합니다.
- 결과: 정확도가 폭락했습니다. 역전된 영상에 속아 정답을 틀렸기 때문입니다. 이 모델은 **시각적 순서(visual order)**를 읽고 있었습니다.
숫자는 거짓말을 하지 않는다
논문은 이 "드롭(drop)"을 측정하여 차이를 증명했습니다.
- TVBench라는 벤치마크에서, 영상을 역전시키고 라벨은 정방향으로 유지했을 때:
- Molmo2는 거의 변화가 없었습니다 (약 +0.00 ~ +0.08 포인트). 아주 멀쩡했습니다.
- Qwen3-VL은 엄청나게 떨어졌습니다 (약 +0.24 ~ +0.55 포인트). 완전히 무너졌습니다.
- TempCompass에서, "쌍을 이룬 정답(paired ground truth)" 테스트(정방향과 역방향 영상 모두에 대한 정답을 알고 있는 테스트)를 사용했을 때:
- Molmo2는 두 경우 모두 (역전된 영상을 무시하고) "정방향" 이벤트에 대해 0.965의 점수로 답했습니다.
- Qwen3-VL은 정상 상태의 0.944에서 역전 상태의 0.576으로 급락했습니다.
이는 두 모델이 일반적인 테스트에서는 똑같이 높은 점수를 가질 수 있지만, 한 모델은 "지도(라벨)"에 의존하고 다른 모델은 "지형(픽셀)"에 의존한다는 것을 증명합니다. 만약 지도를 가짜로 바꾼다면, 첫 번째 모델은 실패하겠지만 두 번째 모델은 여-전히 괜찮을 수 있습니다.
이 논문이 배제한 것들
저자들은 이것이 단순히 오류나 테스트의 이상 현상이 아님을 확실히 하기 위해 매우 주의를 기울였습니다.
- 단순한 "혼란"이 아닙니다: 그들은 활성화 패칭(activation patching)(한 모델의 뇌세포를 다른 모델의 "올바른" 뇌세포로 교체하는 것과 같은 기술)을 사용하여 차이가 실재함을 증명했습니다.
- Molmo2의 "뇌"를 첫 번째 레이어에서 고정했을 때, 완벽하게 회복되었습니다.
- Qwen3-VL의 "뇌"를 첫 번째 레이어에서 고정했을 때, 여전히 약간 실패했습니다. 그들은 DeepStack이라는 기능이 추가적인 시각 데이터를 주입하는 레이어 0, 1, 2까지 내려가서 고쳐야만 회복할 수 있었습니다.
- 이는 차이가 표면적인 트릭이 아니라, 모델이 구축된 방식의 깊고 내부적인 특성임을 증명합니다.
- 단순한 "타임스탬프" 문제가 아닙니다: 그들은 모델이 화면에 적힌 시간(예: "00:01", "00:02")을 읽고 있는 것인지 확인했습니다. 타임스탬프가 도움이 되긴 하지만, 모델은 타임스탬프를 제거해도 여전히 위치 라벨이나 픽셀에 크게 의존한다는 것을 발견했습니다.
- 단순한 "단일 프레임" 속임수가 아닙니다: 그들은 두 모델 모두 이러한 문제를 해결하기 위해 실제로 여러 프레임이 필요하다는 것을 보여주었습니다 (전체 영상을 볼 때 단일 프레임보다 +0.20의 향상이 있었습니다). 따라서 그들은 단순히 한 장의 사진으로 찍어 맞히는 것이 아니라, 실제로 시퀀스를 처리하고 있습니다. 다만 서로 다른 방식으로 처리할 뿐입니다.
핵심 결론
논문은 단일 "시간적 점수(temporal score)"는 오해의 소지가 있다고 결론 내립니다. 그것은 마치 두 자동차의 최고 속도가 같다고 말하는 것과 같지만, 한 대는 휘발유로 달리고 다른 한 대는 전기로 달리는 것과 같습니다. 만약 주유소가 없는 길을 간다면, 전기차는 속도가 같았음에도 불구하고 실패할 것입니다.
- Molmo2는 **위치 지배적(position-dominant)**입니다: 시각적인 것보다 보이지 않는 라벨(RoPE)을 더 신뢰합니다.
- Qwen3-VL은 **시각적 순서 지배적(visual-sequence-dominant)**입니다: 라벨보다 자신이 보는 것(픽셀)을 더 신뢰합니다.
저자들은 미래의 테스트가 단순히 하나의 숫자만을 제시하는 것을 멈춰야 한다고 제안합니다. 대신, 모델이 지도를 읽고 있는지 아니면 지형을 읽고 있는지 확인하기 위해 **"역전 드롭(reversal-drop)"**을 보고해야 합니다. 이는 모델이 어떻게 실패하는지를 이해하는 데 도움을 줍니다. 만약 당신에게 실제 비디오 콘텐츠에 주의를 기울이는 모델이 필요하다면, 단순히 라벨을 읽는 모델을 선택해서는 안 됩니다. 만약 엄격한 스케줄을 따라야 하는 모델이 필요하다면, 라벨을 읽는 모델이 나을 수도 있습니다. 하지만 최종 점수만 봐서는 그 차이를 알 수 없습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.