← 최신 논문
💻 computer science

VidNum-1.4K: A Comprehensive Benchmark for Video-based Numerical Reasoning

본 논문은 실제 비디오 맥락 내에서 복잡한 다단계 수치 추론을 수행하는 데 있어 현재의 시각-언어 모델들이 가진 중대한 한계를 엄격하게 평가하고 드러내기 위해, 3단계 계층 구조로 구성된 1,379개의 비디오-질문 쌍을 특징으로 하는 포괄적인 인간 주석 기반 벤치마크인 VidNum-1.4K를 소개한다.

원저자: Shaoyang Cui, Lingbei Meng, Yaodi Luo, Peize He

게시일 2026-07-20
📖 3 분 읽기☕ 가벼운 읽기

원저자: Shaoyang Cui, Lingbei Meng, Yaodi Luo, Peize He

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 영화를 보고 있다고 상상해 보세요. 하지만 단순히 줄거리를 즐기는 것이 아니라, 사물과 사건의 개수를 세고, 양 사이의 차이를 계산하며, 장면이 바뀐 후 군중의 수가 늘어났는지 줄어들었는지를 파악하는 능력을 테스트받고 있는 상황입니다. 이것이 바로 **시각-언어 모델(Vision-Language Models, VLMs)**의 세계입니다. 이 모델들을 이미지를 보고 비디오를 보며 텍스트를 읽을 수 있는, 우리처럼 세상을 이해하려고 노력하는 초스마트 디지털 탐정이라고 생각해보세요. 한동안 이 AI 탐정들은 "강아지가 달리고 있다"라고 말하는 것처럼 자신이 보는 것을 묘사하는 데 매우 능숙해졌습니다. 하지만 과학자들은 의문을 가져왔습니다. 과연 이 AI들이 정말로 이야기와 시간의 흐름, 그리고 사물이 어떻게 변하는지에 대한 논리를 이해하고 있는 것일까요? 아니면 그저 훈련 데이터에서 암기한 패턴을 바탕으로 추측하고 있는 것일까요? 이 질문은 매우 중요합니다. 만약 AI가 물리적 세계를 진정으로 이해하지 못한다면(예를 들어, 카메라 각도가 바뀌더라도 사과 두 개에 세 개를 더하면 다섯 개가 된다는 것을 아는 것처럼), 우리는 복잡한 실무 작업에서 AI를 신뢰할 수 없기 때문입니다.

여기에 VidNum-1.4K라는 새로운 도전 과제가 등장했습니다. 이는 AI 탐정들이 비디오 속에서 **수치적 추론(numerical reasoning)**을 할 수 있는지 테스트하기 위해 특별히 설계된 엄격한 "최종 시험"입니다. 이 연구를 이끄는 샤오양 퀴(Shaoyang Cui)와 그의 팀은 AI가 단순히 보는 것을 넘어 세고, 비교하고, 계산하도록 강요하는 1,379개의 비디오 클립과 질문 모음을 구축했습니다. 그들은 난이도가 높아지는 비디오 게임의 보스전처럼 질문들을 세 가지 단계로 구성했습니다. 레벨 1은 "이지 모드"로, AI가 "이 방에 초록색 문이 몇 개 있습니까?"와 같이 단순한 것을 세기만 하면 됩니다. 레벨 2는 난이도를 높여, 카메라가 다른 각도로 바뀌더라도 검은색 개는 무시하고 "갈색 개는 몇 마리입니까?"와 같이 특정 유형의 사물을 세도록 요구합니다. 레벨 3은 "하드코어 모드"로, 축구 경기 첫 번째 장면의 선수 수를 세고, 특정 제약 조건이 있는 두 번째 장면에서 다시 세는 등 다단계 논리를 수행한 뒤, 이 두 개의 분리된 사건 사이의 논리적 비교나 계산을 통해 답을 찾아내야 합니다.

시험 결과는 충격적이었습니다. 강력한 폐쇄형 모델인 "Gemini-1.5-pro"를 포함하여 가장 진보된 AI 모델들조차 단계별로 생각하도록 허용했을 때 정답률이 약 **60%**에 그쳤습니다. AI 세계의 커뮤니티 구축 도구와 같은 오픈 소스 모델들은 훨씬 더 고전하며 25%에서 45% 사이의 점수를 기록했습니다. 이 논문은 이러한 모델들이 여전히 "지름길(shortcuts)"—즉, 이전에 들었던 흔한 문구를 바탕으로 추측하는 것—에 의존하고 있으며, 사물이 시간이 지남에 따라 어떻게 행동하는지 이해하는 안정적인 "내부 세계 모델(internal world model)"을 구축하지 못하고 있다고 시사합니다. 예를 들어, 비디오가 새로운 장면으로 전환될 때 모델들은 종-종 숫자를 놓치거나 동일한 사물을 중복해서 세곤 하는데, 이는 그들이 영상 시작 부분의 개가 끝부분의 개와 동일하다는 것을 진정으로 파악하지 못하고 있음을 보여줍니다.

흥미롭게도, 연구진은 AI에게 "소리 내어 생각하기(Chain-of-Thought라고 불리는 기법)"를 요청하는 것이 가장 어려운 논리 퍼즐을 푸는 데는 도움이 되었지만, 때로는 이전에 맞혔던 쉬운 계산 작업들을 틀리게 만들기도 했다는 것을 발견했습니다. 이는 이러한 모델들이 높은 수준의 수학에는 익고 있지만, 비디오 속에서 움직이는 사물을 추적하는 기본적인 능력은 여전히 불안정하다는 것을 시사합니다. 이 연구는 단순히 AI 모델을 더 크게 만드는 것(파라미터 추가)이 복잡한 논리 해결에는 도움이 되지만, 서로 다른 비디오 장면을 가로질러 사물을 추적하는 데 겪는 문제를 마법처럼 해결해주지는 않는다고 결론짓습니다. Vid-Num-1.4K는 우리의 AI 탐정들이 점점 똑똑해지고는 있지만, 역동적으로 변화하는 세상을 진정으로 이해하기까지는 아직 갈 길이 멀다는 것을 보여주는 혹독하고 정직한 거울 역할을 하고 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →