← 최신 논문
💻 computer science

VideoReasonBench: Can MLLMs Perform Vision-Centric Complex Video Reasoning?

이 논문은 기존 벤치마크의 한계를 극복하기 위해 시각적 풍부함과 추론 복잡성을 갖춘 새로운 벤치마크 'VideoReasonBench'를 제안하고, 이를 통해 대부분의 멀티모달 LLM 은 복잡한 비디오 추론에서 부진한 반면 확장된 사고 과정이 필수적임을 입증합니다.

원저자: Yuanxin Liu, Kun Ouyang, Haoning Wu, Yi Liu, Lin Sui, Xinhao Li, Yan Zhong, Y. Charles, Xinyu Zhou, Xu Sun

게시일 2026-03-18
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yuanxin Liu, Kun Ouyang, Haoning Wu, Yi Liu, Lin Sui, Xinhao Li, Yan Zhong, Y. Charles, Xinyu Zhou, Xu Sun

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

🎥 비디오 추론의 새로운 시험대: 'VIDEOREASONBENCH' 설명

이 논문은 **"최신 인공지능 (AI) 이 정말로 복잡한 비디오를 보고 논리적으로 추론할 수 있을까?"**라는 질문에 답하기 위해 작성된 연구입니다.

기존의 AI 평가 방식은 마치 **"단순한 퀴즈"**를 풀게 하는 것과 비슷했습니다. 하지만 이 연구팀은 AI 에게 **"미로 찾기"**나 "수술 실습" 같은 훨씬 더 까다로운 과제를 주었습니다.

이 내용을 일상적인 비유로 쉽게 설명해 드릴게요.


1. 왜 새로운 시험이 필요했을까? (기존의 문제점)

지금까지의 AI 평가는 **"기억력"**이나 **"상식"**을 주로 테스트했습니다.

  • 비유: 마치 "이 사진에서 개가 몇 마리야?"라고 물어보는 거죠. AI 는 사진만 보고도 "1 마리"라고 쉽게 답할 수 있습니다.
  • 문제: 하지만 실제 세상은 그렇게 단순하지 않습니다. "이 사람이 10 분 동안 어떤 물건을 숨기고, 다시 꺼내서, 또 다른 사람에게 건네줬을 때, 마지막에 그 물건은 어디에 있을까?" 같은 시간이 흐르며 변하는 복잡한 상황을 이해하는 건 AI 에게 매우 어렵습니다.

기존 벤치마크 (시험지) 들은 AI 가 **"생각 (Chain-of-Thought)"**을 길게 펼칠 필요가 없도록 너무 쉬웠습니다. 그래서 AI 가 정말로 논리적으로 깊게 생각할 수 있는지 알 수 없었습니다.

2. 새로운 시험지: VIDEOREASONBENCH

연구팀은 **"VIDEOREASONBENCH"**라는 새로운 시험지를 만들었습니다. 이 시험지의 핵심은 **"보이지 않는 것을 추론하는 능력"**입니다.

🎬 시험 문제의 예시 (슬라이딩 퍼즐):

  1. 시작: AI 는 숫자가 적힌 타일들이 어떻게 배열되어 있는지 봅니다.
  2. 중간: 타일들이 움직이기 시작합니다. 하지만 중요한 건, 타일들이 움직이는 동안은 화면이 가려져서 (블루색으로 덮여) 타일의 위치를 볼 수 없다는 점입니다.
  3. 끝: 가려진 화면이 사라지고, 최종 타일 배열이 보입니다.
  4. 질문: "그럼, 중간에 타일이 몇 번 움직였고, 최종적으로 타일이 어떻게 배열되었을까?"

이 문제는 AI 가 단순히 영상을 보고 답하는 게 아니라, 마치 체스 선수가 다음 수를 계산하듯, "이게 움직였으니 저게 이렇게 변했겠지"라고 단계별로 추론해야만 풀 수 있습니다.

3. 시험 결과: AI 들은 어떻게 했을까?

연구팀은 최신 AI 모델 18 개를 이 시험에 도전시켰습니다. 결과는 충격적이었습니다.

  • 대부분의 AI (GPT-4o 등): **6.9%**의 점수. 거의 무작위로 찍는 수준이었습니다.
    • 이유: AI 들은 "보이는 것"에만 집중하고, "보이지 않는 과정"을 추적하는 데 실패했습니다. 마치 눈을 감고 퍼즐을 맞추려는 사람과 같습니다.
  • 성공한 AI (Gemini-2.5-Pro): **56.0%**의 점수. 압도적으로 잘했습니다.
    • 비유: 이 AI 는 **"생각하는 시간 (Thinking Budget)"**을 충분히 가져갔습니다. 마치 수학 문제를 풀 때 답만 외우는 게 아니라, 풀이 과정을 종이에 하나하나 적어가며 꼼꼼히 계산하는 학생처럼 행동했습니다.

4. 핵심 발견: "생각"이 필수입니다

이 연구에서 가장 중요한 발견은 **"생각할 시간을 더 주면 성능이 오르는가?"**에 대한 것이었습니다.

  • 기존 시험지: 생각할 시간을 10 배, 100 배 줘도 점수는 거의 오르지 않았습니다. (이미 너무 쉬워서 생각할 필요가 없었기 때문)
  • VIDEOREASONBENCH: 생각할 시간을 늘리자 점수가 폭발적으로 올랐습니다.
    • 비유: 기존 시험지는 "사과 몇 개?"를 묻는 거라 생각할 시간이 필요 없었지만, 새 시험지는 "복잡한 미로를 빠져나가는 길"을 묻는 거라 생각할 시간 (계산 능력) 이 없으면 절대 풀 수 없습니다.

5. 결론: AI 는 아직 '눈'이 부족합니다

이 논문의 결론은 다음과 같습니다.

  1. 현재 AI 의 한계: 대부분의 최신 AI 는 비디오 속의 미세한 움직임과 시간의 흐름을 추적하는 능력이 매우 부족합니다.
  2. 시각적 정보의 중요성: 만약 비디오를 텍스트로 요약해서만 보여준다면, AI 는 훨씬 잘 풀었습니다. 하지만 실제 영상을 보고 추론해야 하는 상황에서는 AI 가 매우 취약합니다.
  3. 미래의 방향: AI 가 진짜로 복잡한 세상을 이해하려면, 단순히 많은 데이터를 외우는 게 아니라 비디오 속의 사건들을 단계별로 논리적으로 연결하고 추론할 수 있는 능력을 키워야 합니다.

한 줄 요약:

"지금까지의 AI 시험은 너무 쉬워서 AI 가 '생각'할 필요가 없었습니다. 하지만 이번에 만든 새로운 시험 (VIDEOREASONBENCH) 은 AI 에게 '눈을 감고 퍼즐을 맞추는 것' 같은 어려운 과제를 주어, AI 가 정말로 논리적으로 생각할 수 있는지 시험했습니다. 그 결과, 대부분의 AI 는 실패했지만, '생각'을 충분히 할 수 있는 AI 는 성공했습니다."

이 연구는 앞으로 더 똑똑한 AI 를 만들기 위해, **"시각적 추론"**과 **"깊은 생각"**을 훈련시키는 것이 얼마나 중요한지 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →