← 최신 논문
💻 computer science

TOC-Bench: A Temporal Object Consistency Benchmark for Video Large Language Models

본 논문은 가림, 상태 변화, 상호작용을 거치며 비디오 대규모 언어 모델이 시간적 객체 일관성을 유지하는 능력을 평가하도록 설계된 엄격하게 필터링되고 인간이 검증한 벤치마크인 TOC-Bench 를 소개하며, 전반적인 비디오 이해의 진전에도 불구하고 현재 모델들이 정체성 민감 추론과 사건 순서화에 있어 현저히 어려움을 겪고 있음을 밝힌다.

원저자: Junzhe Chen, Siyuan Meng, Yuxi Chen, Man Zhao, Wenyao Gui, Xiaojie Guo

게시일 2026-05-13
📖 3 분 읽기☕ 가벼운 읽기

원저자: Junzhe Chen, Siyuan Meng, Yuxi Chen, Man Zhao, Wenyao Gui, Xiaojie Guo

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

친구가 영화를 처음 보는 상황이라고 상상해 보세요. 친구에게 "빨간 공이 소파 뒤로 굴러갔기 때문에 사라진 건가요, 아니면 방을 완전히 떠난 건가요?"라고 물어봅니다.

만약 친구가 표준 AI 비디오 모델이라면, "빨간 공을 보았고 나중에 소파를 보았으니 소파 뒤에 있을 것이다"라고 답할지도 모릅니다. 그들은 단일 순간의 이미지에서 사물을 인식하는 데는 능숙합니다. 하지만 "공이 숨기 전까지 몇 번 튀었나요?" 또는 "공이 튀는 것이 개가 들어오는 것보다 앞선 건가요, 아니면 뒤인 건가요?"라고 묻는다면 종종 혼란에 빠집니다. 특히 공이 숨겨지거나 나중에 다시 나타날 때, 그들은 그 특정 공의 이야기를 시간의 흐름에 따라 일관되게 추적하는 데 어려움을 겪습니다.

이 논문은 시간이 흐르면서 AI가 사물을 얼마나 잘 추적하는지 정확히 평가하기 위해 TOC-Bench(Temporal Object Consistency Benchmark, 시간적 사물 일관성 벤치마크) 라는 새로운 테스트를 소개합니다.

문제: "기억상실증"을 앓는 시청자

현재의 AI 모델은 개별 사진에 대한 기억은 뛰어나지만 사진 사이에서는 기억상실증을 앓는 사람과 같습니다. 그들은 사진 속에 무엇이 있는지 알려줄 수는 있지만, 종종 다음 사항을 놓칩니다:

  • 정체성: 숨은 후 다시 나타나는 사람이 동일한 사람인지, 아니면 다른 사람인지?
  • 연속성: 사물이 방을 떠난 것인지, 아니면 단순히 시야에서 가려진 것뿐인지?
  • 계수: 고양이가 몇 번 위아래로 점프했는지?
  • 순서: 컵이 깨진 것이 개가 짖는 것보다 앞선 건가요, 아니면 뒤인 건가요?

기존 테스트들은 주로 "이 비디오에서 무슨 일이 일어나고 있나요?" 또는 "주인공은 누구인가요?"와 같은 광범위한 질문을 던집니다. 그들은 AI가 전체 이야기 속에서 특정 사물의 여정을 따라갈 수 있는지 확인하지는 못합니다.

해결책: 탐정의 수첩 (TOC-Bench)

저자들은 TOC-Bench라는 특수 테스트 세트를 개발했습니다. 이를 비디오 AI 를 위한 "탐정의 수첩"이라고 생각하세요.

  1. 진실 (지도): AI 에게 질문하기 전에 연구자들은 특수 도구를 사용하여 비디오의 완벽한 "지도"를 만들었습니다. 그들은 빨간 공이나 사람과 같은 모든 사물을 프레임 단위로 추적하여 언제 나타났는지, 사라졌는지, 숨겨졌는지, 혹은 다른 사물과 상호작용했는지를 정확히 기록했습니다.

  2. 질문 (수수께끼): 그들은 오직 이 지도에만 기반하여 수천 개의 질문을 생성했습니다. 예를 들어: "파란 상자 뒤에 빨간 공이 숨겨진 횟수를 세어보세요."

  3. "단축키" 필터 (함정): 이것이 가장 교묘한 부분입니다. 연구자들은 AI 가 속임수를 쓸 수 없도록 하고 싶었습니다. 그들은 다음 세 가지 방법으로 답변할 수 있는 모든 질문을 제거하는 3 단계 필터를 사용했습니다:

    • 질문만 읽는 것 (언어적 속임수).
    • 단일 프레임만 보는 것 (정적 이미지 속임수).
    • 프레임을 무작위 순서로 보는 것 (시간 무시).

    비디오를 순서대로 시청하지 않고도 질문을 풀 수 있다면 그 질문은 폐기되었습니다. 이를 통해 AI 가 정답을 얻으려면 반드시 시간의 흐름과 사물의 역사를 이해해야 함을 보장합니다.

결과: 현실 점검

연구자들은 이 새로운 테스트에서 23 개의 서로 다른 AI 모델 (무료 및 유료 모델 모두) 을 테스트했습니다. 결과는 놀라웠습니다:

  • 격차: 인간은 약 **89%**의 정답률을 보인 반면, 가장 우수한 AI 모델은 고작 **47%**만 맞췄습니다.
  • 약점: AI 들은 다음 영역에서 형편없었습니다:
    • 계수: "이 사건은 몇 번 일어났나요?" (정답이 4 일 때 종종 2 라고 추측함).
    • 순서: "무엇이 먼저 일어났나요?" (시간 순서를 종종 뒤섞음).
    • 환각: 비디오에 존재하지 않는 사물에 대해 질문했을 때, AI 는 "그 사물은 없습니다"라고 말하기보다 종종 그 사물에 대한 이야기를 자신 있게 지어냈습니다.

핵심 교훈

이 논문은 "일반적인 비디오 이해"(예: 장면 설명) 에 능숙하다는 것이 "시간적 사물 일관성"(시간에 따른 특정 사물의 이야기 추적) 에 능숙하다는 것을 의미하지는 않는다고 결론 내립니다.

이렇게 생각해보세요: 당신은 장면에서 모든 배우의 이름과 그들이 무엇을 입고 있는지 아는 친구를 가질 수 있습니다. 하지만 10 분간의 논쟁 동안 누가 누구에게 비밀 편지를 건넸는지 추적해 달라고 요청하면, 그들은 실패할 것입니다. TOC-Bench 는 현재 AI 모델들이 시간 속을 통해 사물의 구체적인 여정을 추적하는 데 있어 여전히 "기억상실증"을 앓고 있음을 증명합니다.

저자들은 이 테스트가 개발자들이 단순히 순간을 인식하는 것이 아니라, 진정으로 이야기를 따라갈 수 있는 더 나은 AI 를 구축하는 데 도움이 되기를 바랍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →