← 최신 논문
💬 NLP

Tracing the Arrow of Time: Diagnosing Temporal Information Flow in Video-LLMs

본 논문은 비주얼 인코더와 프로젝터 설계의 병목 현상을 규명함으로써 비디오-LLM 의 열악한 시간적 추론 능력을 진단하고, 이를 통해 시간의 화살 태스크에서 거의 완벽한 성능을 달성하고 보다 광범위한 시간적 추론 벤치마크를 획기적으로 개선하는 새로운 아키텍처를 제시합니다.

원저자: Peitao Han, Fei Cheng, Lis K. Pereira, Qianying Liu, Shigeru Kitazawa

게시일 2026-05-11
📖 3 분 읽기☕ 가벼운 읽기

원저자: Peitao Han, Fei Cheng, Lis K. Pereira, Qianying Liu, Shigeru Kitazawa

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

유리잔이 테이블에서 떨어져 깨지는 장면을 담은 동영상을 보고 있다고 상상해 보세요. 그 동영상을 거꾸로 재생하면 조각들이 마법처럼 날아올라 완벽한 유리잔으로 다시 조립되는 것을 보게 됩니다. 심지어 유아조차 이것이 잘못되었다는 것을 압니다. 인간은 시간이 어느 방향으로 흐르는지 알려주는 선천적인 '시간 감각'을 가지고 있습니다.

이 논문은 Video-LLM(Video Large Language Models, 비디오 대형 언어 모델)이라고 불리는 고급 AI 모델들이 왜 이 간단한 작업에 서툴러 하는지 조사합니다. 인간이 거의 100%의 정확도로 정답을 맞히는 반면, 이러한 AI 모델들은 동전 던지기처럼 무작위로 추측하는 경우가 많습니다.

저자들은 AI 가 시간을 놓치는 원인을 찾기 위해 탐정 역할을 하기로 결정했습니다. 그들은 AI 를 세 가지 주요 부분으로 분해하고 각 부분을 통해 '시간의 화살'을 추적했습니다.

다음은 그들의 발견을 간단한 비유로 풀어낸 이야기입니다:

1. 카메라 (비전 인코더)

먼저, 그들은 동영상을 '보는' AI 부분을 살펴보았습니다. 두 가지 유형의 카메라를 발견했습니다:

  • '프레임 단위' 카메라: 이는 사진 앨범을 넘기듯 동영상의 각 장면을 개별적으로 봅니다. 사진 사이의 움직임을 놓칩니다. 논문은 이러한 카메라들이 시간에 대해 맹목적임을 발견했습니다. 유리잔이 떨어지는지 날아오르는지 구별할 수 없습니다.
  • '영화' 카메라: 이는 전체 동영상 클립을 한 번에 보며 프레임이 어떻게 연결되는지 이해합니다. 이러한 카메라들은 시간의 화살을 볼 수 있습니다. 저자들이 AI 의 나머지 부분 (뇌) 없이 이 부분만 테스트했을 때, 정답을 맞히는 비율이 85~90% 였습니다.

문제점: AI 에는 훌륭한 '영화 카메라'가 있지만, 정보가 뇌에 도달하기 전에 무언가가 잘못됩니다.

2. 번역기 (프로젝터)

비디오 카메라는 AI 의 '뇌'(언어 모델) 와 다른 언어를 사용합니다. 프로젝터라는 중개자가 동영상을 뇌가 이해할 수 있는 텍스트와 유사한 토큰으로 번역합니다.

저자들은 두 가지 유형의 번역기를 테스트했습니다:

  • '요약자' (Q-Former): 이 번역기는 효율성을 추구합니다. 전체 동영상을 보고 영화 리뷰처럼 몇 가지 핵심 문장으로 압축합니다. 불행히도, 그렇게 하는 과정에서 시간의 흐름을 버립니다. 뇌에 무엇이 일어났는지는 알려주지만, 언제 또는 어떤 순서로 일어났는지는 알려주지 않습니다. 논문은 이 번역기가 시간 정보를 파괴하여 AI 가 실패하게 만든다고 발견했습니다.
  • '시간 보존' 번역기 (MLP): 이 번역기는 신중합니다. 모든 장면을 순서대로 나열한 대본처럼 사건 순서를 온전하게 유지합니다. 이 번역기를 사용했을 때 AI 의 성능이 급격히 향상되었습니다.

발견: 병목 현상은 카메라가 아니라 번역기에 있었습니다. 표준 번역기는 실수로 메시지의 '시간' 부분을 삭제하고 있었습니다.

3. 뇌 (LLM)

마지막으로, 그들은 뇌 자체를 살펴보았습니다. 그들은 뇌가 정보가 올바르게 전달된다면 실제로 시간을 이해하는 데 꽤 능하다는 것을 발견했습니다.

  • 그러나 카메라가 뇌와 대화하도록 훈련되는 과정 (언어 정렬이라고 함) 에서 카메라는 단어 매칭에 집중하기 위해 시간의 구체적인 세부 사항을 잊기 시작한다는 점을 발견했습니다. 마치 유리잔이 떨어지는지 상승하는지 잊어버릴 정도로 유리잔을 잘 묘사하는 법을 배운 카메라와 같습니다.
  • 뇌는 카메라의 이전 계층에서 나온 원시적이고 필터링되지 않은 시간 데이터를 '시간 보존' 번역기를 통해 전달받을 때 가장 잘 작동합니다.

해결책: 시간을 잘 아는 AI 구축

이러한 단서들을 바탕으로 저자들은 세 가지 구체적인 업그레이드가 포함된 새로운 Video-LLM 을 구축했습니다:

  1. '영화' 카메라: 움직임을 명시적으로 이해하는 카메라.
  2. '시간 보존' 번역기: 시간의 흐름을 압축하는 것을 거부하는 번역기.
  3. 특별 훈련: '시간의 화살' 작업 (정방향 vs 역방향 비디오) 에 대해 AI 를 특별히 훈련시킴.

결과:
이 새로운 AI 는 단순히 더 나아진 것이 아니라 인간을 능가했습니다. 시간 방향 테스트에서 98.1% 의 정확도를 기록한 반면, 인간의 평균은 89.2% 였습니다.

더 나아가, 이 훈련은 시간 테스트에만 도움이 된 것이 아니었습니다. 이야기 속 사건의 순서나 이동 방향을 파악하는 등 시간 이해가 필요한 다른 작업에서도 AI 를 더 잘 만들었으며, 다른 벤치마크 점수를 최대 6 점까지 향상시켰습니다.

요약

이 논문은 AI 가 시간을 이해하기 위해서는 두 가지가 필요하다고 결론 내립니다:

  1. 사진이 아닌 시간을 실제로 기록하는 카메라.
  2. 메시지를 뇌로 전달할 때 시간의 흐름을 삭제하지 않는 번역기.

번역기에서 발생한 '누수'를 고치자, AI 는 마침내 시간의 화살을 명확하게 볼 수 있게 되었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →