← 최신 논문
🤖 AI

The TIME Machine: On The Power of Motion for Efficient Perception

이 논문은 현재 비디오 모델의 확장성과 언어 의존성 한계를 극복하여 기존 비디오 모델 대비 최대 10,000 배 적은 학습 데이터로 최첨단 제로샷 성능을 달성하는 마스킹 오토인코더를 통해 합성 운동 데이터만으로 학습된 자기지도형 비디오 표현인 TIME 을 소개합니다.

원저자: Mantas Skackauskas, Xinyue Hao, Laura Sevilla-Lara

게시일 2026-05-25
📖 3 분 읽기☕ 가벼운 읽기

원저자: Mantas Skackauskas, Xinyue Hao, Laura Sevilla-Lara

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇이 동영상을 이해하도록 가르친다고 상상해 보세요. 보통 우리는 로봇에게 현실 세계의 비디오 (요리하거나, 뛰거나, 춤추는 사람들 등) 를 수백만 개 보여주고 "이것은 양파를 썰고 있습니다" 또는 "이것은 충돌입니다"라고 말하며 가르칩니다.

이 논문은 이러한 전통적인 방식에 두 가지 큰 문제가 있다고 주장합니다:

  1. 엄청나게 비용이 많이 듭니다: 좋은 결과를 얻으려면 방대한 양의 데이터와 컴퓨팅 파워가 필요합니다.
  2. 단어에 지나치게 의존합니다: 자막을 이용해 로봇을 가르치면, 단어로 쉽게 설명할 수 있는 것들만 배울 수 있습니다. 공이 튀는 정확한 방식, 유리 조각이 부서지는 모습, 또는 충돌의 정확한 타이밍처럼 문장으로 표현하기 어려운 것들은 이해하는 데 어려움을 겪습니다.

해결책: "TIME" 기계

저자들은 로봇을 가르치는 새로운 방식을 제안하는데, 이를 TIME(Temporally Informed Motion Embedding, 시간 정보 기반 운동 임베딩) 이라고 부릅니다. 로봇에게 색상, 질감, 얼굴이 포함된 전체 동영상을 보여주는 대신, 모든 것을 제거하고 운동만 보여줍니다.

이렇게 생각해보세요:

  • 전통적인 비디오 모델은 자동차 충돌의 풀컬러 영화를 보고 대본을 읽으며 배우들의 이름을 외우는 물리학을 배우려는 학생과 같습니다.
  • TIME 모델은 충돌의 와이어프레임 애니메이션만 보는 학생과 같습니다. 그들은 자동차의 페인트나 운전자의 얼굴을 보지 않으며, 점들이 어떻게 움직이고 충돌하는지만 봅니다.

작동 원리: "유령 점들"

  1. 입력: 시스템은 비디오를 받아 화면을 가로지르는 특정 점 (점들) 을 추적합니다. 색상과 모양은 완전히 무시합니다.
  2. 훈련 게임: 시스템은 "빈칸 채우기" 게임을 합니다. 움직이는 점들의 시퀀스를 가져와 그 중 75% 를 가리고 (숨기고), AI 에게 여전히 볼 수 있는 점들만을 바탕으로 숨겨진 점들이 어디에 있었는지 추측하도록 요청합니다.
  3. 비밀 재료: 여기가 가장 놀라운 부분입니다. AI 는 실제 비디오를 한 번도 보지 않습니다. 완전히 합성 데이터로 훈련됩니다. 즉, 가상 세계에서 튀어 오르는 간단한 모양 (큐브와 구 등) 의 컴퓨터 생성 시뮬레이션으로 훈련됩니다.

이것이 중요한 이유

이 논문은 이 접근 방식이 앞서 언급한 두 가지 큰 문제를 해결한다고 주장합니다:

1. 데이터 효율성의 기적
보통 똑똑한 비디오 AI 를 얻으려면 수천 년 분량의 비디오 영상을 먹여야 합니다. 그러나 TIME 모델은 컴퓨터 생성 시뮬레이션 140 시간만으로 기술을 습득했습니다.

  • 비유: 운전하는 법을 배우려 한다고 상상해 보세요. 대부분의 사람들은 교통이 있는 실제 도로에서 수년을 운전하며 배웁니다. 반면 TIME 모델은 완벽한 오류 없는 운전 시뮬레이션을 단 며칠간 플레이하며 운전하는 법을 배웠지만, 수년을 운전한 전문가들과 똑같이 잘 수행합니다.

2. "시간"을 더 잘 이해합니다
모델이 색상이나 질감에 방해받지 않고 운동만 보도록 강요받기 때문에, 시간적 인과관계를 이해하는 데 전문가가 됩니다.

  • 비유: 전통적인 AI 에게 양파를 까는 사람의 비디오를 보여주면, 양파의 색상이나 주방 배경에 혼란을 느낄 수 있습니다. TIME 모델은 손의 움직임과 층들의 분리를 봅니다. 그것은 운동의 "이야기"를 완벽하게 이해합니다.

결과

연구진들은 이 "운동 전용" 뇌를 다양한 작업에 테스트했습니다:

  • 방향성 작업: 무언가가 "위"로 움직이는지 "아래"로 움직이는지 알 수 있을까요? 네, 10,000 배 적은 데이터를 사용함에도 불구하고 세계 최고의 모델과 맞먹거나 능가합니다.
  • 물리 작업: 물체가 충돌하는 횟수를 셀 수 있을까요? 네, 현실 세계 데이터로 훈련된 거대 모델들을 능가합니다.
  • 팀워크: 이 "운동 뇌"를 색상과 질감을 보는 표준 "외관 뇌"와 결합했을 때, 팀은 어느 하나만 사용할 때보다 훨씬 더 잘 수행했습니다. 단서 (외관) 를 찾는 데 뛰어난 탐정과 사건의 순서를 이해하는 시간 여행자 (운동) 가 팀을 이루는 것과 같습니다.

결론

이 논문은 AI 를 더 똑똑하게 만들기 위해 현실 세계의 비디오를 점점 더 많이 먹일 필요가 없다고 결론지었습니다. 대신, 간단하고 깨끗한 컴퓨터 생성 데이터를 사용하여 운동의 순수한 "춤"을 이해하도록 가르침으로써, 훈련 비용이 더 저렴하고 시간을 더 잘 이해하며, 현실 세계의 시각적 혼란에 덜 혼란을 겪는 비디오 모델을 구축할 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →