← 최신 논문
💻 computer science

InternVideo-Next: Towards General Video Foundation Models without Video-Text Supervision

이 논문은 비디오 - 텍스트 라벨 없이 대규모 비디오를 학습하여 시공간 구조와 세계 지식을 효과적으로 포착하는 새로운 아키텍처 (EPD) 와 2 단계 사전 학습 전략을 제안함으로써, 기존 마스킹 비디오 모델링의 한계를 극복하고 범용 비디오 표현 학습의 새로운 기준을 제시합니다.

원저자: Chenting Wang, Yuhan Zhu, Yicheng Xu, Jiange Yang, Lang Lin, Ziang Yan, Yali Wang, Yi Wang, Limin Wang

게시일 2026-03-31
📖 3 분 읽기☕ 가벼운 읽기

원저자: Chenting Wang, Yuhan Zhu, Yicheng Xu, Jiange Yang, Lang Lin, Ziang Yan, Yali Wang, Yi Wang, Limin Wang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

🧐 기존 AI 의 문제점: "자막에 의존하는 눈먼 학생"

기존의 비디오 AI 는 주로 "비디오 + 자막" 데이터를 학습했습니다.

  • 비유: 마치 자막만 보고 영화를 이해하는 학생과 같습니다.
  • 한계: 자막에는 "사람이 공을 차다" 같은 대략적인 내용만 나옵니다. 하지만 공이 어떻게 날아갔는지 (물리 법칙), 공이 벽에 부딪혀 어떻게 튕겨 나갔는지 (3D 공간감), 왜 그 사람이 공을 찼는지 (인과관계) 같은 세밀한 정보는 자막에 없습니다.
  • 결과: AI 는 행동 인식은 잘하지만, 물체의 움직임이나 3D 공간 구조를 이해하는 데는 서툴렀습니다.

반면, **"마스크된 비디오 모델링 (MVM)"**이라는 다른 방식은 자막 없이 비디오 자체를 학습하려 했습니다.

  • 비유: 자막 없이 영화의 일부 장면을 가리고, 가린 부분을 상상해서 채우는 연습을 하는 것입니다.
  • 문제: 하지만 기존 방식은 두 가지 큰 실수를 저질렀습니다.
    1. 픽셀 재구성 (Pixel Reconstruction): 가린 부분을 "화소 (색상) 단위"로 채우려다 보니, AI 는 의미 있는 내용보다는 "색깔만 비슷하게 맞추는" 데 급급해졌습니다. (세부 묘사는 잘하지만, 전체적인 맥락을 놓침)
    2. 잠재 공간 예측 (Latent Prediction): 추상적인 개념을 예측하려다 보니, AI 는 "가장 쉬운 길 (Shortcut)"만 찾아냈습니다. (예: "사람이 달린다"는 말만 듣고, 배경이 흐릿해지는 것만 보고 '달린다'고 추측하는 식)

🚀 해결책: "InternVideo-Next"의 두 단계 전략

저자들은 이 문제를 해결하기 위해 **Encoder-Predictor-Decoder (EPD)**라는 새로운 구조를 만들었습니다. 이를 두 단계의 훈련 과정으로 나누어 설명해 드리겠습니다.

1 단계: "세밀한 그림자"와 "의미 있는 그림"을 동시에 잡기

  • 목표: 가린 부분을 채울 때, **세부적인 픽셀 (색상, 질감)**과 **높은 수준의 의미 (사물이 무엇인지)**를 모두 잃지 않는 것.
  • 방법:
    • 기존에는 가린 부분을 채울 때 단순한 선형 변환 (Linear Decoder) 을 썼는데, 이는 AI 에게 "의미보다는 색깔 맞추기"를 강요했습니다.
    • 새로운 아이디어: **확산 모델 (Diffusion Decoder)**을 사용했습니다.
    • 비유: 그림을 그릴 때, 단순히 색칠하는 게 아니라 이미지 생성 AI 가 그리는 것처럼 "이곳은 공이고, 공은 둥글고 반짝이며, 빛을 받아 그림자가 생긴다"는 이미지 수준의 지식을 주입하여 채우게 했습니다.
    • 효과: AI 는 가린 부분을 채우면서 세부적인 픽셀 정보높은 수준의 의미를 동시에 학습하게 되었습니다.

2 단계: "세계의 법칙"을 예측하는 훈련

  • 목표: 이제 AI 가 1 단계에서 배운 풍부한 지식을 바탕으로, 시간의 흐름과 인과관계를 학습합니다.
  • 방법:
    • 1 단계에서 학습된 "지식豊富な (지식이 풍부한) AI"를 **선생님 (Teacher)**으로 고정합니다.
    • 학생 (Student) AI 는 가린 비디오 조각을 보고, 선생님이 예측한 **추상적인 개념 (잠재 표현)**을 맞추는 훈련을 합니다.
    • 핵심: 선생님은 이미 1 단계에서 세부 정보와 의미를 모두 갖춘 상태이므로, 학생은 **쉬운 길 (단순한 통계적 패턴)**을 피하고 **진짜 세계의 법칙 (물리 법칙, 3D 구조, 인과관계)**을 학습해야만 정답을 맞출 수 있습니다.
    • 비유: 선생님이 "공이 벽에 부딪혀 튕겨 나간다"는 법칙을 이미 알고 있는데, 학생은 이 법칙을 이해하지 않고는 정답을 맞출 수 없습니다.

🏆 결과: 왜 이 모델이 특별한가요?

이 모델은 자막 (Video-Text) 없이, 오직 비디오 데이터만으로 훈련되었음에도 불구하고, 자막을 많이 사용한 최신 모델들보다 뛰어난 성과를 보였습니다.

  1. 행동 인식 (Action Recognition): 사람이 무엇을 하는지 정확히 알아맞힙니다.
  2. 세부 운동 감지 (Fine-grained Motion): 공이 어떻게 튕겨 나가는지, 물체가 어떻게 움직이는지 미세한 움직임까지 이해합니다.
  3. 3D 공간 및 깊이 인식 (Depth Estimation): 2D 비디오만 보고도 사물의 거리와 3D 구조를 파악합니다. (예: 깊이 추정)
  4. 객체 추적 (Object Tracking): 카메라가 흔들려도 물체를 따라가는 능력을 가집니다.
  5. 미래 예측 (Video Prediction): 현재 상황을 보고 "다음에 무슨 일이 일어날지" 예측합니다.

💡 요약: 한 문장으로 정리하면?

"InternVideo-Next 는 비디오를 볼 때 자막에 의존하지 않고, 마치 사람이 세상을 보듯 '세부적인 모습'과 '세계의 법칙'을 동시에 학습하여, 비디오의 숨겨진 의미를 깊이 있게 이해하는 새로운 AI 입니다."

이 기술은 앞으로 로봇이 세상을 이해하고 행동하는 것 (Embodied AI), 더 똑똑한 멀티미디어 AI를 만드는 데 중요한 기초가 될 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →