← 최신 논문
💻 computer science

InTraGen: Trajectory-controlled Video Generation for Object Interactions

이 논문은 텍스트의 모호성을 보완하고 객체 간 상호작용의 현실성을 높이기 위해 궤적 제어, 다중 모달 인코딩 및 객체 ID 주입 메커니즘을 도입한 'InTraGen' 파이프라인과 이를 평가하기 위한 새로운 데이터셋 및 지표를 제안합니다.

원저자: Zuhao Liu, Aleksandar Yanev, Ahmad Mahmood, Ivan Nikolov, Saman Motamed, Wei-Shi Zheng, Xi Wang, Lei Sun, Luc Van Gool, Danda Pani Paudel

게시일 2026-04-03
📖 3 분 읽기☕ 가벼운 읽기

원저자: Zuhao Liu, Aleksandar Yanev, Ahmad Mahmood, Ivan Nikolov, Saman Motamed, Wei-Shi Zheng, Xi Wang, Lei Sun, Luc Van Gool, Danda Pani Paudel

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

🎥 인트라젠 (InTraGen): "영화 속 주인공들의 움직임을 내가 직접 지휘한다!"

이 논문은 비디오 생성 AI의 새로운 혁신을 소개합니다. 기존 AI 는 "공을 던지는 장면"이라고 말하면 공이 어떻게 날아갈지, 누가 공을 잡을지, 공이 벽에 부딪히면 어떻게 튕겨 나갈지 정확히 예측하지 못해 엉뚱한 장면을 만들어내곤 했습니다.

이 문제를 해결하기 위해 개발된 **'인트라젠 (InTraGen)'**은 마치 영화 감독이 배우들에게 "여기서 저기로 걸어가고, 저기서 공을 받아쳐!"라고 구체적인 지시를 내리는 것과 같습니다.


1. 왜 이 기술이 필요한가요? (기존의 문제점)

기존의 텍스트 기반 비디오 생성 AI 는 모호한 지시를 받으면 혼란을 겪습니다.

  • 비유: 당신이 "빨간 차가 파란 차를 들이받는다"고 말하면, AI 는 두 차가 동시에 화면에 나타나거나, 충돌 순서가 뒤죽박죽이 될 수 있습니다. AI 는 "시간의 흐름"을 텍스트로만 이해하려다 보니, 어떤 물체가 언제, 어떻게 움직이는지를 정확히 파악하지 못합니다.

2. 인트라젠의 핵심 아이디어: "궤적 (Trajectory) 지도"

인트라젠은 텍스트 대신 **물체의 이동 경로 (궤적)**를 입력으로 받습니다.

  • 비유: 마치 드론 촬영을 할 때, 드론이 어디를 날아가야 할지 미리 GPS 경로를 입력하는 것과 같습니다.
    • 사용자는 "공이 A 지점에서 B 지점으로 굴러가서 벽에 부딪혀 C 지점으로 튕겨 나가라"는 경로 지도를 AI 에게 줍니다.
    • AI 는 이 지도를 보고, 공이 정확히 그 길을 따라 움직이게 영상을 만들어냅니다.

3. 어떻게 더 똑똑하게 만들었나요? (세 가지 비밀 무기)

인트라젠은 단순히 경로만 따라가는 게 아니라, 세 가지 정보를 동시에 이해하도록 훈련되었습니다.

① 움직이는 것 (Dynamic) vs. 멈춰 있는 것 (Static)

  • 비유: 무대 위에 춤추는 배우조명 기구가 있다고 상상해 보세요.
    • 기존 AI 는 춤추는 배우만 보고 조명 기구는 잊어버리거나, 둘을 섞어버리는 실수를 했습니다.
    • 인트라젠은 **춤추는 배우 (움직이는 물체)**와 **조명 기구 (멈춰 있는 물체)**를 명확히 구분합니다.

② 각자의 이름표 (Object ID)

  • 비유: 두 명의 배우가 매우 가까이서 춤을 추고 있다면, 카메라가 누구를 찍고 있는지 헷갈릴 수 있습니다.
    • 인트라젠은 각 물체에 **고유한 이름표 (ID)**를 붙여줍니다. 빨간 공은 '공 A', 파란 공은 '공 B'로 구분해서, 서로 섞여도 누가 누구인지 절대 잊지 않게 합니다.

③ 상호작용 (Interaction)

  • 비유: 두 공이 부딪혔을 때, AI 는 단순히 겹쳐지는 게 아니라 **"부딪히는 순간의 물리 법칙"**을 이해합니다.
    • 공이 벽에 부딪혀 튕겨 나가는 모습이나, 한 물체가 다른 물체를 밀어내는 장면을 자연스럽게 구현합니다.

4. 어떻게 테스트했나요? (가상 현실 놀이터)

이 기술이 정말 잘 작동하는지 확인하기 위해, 연구팀은 **블렌더 (Blender)**와 **유니티 (Unity)**라는 3D 게임 엔진을 이용해 5 만 개가 넘는 가상 비디오를 직접 만들었습니다.

  • 풀 (Pool) 게임: 공들이 테이블 모서리에 부딪혀 복잡한 궤적을 그리는 장면.
  • 도미노: 도미노가 줄지어 넘어가는 장면.
  • 축구: 골키퍼와 선수가 공을 주고받는 장면.
  • 이 모든 장면에서 AI 가 입력한 경로대로 물체가 움직이는지, 충돌이 자연스러운지 철저히 검증했습니다.

5. 결과: 어떤 변화가 일어났나요?

  • 정확도 향상: AI 가 만든 영상이 사용자가 원하는 경로와 거의 일치하게 되었습니다.
  • 현실감: 물체가 부딪히거나 떨어지는 모습이 실제처럼 보입니다.
  • 다른 모델과의 비교: 기존 최신 모델들 (I2VGen-XL, LUMA 등) 은 복잡한 상호작용 장면에서 실패한 반면, 인트라젠은 가장 현실적인 결과를 보여주었습니다.

🌟 한 줄 요약

"인트라젠은 AI 에게 '무엇을' 만들지 말하는 대신, '어떻게 움직일지' 지도를 그려주어, 영화 속 물체들이 마치 실제 배우처럼 정교하게 상호작용하게 만든 기술입니다."

이 기술은 앞으로 게임 제작, 영화 특수효과, 혹은 복잡한 시뮬레이션 분야에서 AI 가 더 정교하고 예측 가능한 영상을 만드는 데 큰 역할을 할 것으로 기대됩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →