← 최신 논문
💻 computer science

MotionGrounder: Grounded Multi-Object Motion Transfer via Diffusion Transformer

이 논문은 기존 방법의 한계를 극복하고 다중 객체 비디오에서 정밀한 제어가 가능한 새로운 프레임워크 'MotionGrounder'를 제안하며, 이를 통해 객체와 캡션의 정합성을 보장하는 손실 함수와 새로운 평가 지표를 도입하여 기존 베이스라인을 능가하는 성능을 입증했습니다.

원저자: Samuel Teodoro, Yun Chen, Agus Gunawan, Soo Ye Kim, Jihyong Oh, Munchurl Kim

게시일 2026-04-02
📖 3 분 읽기☕ 가벼운 읽기

원저자: Samuel Teodoro, Yun Chen, Agus Gunawan, Soo Ye Kim, Jihyong Oh, Munchurl Kim

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

MotionGrounder: 여러 개의 움직임을 한 번에, 정확하게 옮기는 마법사

이 논문은 **"MotionGrounder"**라는 새로운 AI 기술을 소개합니다. 이 기술은 기존의 비디오 생성 AI 가 가진 큰 한계를 해결해 줍니다.

🎬 기존 AI 의 문제: "혼란스러운 파티"

기존의 비디오 생성 AI 는 영상을 만들 때, **"한 명만 움직이는 영상"**은 잘 만들었습니다. 하지만 **"여러 명이 함께 있는 복잡한 장면"**을 만들려고 하면 엉망이 되었습니다.

비유: imagine(상상해 보세요) 한 파티에 AI 가 DJ 역할을 하고 있습니다.

  • 기존 AI: "누가 춤을 추나요?"라고 물으면, 한 사람만 춤추게는 잘 시킵니다. 하지만 "여러 명이 춤추게 해줘"라고 하면, 누가 누구인지 헷갈려서 모두 같은 동작을 하거나, 엉뚱한 사람이 춤을 추게 됩니다. 마치 DJ 가 마이크를 잘못 들고 "누가 춤추지?"라고 외치다 보니, 춤추는 사람과 춤추지 않는 사람이 뒤섞여 버린 것과 같습니다.

✨ MotionGrounder 의 해결책: "명확한 지시와 마법 지팡이"

MotionGrounder 는 이 문제를 해결하기 위해 두 가지 핵심 기술을 도입했습니다.

1. FMS (Flow-based Motion Signal): "안정적인 춤 동작 지도"

기존 기술은 영상의 움직임을 분석할 때 소음 (노이즈) 때문에 흔들리는 경우가 많았습니다. MotionGrounder 는 **광학 흐름 (Optical Flow)**이라는 기술을 이용해, 마치 **"춤 동작을 정확히 따라가는 지도"**를 먼저 그려냅니다.

  • 비유: 춤추는 사람의 발자국을 따라가는 투명한 발자국 지도를 먼저 만들어두고, AI 가 그 지도를 따라 춤을 추게 합니다. 그래서 흔들리지 않고 정확한 동작을 유지할 수 있습니다.

2. OCAL (Object-Caption Alignment Loss): "이름표 붙이기"

이게 가장 중요한 부분입니다. AI 가 여러 물체를 만들 때, **"누가 누구인지"**를 정확히 구분하게 해줍니다.

  • 상황: "여우와 너구리가 나무 위에 앉아 있다"는 문장을 AI 가 보고 영상을 만든다고 칩시다.
  • 기존 AI: "여우"와 "너구리"가 어디에 있어야 할지 헷갈려서, 둘 다 같은 자리에 생기거나, 여우가 너구리 역할을 하는 경우가 생깁니다.
  • MotionGrounder: AI 에게 **"여우는 왼쪽, 너구리는 오른쪽"**이라고 **명확한 이름표 (마스크)**를 붙여줍니다. AI 는 이 이름표를 보고, "아, 여우는 이쪽에서 움직여야 하고, 너구리는 저쪽에서 움직여야 구나!"라고 정확히 이해합니다.

🎯 이 기술이 가져온 변화

이 기술 덕분에 다음과 같은 놀라운 일이 가능해졌습니다.

  1. 여러 물체, 각자 다른 움직임: "군인이 탱크를 향해 걷고, 헬리콥터가 날아가고, 개가 뛰어다니는" 영상에서, 군인은 걷고, 헬리콥터는 날고, 개는 뛰는 식으로 각자 고유한 움직임을 정확하게 구현합니다.
  2. 배경은 그대로, 주인공은 바뀜: "사막에서 탱크를 향해 걷는 군인" 영상을 "달 표면에서 달 착륙선을 향해 걷는 우주비행사"로 바꿀 때, 군인의 걷는 동작은 그대로 유지하면서, 옷과 배경만 자연스럽게 바뀝니다.
  3. 학습 없이 바로 가능 (Zero-shot): 이 기술을 쓰기 위해 AI 를 다시 가르칠 필요가 없습니다. 이미 훈련된 AI 에다가 이 '명확한 지시'만 추가하면 바로 작동합니다.

📊 요약: 왜 이것이 중요한가요?

  • 기존: "여러 명이 있는 영상"을 만들면, 누가 누구인지 헷갈리고 움직임이 꼬였습니다. (예: 사자가 개처럼 움직이거나, 사람이 공중에 뜬 채로 움직이는 등)
  • MotionGrounder: **"누가, 어디에서, 어떻게 움직일지"**를 AI 에게 정확히 알려줍니다. 그래서 복잡한 상황에서도 각 물체가 제자리를 지키며 자연스럽게 움직이는 영상을 만들 수 있습니다.

결론적으로, MotionGrounder 는 AI 가 복잡한 장면을 이해하고, 각 캐릭터에게 개별적인 역할과 움직임을 부여하는 '명령자' 역할을 하게 만들어, 훨씬 더 현실적이고 통제 가능한 비디오를 만들어냅니다. 마치 영화 감독이 배우들에게 "너는 여기서 웃고, 너는 저기서 뛰어"라고 명확히 지시하는 것과 같습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →