← 최신 논문
🤖 AI

Rebalancing Reference Frame Dominance to Improve Motion in Image-to-Video Models

본 논문은 어텐션 메커니즘에서 참조 프레임의 지배력을 재조정하여 이미지-비디오 생성의 운동 역학을 강화하고, 추가 학습 없이도 시각적 충실도를 훼손하지 않으면서 운동 억제를 극복하는 학습 불필요 및 모델 독립적 방법인 DyMoS 를 소개한다.

원저자: Wooseok Jeon, Seungho Park, Seunghyun Shin, Sangeyl Lee, Hyeonho Jeong, Hae-Gon Jeon

게시일 2026-05-20
📖 3 분 읽기☕ 가벼운 읽기

원저자: Wooseok Jeon, Seungho Park, Seunghyun Shin, Sangeyl Lee, Hyeonho Jeong, Hae-Gon Jeon

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

"Rebalancing Reference Frame Dominance to Improve Motion in Image-to-Video Models"(DyMoS) 논문에 대한 설명을 쉬운 언어와 창의적인 비유로 풀어보겠습니다.

문제: "얼어붙은" 비디오

말의 사진을 가지고 컴퓨터에게 그 말의 달리는 모습을 비디오로 만들어달라고 요청한다고 상상해 보세요. 말은 질주할 것이라고 기대하시겠지만, 현재의 AI 모델들은 종종 원래 사진에 대해 너무 "공손한" 반응을 보입니다. 여러분이 준 사진을 바꾸는 것을 너무 두려워하기 때문에, 말은 제자리에 얼어붙은 채로 머릿속만 살짝 움직일 뿐입니다.

이 논문은 이를**"정적 운동 편향 (Static Motion Bias)"**이라고 부릅니다. AI 가 첫 번째 프레임 (참조 이미지) 을 완벽하게 유지하는 데 너무 집중하다 보니, 나머지 비디오가 움직이도록 만드는 것을 잊어버리는 것입니다.

발견: "과도하게 주의 깊은" 학생

연구진들은 이러한 AI 모델이 작동하는 방식을 자세히 살펴보았습니다. 그리고**"참조 프레임 우세 (Reference-Frame Dominance)"**라고 부르는 특정 행동을 발견했습니다.

AI 모델을 시험을 치르는 학생이라고 상상해 보세요.

  • 텍스트 프롬프트는 질문입니다: "말을 달리게 해줘."
  • 참조 이미지는 책상 위에 놓인 말의 사진입니다.

일반적인 텍스트 - 비디오 모델에서 학생은 질문을 보고 달리는 말을 상상합니다.
하지만 이미지 - 비디오 모델에서 학생은 책상 위의 사진을너무 빤히쳐다봅니다. 학생이 비디오의 다음 프레임을 그리려고 할 때마다, 사진을 보며 이렇게 말합니다. "좋아, 이 다음 프레임은 사진과 정확히 똑같이 그려야 해."

학생이 사진을 복사하는 데 너무 집착하다 보니, 실제로 말의 움직임을 그리지 못합니다. "사진"이 "상상력"을 지배하고 있는 셈입니다.

해결책: DyMoS("운동 슬라이더")

연구진들은 **DyMoS(Dynamic Motion Slider)**라는 도구를 개발했습니다. 이 도구는 AI 를 다시 학습시키거나 원래 사진을 변경할 필요가 없습니다. 대신, 학생의 집착을 조절하는 볼륨 노브처럼 작동합니다.

작동 원리:

  1. 개입: 비디오 생성의 아주 초기 단계 (즉, "디노이징" 단계) 에 DyMoS 는 학생의 어깨를 살며시 두드립니다. "이봐, 참조 사진을 너무 빤히 쳐다보지 마. 이제 움직임을 상상해야 해."라고 말입니다.
  2. 메커니즘: 기술적으로 이는 AI 의 주의 시스템에 있는 특정 숫자 (편향) 를 조정합니다. AI 가 다음 프레임이 어떻게 보여야 할지 결정할 때, 참조 이미지 토큰에 부여하는 점수를 약간 낮춥니다.
  3. 결과: AI 는 여전히 사진을 볼 수 있습니다 (그래서 말은 여전히 말처럼 보입니다). 하지만 더 이상 사진을 완벽하게 복사하도록 강요받지는 않습니다. 이로 인해 AI 는 말이 달리고, 차가 운전하며, 물이 튀는 것을 자유롭게 구현할 수 있게 됩니다.

"슬라이더" 기능

DyMoS 의 가장 멋진 점은 단순히 켜고 끄는 스위치가 아니라 슬라이더라는 것입니다. 사용자가 조절할 수 있는 숫자가 하나 있습니다.

  • 내리면 (음수): AI 는 사진에 대해 더 집착하게 됩니다. 비디오는 더욱 정적이 됩니다 (거의 움직이지 않는 정지 이미지를 원할 때 유용합니다).
  • 올리면 (양수): AI 에게 사진의 "얼어붙은" 성격을 더 무시하라고 지시합니다. 비디오는 매우 역동적이고 에너지가 넘치게 됩니다.
  • 중간 지점: 비디오가 자연스럽게 움직이면서도 캐릭터가 처음 시작한 사진과 정확히 똑같이 보이도록 완벽한 균형을 찾을 수 있습니다.

기존 방법보다 더 나은 이유

이전까지 "얼어붙은 비디오" 문제를 해결하려는 시도들은 엔진을 부수거나 바퀴를 페인트로 덮는 방식으로 차를 고치려는 것과 같았습니다.

  • 일부 방법은 AI 전체를 재학습시키는 것을 요구했습니다 (비싸고 느립니다).
  • 다른 방법들은 운동을 강제하기 위해 입력 이미지를 흐리게 하거나 망가뜨리려 시도했는데, 이로 인해 비디오가 추하거나 왜곡되는 경우가 많았습니다.

DyMoS 는 다음과 같은 이유로 다릅니다:

  1. 학습 불필요 (Training-Free): AI 에게 새로운 것을 가르칠 필요가 없습니다. AI 가 작동하는 동안 이 도구만 사용하면 됩니다.
  2. 모델 중립성 (Model-Agnostic): Wan 2.2, HunyuanVideo, CogVideoX 와 같은 거의 모든 최신 비디오 AI 에서 작동합니다.
  3. 품질 유지: 비디오를 움직이게 하면서도 사진이 흐릿하거나 이상해지지 않도록 합니다.

요약

이 논문은 이미지 - 비디오 모델이 입력 이미지에 대해 "너무 공손한" 나머지 비디오가 지루하고 정지된 상태가 된다는 점을 규명했습니다. 연구진들은 DyMoS라는 간단한 도구로 이를 해결했습니다. 이 도구는 볼륨 노브처럼 작동하여, AI 가 시작 사진에 대한 집착을 운동이 일어날 수 있을 정도로만 적절히 낮춤으로써, 모델이나 원래 이미지를 변경하지 않고도 해결책을 제시합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →