← 최신 논문
💻 computer science

MiVE: Multiscale Vision-language features for reference-guided video Editing

MiVE 는 Qwen3-VL 의 계층적 다중 스케일 특징을 통합된 자기 주의 확산 트랜스포머 내에서 활용하여 모달리티 간극과 공간적 세부 정보 손실을 극복하고, 운동성을 유지하며 정밀한 편집을 수행하는 데 있어 최첨단 성능을 달성하는 참조 기반 비디오 편집 프레임워크를 소개합니다.

원저자: Tong Wang, Meng Zou, Chengjing Wu, Xiaochao Qu, Luoqi Liu, Xiaolin Hu, Ting Liu

게시일 2026-05-15
📖 3 분 읽기☕ 가벼운 읽기

원저자: Tong Wang, Meng Zou, Chengjing Wu, Xiaochao Qu, Luoqi Liu, Xiaolin Hu, Ting Liu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

친구가 길을 걷는 홈 비디오가 있다고 상상해 보세요. 머리카락 색을 선명한 분홍색으로 바꾸고 싶지만, 걷는 모습, 배경, 그리고 그 외 모든 것은 정확히 그대로 유지하고 싶습니다. 이것이 바로 참조 기반 비디오 편집의 과제입니다.

이 논문은 기존 방법들, 심지어 고가의 상용 시스템보다 이 문제를 더 잘 해결하는 MiVE(참조 기반 비디오 편집을 위한 다중 스케일 비전 - 언어 특징) 라는 새로운 도구를 소개합니다.

MiVE 가 어떻게 작동하는지 간단한 비유로 설명해 드리겠습니다:

문제: "번역가" 대 "건축가"

기존 비디오 편집 도구들은 보통 두 가지 일을 따로 처리하려 합니다:

  1. 번역가: 텍스트 지시사항 (예: "머리카락을 분홍색으로 만들어라") 을 읽는 시스템.
  2. 건축가: 비디오와 참조 사진을 보고 무엇을 변경해야 할지 이해하는 시스템.

이 논문은 이 두 시스템이 종종 서로의 말을 제대로 듣지 못한다고 주장합니다. "번역가"는 분홍색 머리카락이라는 개념은 이해하지만, 정확히 어디에 머리카락이 있는지 모릅니다. "건축가"는 머리카락을 보지만 구체적인 지시사항을 완전히 파악하지 못할 수 있습니다. 그들이 작업 후반부에 서로의 결과를 합치려 할 때, 결과는 종종 흐릿하거나 일관성이 없거나, 변경하고 싶지 않은 부분까지 변해버립니다.

해결책: MiVE 의 "전원 회의"

MiVE 는 하나의 강력한 두뇌 (Qwen3-VL 이라는 비전 - 언어 모델) 를 사용하여 모든 일을 한 번에 처리함으로써 게임의 규칙을 바꿉니다. 하지만 여기서 핵심 비법은 바로 MiVE 가 그 두뇌 내부의 서로 다른 "목소리"들을 경청한다는 점입니다.

저자들은 딥러닝 모델이 고층 빌딩의 층수처럼 레이어로 구성되어 있음을 발견했습니다:

  • 아래층 (초기 레이어): 이들은 확대경을 든 건축가와 같습니다. 머리카락 한 올의 정확한 모양, 셔츠의 질감, 또는 그림자의 가장자리 같은 작고 구체적인 세부 사항들을 봅니다.
  • 최상층 (최종 레이어): 이는 CEO와 같습니다. 큰 그림과 의미를 이해합니다. "이건 사람이다", "이건 분홍색 머리카락이다", "이건 화창한 날이다" 같은 것들입니다.

기존 방법은 CEO(최종 레이어) 의 목소리만 들었습니다. 무엇을 해야 하는지는 알았지만 세부 사항을 놓쳐 흐릿한 편집 결과를 낳았습니다.
MiVE는 확대경을 든 건축가들과 CEO 가 동시에 이야기하는 회의를 엽니다.

작동 방식: "통합 무대"

텍스트, 참조 사진, 비디오가 복잡한 릴레이 경기처럼 서로에게 말을 전달하는 방식 (지연과 오류를 유발함) 대신, MiVE 는 이들을 모두 단 하나의 무대에 올립니다.

  1. 입력: MiVE 에게 원본 비디오, 텍스트 지시사항, 그리고 원하는 결과물의 모습을 담은 참조 사진을 제공합니다.
  2. 혼합: MiVE 는 참조 사진과 지시사항에서 "확대경" 세부 사항과 "큰 그림" 의미를 모두 취합니다.
  3. : 이 모든 정보를 하나의 큰 풀에 섞습니다. 비디오 프레임은 단순히 지시사항을 "듣는" 것이 아니라, 그들과 함께 "춤"을 춥니다. 이로써 비디오가 머리카락 색을 바꿀 때, 정확히 어떤 픽셀을 건드리고 어떤 픽셀은 건드리지 말아야 하는지 알게 되어, 원래의 움직임을 완벽하게 보존합니다.

결과: 왜 MiVE 가 승리하는가

이 논문은 MiVE 를 다른 최상위 학술 모델들과 유명한 상용 시스템 (Kling O1) 과 비교 테스트했습니다.

  • 단순한 시나리오에서: MiVE 는 배경을 흐리게 하지 않고 물체의 색을 바꾸거나 사람을 제거할 수 있었습니다.
  • 복잡한 시나리오에서: 비디오에 빠른 움직임, 그림자, 또는 물체 뒤를 걷는 사람들이 있을 때, MiVE 는 사람의 얼굴을 식별 가능하게 유지하고 조명을 사실적으로 표현한 유일한 모델이었습니다.

저자들은 MiVE 가 가장 뛰어난 이유는 단순히 추측하지 않기 때문이라고 말합니다. 정밀함을 보장하기 위해 세부 사항(초기 레이어에서) 을 활용하고, 지시사항이 올바르게 따르도록 보장하기 위해 큰 아이디어(최종 레이어에서) 를 활용합니다.

요약

MiVE 를 시나리오 (텍스트) 를 읽고 참조 (사진) 를 보는 것을 따로 하지 않는 마스터 편집자로 생각하세요. 대신 MiVE 는 전체 영화전체 시나리오를 동시에 볼 수 있는 초능력을 가지고 있습니다. 이는 광범위한 이야기작은 세부 사항에 동시에 주의를 기울일 수 있게 합니다. 이를 통해 MiVE 는 자연스럽고 일관성이 있으며 지시사항을 완벽하게 따르는 변경을 가능하게 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →