← 최신 논문
💻 computer science

ReBind: Multi-Reference Video Editing via Structured Instructions with Explicit Reference Relationships

ReBind는 명시적인 참조 토큰을 포함하는 시맨틱 명령어를 생성하도록 설계된 특화된 MLLM(ReBind-Instruct)을 도입함으로써, 시각적 속성을 해당 소스에 정밀하게 결합하고 다중 참조 이미지 조건부 비디오 편집에서 최첨단 성능을 달성하여 비디오 편집 시 여러 시각적 소스를 조정하는 문제를 해결하는 체계적인 프레임워크입니다.

원저자: Xinyu Liu, Shihao Li, Weihong Lin, Xinlong Chen, Yang Shi, Yujin Han, Yiyang Cai, Yanghao Wang, Ruibin Yuan, Yuanxing Zhang, Pengfei Wan, Wenhan Luo, Yike Guo

게시일 2026-07-17
📖 5 분 읽기🧠 심층 분석

원저자: Xinyu Liu, Shihao Li, Weihong Lin, Xinlong Chen, Yang Shi, Yujin Han, Yiyang Cai, Yanghao Wang, Ruibin Yuan, Yuanxing Zhang, Pengfei Wan, Wenhan Luo, Yike Guo

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 영화의 한 장면을 촬영하려는 감독이라고 상상해 보세요. 하지만 당신에게는 단 하나의 대본 대신, 사진 한 더미와 비디오 클립 하나가 무질서하게 놓여 있고, 당신은 배우들에게 정확히 무엇을 해야 할지 지시해야 합니다. 이것이 바로 AI 비디오 편집의 세계입니다. 컴퓨터가 우리가 말하는 바에 따라 영상을 변화시키는 법을 배우는 분야죠. 오랫동안 이 컴퓨터들은 열정적이지만 혼란스러워하는 인턴과 같았습니다. 만약 당신이 "하늘을 이 사진처럼 만들고, 캐릭터를 저 사진처럼 만들어줘"라고 요청하면, 그들은 하늘과 캐릭터를 서로 바꾸거나 두 이미지를 이상하게 뒤섞어 버리곤 했습니다. 핵심적인 문제는 컴퓨터가 이미지를 '볼' 수 없어서가 아니라, 어떤 특정 사진을 바탕으로 영상의 어느 부분을 바꿔야 하는지 명확하게 이해할 수 있는 '지시 사항'을 파악하지 못했다는 점이었습니다.

이 논문인 ReBind는 더 똑똑한 비디오 생성기를 만드는 것보다, 더 똑똑한 "번역기"를 갖추는 것이 비결이라는 점을 깨달음으로써 그 혼란을 해결합니다. 저자들은 기존의 방식, 즉 "2번 사진에 있는 사람으로 저 남자를 교체해"와 같은 모호한 문장으로 지시하는 것은 여러 장의 사진이 관여될 때 컴퓨터가 처리하기에는 너무 불분명하다고 제안합니다. 대신, 그들은 새로운 방식으로 AI와 대화할 것을 제안합니다. 마치 엄격한 무대 감독처럼, 모든 사진을 하나하나 가리키며 "이 부분의 영상은 특정 사진에서 온 것이고, 저 부분은 사진에서 온 것이다"라고 명시적으로 말하는 방식입니다. 지시 사항을 먼저 바로잡음으로써, 비디오 편집의 마법이 실제로 작동하게 됩니다.

문제점: "너무 많은 사진"으로 인한 혼란

세 권의 서로 다른 요리책에서 재료를 가져와서 레시피를 따르는 상황을 생각해 보세요. 만약 레시피가 단순히 "A 책에서 향신료를 좀 넣고, B 책에서 채소를 넣어라"라고만 되어 있다면, 인간 요리사는 추측할 수 있겠지만 컴퓨터는 종종 패닉에 빠집니다. 잘못된 향신료를 집어 들거나 채소를 엉뚱한 요리에 섞어버릴 수도 있습니다.

저자들은 기존의 AI 모델들이 **다중 참조 비디오 편집(Multi-Reference Video Editing)**에서 어려움을 겪고 있다는 것을 발견했습니다. 이는 비디오(예: 거리의 남자가 걷고 있는 모습)를 가져와서 여러 참조 이미지의 디테일을 사용하여 변경하고 싶을 때 발생합니다(예를 들어, 거리는 사진 1의 사이버펑크 도시처럼 만들고 싶지만, 남자는 사진 2의 로봇처럼 만들고 싶은 경우).

기존 방식들은 사용된 지시 사항이 너무 모호했기 때문에 실패했습니다. 그들은 AI가 어떤 사진이 어떤 부분과 매치되는지 스스로 "파악"하도록 의존했습니다. 논문은 일반적인 목적의 AI 모델들(우리와 대화하고 질문에 답하는 모델들)이 이 특정한 작업에는 서투르다고 주장합니다. 그들은 어떤 시각적 디테일이 어떤 소스 이미지에 속하는지 혼동하며, 이로 인해 로봇이 사이버펑크 거리의 조명을 갖게 되거나 바뀌지 말아야 할 배경이 바뀌는 결과가 초래됩니다. 저자들은 이를 "결정적인 결함"이라 부르며, 지시 사항에 **명시적 참조 관계(explicit reference relationships)**가 부족하기 때문이라고 설명합니다.

해결책: ReBind와 "매직 태그"

이를 해결하기 위해 팀은 ReBind라는 새로운 시스템을 구축했습니다. 당신이 이야기를 쓰고 있는데, 단순히 "빨간 자동차"라고 말하는 대신, "빨간"이라는 단어에 "이 빨간 자동차는 사진 1에서 왔다"라고 적힌 실제 끊어지지 않는 태그를 붙여야 한다고 상상해 보세요.

ReBind는 **명시적 참조 토큰을 포함한 조밀한 지시 사항(Dense Instructions with Explicit Reference Tokens)**이라는 새로운 유형의 지시 사항을 도입합니다.

  • 기존 방식: "젊은 남자를 두 번째 사진에 있는 노인으로 교체하세요." (AI는 어떤 사진이 무엇인지, 그리고 변화가 어디서 일어나는지 추측해야 함).
  • ReBind 방식: "비디오 속의 <Video_1>에 있는 젊은 남자는 <Image_2>와 일치하는 얼굴을 가진 노인으로 교체되며, 그는 <Image_1>에서 온 스웨터를 입고 있다."

이러한 특별한 "태그"(예: <Image_1>)를 문장 속의 설명 바로 옆에 직접 삽입함으로써, AI는 어디를 보아야 할지 정확히 알게 됩니다. 이는 컴퓨터에게 동네에 대한 구두 설명만 주는 것이 아니라, X 표시가 된 지도가 그려진 지도를 주는 것과 같습니다.

AI를 가르치는 방법: 2단계 훈련

논문은 표준적인 AI에게 이러한 특별한 지시 사항을 준다고 해서 바로 작동하는 것이 아니며, 이를 작성하도록 특별히 훈련되어야 한다고 설명합니다. 저자들은 새로운 AI인 ReBind-Instruct를 위한 두 단계 훈련 과정을 만들었습니다.

  1. 1단계: 형식 학습 (지도 미세 조정, Supervised Fine-Tuning).
    먼저, AI에게 이러한 구조화된 문장을 쓰는 법을 가르쳤습니다. 그들은 AI에게 수천 개의 비디오와 그들의 "전과 후" 버전, 그리고 올바른 "태그가 달린" 지시 사항을 보여주었습니다. AI는 변화를 관찰하고 "아, 이 부분은 사진 1 때문에 변했고, 이 부분은 원래 비디오와 동일하게 유지되었다"라고 말하는 법을 배웠습니다. 또한 <Image_1> 태그를 올바른 위치에 배치하는 법을 배웠습니다.

  2. 2단계: 정확성 학습 (강화 학습, Reinforcement Learning).
    단순히 형식을 아는 것만으로는 충분하지 않습니다. AI는 정확해야 합니다. 만약 AI가 "모자가 사진 1에서 왔다"라고 말했는데 실제로는 사진 2의 모자라면, 그것은 실패한 것입니다. 이를 고치기 위해 팀은 그룹 상대 정책 최적화(Group Relative Policy Optimization, GRPO) 기법을 사용했습니다.

  • 이것은 AI가 몇 가지 다른 버전의 지시 사항을 작성하는 게임과 같습니다.
  • "판사"(다른 AI)가 체크리스트를 바탕으로 이를 검토합니다. 변화된 모든 것을 언급했는가? 모자를 올바른 사진에 제대로 연결했는가? 존재하지 않는 것을 만들어내는 환각(hallucination)을 피했는가?
  • AI는 링크를 정확하게 연결하면 "보상"을 받고, 서로 섞어버리면 "벌점"을 받습니다. 시간이 흐르면서 AI는 항상 올바른 사진 태그를 올바른 디테일에 부착하는 법을 배웁니다.

결과: 더 똑똑한 편집기

AI(ReBind-Instruct)가 이러한 완벽하고 태그가 달린 지시 사항을 쓰는 전문가가 된 후, 그들은 이 지시 사항을 사용하여 비디오 편집기인 ReBind-Edit를 훈련시켰습니다. 이 편집기는 태그가 달린 지시 사항을 받아 (LTX-2.3이라는 시스템에 기반한) 비디오 생성 모델을 안내합니다.

결과는 인상적이었습니다. UniVBenchIntelligentVBench와 같은 벤치마크에서 테스트했을 때:

  • 지시 사항 품질: ReBind-Instruct는 시각적 디테일을 소스 이미지에 올바르게 연결하는 데 있어 표준적인 범용 AI 모델들보다 훨씬 뛰어난 성능을 보였으며, 심지어 가장 강력한 "폐쇄형 소스(closed-source)" 모델들보다도 우수한 성적을 거두었습니다.
  • 비디오 품질: ReBind-Edit가 생성한 비디오는 다른 오픈 소스 방식들보다 현저히 뛰어났습니다. 한 장의 사진으로 캐릭터의 얼굴을 바꾸고 다른 한 장으로 배경을 바꾸는 테스트에서, ReBind-Edit는 디테일을 명확히 구분해 냈지만, 다른 모델들은 종-종 이 둘을 섞어버리거나 원래 비디오의 움직임을 유지하는 데 실패했습니다.

저자들은 지시 사항의 품질이 비디오의 품질을 직접적으로 결정한다는 것을 발견했습니다. 태그가 달린 새로운 "조밀한" 지시 사항을 사용하여 비디오 편집기를 훈련했을 때, 기존의 모호한 지시 사항을 사용했을 때보다 결과가 훨씬 좋았습니다. 이는 비디오 편집의 병목 현상이 반드시 비디오 생성기 자체에 있는 것이 아니라, 우리가 주는 지시 사항의 품질에 있다는 것을 시사합니다.

이것이 왜 중요한가

이 논문은 AI가 복잡한 비디오 편집(예를 들어, 다섯 장의 서로 다른 사진에서 요소를 결합하여 하나의 장면을 만들고 싶은 경우)을 진정으로 마스터하기 위해서는, 지시 사항을 단순한 문장으로 취급하는 것을 멈추고 구조화된 지도로 취급해야 한다고 결론짓습니다. "이 픽셀은 저 사진에서 왔다"라고 AI가 명시적으로 말하게 함으로써 혼란을 제거합니다.

저자들은 자신들이 모든 비디오 생성 문제를 해결했다고 주장하는 것이 아닙니다. 다만 **명시적 참조 접지(explicit reference grounding)**가 빠져 있던 핵심 요소임을 보여주었습니다. 그들의 방식인 ReBind는, 지시 사항을 작성하는 적절한 "번역기"가 있다면 오픈 소스 모델도 최고의 폐쇄형 시스템과 경쟁할 수 있으며, 단순히 시각적으로 멋진 영상을 넘어 감독의 구체적이고 다중 참조적인 비전을 실제로 구현할 수 있음을 증명합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →