← 최신 논문
💻 computer science

Many-for-Many: Unify the Training of Multiple Video and Image Generation and Manipulation Tasks

이 논문은 경량 어댑터와 이미지-비디오 공동 학습 전략을 사용하는 통합 프레임워크인 "Many-for-Many"를 소개하며, 이는 특정 작업별 학습의 높은 비용을 극복하기 위해 여러 소스의 데이터를 활용하면서도 10개 이상의 다양한 시각적 생성 및 조작 작업을 수행할 수 있는 단일 파운데이션 모델을 훈련하여 경쟁력 있는 성능을 달성한다.

원저자: Ruibin Li, Tao Yang, Yangming Shi, Weiguo Feng, Shilei Wen, Bingyue Peng, Lei Zhang

게시일 2026-02-06
📖 4 분 읽기☕ 가벼운 읽기

원저자: Ruibin Li, Tao Yang, Yangming Shi, Weiguo Feng, Shilei Wen, Bingyue Peng, Lei Zhang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게 예술을 만드는 데 필요한 수많은 지침서가 담긴 거대한 도서관이 있다고 상상해 보세요. 어떤 지침은 "고양이를 그려라"라고 하고, 어떤 지침은 "이 고양이 사진을 비디오로 바꿔라"라고 하며, 또 다른 지침은 "이 비디오의 흐릿한 부분을 수정하라" 또는 "흑백 영화에 색을 입혀라"라고 합니다.

보통 이 모든 일을 수행하려면 매 작업마다 서로 다른 전문가가 필요합니다. "텍스트-투-비디오(Text-to-Video)" 요리사, "이미지-투-비디오(Image-to-Video)" 요리사, 그리고 "비디오 편집(Video-Editing)" 요리사가 각각 따로 있어야 하죠. 이 요리사들을 처음부터 다시 훈련시키는 것은 엄청나게 비용이 많이 들며, 매우 양질의 식재료(데이터)를 필요로 합니다.

여기 "Many-for-Many" (MfM)가 등장합니다.

이 논문의 저자들은 이 모든 일을 한 번에 처리할 수 있는 "슈퍼 셰프"를 구축했습니다. 열 명의 서로 다른 전문가를 고용하는 대신, 그들은 텍스트로부터 비디오를 생성하는 것부터 기존 비디오를 편집하는 것까지 10가지 이상의 다양한 시각적 작업을 처리할 수 있는 단 하나의 모델을 훈련시켰습니다.

그들이 어떻게 이 일을 해냈는지, 쉬운 비유를 통해 설명하겠습니다.

1. 유니버설 어댑터 (스위스 아미 나이프의 손잡이)

서로 다른 작업에는 서로 다른 "입력값"이 필요합니다.

  • 텍스트-투-비디오: 문장을 입력합니다.
  • 이미지-투-비디오: 사진을 입력합니다.
  • 비디오 편집: 마스크(변경할 부분을 표시하는 스텐실)가 포함된 비디오를 입력합니다.

보통 이러한 입력값들은 서로 맞지 않는 퍼즐 조각처럼 서로 다른 모양을 가집니다. MfM 팀은 경량화된 어댑터를 설계했습니다. 이것을 유니버셜 핸들이나 스위스 아미 나이프의 부착물이라고 생각하면 됩니다. 이 어댑터는 텍스트, 이미지, 비디오, 마스크, 그리고 심지어 **뎁스 맵(Depth Map, 장면의 3D 공간을 보여주는 지형도와 같은 청사진)**을 가져와서 모두 동일한 형식으로 재구성합니다. 이를 통해 모델은 어떤 형태의 지침이 들어오더라도 이를 이해할 수 있습니다.

2. "결합 학습" 전략 (견습생 방식)

비디오 AI를 처음부터 훈련시키는 것은 보통 누군가에게 걷기도 전에 마라톤을 하는 법을 가르치는 것과 같습니다. 여기에는 수백만 개의 값비싼 비디오 예시가 필요합니다.

MfM은 **결합 이미지-비디오 학습(Joint Image-Video Learning)**이라는 영리한 훈련 트릭을 사용합니다.

  • 1단계: 모델에게 단순한 "이미지" 작업(예: 텍스트로부터 그림 그리기)을 먼저 가르칩니다. 이는 비용이 적게 들고 쉽습니다.
  • 2단계: 서서히 "비디오" 작업을 도입합니다.
  • 마법 같은 점: 모델이 이미지로부터 "시각적 요소"의 기초를 배웠기 때문에, 사물이 움직이는 법을 배우기 위해 그렇게 많은 값비싼 비디오 예시를 필요로 하지 않습니다. 이는 마치 채소를 써는 법(이미지)을 먼저 배운 견습생이 스튜를 만드는 법(비디오)으로 넘어갈 때, 이미 식재료를 다루는 법을 알고 있는 것과 같습니다.

이 덕분에 그들은 다른 최고 수준의 모델들이 사용하는 비디오 데이터의 **단 10%**만을 사용하여 강력한 80억 파라미터 모델을 훈련할 수 있었습니다.

3. "3D RoPE" (시간과 공간을 위한 GPS)

비디오가 자연스럽게 보이려면 모델은 단순히 사물이 어디에 있는지(왼쪽, 오른쪽, 위, 아래)뿐만 아니라, 언제 일어나는지(첫 번째 프레임, 마지막 프레임)도 이해해야 합니다.
팀은 모델의 내부 "GPS"(3D RoPE라고 불림)를 업그레이드했습니다. 모델은 이제 단순히 평면 화면 위의 픽셀 위치를 아는 것을 넘어, 3D 공간에서의 위치와 시간을 통한 위치를 이해합니다. 이는 모델이 끊기거나 부자연스러운 움직임 대신 매끄럽고 현실적인 움직임을 생성하도록 도와줍니다.

4. 결과: 하나의 모델, 여러 가지 초능력

논문에서는 이 "슈퍼 셰프"를 두 가지 크기, 즉 더 작은 20억 파라미터 버전과 더 큰 80억 파라미터 버전으로 테스트했습니다.

  • 다재다능함: 이 모델은 다음과 같은 10가지 이상의 다양한 작업을 수행할 수 있습니다:
    • 생성: 텍스트를 비디오로 바꾸거나, 이미지를 비디오로 바꿉니다.
    • 확장: 짧은 클립을 가져와 길게 만듭니다.
    • 편집: 개체를 제거하거나(Inpainting), 새로운 배경을 추가하거나(Outpainting), 색상을 변경합니다.
    • 강화: 흐릿한 비디오를 선명하게 만듭니다(Super-resolution).
  • 성능: 유명한 모델들(Wan2.1, Hunyuan, 그리고 심지어 상업적 거물인 Sora 등)과의 헤드 투 헤드 테스트에서 MfM 모델은 매우 경쟁력이 있었습니다. 데이터는 훨씬 적게 사용했음에도 불구하고, 일관성과 움직임 품질 면에서 종종 1위 또는 2위를 차지했습니다.

핵심 요약

이 논문은 훈련 과정을 통일하고 다양한 유형의 데이터를 혼합하기 위해 스마트한 "어댑터"를 사용함으로써, 단 하나의 효율적인 모델이 특정 작업만을 위해 훈련된 전문 모델만큼 혹은 그보다 더 뛰어날 수 있음을 입증했습니다. 그들은 하나의 다재다능한 도구를 만든다면 모든 작업에 별도의 도구가 필요하지 않다는 것을 증명했습니다.

이 논문이 주장하지 않는 것:
이 논문은 모델의 기술적 훈련과 표준 벤치마크 성능에 엄격히 집중합니다. 특정 임상적 문제를 해결했다고 주장하지 않으며, 코드와 모델 가중치의 오픈 소스 공개 외에 구체적인 미래 상업 제품에 대해서도 상세히 다루지 않습니다. 이것은 완성된 소비자용 앱이 아니라 기초적인 연구 단계입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →