← 최신 논문
💻 computer science

UnityShots: Memory-Driven Multi-Shot Audio-Video Generation with Boundary-Aware Gating

UnityShots는 LTX-2.3을 기반으로 구축된 메모리 구동형 멀티샷 오디오-비디오 생성 시스템으로, 고정 크기 시각 메모리를 위한 경계 인식 게이팅 메커니즘과 오디오를 위한 참조 화자 토큰을 통해 샷 간 일관성을 보장하며, 새롭게 출시된 다문화 벤치마크에서 오픈 소스 베이스라인들을 능가하는 성능을 보여준다.

원저자: Jiehui Huang, Yuechen Zhang, Bin Xia, Jiahao Wang, Xu He, Zhenchao Tang, Meng Chu, Xin Tao, Pengfei Wan, Jiaya Jia

게시일 2026-06-23
📖 3 분 읽기☕ 가벼운 읽기

원저자: Jiehui Huang, Yuechen Zhang, Bin Xia, Jiahao Wang, Xu He, Zhenchao Tang, Meng Chu, Xin Tao, Pengfei Wan, Jiaya Jia

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 영화 감독이라고 상상해 보세요. 당신은 수많은 장면(샷)이 담긴 대본을 가지고 있습니다. AI로 영화를 제작할 때 가장 큰 도전 과제는 이야기의 일관성을 유지하는 것입니다. 만약 당신이 AI에게 장면 1, 장면 2, 장면 3을 만들라고 요청한다면, AI는 장면 3에 도달할 때쯤이면 장면 1에서 주인공이 어떻게 생겼었는지 잊어버리곤 합니다. 캐릭터의 머리카락 색이 변하거나, 옷이 바뀌거나, 목소리가 다른 사람처럼 들릴 수도 있습니다.

UnityShots는 이 "망각" 문제를 해결하기 위해 설계된 새로운 AI 시스템입니다. 이것을 이야기를 절대 놓치지 않는 매우 체계적인 영화 감독이라고 생각하세요. 이 시스템이 어떻게 작동하는지 쉬운 비유를 통해 설명하겠습니다.

1. 두 가지 메모리 시스템 (더 "앵커"와 "스텝")

대부분의 AI 비디오 생성기는 아주 짧은 기억력을 가진 사람과 같습니다. 그들은 오직 마지막 몇 초만을 기억합니다. 하지만 UnityShots는 다릅니다. 모든 새로운 장면을 위해 주머니 속에 두 가지 특정한 유형의 메모리를 지니고 있습니다.

  • 장기적 "앵커" (LTM): 주인공의 사진 한 장이 영화 시작 부분에 벽에 핀으로 고정되어 있다고 상상해 보세요. 아무리 많은 장면이 지나더라도, AI는 항상 이 사진을 훑어보며 이렇게 기억합니다. "이 사람이 바로 그 캐릭터다." 이를 통해 캐릭터의 얼굴, 옷, 정체성이 첫 번째 샷부터 마지막 샷까지 동일하게 유지되도록 보장합니다.
  • 단기적 "스텝" (STM): 또한 AI는 바로 이전 장면이 어떻게 끝났는지에 대한 정신적 메모를 유지합니다. 캐릭터가 방금 일어섰나요? 카메라가 왼쪽으로 움직이고 있었나요? 이 "스텝" 메모는 새로운 장면이 이전 장면으로부터 자연스럽게 이어지도록 도와주며, 움직임이 끊기거나 어색해 보이지 않게 합니다.

2. "스마트 게이트키퍼" (Smart Gatekeeper)

일반적인 영화에서 감독은 액션이나 음악에 따라 장면 전환(컷)을 결정합니다. UnityShots는 이 과정을 자동으로 수행하는 스마트 게이트키퍼를 가지고 있습니다.

  • 시각적 단서: 시각적 변화(예: 갑작스러운 컷 전환이나 새로운 장소 등장)를 관찰합니다.
  • 오디오 단서: 음악의 리듬이나 오디오의 비트를 듣습니다.
  • 결정: 게이트키퍼가 큰 변화(예: 대본상의 하드 컷)를 감지하면, 새로운 액션에 맞춰 "단기적 스텝" 메모를 업데이트합니다. 하지만 결정적으로, 게이트키퍼는 절대로 "장기적 앵커"를 놓치지 않습니다. 장면이 완전히 바뀌더라도 주인공은 반드시 동일해야 한다는 것을 알고 있기 때문입니다.

3. "보이스 앵커" (Voice Anchor)

캐릭터의 얼굴이 일관되어야 하는 것처럼, 목소리 또한 일관되어야 합니다. UnityShots는 영화의 전체 오디오 트랙을 기억하려고 애쓰지 않습니다. 대신, 각 캐릭터를 위한 단 하나의 "보이스 ID" 카드를 보관합니다. 새로운 장면이 시작될 때마다 AI에게 이 카드를 보여주며 이렇게 말합니다. "기억해, 이 목이 말하는 사람은 동일한 인물이야." 이를 통해 다음 샷에서 캐릭터의 목소리가 다른 사람처럼 들리는 것을 방지합니다.

4. "스트라타" (Strata, 층층이 쌓인 책장)

이 모든 정보를 혼란 없이 체계적으로 정리하기 위해, UnityShots는 Strata-RoPE라고 불리는 특별한 파일링 시스템을 사용합니다.

정보가 분리되어 있는 세 개의 선반이 있는 책장을 상상해 보세요:

  1. 상단 선반: "장기적 앵커"(첫 장면)를 담습니다.
  2. 중간 선반: "단기적 스텝"(직전의 과거)을 담습니다.
  3. 하단 선반: "현재 장면"(지금 만들어지고 있는 것)을 담습니다.

이 선반들이 물리적으로 분리되어 있기 때문에, AI는 오래된 캐릭터의 세부 사항과 새로운 장면의 세부 사항을 절대 혼동하지 않습니다. AI는 어떤 정보에 어떤 선반을 참조해야 하는지 정확히 알고 있습니다.

5. 결과: 일관성 있는 영화

이 논문은 이 시스템을 "다문화 벤치마크"(6개의 서로 다른 문화적 배경과 다양한 언어를 가진 200개의 짧은 이야기 모음)에서 테스트했습니다.

  • 기존 방식들: 캐릭터의 외형이 변하거나 중간에 목소리가 바뀌는 "드리프트(drift)" 현상이 자주 발생했습니다.
  • UnityShots: 여러 번의 컷이 지나가는 동안에도 캐릭터의 모습과 목소리를 성공적으로 유지했습니다. 이 시스템은 다른 오픈 소스 도구들보다 뛰어난 성능을 보였으며, 최고의 폐쇄형 상용 시스템들과 대등한 품질을 보여주는 동시에 오디오와 비디오를 매끄럽게 함께 처리할 수 있는 능력을 갖추었습니다.

요약하자면, UnityShots는 출연진의 사진을 벽에 붙여둔 영구적인 감독(장기 기억), 직전의 액션을 적어둔 메모장(단기 기억), 그리고 장면 전환을 위한 엄격한 규칙서(게이트키퍼)를 가진 감독과 같습니다. 이를 통해 UnityShots는 이야기, 캐릭터, 그리고 목소리가 처음부터 끝까지 일관되게 유지되는 긴 다중 장면 영상을 생성할 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →