← 최신 논문
🤖 AI

ViMax: Agentic Video Generation

Max는 협력적인 멀티 에이전트 협업, 계층적 서사 엔진, 그리고 의존성 인식 시각적 일관성 메커니즘을 채택하여, 장편의 서사 구조를 가진 영상을 제작할 때 발생하는 캐릭터 및 환경의 지속적인 일관성 유지에 대한 기존 방식의 한계를 극복하는 에이전트 기반 비디오 생성 프레임워크이다.

원저자: Lingxuan Huang, Sizhe He, Hengji Zhou, Liqiang Nie, Lianghao Xia, Chao Huang

게시일 2026-06-09
📖 3 분 읽기☕ 가벼운 읽기

원저자: Lingxuan Huang, Sizhe He, Hengji Zhou, Liqiang Nie, Lianghao Xia, Chao Huang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 비디오를 통해 길고 복잡한 이야기, 예를 들어 단편 영화 같은 것을 만들고 싶다고 상상해 보십시오. 현재 대부분의 AI 비디오 도구들은 재능은 있지만 주의 지속 시간이 짧은 배우와 같습니다. 그들은 사람이 걷는 모습의 아름다운 5초짜리 클립은 만들 수 있지만, 만약 당신이 동일한 인물이 여러 방을 돌아다니고, 친구들과 대화하며, 얼굴이나 옷이 바뀌지 않는 10분짜리 영화를 만들어 달라고 요청한다면 AI는 혼란에 빠집니다. 캐릭터의 눈 색깔이 갈색에서 갑자기 파란색으로 변하거나, 장면 사이에서 주방이 갑자기 숲으로 변해버릴 수도 있습니다.

ViMax는 이를 해결하기 위해 설계된 새로운 시스템입니다. 이것을 단일한 배우가 아니라, 특화된 AI 에이전트들로 구성된 고도로 조직화된 영화 제작사라고 생각하십시오.

ViMax가 작동하는 방식은 다음과 같습니다(쉬운 비유를 사용합니다):

1. "감독실" (계층적 서사 계획)

만약 당신이 단일 AI에게 영화 스크립트 전체를 한 번에 쓰라고 요청한다면, 그 AI는 과부하가 걸려 결말에 도달할 때쯤에는 도입부를 잊어버릴 것입니다.

  • ViMax의 솔루션: ViMax는 이야기를 **러시아 인형(마트료시카)**처럼 분해합니다.
    • 먼저, 큰 "이벤트"(영화의 시작, 중간, 끝과 같은 것)를 개요화합니다.
    • 그다음, 이 이벤트들을 "장면(Scene)"으로 나눕니다.
    • 마지막으로, 장면들을 개별적인 "샷(Shot, 카메라 각도)"으로 나눕니다.
  • 비법: AI가 작은 세부 사항에 집중하는 동안에도 큰 그림을 잊지 않도록 하기 위해, **디지털 도서관(검색 증강 생성, RAG)**을 사용합니다. AI가 새로운 장면을 계획할 때마다, 원래의 이야기를 도서관에서 "찾아보며" 등장인물이 누구인지, 줄거리가 무엇인지 스스로에게 상기시킵니다. 이는 처음부터 끝까지 이야기가 일관되게 유지되도록 합니다.

2. "연속성 부서" (시각적 일관성)

실제 영화 제작에서, 만약 캐릭터가 장면 1에서 빨간 모자를 쓰고 있다면, 장면 10에서도 반드시 빨간 모자를 써야 합니다. 파란 소파에 앉아 있다면, 소파는 계속 파란색이어야 합니다. 현재의 AI 도구들은 이러한 세부 사항을 자주 잊어버립니다.

  • ViMax의 솔루션: ViMax는 **의존성 맵(그래프 기반 시각적 의존성)**을 사용합니다.
    • 모든 샷을 연결하는 순서도를 상상해 보십시오. 만약 샷 5가 샷 2와 비슷하게 보여야 한다면, 시스템은 둘을 연결합니다.
    • 샷 5를 생성할 때, AI는 단순히 추측하는 것이 아니라 샷 2의 실제 이미지를 참조 모델로 사용합니다. 이는 마치 화가가 이전의 스케치를 따라 그려서 캐릭터의 얼굴이 정확히 똑같아 보이도록 만드는 것과 같습니다.
  • "카메라 이동" 기술: 서로 다른 각도에서 볼 때(예: 캐릭터를 왼쪽에서 본 다음 오른쪽에서 보는 경우) 방이 동일하게 보이도록 하기 위해, ViMax는 먼저 **전환 비디오(transition video)**를 생성합니다. 하나의 부드러운 카메라 이동 영상을 먼저 만든 다음, 그 부드러운 움직임에서 필요한 특정 샷들을 잘라냅니다. 이는 3D 공간(가구, 벽 등)이 일관되게 유지되도록 보장합니다.

3. "품질 관리 팀" (VLM 기반 선택)

때때 lòng데, AI는 괜찮아 보이지만 손가락이 여섯 개인 것과 같은 이상한 오류(glitch)가 있는 비디오를 생성할 수 있습니다.

  • ViMax의 솔루션: 모든 단일 샷에 대해, ViMax는 단 하나의 비디오만 만드는 것이 아니라 여러 개의 후보군을 만듭니다(마치 같은 포즈로 5장의 사진을 찍는 것과 같습니다).
  • 그런 다음, "판사" 역할을 하는 AI(시각-언어 모델, VLM)가 이 후보들을 살펴보고 스크립트와 가장 잘 맞고 가장 사실적인 최선의 결과물을 선택합니다. 이는 오직 최고 품질의 클립만이 최종 영화에 포함되도록 보장합니다.

무엇을 증명했는가?

연구진은 AI가 많은 수의 샷(최대 13개의 연속 샷)을 생성하면서도 캐릭터와 배경을 일관되게 유지해야 하는 도전 과제를 담은 새로운 벤치마크인 ViMax-Bench를 통해 ViMax를 테스트했습니다.

  • 결과: ViMax는 캐릭터의 외형을 유지하고 이야기가 논리적으로 이어지게 만드는 데 있어 기존 방식(Sora, Veo 등)보다 뛰어난 성능을 보였습니다.
  • 트레이드오프(교환 조건): 이 모든 계획과 점검 과정을 수행하기 때문에 더 많은 컴퓨팅 자원과 시간이 소요되지만, 그 결과 훨씬 더 일관성 있고 긴 비디오를 얻을 수 있습니다.

요약

ViMax는 **즉흥 연기(AI가 그때그때 상황을 만들어가며 진행하다가 종종 줄거리를 잊어버리는 것)**에서 **전문적인 영화 제작팀(감독, 작가, 연속성 관리자가 협력하여 이야기가 논리적으로 흐르고 배우가 매 장면 동일하게 보이도록 보장하는 것)**으로 업그레이드하는 것과 같습니다.

논문에 언급된 한계점:

  • 실제 그림을 그리거나 비디오를 만드는 데 있어 다른 강력한 AI 모델들에 의존합니다.
  • 여전히 매우 붐비는 장면이나 복잡한 상호작용(예: 두 사람이 하이파이브를 하는 장면)을 처리하는 데 어려움을 겪을 수 있습니다.
  • 아직 오디오나 대사 동기화를 처리하지 못합니다.
  • 이처럼 일관된 비디오 생성을 사용하여 가짜 사건을 만들거나 사람을 사칭할 수 있다는 윤리적 우려가 있으므로, 저자들은 안전 점검이 필요하다고 제안합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →