← 최신 논문
💻 computer science

Bernini: Latent Semantic Planning for Video Diffusion

Bernini 는 MLLM 기반 플래너가 ViT 임베딩 공간에서 의미론적 추론을 수행하여 DiT 기반 렌더러를 안내하는 분업 구조를 활용하는 통합 비디오 생성 및 편집 프레임워크로, 효율적인 분리 학습과 세그먼트 인식 3D 회전 위치 임베딩과 같은 새로운 구성 요소를 통해 최첨단 성능을 달성합니다.

원저자: Bernini Team, Chenchen Liu, Junyi Chen, Lei Li, Lu Chi, Mingzhen Sun, Zhuoying Li, Yi Fu, Ruoyu Guo, Yiheng Wu, Ge Bai, Zehuan Yuan

게시일 2026-05-22
📖 4 분 읽기☕ 가벼운 읽기

원저자: Bernini Team, Chenchen Liu, Junyi Chen, Lei Li, Lu Chi, Mingzhen Sun, Zhuoying Li, Yi Fu, Ruoyu Guo, Yiheng Wu, Ge Bai, Zehuan Yuan

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

베르니니 논문에 대한 설명을 일상적인 언어와 비유를 사용하여 번역한 것입니다.

핵심 아이디어: 건축가와 시공자

커스텀 주택을 짓고 싶다고 상상해 보세요. 당신은 두 명의 전문가를 두고 있습니다:

  1. 건축가 (MLLM): 이 사람은 당신의 모호한 아이디어를 이해하고, 복잡한 설계도를 읽으며, 집이 어떻게 보여야 하는지 파악하는 데 탁월합니다. 추론 능력은 뛰어나지만, 실제로 벽돌을 쌓는 것은 매우 서툴러요.
  2. 시공자 (확산 모델): 이 사람은 장인 정신의 대가입니다. 벽돌을 쌓고, 벽을 칠하며, 창문을 설치할 때 사진처럼 사실적인 완벽함을 구현할 수 있습니다. 하지만 단순히 "예쁘게 만들어줘"라고만 말하면, 당신이 원한 것은 별장이었는데 성을 지을 수도 있어요. 그들은 매우 구체적인 지시가 필요합니다.

베르니니는 이 두 전문가를 하나로 묶는 시스템입니다. 건축가에게 벽돌을 쌓게 하거나 시공자에게 복잡한 추론을 시키려 강요하는 대신, 베르니니는 그들에게 서로 대화할 수 있는 전문적인 언어를 제공합니다.

작동 원리: "비밀 설계도"

과거에는 이 두 가지 유형의 AI 를 결합하려는 시도가 혼란스러웠습니다. 베르니니는 "노동 분업"을 창출함으로써 이를 해결합니다:

  1. 계획 단계 (건축가):
    당신이 베르니니에게 명령을 내리면 (예: "날씨를 폭풍우가 치는 밤으로 바꾸고 개를 행복하게 만들어줘"), MLLM 플래너는 비디오를 그리려고 시도하지 않습니다. 대신 건축가가 고수준 설계도를 스케치하듯 행동합니다.

    • 비밀 소스: 이 설계도는 그림이나 문장이 아닙니다. 장면의 의미를 나타내는 수학적 코드 (ViT 임베딩이라 함) 의 집합입니다. 이는 건축가가 시공자에게 그림 대신 좌표와 감정 톤의 목록을 건네는 것과 같습니다.
  2. 렌더링 단계 (시공자):
    DiT 렌더러 (시공자) 는 이 설계도를 받습니다. 또한 (편집하는 경우) 배경을 일관되게 유지하기 위해 원본 비디오도 참조합니다. 설계도를 가이드로 사용하여 실제 픽셀을 프레임별로 생성하여 사실적인 비디오를 만들어냅니다.

왜 이것이 cool 한가요? 건축가와 시공자는 별도로 훈련될 수 있기 때문입니다. 건축가는 인간 언어 이해 능력을 계속 향상시키고, 시공자는 아름다운 이미지를 만드는 능력을 계속 발전시킵니다. 그들은 전체 시스템을 처음부터 다시 훈련하는 것보다 훨씬 쉬운, 서로의 "비밀 설계도" 언어를 읽는 법만 배우면 됩니다.

새로운 도구: "이름표"와 "생각하는 단계"

이것이 완벽하게 작동하도록 하기 위해 연구자들은 두 가지 교묘한 트릭을 추가했습니다:

  • "이름표" 시스템 (SA-3D RoPE):
    모두가 같은 옷을 입고 있는 붐비는 방에 있다고 상상해 보세요. "빨간 모자를 쓴 사람 좀 봐"라고 외치면, 빨간 모자를 쓴 사람이 세 명이라면 혼란스러울 것입니다.
    비디오 편집에서 AI 는 종종 원본 비디오, 참조 이미지, 그리고 새로운 비디오를 동시에 봐야 합니다. 때로는 원본 비디오의 픽셀이 새로운 비디오의 픽셀과 정확히 같은 위치에 있기도 합니다.
    베르니니는 퍼즐의 모든 조각에 "이름표" (세그먼트 인덱스) 를 붙여줍니다. 이는 AI 에게 "이 빨간 모자는 원본 비디오에 속하고, 저 빨간 모자는 새로운 비디오에 속한다"고 알려줍니다. 이를 통해 AI 가 혼란을 겪고 소스와 결과를 섞어놓는 것을 방지합니다.

  • "생각을 말로 표현하는" 단계 (Chain-of-Thought):
    때로는 간단한 명령만으로는 충분하지 않습니다. "카툰처럼 보이게 만들어줘"라고 말하면 AI 는 단순히 색상만 바꿀 수 있습니다.
    베르니니의 플래너는 설계도를 그리기 전에 생각을 말로 표현하도록 훈련받습니다. 작업을 분해합니다: "첫째, 조명 방식을 이해해야 해. 둘째, 피부 질감을 바꿔야 해. 셋째, 움직임을 조정해야 해." 이러한 단계별 추론은 비디오 속의 불이 자연스럽게 꺼지도록 날씨를 바꾸는 것과 같은 복잡한 작업 (인과 추론) 을 AI 가 처리하는 데 도움을 줍니다.

무엇을 할 수 있나요?

이 논문은 베르니니가 비디오를 위한 "스위스 아미 나이프"임을 보여줍니다. 다음과 같은 작업을 수행할 수 있습니다:

  • 텍스트-to-비디오: 설명을 바탕으로 처음부터 비디오를 생성합니다.
  • 비디오-to-비디오 편집: 기존 비디오의 스타일을 변경하거나, 객체를 추가/제거하거나, 날씨를 바꿉니다.
  • 참조 기반 편집: "이 비디오의 사람을 이 사진의 사람처럼 만들어줘."
  • 모션 전달: "이 사진의 사람을 이 비디오의 사람처럼 춤추게 만들어줘."

결과: 경주에서 승리

연구자들은 새로 만든 베르니니-벤치 (Bernini-Bench) 라는 새로운 벤치마크에서 클링 (Kling), 완 (Wan) 등 다른 최상급 비디오 AI 모델들과 베르니니를 테스트했습니다.

  • 점수: 베르니니는 일관성과 지시 따르기 측면에서 경쟁사를 제치고 "비디오 편집 리더보드"에서 승리했습니다.
  • 핵심 승리: 특히 비디오 일관성 유지에 탁월했습니다. 비디오의 한 부분을 편집할 때, 비디오의 나머지 부분이 왜곡되거나 오류가 발생하지 않습니다. 요청한 부분만 변경되면서도 원래 장면에 충실하게 유지됩니다.

요약

베르니니는 장인 시공자를 위한 완벽한 지시 사항을 작성하는 천재 건축가를 고용하는 것과 같습니다. 그들이 전문적인 "설계도 언어"로 대화하게 하고, 비디오의 어느 부분이 무엇인지 추적할 수 있는 도구를 제공함으로써, 베르니니는 아름답을 뿐만 아니라 복잡하고 논리적인 변화를 이해할 만큼 똑똑한 비디오를 생성합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →