← 최신 논문
💻 computer science

DOLLAR: Few-Step Video Generation via Distillation and Latent Reward Optimization

DOLLAR 프레임워크는 변분 및 일관성 증류와 메모리 효율적인 잠재 보상 최적화 접근법을 결합한 새로운 몇 단계 비디오 생성 방법을 도입하여 10 초 비디오에서 최첨단 품질과 다양성을 달성하면서 샘플링 속도를 최대 278.6 배까지 가속화합니다.

원저자: Zihan Ding, Chi Jin, Difan Liu, Haitian Zheng, Krishna Kumar Singh, Qiang Zhang, Yan Kang, Zhe Lin, Yuchen Liu

게시일 2026-05-08
📖 3 분 읽기☕ 가벼운 읽기

원저자: Zihan Ding, Chi Jin, Difan Liu, Haitian Zheng, Krishna Kumar Singh, Qiang Zhang, Yan Kang, Zhe Lin, Yuchen Liu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

마스터 셰프 (교사 모델) 가 완벽한 복잡한 10 초짜리 비디오 요리를 만들 수 있다고 상상해 보세요. 문제는 이 셰프가 매우 느리다는 것입니다. 요리를 완벽하게 하기 위해 셰프는 서빙하기 전까지 50 번이나 맛을 보고, 조정하고, 다시 맛보고, 조정합니다. 매일 요리를 원한다면 이 과정은 영원히 걸리고 주방의 전기 (컴퓨팅 파워) 를 모두 소모합니다.

이 논문은 DOLLAR이라는 새로운 방법을 소개합니다. 이 방법은 맛이나 품질을 잃지 않고 정확히 같은 맛있는 요리를 단 4 단계(심지어 1 단계) 만에 요리할 수 있는 학생 셰프를 훈련시킵니다.

다음은 세 가지 간단한 트릭을 사용하여 그들이 어떻게 이를 달성했는지입니다:

1. "맛보기"와 "일관성" 훈련

보통 학생이 빠르게 요리하도록 가르치려 할 때 두 가지 문제에 직면합니다:

  • 문제 A (맛없는 학생): 단순히 학생에게 마스터의 최종 요리를 복사하라고만 하면, 맛은 맞출 수 있지만 매번 똑같은 요리를 만들어 내는 (다양성 부족) 문제가 발생합니다.
  • 문제 B ( messy 한 학생): 창의적이고 빠르게 하라고 하면, 음식은 보기엔 좋을지 몰라도 맛이 끔찍하거나 일관성이 없을 수 있습니다.

저자들은 두 가지 훈련 방법을 결합하여 이를 해결했습니다:

  • 변분 스코어 증류 (VSD): 이는 학생이 마스터의 요리를 맛보고 맛 프로필을 완벽하게 맞추려고 노력하는 것과 같습니다. 이는 비디오가 고품질로 보이도록 보장합니다.
  • 일관성 증류 (CD): 이는 학생이 직선으로 요리를 만드는 훈련을 하는 것과 같습니다. 이는 요리 시작 방식에 관계없이 일관된 결과로 이어지도록 보장합니다. 이를 통해 비디오가 다양하게 유지되고 "맛없는" 복제본이 되는 것을 방지합니다.

이 두 가지를 혼합함으로써 학생은 훨씬 더 빠르면서도 고품질이면서 다양성을 갖는 법을 배웁니다.

2. "비밀 소스" (잠재 보상 최적화)

빠른 학생이 있더라도 비디오가 원하는 것과 완전히 일치하지 않을 때가 있습니다. 아마도 더 "영화 같은" 느낌을 원하거나 조명이 더 좋아지기를 원할 수 있습니다. 보통 이를 고치려면 비디오를 거대한 느린 "미식가" (보상 모델) 에게 보내 모든 픽셀을 확인하게 해야 합니다. 이는 느리고 막대한 주방 (컴퓨터 메모리) 을 필요로 합니다.

저자들은 **잠재 보상 모델 (LRM)**을 발명했습니다.

  • 비유: 완성된 무거운 비디오를 미식가에게 보내는 대신, 비디오가 완전히 요리되기 전에 재료 (잠재 공간) 를 판단하도록 작고 주머니에 들어가는 "미니 미식가"를 가르칩니다.
  • 이점: 이 미니 미식가는 작고 빠르며, 피드백을 주기 위해 전체 비디오를 볼 필요가 없습니다. 학생 셰프에게 "조명이 약간 어긋났어요"라고 말하면 학생은 즉시 조정합니다. 이는 슈퍼컴퓨터 없이도 미학이나 텍스트 정렬과 같은 분야에서 마스터 셰프의 원래 실력을 넘어 학생이 개선할 수 있게 합니다.

3. 결과: 초고속 주방

이 논문은 이 방법으로 다음과 같은 결과를 얻었다고 주장합니다:

  • 속도: 50 단계 대신 4 단계로 10 초짜리 비디오를 생성할 수 있습니다. 이는 원래 방법보다 최대 278 배 빠릅니다. 거의 실시간 생성과 같습니다.
  • 품질: 학생 비디오는 VBench 라고 불리는 표준 테스트에서 원래 마스터 셰프뿐만 아니라 Gen-3 와 Kling 같은 다른 최상위 경쟁자들보다 높은 점수를 받습니다.
  • 효율성: 거대한 미식가 대신 "미니 미식가" (잠재 보상 모델) 를 사용하기 때문에 컴퓨터 메모리를 대폭 절약합니다. 이를 실행하기 위해 슈퍼컴퓨터가 필요하지 않으며, 표준 고성능 GPU 에서 실행 가능합니다.

요약

DOLLAR은 느리고 완벽주의적인 비디오 생성기를 번개처럼 빠른 예술가로 바꾸는 훈련 프로그램이라고 생각하세요. 이는 다음을 통해 이루어집니다:

  1. 예술가가 동시에 정확하고 창의적이도록 가르칩니다.
  2. 작업이 느린 거대한 컴퓨터를 기다릴 필요 없이 품질에 대한 즉각적인 피드백을 제공하는 작고 똑똑한 조수를 제공합니다.

결과는 분 단위가 아닌 초 단위로 고품질이고 다양한 비디오를 생성하는 시스템으로, "실시간" 비디오 생성을 현실로 만듭니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →