← 최신 논문
💻 computer science

A Systematic Post-Train Framework for Video Generation

본 논문은 사전 학습 성능과 실제 배포 간의 격차를 해소하기 위해 지도 미세 조정, 새로운 그룹 상대적 정책 최적화 기반 RLHF 단계, 프롬프트 향상, 추론 최적화를 통합하여 지시 따르기, 시간적 일관성, 시각적 품질을 크게 향상시키고 추론 비용을 줄이는 비디오 확산 모델을 위한 체계적인 사후 학습 프레임워크를 제안합니다.

원저자: Zeyue Xue, Siming Fu, Jie Huang, Shuai Lu, Haoran Li, Yijun Liu, Yuming Li, Xiaoxuan He, Mengzhao Chen, Haoyang Huang, Nan Duan, Ping Luo

게시일 2026-04-29
📖 4 분 읽기☕ 가벼운 읽기

원저자: Zeyue Xue, Siming Fu, Jie Huang, Shuai Lu, Haoran Li, Yijun Liu, Yuming Li, Xiaoxuan He, Mengzhao Chen, Haoyang Huang, Nan Duan, Ping Luo

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 존재하는 모든 요리책에서 수년 동안 요리를 배워 온 천재적인 세계적 셰프가 있다고 가정해 봅시다. 이 셰프 (사전 훈련된 모델) 는 놀랍고 복잡한 요리를 만들 수 있습니다. 그러나 "치즈를 더 넣은 매운 파스타를 만들어 줘"라고 요청하면, 그들은 혼란을 겪거나 부엌을 태우거나, 보기에는 훌륭하지만 파스타 맛과는 전혀 다른 요리를 내놓을 수도 있습니다. 그들은 재능이 있지만 예측 불가능하며 운영 비용이 매우 비쌉니다.

이 논문은 그 천재적이지만 불안정한 셰프를 바쁜 레스토랑에서 일할 수 있는 신뢰할 수 있고 효율적이며 순종적인 전문가로 바꾸기 위한 4 단계 훈련 캠프를 제안합니다.

다음은 간단한 비유를 통해 4 단계가 어떻게 작동하는지 설명한 것입니다:

1 단계: "기본 순종" 부트 캠프 (지도 미세 조정)

문제: 셰프는 요리하는 법을 알지만, 잘 듣지 않습니다. 주문을 무시하거나 자신만의 규칙을 만들어 낼 수도 있습니다.
해결: 고급 기술을 가르치기 전에, 엄격한 부트 캠프를 시킵니다. 구체적인 주문이 주어졌을 때 정확히 무엇을 해야 하는지에 대한 수천 가지 예시를 보여줍니다.
결과: 셰프는 더 이상 자신만의 규칙을 만들어 내지 않습니다. "네, 셰프님"이라고 말하고 지시를 신뢰할 수 있게 따르는 법을 배웁니다. 이는 나중에 더 강하게 밀어붙였을 때 미쳐버리지 않도록 안정적인 기반을 마련해 줍니다.

2 단계: "맛보기" 대회 (강화 학습)

문제: 셰프는 이제 지시를 따르지만, 음식이 여전히 약간 기이해 보이거나 소스가 덩어져 있거나, 몇 분 후 요리가 무너질 수도 있습니다.
해결: 셰프에게 무엇을 해야 하는지 단순히 말하는 것이 아니라, 같은 요리의 여러 버전을 시도하게 하고 서로 비교하여 평가하게 합니다.

  • 비유: 셰프가 파스타 요리 8 가지 버전을 만든다고 상상해 보세요. 심사위원 패널 (보상 모델) 이 이를 시식하고 다음 네 가지 기준에 따라 우승자를 선정합니다:
    1. 보기에 좋은가? (시각적 미학)
    2. 소스가 매끄러운가? (모션 품질)
    3. 주문 내용과 일치하는가? (텍스트 정렬)
    4. 접시 장식이 예쁜가? (이미지 미학)
  • 마법: 셰프는 추측하는 대신 자신의 시도를 비교하며 배웁니다. 버전 A 가 버전 B 보다 더 좋게 보이면, 셰프는 버전 A 가 한 일을 더 많이 하도록 배웁니다. 이를 GRPO(그룹 상대 정책 최적화) 라고 합니다. 이는 코치가 그들을 향해 소리지르는 것을 기다리는 대신, 스포츠 팀이 서로 연습하며 더 빨라지는 것과 같습니다.

3 단계: "번역기" 업그레이드 (프롬프트 향상)

문제: 때로는 셰프가 훌륭하지만, 당신(고객) 이 원하는 것을 설명하는 데 서툴 수 있습니다. "멋진 영상을 만들어 줘"라고 말하면, "멋진"이라는 표현이 모호하기 때문에 셰프는 지루한 무언가를 만들어냅니다.
해결: 당신과 셰프 사이에 똑똑한 번역기 (언어 모델) 를 고용합니다.

  • 비유: 당신은 번역기에게 "멋진 영상을 만들어 줘"라고 말합니다. 번역기는 이를 "네온 사인과 비행 자동차가 있는 일몰의 미래 도시를 영화적으로 촬영한 장면"으로 다시 씁니다.
  • 훈련: 이 번역기도 동일한 "맛보기" 대회를 통해 훈련됩니다. 번역기가 다시 쓴 프롬프트가 더 나은 요리를 이끌어내면, 번역기는 높은 점수를 받습니다. 이제 당신이 모호한 지시를 주더라도 번역기는 셰프를 위한 완벽한 레시피로 변환해 줍니다.

4 단계: "스피드 런" 훈련 (자기회귀 증류)

문제: 셰프는 이제 놀라울 정도로 훌륭하지만 느립니다. 부엌의 모든 재료를 서로 비교하며 확인하기 때문에 한 요리를 만드는 데 몇 시간이 걸립니다.
해결: 우리는 셰프에게 한 번에 모든 것을 확인할 필요가 없는 더 빠르고 새로운 요리법을 가르칩니다.

  • 비유: 다음에 무엇을 할지 결정하기 위해 부엌 전체를 살펴보는 대신, 셰프는 프레임 단위(또는 단계별) 로 요리하는 법을 배웁니다. 바로 방금 만든 것만을 사용하여 다음 단계를 결정하는 것입니다.
  • 결과: 셰프는 이제 이전 단계에서 배운 품질을 잃지 않으면서도 훨씬 빠르게 요리를 제공할 수 있습니다 (효율적인 추론). 이는 느리고 조심스러운 수동 변속기에서 고속 자동 변속기로 전환하는 것과 같습니다.

최종 결과

이 4 단계 프로세스가 끝날 때쯤 영상 생성 모델은 다음과 같은 특징을 갖게 됩니다:

  1. 순종적: 실제로 당신의 지시를 듣습니다.
  2. 아름답습니다: 영상은 매끄럽고 사실적이며 고품질로 보입니다.
  3. 강건합니다: 복잡한 프롬프트를 주더라도 깨지지 않습니다.
  4. 빠릅니다: 실생활에서 유용하게 사용할 수 있을 정도로 영상을 빠르게 생성할 수 있습니다.

이 논문은 내부 영상 모델에서 이를 테스트한 결과, "맛보기" 단계만으로도 인간 평가에서 영상이 31% 더 좋아졌으며, "번역기"를 추가하면 20% 더 향상된 것으로 나타났습니다. 그 결과 이 시스템은 실험실에서의 멋진 실험이 아니라 실제 응용 프로그램에 사용될 준비가 된 상태가 되었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →