← 최신 논문
💻 computer science

Scaling Reinforcement Learning for Diffusion Models via Velocity Matching

이 논문은 보상 기반 속도 매칭(Reward-based Velocity Matching, RVM)을 소개하는데, 이는 확산 모델의 속도장을 직접 최적화하여 보상 미세 조정을 수행하는 단순하고 계산 효율적인 궤적 불필요 프레임워크로서, 기존의 가능도 기반 정책 경사 방법들을 능가하는 동시에 최근 접근 방식들에 대한 통합된 관점을 제공하고 비디오 생성의 동적 보상을 개선할 수 있게 한다.

원저자: Jaemoo Choi, Wei Guo, Yuchen Zhu, Arash Vahdat, Molei Tao, Julius Berner, Yongxin Chen

게시일 2026-08-26
📖 3 분 읽기☕ 가벼운 읽기

원저자: Jaemoo Choi, Wei Guo, Yuchen Zhu, Arash Vahdat, Molei Tao, Julius Berner, Yongxin Chen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

급격히 진화하는 인공지능의 세계에서, 단순한 텍스트 설명으로부터 놀라운 이미지와 사실적인 영상을 만들어낼 수 있는 특정 부류의 컴퓨터 프로그램이 등장했습니다. 디퓨전 모델(diffusion models)이라고 알려진 이 시스템은 점진적인 부패 과정을 역으로 학습하는 방식으로 작동합니다. 선명한 사진을 가져와서 형체를 알아볼 수 없을 때까지 노이즈(static noise)를 서서히 추가하는 과정을 상상해 보십시오. 이 모델들은 순수한 노이즈로부터 시작하여 단계별로 정교하게 노이즈를 제거하며 일관된 그림을 드러내는, 즉 역방향으로 가는 수학적 경로를 학습합니다. 이러한 도구들이 믿기 힘들 정도로 강력해졌지만, 영상이 더 자연스럽게 움직이게 하거나 이미지가 더 아름다워 보이게 하는 것과 같은 인간의 선호도를 따르도록 가르치는 것은 어려운 일로 판명되었습니다. 전통적으로 연구자들은 모든 가능한 다음 단계의 확률을 계산하는 데 의존하는 언어 모델의 방식을 응용하려고 시도해 왔습니다. 그러나 이미지 및 영상 생성은 수백만 개의 픽셀이 동시에 변화하는 과정을 포함하기 때문에, 이러한 확률을 계산하는 것은 계산 비용이 많이 들며 완벽한 정확도로 수행하는 것이 종종 불가능합니다.

조지아 공과대학교와 NVIDIA의 연구진은 이러한 모델들에게 인간이 무엇을 선호하는지 가르칠 수 있는 더 단순하고 직접적인 방법을 찾아냈습니다. 생성 과정의 모든 미세한 단계에 대해 복잡한 확률을 계산하는 대신, 그들은 이미지가 형성되는 과정의 '속도(velocity)'에 직접 집중하는 방법을 제안했습니다. 이 모델들의 언어로 표현하자면, 시스템은 최종 결과에 도달하기 위해 이미지가 다음 순간에 어떻게 변해야 하는지를 예측합니다. 연구진은 이 예측을 고품질의 결과로 이어지는 방향으로 밀어주고, 품질이 낮은 방향으로부터는 멀어지도록 보상 신호(reward signal)를 가이드로 사용하여 밀어낼 수 있다는 것을 발견했습니다. 이 접근 방식은 '보상 기반 속도 매칭(reward-based velocity matching)'이라 불리며, 이전의 시도들을 늦추었던 복잡한 확률 계산 과정을 우회합니다.

연구진은 이 아이디어를 대규모 영상 생성 모델에 테스트했는데, 단 하나의 영상을 만드는 데도 상당한 컴퓨팅 파워가 필요하기 때문에 이 모델들은 훈련 비용이 특히 많이 듭니다. 그들은 영상의 생성 경로 전체를 추적하는 기존 기술들과 새로운 방법을 비교했습니다. 결과는 놀라웠습니다. 그들의 더 단순한 방법은 영상의 품질을 더 높였을 뿐만 아니라, 계산 시간도 훨씬 적게 소요되었습니다. Wan2.1이라는 모델을 사용한 특정 테스트에서, 그들의 방식은 기존의 가장 뛰어난 방법들이 필요로 했던 훈련 시간의 약 12분의 1만을 사용하면서도 가장 높은 종합 품질 점수를 달월성했습니다. 이는 기존 방법들의 복잡성이 불필요했다는 것을 시사합니다. 개선의 핵심은 확률의 수학적 기제를 정교화하는 데 있는 것이 아니라, 보상 신호가 어떻게 설계되고 적용되느냐에 있었습니다.

그들의 발견 중 결정적인 부분은 모델이 실제로 무엇을 최적화하고 있는지 이해하는 것이었습니다. 연구진은 시각적 명확성이나 영상이 텍스트 설명과 얼마나 잘 일치하는지에 초점을 맞춘 표준적인 보상들이, 의도치 않게 모델이 깨끗해 보이지만 지루한, 움직임이 없는 정적인 이미지를 생성하도록 유도할 수 있다는 것을 발견했습니다. 이를 해결하기 위해, 그들은 영상에 의미 있는 움직임이 포함되도록 움직임을 구체적으로 추적하는 새로운 유형의 보상을 도입했습니다. 이 움직임 중심의 보상을 시스템에 추가했을 때, 영상은 시각적 품질을 잃지 않으면서도 훨씬 더 역동적으로 변했습니다. 이 발견은 이러한 강력한 모델들에 있어 가장 중요한 요소는 훈련 알고리즘의 복잡성이 아니라, 기계에 설정된 목표의 명확성과 구체성이라는 점을 강조합니다.

또한 이 연구는 모델을 업데이트하는 데 사용되는 특정 수학 공식이 이전에 생각했던 것보다 덜 중요하다는 것을 밝혀냈습니다. 연구진은 자신들의 새로운 방법이 최근의 여러 다른 접근 방식들과 수학적으로 동일하다는 것을 보여주었으며, 이는 해당 방법들 사이의 성능 차이가 핵심 알고리즘 자체보다는 보상을 설정하는 방식에서 기인했을 가능성이 높다는 것을 의미합니다. 확률 추정의 불필요한 층을 제거함으로써, 그들은 직접적인 속도 기반 업데이트가 더 나은 결과를 향해 모델을 안내하는 데 충분하다는 것을 입증했습니다. 이러한 단순화는 더 효율적인 훈련의 길을 열어주어, 연구자들이 컴퓨팅 비용에 발목 잡히지 않고 더 빠르게 반복 실험을 하고, 이러한 기술을 더욱 복잡한 작업으로 확장할 수 있게 합니다.

궁극적으로 이 연구는 생성형 AI를 훈련하는 방식에 대한 사고의 전환을 제안합니다. 문제를 확률 추정의 복잡한 퍼즐로 취급하기보다, 모델의 내부 방향을 인간의 선호도와 직접 정렬하는 것으로 보는 것이 더 낫다는 것을 연구진은 보여주었습니다. 훨씬 적은 자원으로 우수한 결과를 얻어낸 그들의 방법의 성공은, 효율적인 AI 훈련의 미래가 더 단순하고 직접적인 피드백 루프에 있을 수 있음을 나타냅니다. 이러한 모델들이 규모와 역량을 계속 키워나감에 따라, 모델을 빠르고 효과적으로 미세 조정(fine-tuning)하는 능력은 필수적일 것이며, 이 새로운 접근 방식은 인공지능을 인간의 요구에 더 민감하게 반응하도록 만들기 위한 명확하고 실질적인 경로를 제시합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →