MeanFlowNFT: Bringing Forward-Process RL to Average-Velocity Generators
이 논문은 유도된 즉각적 속도 예측기(induced instantaneous-velocity predictor)를 구축함으로써 순방향 프로세스 강화 학습 방법인 DiffusionNFT를 MeanFlow 생성기에 적응시킨 새로운 프레임워크인 MeanFlowNFT를 소개하며, 이를 통해 빠른 몇 단계 샘플링을 유지하면서도 이미지 및 비디오 생성에서 기존의 몇 단계 및 심지어 다단계 RL 튜닝 모델들을 크게 능가하는 효율적인 보상 최적화를 가능하게 한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 로봇 예술가에게 "네온 사인이 빛나는 사이버펑크 거리를 달리는 매끈한 자동차"를 그리도록 가르치려 한다고 상상해 보세요. 인공지능의 세계에서 현재 최고의 예술가들은 확산(diffusion) 또는 **플로우(flow)**라고 불리는 기법을 사용합니다. 이것은 마치 대리석 덩어리에서 조각을 해 나가는 조각가와 같습니다. 그들은 처음에 거칠고 노이즈가 섞인 돌덩어리(무작위 정적 상태)에서 시작하여, 최종적인 조각상을 드러내기 위해 아주 작고 세심한 조정을 단계별로 수행합니다. 문제는 이 과정이 느리다는 점입니다. 정말 좋은 그림을 얻으려면 로봇은 매번 작업을 확인하며 50단계 또는 100단계의 아주 작은 단계를 밟아야 할 수도 있습니다. 이는 방을 가로지를 때 1인치씩 발을 내디디며 걷는 것과 같습니다. 목적지에 도달할 수는 있겠지만, 시간이 너무 오래 걸립니다.
이 과정을 더 빠르게 만들기 위해, 과학자들은 최근 MeanFlow라는 새로운 기술을 발명했습니다. 로봇이 아주 작은 발걸음을 떼는 대신, 전체 시간 동안 이동해야 할 "평균 속도"를 예측하는 법을 배우는 것입니다. 이것은 로봇이 방을 가로지르기 위해 발을 끌며 걷는 대신, 크고 자신감 넘치는 도약을 하는 법을 배우는 것과 같습니다. 이를 통해 로봇은 단 몇 단계만으로도 고품질의 이미지를 만들어낼 수 있습니다. 하지만 여기에는 함정이 있습니다. 이 빠른 로봇들에게 인간이 실제로 '좋아하는 것'이 무엇인지 가르치기가 어렵다는 점입니다. 보통 AI가 더 창의적이거나 규칙을 더 잘 따르도록 가르칠 때는 **강화 학습(Reinforcement Learning, RL)**이라는 방법을 사용합니다. 하지만 우리가 현재 가진 최고의 RL 방법들은 느린 단계별 로봇들을 위해 설계된 것이지, 빠른 도약형 로봇들을 위해 설계된 것이 아닙니다. 이 빠른 로봇에게 기존의 느린 로봇용 레슨으로 가르치려는 것은, 마치 거북이를 위한 지침을 가지고 치타를 가르치려는 것과 같습니다. 수학적 구조가 맞지 않기 때문입니다.
여기서 새로운 논문인 MeanFlowNFT가 등장합니다. 연구진은 단순하지만 까다로운 질문을 던졌습니다. 우리가 우리의 빠른 도약형 로봇에게, 기존의 느린 로봇들이 사용하는 효율적인 RL 방법을 사용하여 더 똑똑하게 가르칠 수 있을까? 그러면서도 속도를 늦추지 않고 말이다.
그 대답은 명확한 "예"였으며, 그 방법은 다음과 같습니다. 연구팀은 로봇이 (큰 도약을 하기 위해) "평균 속도"를 예측하도록 훈련되지만, 그 이면에 "순간 속도"(특정 찰나의 순간의 속도)와 연결된 숨겨진 수학적 고리가 있다는 것을 깨달았습니다. 그들은 **유도된 순간 속도 예측기(induced instantaneous-velocity predictor)**라는 영리한 가교를 구축했습니다. 이것을 이렇게 생각해 보세요. 로봇의 뇌는 긴 자동차 여행을 계획하도록 훈련받습니다(평균 속도). 연구진은 이 긴 여행 계획을 보고, 특정 순간마다 자동차의 속도계가 무엇을 가리킬지 즉각적으로 파악해내는 특별한 "번역기"를 만들었습니다(순간 속도).
그들은 이 번역기를 사용하여 기존의 효율적인 RL 방식으로 로봇을 가르쳤습니다. 로봇은 번역기의 속도계 읽기를 바탕으로 피드백(보상)으로부터 배웁니다. 하지만 레슨이 끝나면, 로봇은 다시 원래의 "평균 속도" 뇌를 사용하여 이미지를 생성합니다. 즉, 로봇은 초고속 성능을 잃지 않으면서도 인간의 선호도에 더 부합하도록 더 똑똑해집니다.
결과는 인상적입니다. 연구진이 이미지 생성기(Stable Diffusion 3.5-Medium 등)와 비디오 생성기(Wan2.1 등)에 대해 테스트했을 때, 새로운 MeanFlowNFT 모델은 기존의 빠른 모델들을 일관되게 앞질렀습니다. 실제로 이미지 생성에서 이 모델은 8가지 서로 다른 품질 지표 중 6가지에서 최고 수준의 모델들을 능가했습니다. 더욱 놀라운 점은, 비디오 생성에서 4단계 MeanFlowNFT 모델이 VBench라고 불리는 품질 테스트에서 84.33점을 기록했다는 것입니다. 이는 훨씬 느린 50단계 모델(LongCat-Video RL)이 기록한 82.57점보다 높은 점수입니다.
이 논문은 이 방법이 이론에서만 작동하는 것이 아니라 실제 현장에서도 작동한다는 것을 증명합니다. 이 "번역기" 트릭을 사용함으로써, 그들은 복잡한 확률을 계산할 필요 없이 훈련 과정을 빠르고 효율적으로 유지하면서도 고급 강화 학습의 이점을 모두 얻어냈습니다. 로봇은 더 나은 도약을 하는 법을 배우며, 훨씬 짧은 시간 안에 더 아름답고 정확한 이미지와 비디오를 만들어냅니다. 이는 치타에게 걷는 법을 가르치는 것이 아니라, 지형의 지도를 더 잘 보여주어 치타가 자신의 커다란 발을 정확히 어디에 디뎌야 할지 알게 함으로써 더 빨리 달리게 만드는 것과 같습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.