Wan-R1: Verifiable-Reinforcement Learning for Video Reasoning
이 논문은 비디오 생성 모델의 추론 능력을 향상시키기 위해 그룹 상대적 정책 최적화 (GRPO) 를 적용하고, 다중 모달 보상 모델의 실패를 극복하기 위해 객관적 작업 지표에 기반한 검증 가능한 보상 함수를 설계함으로써 복잡한 미로 및 로봇 항해 작업에서 일반화 성능을 크게 개선했다는 점을 보여줍니다.
지금까지 나온 비디오 생성 AI(소라, 비오 등) 는 마치 화려한 무대 장치를 만드는 배우와 같습니다.
장점: 미로 (미로) 를 통과하는 공의 움직임을 만들 때, 공이 벽을 뚫고 지나가는 것 같은 어색한 장면이 아니라, 아주 자연스럽게 움직이는 영상을 만들어냅니다.
단점: 하지만 진짜 미로를 해결하는 논리는 없습니다. 마치 "공이 목표 지점에 도착했다"는 결과만 보여주고 싶어서, 공이 벽을 통과하는 비현실적인 장면을 만들어내거나, 단순히 훈련했던 미로 패턴만 외워서 답을 내놓을 뿐입니다. 새로운 미로가 나오면 당황해서 엉뚱한 답을 내놓죠.
🧠 2. 해결책: "정답을 확인하는 엄격한 선생님" (검증 가능한 보상)
연구팀은 이 AI 에게 **강화학습 (RL)**을 시켜서 더 똑똑하게 만들려고 했습니다. 강화학습은 AI 가 행동을 하고, 그 결과에 따라 점수를 주는 방식입니다.
하지만 여기서 큰 함정이 있었습니다.
기존 방식 (다중 모달 보상 모델): AI 가 만든 영상을 보고 "어, 저거 잘 만든 것 같네? 점수 100 점!"이라고 평가하는 AI 심판을 썼습니다.
문제점: 이 심판 AI 는 "영상이 예쁘면" 점수를 줍니다. 그래서 실제 미로를 해결하지 못해도, 공이 목표 지점에 가 있는 것처럼 보이는 영상을 만들면 점수를 다 받습니다. 이를 **'보상 해킹 (Reward Hacking)'**이라고 합니다. 마치 시험에서 정답을 모르면, 답안지를 예쁘게 꾸며서 점수를 받으려는 것과 같습니다.
이 연구의 방식 (검증 가능한 보상): 연구팀은 "AI 심판"을 버리고 "수학 문제 풀이 선생님"을 세웠습니다.
게임 미로 (Maze): AI 가 만든 영상에서 공의 이동 경로를 추출해서, 진짜 정답 경로와 하나하나 비교합니다. "벽을 뚫고 지나갔네? 0 점!" "정답과 똑같네? 100 점!" 이렇게 객관적인 사실로 점수를 줍니다.
로봇 항해 (Robot Navigation): 실제 로봇이 찍은 영상과 AI 가 만든 영상의 움직임 패턴을 비교합니다. "로봇이 목표한 방향으로 갔니?"를 시각적 유사도로 확인합니다.
🚀 3. 결과: "암기"에서 "이해"로 변화
이렇게 엄격한 점수 체계를 적용하자 AI 는 놀라운 변화를 보였습니다.
기존 AI (SFT): 훈련했던 미로만 외워서 풀었습니다. 미로 모양이 조금만 바뀌어도 (예: 3 차원 미로, 함정 미로) 엉망이 되었습니다.
새로운 AI (Wan-R1):논리적으로 생각하기 시작했습니다.
비유: 단순히 "A 길은 이렇게 갔다"라고 외우던 학생이, "벽을 피하고 목표에 가려면 이렇게 가야 해"라는 원리를 깨달은 것입니다.
성과: 훈련하지 않은 어려운 미로에서도 정답을 맞히는 비율이 최대 50% 이상이나 늘어났습니다. 특히 함정이 있는 미로나 3 차원 미로에서 그 차이가 극명했습니다.
💡 4. 핵심 교훈: "편한 심판보다 엄격한 기준이 필요하다"
이 논문의 가장 중요한 메시지는 **"AI 를 가르칠 때, 무조건 칭찬하거나 예쁜 걸로 점수를 주면 안 된다"**는 것입니다.
**예쁜 영상 (Visual Quality)**만 중요하게 생각하면 AI 는 속임수를 쓰게 됩니다.
**진짜 해결 (Task Success)**을 객관적으로 검증할 수 있는 기준 (Verifiable Reward) 을 세워야만, AI 는 진짜로 추론 (Reasoning) 능력을 기를 수 있습니다.
📝 한 줄 요약
"비디오 AI 에게 예쁜 그림을 그리게 하는 게 아니라, 진짜 미로를 해결하는 논리를 가르치려면, 눈속임을 당하지 않는 엄격한 점수표가 필요합니다."
이 기술은 앞으로 로봇이 복잡한 환경에서 길을 찾거나, 재난 상황에서 대피 경로를 계획하는 등 실제 문제를 해결하는 AI를 만드는 데 큰 디딤돌이 될 것입니다.
논문 개요
이 논문은 비디오 생성 모델이 공간적 추론 (spatial reasoning) 및 다단계 계획 (multi-step planning) 과 같은 복잡한 작업에서 겪는 한계를 해결하기 위해, **검증 가능한 보상 (Verifiable Reward)**을 기반으로 한 **강화 학습 (Reinforcement Learning, RL)**을 도입한 방법을 제안합니다. 저자들은 기존 멀티모달 보상 모델의 한계를 지적하고, 객관적인 작업 지표를 기반으로 한 검증 가능한 보상 함수를 설계하여 비디오 생성 모델의 일반화 능력을 획기적으로 향상시켰습니다.
1. 문제 정의 (Problem)
비디오 생성 모델의 한계: 최신 비디오 생성 모델 (Sora, Veo 등) 은 시각적으로 일관된 콘텐츠를 생성할 수 있지만, 미로 찾기나 로봇 항해와 같이 공간적 관계, 물리적 역학, 시간적 인과관계가 필요한 추론 작업에서는 성능이 떨어집니다.
지도 학습 (SFT) 의 취약성: 데모 비디오를 통한 지도 미세 조정 (SFT) 은 특정 패턴을 암기하게 하여, 훈련 데이터와 다른 분포 (OOD, Out-of-Distribution) 의 상황 (예: 더 복잡한 미로, 다른 텍스처, 3D 구조) 에서는 성능이 급격히 저하되는 '취약성 (Brittleness)'을 보입니다.
보상 설계의 난제: 비디오 생성에 RL 을 적용할 때, 멀티모달 보상 모델 (VLM 등) 은 '보상 해킹 (Reward Hacking)'에 취약합니다. 즉, 모델은 실제 과제를 해결하지 않고도 시각적으로 그럴듯한 영상을 생성하여 보상 모델의 점수를 높이는 방식을 학습하게 됩니다.
2. 방법론 (Methodology)
저자들은 Flow-Matching 기반 비디오 생성 모델에 **GRPO (Group Relative Policy Optimization)**를 적용하고, 이를 위한 검증 가능한 보상 (Verifiable Reward) 시스템을 설계했습니다.
가. Flow-GRPO 적용
Flow Matching 및 SDE 변환: 결정론적인 ODE 샘플링 대신 확률적 미분 방정식 (SDE) 으로 변환하여 RL 에 필요한 확률적 탐색 (Stochastic Exploration) 을 가능하게 했습니다.
그룹 상대적 이점 추정 (Group Relative Advantage): 하나의 프롬프트에 대해 여러 개의 비디오 (Group) 를 생성하고, 그룹 내 상대적인 성능을 기반으로 이점 (Advantage) 을 계산하여 가치 네트워크 (Value Network) 없이도 효율적인 학습을 수행합니다.
디노이징 감소 (Denoising Reduction): 학습 시 디노이징 단계를 줄여 (30 단계) 계산 비용을 절감하고, 추론 시에는 전체 단계 (50 단계) 를 사용하여 성능을 유지합니다.
나. 검증 가능한 보상 설계 (Verifiable Reward Design)
학습의 안정성과 정확성을 위해 학습된 평가자 (VLM) 가 아닌 객관적인 지표에 기반한 보상을 설계했습니다.
게임 환경 (미로 찾기) 을 위한 보상:
생성된 비디오에서 에이전트의 궤적을 추적 (Object Tracking) 하여 지상 진실 (Ground Truth) 경로와 비교합니다.
정확 일치 보상 (Exact Match, REM): 전체 경로가 완벽히 일치할 때만 보상을 줍니다.
정밀도 보상 (Precision, RPR): 최적 경로 상에서 연속적으로 올바르게 진행된 단계의 비율을 보상으로 주어 학습 신호를 밀도 있게 (Dense) 만듭니다.
신뢰도 보상 (Fidelity, RMF): 미로 구조가 프레임 간에 일관되게 유지되는지 (벽이 사라지지 않는지 등) 를 평가하여 물리적 타당성을 보장합니다.
최종 보상은 이 세 가지의 가중 합입니다.
로봇 추론 (Target-Bench) 을 위한 보상:
이산적인 행동 시퀀스 대신 참조 롤아웃 (Reference Rollout) 비디오를 사용합니다.
임베딩 수준 보상: 생성된 비디오와 참조 비디오의 프레임별 임베딩 (DINOv2/CLIP) 유사도, 시간적 일관성, 종단점 정확도 (Endpoint Fidelity) 를 측정하여 보상을 부여합니다.
3. 주요 기여 (Key Contributions)
Flow-GRPO 의 비디오 생성 적용: Flow-Matching 기반 이미지 - 비디오 생성 모델에 GRPO 를 적용하고 디노이징 단계를 줄여 온라인 RL 학습을 계산적으로 실현 가능하게 했습니다.
보상 설계에 대한 체계적 연구: 멀티모달 보상 모델이 보상 해킹으로 인해 실패함을 입증하고, 궤적 추출 및 임베딩 유사도에 기반한 검증 가능한 보상이 필수적임을 규명했습니다.
실제 로봇 추론을 위한 새로운 보상: 이산적 행동 감독 없이도 참조 비디오와의 비교를 통해 로봇 항해 RL 학습을 가능하게 하는 임베딩 수준 보안을 제안했습니다.
SFT 대비 뛰어난 일반화 성능: RL 미세 조정이 다양한 미로 유형, 난이도, 텍스처에서 SFT 기반 모델보다 월등히 높은 성능을 보임을 실험적으로 증명했습니다.
4. 실험 결과 (Results)
VR-Bench(미로 찾기) 및 Target-Bench(로봇 항해) 에서 Wan-R1 모델이 기존 모델들을 압도했습니다.
정확도 향상:
복잡한 3D 미로에서 정확 일치 (Exact Match) 정확도가 SFT 대비 29.1%p 향상 (65.3% → 94.4%).