← नवीनतम पेपर
💻 computer science

Flash-GRPO: Efficient Alignment for Video Diffusion via One-Step Policy Optimization

फ्लैश-जीआरपीओ (Flash-GRPO) एक सिंगल-स्टेप ट्रेनिंग फ्रेमवर्क है जो आइसो-टेम्पोरल ग्रुपिंग (iso-temporal grouping) और टेम्पोरल ग्रेडिएंट रेक्टिफिकेशन (temporal gradient rectification) को पेश करके वीडियो डिफ्यूजन मॉडल्स के लिए मौजूदा ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइज़ेशन (Group Relative Policy Optimization) विधियों की कम्प्यूटेशनल बाधाओं और अस्थिरता को दूर करता है ताकि काफी कम प्रशिक्षण लागत के साथ अत्याधुनिक अलाइनमेंट गुणवत्ता प्राप्त की जा सके।

मूल लेखक: Xiaoxuan He, Siming Fu, Zeyue Xue, Weijie Wang, Ruizhe He, Yuming Li, Dacheng Yin, Shuai Dong, Haoyang Huang, Hongfa Wang, Nan Duan, Bohan Zhuang

प्रकाशित 2026-05-18
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xiaoxuan He, Siming Fu, Zeyue Xue, Weijie Wang, Ruizhe He, Yuming Li, Dacheng Yin, Shuai Dong, Haoyang Huang, Hongfa Wang, Nan Duan, Bohan Zhuang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक अत्यंत प्रतिभाशाली लेकिन अराजक कलाकार (एक वीडियो डिफ्यूजन मॉडल) को ऐसी तस्वीरें बनाना सिखाने की कोशिश कर रहे हैं जो वास्तव में मनुष्यों को पसंद आएं। वह कलाकार चीजें बनाने में तो माहिर है, लेकिन कभी-कभी उसके परिणाम अजीब, धुंधले या आपके निर्देशों का पालन न करने वाले होते हैं। इसे ठीक करने के लिए, आप एक "कोच" (एक एल्गोरिदम जिसे GRPO कहा जाता है) का उपयोग करते हैं जो कलाकार को देखता है, उसे फीडबैक देता है, और उसे बेहतर बनने में मदद करता है।

हालाँकि, एक बहुत बड़ी समस्या है: कलाकार धीमी गति (स्लो मोशन) में काम करता है। अच्छा फीडबैक देने के लिए, कोच को आमतौर पर पेंटिंग की पूरी प्रक्रिया को शुरू से अंत तक, फ्रेम-दर-फ्रेम देखना पड़ता है। इसमें अनंत समय लगता है और इसके लिए एक छोटे शहर के आकार के सुपरकंप्यूटर (सैकड़ों GPU दिन) की आवश्यकता होती है।

मौजूदा "फास्ट" विधियों ने कुछ रैंडम फ्रेम देखकर धोखाधड़ी करने की कोशिश की। लेकिन यह उल्टा पड़ गया। यह ऐसा था जैसे किसी मैराथन धावक को दौड़ की रेस के दौरान केवल एक सेकंड के लिए देखकर उसका आकलन करना। कभी आप उन्हें स्प्रिंट करते हुए पकड़ते हैं, तो कभी वे अपने जूते के फीते बांध रहे होते हैं। कोच भ्रमित हो जाता है, प्रशिक्षण अस्थिर हो जाता है, और कलाकार कभी भी ठीक से दौड़ना नहीं सीख पाता।

Flash-GRPO एक नया, स्मार्ट कोचिंग तरीका है जो इस समस्या को हल करता है। यह कोच को पेंटिंग प्रक्रिया के केवल एक ही क्षण को देखकर प्रभावी ढंग से सीखने की अनुमति देता है, लेकिन यह ऐसा करता है कि वह भ्रमित न हो। यह दो सरल ट्रिक्स का उपयोग करके काम करता है:

1. "एक जैसा मौसम" का नियम (Iso-Temporal Grouping)

समस्या: कल्पना कीजिए कि आप धावकों के एक समूह का निर्णय ले रहे हैं। यदि आप धावक A (जो बर्फीले तूफान में दौड़ रहा है) की तुलना धावक B (जो एक धूप वाले पार्क में दौड़ रहा है) से करते हैं, तो आप यह नहीं बता पाएंगे कि वास्तव में कौन बेहतर धावक है। मौसम (टाइमस्टेप या नॉइज़ लेवल) परिणामों को भ्रमित कर रहा है।

Flash-GRPO का समाधान: पेपर कहता है, "आइए सुनिश्चित करें कि तुलना किए जाने वाले समूह में हर कोई बिल्कुल एक जैसे मौसम में दौड़े।"

  • हर धावक के लिए अलग-अलग रैंडम क्षण चुनने के बजाय, Flash-GRPO पूरे समूह के प्रयासों के लिए एक विशिष्ट क्षण (जैसे, "दौड़ के 30% के दौरान") चुनता है।
  • उस समूह के सभी कलाकार उसी प्रक्रिया के ठीक उसी चरण पर पेंट करने का प्रयास करते हैं।
  • यह सुनिश्चित करता है कि जब कोच उनकी तुलना करता है, तो एकमात्र अंतर पेंटिंग की गुणवत्ता है, न कि उस क्षण की कठिनाई। यह "शोर" को हटा देता है ताकि कोच जान सके कि वास्तव में क्या ठीक करना है।

2. "वॉल्यूम नॉब" का ट्रिक (Temporal Gradient Rectification)

समस्या: वीडियो पेंटिंग की प्रक्रिया में, कुछ क्षण स्वाभाविक रूप से दूसरों की तुलना में अधिक "तेज" (लाउड) होते हैं। गणितीय रूप से, पेंटिंग के शुरुआती चरणों के संकेत बहुत बड़े होते हैं, जबकि बाद के चरणों के संकेत बहुत छोटे होते हैं। यदि कोच कच्चे संकेतों को सुनता है, तो वह केवल शुरुआती चरणों को सुनेगा और बाकी को अनदेखा कर देगा, जिससे कलाकार पागल (अस्थिर प्रशिक्षण) हो जाएगा।

Flash-GRO का समाधान: पेपर एक "वॉल्यूम नॉब" पेश करता है जो स्वचालित रूप से आवाज को एडजस्ट करता है।

  • यह गणना करता है कि प्रत्येक क्षण कितना "तेज" होना चाहिए और फिर तेज हिस्सों की आवाज़ कम कर देता है और शांत हिस्सों की आवाज़ बढ़ा देता है।
  • यह सुनिश्चित करता है कि पेंटिंग प्रक्रिया का हर एक क्षण सीखने में समान रूप से योगदान दे। अब शुरुआत में चिल्लाना और अंत में फुसफुसाना जैसी समस्या नहीं रहेगी।

परिणाम

इन दो ट्रिक्स का उपयोग करके, Flash-GRPO एक अद्भुत उपलब्धि हासिल करता है:

  • गति: यह पिछले तरीकों की तुलना में 6 गुना तेज़ प्रशिक्षित होता है क्योंकि इसे एक समय में केवल एक ही स्टेप को प्रोसेस करने की आवश्यकता होती है।
  • गुणवत्ता: तेज़ होने के बावजूद, यह ऐसे वीडियो बनाता है जो वास्तव में धीमे, पूर्ण-प्रक्रिया वाले तरीकों से बेहतर होते हैं। इन वीडियो में बेहतर मोशन होता है, वे अधिक सुंदर दिखते हैं, और निर्देशों का अधिक सटीक रूप से पालन करते हैं।
  • स्थिरता: प्रशिक्षण क्रैश नहीं होता या बेकाबू नहीं होता; यह लगातार सुधरता है, जैसे कि एक छात्र जो अंततः पाठ को समझ गया हो।

संक्षेप में: Flash-GRPO एक जीनियस कोच की तरह है जो यह समझ गया है कि एक जटिल कौशल सिखाने के लिए, आपको हर बार पूरी फिल्म देखने की आवश्यकता नहीं है। आपको बस सही दृश्य, सही परिस्थितियों में, और सही वॉल्यूम के साथ देखने की आवश्यकता है। यह अंतिम फिल्म को एक मास्टरपीस बनाने के लिए भारी मात्रा में समय और ऊर्जा बचाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →