MeanFlowNFT: Bringing Forward-Process RL to Average-Velocity Generators
यह शोध पत्र MeanFlowNFT प्रस्तुत करता है, जो एक नवीन ढांचा है जो एक प्रेरित तात्कालिक-वेग भविष्यवक्ता (induced instantaneous-velocity predictor) का निर्माण करके फॉरवर्ड-प्रोसेस सुदृढीकरण शिक्षण (Reinforcement Learning) विधि DiffusionNFT को MeanFlow जनरेटरों के अनुकूल बनाता है, जिससे कुशल रिवॉर्ड ऑप्टिमाइज़ेशन सक्षम होता है जो तेज़ कुछ-चरणों वाले सैंपलिंग को सुरक्षित रखते हुए इमेज और वीडियो जनरेशन में मौजूदा कुछ-चरणों और यहाँ तक कि बहु-चरण RL-ट्यून्ड मॉडल्स से भी काफी बेहतर प्रदर्शन करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट कलाकार को "एक नियॉन-रोशनी वाली साइबरपंक सड़क पर चलती एक शानदार कार" का चित्र बनाने के लिए सिखाने की कोशिश कर रहे हैं। आर्टिफिशियल इंटेलिजेंस की दुनिया में, वर्तमान के शीर्ष कलाकार डिफ्यूजन (diffusion) या फ्लो (flow) नामक एक तकनीक का उपयोग करते हैं। इसे ऐसे समझें जैसे कोई मूर्तिकार संगमरमर के एक ब्लॉक को तराश कर आकृति बनाता है। वे एक खुरदरे, शोर वाले पत्थर के टुकड़े (रैंडम स्टैटिक) से शुरुआत करते हैं और अंतिम मूर्ति को प्रकट करने के लिए छोटे-छोटे, सावधानीपूर्वक बदलाव करते हैं। समस्या यह है कि यह प्रक्रिया धीमी है। एक वास्तव में अच्छी तस्वीर पाने के लिए, रोबोट को 50 या 100 छोटे कदम उठाने पड़ सकते हैं, और हर एक कट के बाद अपने काम की जांच करनी पड़ सकती है। यह एक कमरे को एक-एक इंच के कदम लेकर पार करने जैसा है; आप वहां पहुँच तो जाएंगे, लेकिन इसमें बहुत समय लगेगा।
इसे तेज़ बनाने के लिए, वैज्ञानिकों ने हाल ही में एक नई तरकीब खोजी जिसे मीनफ्लो (MeanFlow) कहा जाता है। छोटे कदम उठाने के बजाय, रोबमा 'औसत गति' (average speed) की भविष्यवाणी करना सीखता है जिसे उसे समय के एक पूरे अंतराल में तय करना है। यह ऐसा है जैसे रोबोट कमरे में रेंगने के बजाय लंबी, आत्मविश्वास भरी छलांग लगाना सीख जाता है। यह उसे बहुत कम चरणों में उच्च-गुणवत्ता वाली छवियां बनाने की अनुमति देता है। हालाँकि, एक पेंच है: इन तेज़ रोबोटों को यह सिखाना कठिन है कि इंसान वास्तव में क्या पसंद करते हैं। आमतौर पर, एआई को अधिक रचनात्मक बनाने या नियमों का बेहतर पालन करने के लिए सिखाने हेतु, हम रीइन्फोर्समेंट लर्निंग (RL) नामक एक विधि का उपयोग करते हैं। लेकिन हमारे पास मौजूद सबसे अच्छी RL विधियाँ अभी भी उन धीमे, चरण-दर-चरण चलने वाले रोबोटों के लिए डिज़ाइन की गई हैं, न कि इन तेज़, छलांग लगाने वाले रोबोटों के लिए। तेज़ रोबोट को पुराने धीमे-रोबोट वाले पाठों से सिखाने की कोशिश करना एक चीते को कछुए के निर्देशों से दौड़ना सिखाने जैसा है; गणित यहाँ मेल नहीं खाता।
यहीं पर नया पेपर, MeanFlowNFT, आता है। शोधकर्ताओं ने एक सरल लेकिन कठिन प्रश्न पूछा: क्या हम अपने तेज़, छलांग लगाने वाले रोबोट को उन्हीं कुशल RL विधियों का उपयोग करके और भी बेहतर बना सकते हैं जिनका उपयोग हम धीमे रोबोटों के लिए करते हैं, बिना उसकी गति कम किए?
इसका उत्तर एक जोरदार "हाँ" है, और उन्होंने इसे इस प्रकार किया। टीम ने महसूस किया कि भले ही रोबोट "औसत गति" (बड़ी छलांग लगाने के लिए) की भविष्यवाणी करने के लिए प्रशिक्षित है, फिर भी उस औसत गति और "तात्कालिक गति" (किसी भी एक सूक्ष्म क्षण में गति) के बीच एक छिपा हुआ गणितीय संबंध है, जिसकी पुरानी RL विधियों को आवश्यकता होती है। उन्होंने एक चतुर सेतु बनाया जिसे इंड्यूस्ड इंस्टेंटेनियस-वेलोसिटी प्रेडिक्टर (induced instantaneous-velocity predictor) कहा जाता है। इसे ऐसे सोचें: रोबोट का मस्तिष्क एक लंबी सड़क यात्रा की योजना बनाना (औसत गति) सीखता है। शोधकर्ताओं ने एक विशेष "अनुवादक" बनाया जो उस लंबी यात्रा की योजना को देखता है और तुरंत पता लगा लेता है कि किसी विशिष्ट सेकंड में कार का स्पीडोमीटर क्या रीडिंग देगा (तात्कालिक गति)।
फिर उन्होंने इस अनुवादक का उपयोग करके रोबोट को पुरानी, कुशल RL विधि से सिखाया। रोबोट अनुवादक की स्पीडोमीटर रीडिंग के आधार पर फीडबैक (पुरस्कार/रिवॉर्ड) से सीखता है, लेकिन एक बार जब पाठ समाप्त हो जाता है, तो रोबोट अपनी मूल "औसत गति" वाले मस्तिष्क का उपयोग करके चित्र बनाना शुरू कर देता है। इसका मतलब है कि रोबोट अपनी सुपर-स्पीड खोए बिना अधिक रचनात्मक और मानवीय प्राथमिकताओं के अनुरूप बनता है।
परिणाम प्रभावशाली हैं। जब उन्होंने इमेज जनरेटर्स (जैसे Stable Diffusion 3.5-Medium) और वीडियो जनरेटर्स (जैसे Wan2.1) पर इसका परीक्षण किया, तो नया MeanFlowNFT मॉडल लगातार पिछले सर्वश्रेष्ठ तेज़ मॉडलों को पीछे छोड़ दिया। वास्तव में, इमेज जनरेशन पर, इसने 8 में से 6 अलग-अलग गुणवत्ता मेट्रिक्स पर अन्य शीर्ष-स्तरीय मॉडलों को पछाड़ दिया। इससे भी अधिक आश्चर्यजनक रूप से, वीडियो जनरेशन पर, एक 4-स्टेप MeanFlowNFT मॉडल ने VBench नामक गुणवत्ता परीक्षण पर 84.33 का स्कोर प्राप्त किया। यह एक बहुत धीमे, 50-स्टेप (LongCat-Video RL) मॉडल से बेहतर है, जिसने केवल 82.57 का स्कोर किया था।
यह पेपर साबित करता है कि यह तरीका केवल सिद्धांत में ही नहीं, बल्कि व्यवहार में भी काम करता है। इस "अनुवादक" की तरकीब का उपयोग करके, वे जटिल संभावनाओं की गणना किए बिना प्रशिक्षण प्रक्रिया को तेज़ और कुशल बनाए रखने में सफल रहे, जबकि उन्हें उन्नत रीइन्फोर्समेंट लर्निंग के लाभ भी मिले। रोबोट बेहतर छलांग लगाना सीखता है, जिससे वह पहले की तुलना में बहुत कम समय में अधिक सुंदर और सटीक चित्र और वीडियो बनाता है। यह एक चीते को दौड़ना तेज़ सिखाने जैसा है, न कि उसे धीरे चलने के लिए मजबूर करके, बल्कि उसे इलाके का एक बेहतर नक्शा देकर ताकि वह जानता है कि उसे अपने बड़े पंजे कहाँ रखने हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।