← नवीनतम पेपर
💻 computer science

Scaling Reinforcement Learning for Diffusion Models via Velocity Matching

यह शोध पत्र रिवॉर्ड-आधारित वेलोसिटी मैचिंग (RVM) प्रस्तुत करता है, जो एक सरल और गणनात्मक रूप से कुशल ट्रैजेक्टरी-मुक्त ढांचा है जो रिवॉर्ड फाइन-ट्यूनिंग के लिए डिफ्यूजन मॉडल्स के वेलोसिटी फील्ड को सीधे अनुकूलित करता है, जो हालिया दृष्टिकोणों पर एक एकीकृत परिप्रेक्ष्य प्रदान करते हुए और वीडियो जनरेशन के लिए बेहतर डायनेमिक रिवॉर्ड्स को सक्षम करते हुए मौजूदा लाइकलीहुड-आधारित पॉलिसी-ग्रेडिएंट विधियों से बेहतर प्रदर्शन करता है।

मूल लेखक: Jaemoo Choi, Wei Guo, Yuchen Zhu, Arash Vahdat, Molei Tao, Julius Berner, Yongxin Chen

प्रकाशित 2026-08-26
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jaemoo Choi, Wei Guo, Yuchen Zhu, Arash Vahdat, Molei Tao, Julius Berner, Yongxin Chen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

आर्टिफिशियल इंटेलिजेंस की तेजी से बदलती दुनिया में, कंप्यूटर प्रोग्रामों का एक विशिष्ट वर्ग उभरा है जो सरल टेक्स्ट विवरणों से शानदार चित्र और वास्तविक दिखने वाले वीडियो बना सकता है। ये सिस्टम, जिन्हें डिफ्यूजन मॉडल (diffusion models) के रूप में जाना जाता है, क्रमिक भ्रष्टाचार (gradual corruption) की प्रक्रिया को उलटने को सीखकर काम करते हैं। कल्पना कीजिए कि आप एक स्पष्ट तस्वीर ले रहे हैं और उसमें धीरे-धीरे 'स्टेटिक नॉइज़' (static noise) जोड़ रहे हैं जब तक कि वह पहचानने योग्य न रह जाए; ये मॉडल शुद्ध शोर (noise) से शुरू होकर और उसे चरण दर चरण सावधानी से हटाकर एक सुसंगत चित्र प्रकट करने के लिए गणितीय पथ को पीछे की ओर जाने के लिए सीखते हैं। हालांकि ये उपकरण अविश्वसनीय रूप से शक्तिशाली हो गए हैं, लेकिन उन्हें मानवीय प्राथमिकताओं का पालन करना सिखाना—जैसे कि किसी वीडियो को अधिक स्वाभाविक रूप से चलते हुए दिखाना या किसी चित्र को अधिक सुंदर बनाना—कठिन साबित हुआ है। पारंपरिक रूप से, शोधकर्ताओं ने भाषा मॉडलों (language models) के लिए उपयोग की जाने वाली विधियों को अपनाने की कोशिश की है, जो एक अनुक्रम (sequence) में हर संभावित अगले कदम की संभावना (probability) की गणना करने पर निर्भर करती हैं। हालांकि, क्योंकि इमेज और वीडियो जनरेशन में लाखों पिक्सेल एक साथ बदलते हैं, इसलिए इन संभावनाओं की गणना करना कम्प्यूटेशनल रूप से महंगा और अक्सर पूर्ण सटीकता के साथ असंभव होता है।

जॉर्जिया टेक और एनवीडिया (NVIDIA) के शोधकर्ताओं की एक टीम ने इन मॉडलों को मानवीय प्राथमिकताएं सिखाने का एक सरल, अधिक सीधा तरीका खोज निकाला है। इन मॉडलों के जनरेशन प्रक्रिया के हर सूक्ष्म चरण के लिए जटिल संभावनाओं की गणना करने के बजाय, उन्होंने एक ऐसा तरीका प्रस्तावित किया जो सीधे छवि के बनने के दौरान उसकी "वेलोसिटी" (velocity - वेग) पर ध्यान केंद्रित करता है। इन मॉडलों की भाषा में, सिस्टम यह भविष्यवाणी करता है कि अंतिम परिणाम तक पहुँचने के लिए एक क्षण से दूसरे क्षण तक छवि को कैसे बदलना चाहिए। शोधकर्ताओं ने पाया कि वे केवल इस भविष्यवाणी को उन दिशाओं की ओर धकेल सकते हैं जो उच्च गुणवत्ता वाले परिणामों की ओर ले जाती हैं और इसे उन दिशाओं से दूर धकेल सकते हैं जो खराब परिणामों की ओर ले जाती हैं, जिसमें एक 'रिवॉर्ड सिग्नल' (reward signal) मार्गदर्शक के रूप में कार्य करता है। यह दृष्टिकोण, जिसे वे 'रिवॉर्ड-बेस्ड वेलोसिटी मैचिंग' (reward-based velocity matching) कहते हैं, उन जटिल संभावना गणनाओं की आवश्यकता को दरकिनार कर देता है जिन्होंने पिछले प्रयासों को धीमा कर दिया था।

शोधकर्ताओं ने इस विचार का परीक्षण बड़े पैमाने के वीडियो जनरेशन मॉडलों पर किया, जिन्हें प्रशिक्षित करना विशेष रूप से महंगा होता है क्योंकि एक एकल वीडियो बनाने के लिए महत्वपूर्ण कंप्यूटिंग शक्ति की आवश्यकता होती है। उन्होंने अपने नए तरीके की तुलना मौजूदा तकनीकों से की जो वीडियो के निर्माण के पूरे पथ को ट्रैक करने पर निर्भर करती हैं। परिणाम आश्चर्यजनक थे: उनके सरल तरीके ने न केवल बेहतर गुणवत्ता वाले वीडियो बनाए, बल्कि उन्हें बनाने में लगने वाला कंप्यूटिंग समय भी बहुत कम था। 'Wan2.1' नामक एक मॉडल का उपयोग करते हुए एक विशिष्ट परीक्षण में, उनके दृष्टिकोण ने पिछले सर्वोत्तम तरीकों की तुलना में केवल एक-बारहवें प्रशिक्षण समय का उपयोग करके उच्चतम समग्र गुणवत्ता स्कोर प्राप्त किया। यह सुझाव देता है कि पुराने तरीकों की जटिलता अनावश्यक थी; सुधार की कुंजी संभावना के गणितीय तंत्र को परिष्कृत करने में नहीं, बल्कि रिवॉर्ड सिग्नल्स को डिजाइन करने और लागू करने के तरीके में निहित थी।

उनकी खोज का एक महत्वपूर्ण हिस्सा यह समझना था कि मॉडल वास्तव में क्या अनुकूलित (optimize) कर रहा है। शोधकर्ताओं ने पाया कि मानक रिवॉर्ड्स, जो अक्सर दृश्य स्पष्टता या इस बात पर ध्यान केंद्रित करते हैं कि वीडियो टेक्स्ट विवरण से कितनी अच्छी तरह मेल खाता है, अनजाने में मॉडल को स्थिर, बिना किसी हलचल वाली छवियां बनाने के लिए प्रोत्साहित कर सकते हैं जो साफ तो दिखती हैं लेकिन उबाऊ होती हैं। इसे ठीक करने के लिए, उन्होंने एक नया प्रकार का रिवॉर्ड पेश किया जो विशेष रूप से मोशन (गति) को ट्रैक करता है, जिससे यह सुनिश्चित होता है कि वीडियो में सार्थक हलचल हो। जब उन्होंने अपने सिस्टम में मोशन-केंद्रित रिवॉर्ड को जोड़ा, तो वीडियो दृश्य गुणवत्ता खोए बिना काफी गतिशील हो गए। यह निष्कर्ष इस बात पर प्रकाश डालता है कि इन शक्तिशाली मॉडलों के लिए, सबसे महत्वपूर्ण कारक प्रशिक्षण एल्गोरिदम की जटिलता नहीं है, बल्कि मशीन के लिए निर्धारित लक्ष्यों की स्पष्टता और विशिष्टता है।

अध्ययन ने यह भी खुलासा किया कि मॉडल को अपडेट करने के लिए उपयोग किया जाने वाला विशिष्ट गणितीय सूत्र पहले की तुलना में कम महत्वपूर्ण है। शोधकर्ताओं ने दिखाया कि उनका नया तरीका कई अन्य हालिया दृष्टिकोणों के गणितीय रूप से समकक्ष है, जिसका अर्थ है कि उन विधियों के बीच प्रदर्शन का अंतर संभवतः उनके द्वारा रिवॉर्ड सेट करने के तरीके के कारण था, न कि मूल एल्गोरिदम के कारण। संभावना अनुमान की अनावश्यक परतों को हटाकर, उन्होंने प्रदर्शित किया कि एक सीधा, वेलोसिटी-आधारित अपडेट मॉडल को बेहतर परिणामों की ओर ले जाने के लिए पर्याप्त है। यह सरलीकरण अधिक कुशल प्रशिक्षण के द्वार खोलता है, जिससे शोधकर्ता तेजी से प्रयोग कर सकते हैं और संभावित रूप से इन तकनीकों को और अधिक जटिल कार्यों तक स्केल कर सकते हैं बिना कम्प्यूटेशनल लागत के कारण बाधित हुए।

अंततः, यह कार्य हमें जेनेरेटिव एआई को प्रशिक्षित करने के बारे में सोचने के तरीके में एक बदलाव का सुझाव देता है। समस्या को संभावना अनुमान की एक जटिल पहेली के रूप में देखने के बजाय, शोधकर्ताओं ने दिखाया कि इसे मॉडल की आंतरिक दिशा को मानवीय प्राथमिकताओं के साथ सीधे संरेखित (align) करने के रूप में देखना बेहतर है। उनके तरीके की सफलता, जिसने नाटकीय रूप से कम संसाधनों के साथ बेहतर परिणाम प्राप्त किए, यह दर्शाती है कि कुशल एआई प्रशिक्षण का भविष्य सरल, अधिक प्रत्यक्ष फीडबैक लूप्स में निहित है। जैसे-जैसे ये मॉडल आकार और क्षमता में बढ़ते जा रहे हैं, उन्हें तेजी से और प्रभावी ढंग से फाइन-ट्यून करने की क्षमता आवश्यक होती जा रही है, और यह नया दृष्टिकोण आर्टिफिशियल इंटेलिजेंस को मानवीय जरूरतों के प्रति अधिक उत्तरदायी बनाने के लिए एक स्पष्ट, व्यावहारिक मार्ग प्रदान करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →