Compositional Diffusion with Guided Search for Long-Horizon Planning
यह शोध पत्र कंपोजिशनल डिफ्यूजन विद गाइडेड सर्च (CDGS) को प्रस्तुत करता है, जो एक ऐसी विधि है जो कंपोजिशनल जेनेरेटिव मॉडल्स में मोड एवरेजिंग को हल करने के लिए डिफ्यूजन डिनोइजिंग प्रक्रिया में सीधे पॉपुलेशन-आधारित सर्च और लाइकलीहुड फ़िल्टरिंग को एकीकृत करती है, जिससे रोबोटिक मैनिपुलेशन, पैनोरमिक इमेज सिंथेसिस और वीडियो जनरेशन जैसे विविध डोमेन में सुसंगत लॉन्ग-होरिज़न प्लानिंग सक्षम होती है।
मूल पेपर CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/) के तहत सार्वजनिक डोमेन को समर्पित है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को एक विशाल पहेली सुलझाना सिखाने की कोशिश कर रहे हैं, या किसी कंप्यूटर से एक विशाल भित्ति चित्र (mural) बनाने के लिए कह रहे हैं, या यहाँ तक कि घंटों चलने वाली एक फिल्म का निर्देशन कर रहे हैं। समस्या यह है कि ये कार्य इतने बड़े हैं कि उन्हें एक साथ नहीं सीखा जा सकता। यह एक पूरी विश्वकोश (encyclopedia) को एक ही रात में याद करने की कोशिश करने जैसा है; आपका मस्तिष्क (या कंप्यूटर का मस्तिष्क) इसे एक बार में समाहित नहीं कर सकता। इसलिए, वैज्ञानिक एक चतुर तरकीब अपनाते हैं: वे बड़े काम को छोटे, प्रबंधनीय टुकड़ों में तोड़ देते हैं। वे रोबोट को एक एकल ब्लॉक उठाना, या दीवार के एक वर्ग को पेंट करना, या पांच सेकंड की एक क्लिप फिल्माना सिखाते हैं। ये "स्थानीय" (local) विशेषज्ञ हैं।
लेकिन असली पेचीदगी यहाँ है: सिर्फ इसलिए कि आप प्रत्येक छोटे हिस्से को पूरी तरह से करना जानते हैं, इसका मतलब यह नहीं है कि आप उन्हें एक पूर्ण चीज़ बनाने के लिए जोड़ सकते हैं। यदि आप पहेली के डिब्बे पर बने चित्र को देखे बिना दो टुकड़ों को जोड़ने की कोशिश करते हैं, तो आप उन्हें इस तरह फिट करने के लिए मजबूर कर सकते हैं जो पास से तो ठीक लग सकता है, लेकिन पूरे चित्र को विकृत और टूटा हुआ बना देगा। आर्टिफिशियल इंटेलिजेंस की दुनिया में, इसे "मोड एवरेजिंग" (mode averaging) कहा जाता है। यह तब होता है जब कंप्यूटर बहुत अधिक सुरक्षित होने की कोशिश करता है और अपने सभी विकल्पों का औसत निकाल लेता है, जिसके परिणामस्वरूप एक योजना बनती है जो एक अस्त-व्यस्त, असंभव समझौता है—जैसे एक रोबोट का हाथ जो एक कप और एक हथौड़ा दोनों को एक साथ पकड़ने की कोशिश करता है, या एक वीडियो जहाँ एक बिल्ली वाक्य के बीच में अचानक कुत्ते में बदल जाती है।
यहीं जॉर्जिया इंस्टीट्यूट ऑफ टेक्नोलॉजी के शोधकर्ताओं का एक नया शोध पत्र काम आता है। वे जेनेरेटिव एआई (generative AI) के क्षेत्र में काम कर रहे हैं, जो उन कंप्यूटरों के पीछे की तकनीक है जो नई छवियां, वीडियो और योजनाएं बना सकते हैं। विशेष रूप से, वे "लॉन्ग-होरिज़न प्लानिंग" (long-horizon planning) के सिरदर्द से निपट रहे हैं—यानी कई छोटे चरणों को जोड़कर एक बड़ा लक्ष्य प्राप्त करने का तरीका खोजना। उन्होंने देखा कि इन छोटे एआई मॉडलों को जोड़ने का पुराना तरीका अक्सर उन अस्त-व्यस्त, असंभव समझौतों की ओर ले जाता था। इसलिए, उन्होंने एक नई विधि विकसित की जिसे कंपोजिशनल डिफ्यूजन विद गाइडेड सर्च (CDGS) कहा जाता है। इसे कंप्यूटर को पहेली जोड़ने के दौरान एक टॉर्च और एक मानचित्र देने के रूप में समझें, जिससे वह आगे देख सके, यह जांच सके कि क्या टुकड़े वास्तव में फिट बैठते हैं, और खराब विचारों को फेंक सके इससे पहले कि वे चित्र को खराब कर दें।
समस्या: जब "औसत" दुश्मन बन जाता है
लेखकों ने जो ठीक किया उसे समझने के लिए, हमें पहले उस गड़बड़ी को समझना होगा जो उन्होंने पाई। कल्पना कीजिए कि आप न्यूयॉर्क से लॉस एंजिल्स तक की सड़क यात्रा (road trip) की योजना बना रहे हैं। आपके पास एक मैप ऐप है जो छोटी यात्राओं की योजना बनाने में बहुत अच्छा है, जैसे "न्यूयॉर्क से फिलाडेल्फिया" या "शिकागो से डेनवर"। यदि आप केवल हर संभावित स्टॉप के लिए मार्गों का औसत निकालने के लिए ऐप से पूछते हैं, तो आपको एक ऐसा रास्ता मिल सकता है जो शिकागो तक आधा जाता है, फिर अचानक डेनवर कूद जाता है, फिर वापस शिकागो आता है। यह सभी रास्तों का एक "गणितीय औसत" है, लेकिन यह एक भयानक, असंभव रोड ट्रिप है।
एआई की दुनिया में, यह तब होता है जब कंप्यूटर कई अलग-अलग "स्थानीय" योजनाओं को मिलाने की कोशिश करता है। स्थानीय योजनाएं अक्सर "मल्टीमॉडल" (multimodal) होती हैं, जो एक फैंसी तरीका है यह कहने का कि एक एकल चरण के लिए कई अलग-अलग वैध तरीके मौजूद हैं। उदाहरण के लिए, एक ब्लॉक को हिलाने के लिए, एक रोबोट उसे धकेल सकता है, खींच सकता है, या उठा सकता है। यदि कंप्यूटर बस इन विकल्पों का औसत निकाल देता है, तो वह एक ही समय में तीनों करने की कोशिश कर सकता है, जिसके परिणामस्वरूप एक रोबोट बेकार तरीके से कंपन (vibrate) करने लगता है। पुराने तरीकों ने इसे केवल विभिन्न संभावनाओं के स्कोर का औसत निकालकर ठीक करने की कोशिश की, लेकिन लेखकों ने पाया कि यह दृष्टिकोण अक्सर ऐसी योजनाएं बनाता था जो कागज पर तो सहज दिखती थीं लेकिन वास्तविकता में शारीरिक रूप से असंभव या तार्किक रूप से टूटी हुई थीं।
समाधान: कोहरे के बीच एक निर्देशित खोज
लेखक इस समस्या को संभालने का एक नया तरीका प्रस्तावित करते हैं, जिसे वे कंपोजिशनल डिफ्यूजन विद गाइडेड सर्च (CDGS) कहते हैं। इसे समझने के लिए, कल्पना करें कि आप एक अंधेरे, कोहरे से भरे जंगल में एक विशिष्ट खाली जगह (clearing) खोजने की कोशिश कर रहे हैं। आपके पास एक दिशा सूचक यंत्र (compass - एआई मॉडल) है जो आपको सामान्य दिशा बताता है, लेकिन कोहरा इतना घना है कि आप आगे का रास्ता नहीं देख सकते।
पुराना तरीका एक कदम उठाने, दिशा सूचक यंत्र को देखने और फिर दूसरा कदम उठाने जैसा था, इस उम्मीद में कि आप ट्रैक पर बने रहेंगे। लेकिन क्योंकि कोहरा घना है, आप यह महसूस किए बिना दलदल में जा सकते हैं कि बहुत देर हो चुकी है।
CDGS विधि अलग है। केवल एक पथ लेने के बजाय, यह खोजकर्ताओं की एक पूरी टीम (एक "पॉपुलेशन" के संभावित प्लान) भेजता है। यात्रा के हर चरण में, ये खोजकर्ता तीन काम करते हैं:
- वे एक-दूसरे से बात करते हैं (इटरेटिव रीसैंपलिंग): लाइन के आगे वाले खोजकर्ता पीछे वालों से फुसफुसाते हैं, और इसके विपरीत भी। इससे पूरा समूह संरेखित रहने में मदद मिलती। यदि आगे वाला खोजकर्ता महसूस करता है कि आगे का रास्ता बंद है, तो वे पीछे वाले को पूरे समूह के भटकने से पहले मुड़ने के लिए कह सकते हैं। यह सुनिश्चित करता है कि योजना शुरू से अंत तक सुसंगत बनी रहे, न कि शुरुआत और अंत एक-दूसरे का खंडन करें।
- वे मानचित्र की जाँच करते हैं (प्रूनिंग): टीम का एक विशेष नियम है: यदि कोई रास्ता ऐसा दिखता है जो खाई (एक असंभव संक्रमण) की ओर ले जाएगा, तो वे उसे तुरंत काट देते हैं। वे एक चतुर तकनीक का उपयोग करते हैं जिसमें एआई की अपनी "याददाश्त" शामिल है कि एक अच्छा रास्ता कैसा दिखता है, ताकि इन मृत अंतों (dead ends) को जल्दी पहचाना जा सके। वे अंत तक इंतजार नहीं करते कि वे खो गए हैं; वे बढ़ते हुए ही खराब शाखाओं को काट देते हैं।
- वे सबसे अच्छा रास्ता चुनते हैं (सिलेक्शन): रास्तों की जाँच करने के बाद, वे केवल सबसे अच्छे, सबसे आशाजनक खोजकर्ताओं को रखते हैं और उन्हें अगले चरण पर भेजते हैं। यह रोड ट्रिप के लिए "सर्वाइवल ऑफ द फिटेस्ट" (योग्यतम की उत्तरजीविता) जैसा है।
ऐसा करके, CDGS "मोड एवरेजिंग" के जाल से बचता है। एक धुंधला, असंभव औसत बनाने के बजाय, यह एक विशिष्ट, सुसंगत पथ पाता है जो शुरू से अंत तक काम करता है।
उन्होंने क्या पाया: रोबोट, पैनोरमा और फिल्में
लेखकों ने तीन बहुत ही अलग दुनिया में अपने नए तरीके का परीक्षण किया, और परिणाम काफी उत्साहजनक रहे।
1. रोबोट प्लेग्राउंड
सबसे पहले, उन्होंने रोबोट पर CDGS का परीक्षण किया। उन्होंने रोबोट को एक क्यूब को एक स्थान से दूसरे स्थान पर ले जाने जैसे कार्य दिए, लेकिन एक मोड़ के साथ: रोबोट को क्यूब को खींचने के लिए एक हुक का उपयोग करना था, या पहले अन्य वस्तुओं को रास्ते से हटाना था। ये "लॉन्ग-होरिज़न" कार्य हैं क्योंकि इनके लिए कई चरणों के एक अनुक्रम की आवश्यकता होती है।
- परिणाम: इन परीक्षणों में, CDGS ने मौजूदा सर्वोत्तम तरीकों के समान, और कुछ मामलों में उनसे भी बेहतर प्रदर्शन किया। इसने जटिल पहेलियों को हल करने में सफलता प्राप्त की जहाँ रोबोट को बिना बताए चरणों के सही क्रम को समझना था। शोध पत्र सुझाव देता है कि CDGS इन कार्यों को बिना भारी मात्रा में नए प्रशिक्षण डेटा की आवश्यकता के संभाल सकता है, जो एक बड़ी जीत है क्योंकि रोबोट डेटा एकत्र करना धीमा और महंगा है।
2. पैनोरमिक आर्टिस्ट
इसके बाद, उन्होंने विशाल पैनोरमिक चित्र बनाने के लिए CDGS का उपयोग किया। कल्पना कीजिए कि आप पहाड़ों की एक श्रृंखला की फोटो ले रहे हैं, लेकिन आप एक बार में केवल एक शिखर की छोटी तस्वीरें ही ले सकते हैं। आपको पूरे दृश्य को देखने के लिए उन्हें आपस में जोड़ना होगा।
- परिणाम: जब उन्होंने इन छवियों को जोड़ने के लिए CDGS का उपयोग किया, तो अंतिम पैनोरमा निर्बाव (seamless) दिखा। पहाड़ पूरी तरह से मेल खा गए, और आकाश में कोई अजीब गड़बड़ी नहीं थी। उन्होंने अन्य तरीकों की तुलना की जो केवल किनारों का "औसत" निकालते थे, और CDGS ने बहुत अधिक प्राकृतिक दिखने वाले परिणाम दिए जो पूरे चित्र में शैली को सुसंगत बनाए रखते हैं।
3. मूवी डायरेक्टर
अंत में, उन्होंने वीडियो जनरेशन पर इसका परीक्षण किया। उन्होंने छोटे वीडियो क्लिप (लगभग 50 फ्रेम लंबे) लिए और उन्हें एक लंबा वीडियो (350 फ्रेम तक) बनाने के लिए जोड़ने की कोशिश की।
- परिणाम: यहाँ चुनौती पात्रों की निरंतरता बनाए रखना है। यदि पहला क्लिप एक पांडा गिटार बजा रहा है, तो उसे दूसरे क्लिप में भालू में नहीं बदलना चाहिए। CDGS पूरे लंबे वीडियो में विषयों को एक जैसा दिखाने और गति को सुचारू बनाए रखने में सफल रहा। हालाँकि लंबे वीडियो में वीडियो की गुणवत्ता थोड़ी कम थी (एक ट्रेड-ऑफ जिसे लेखक सामान्य मानते हैं), लेकिन यह अन्य तरीकों की तुलना में बहुत अधिक सुसंगत था जो पात्रों को बदलते या रूपांतरित होते छोड़ देते हैं।
निष्कर्ष
लेखक सावधानी बरतते हुए कहते हैं कि यह कोई जादू की छड़ी नहीं है जो हर समस्या को तुरंत हल कर देती है। वे नोट करते हैं कि उनकी विधि के लिए एक स्पष्ट लक्ष्य (जैसे "क्यूब को हरे स्थान पर ले जाना") होना आवश्यक है और यह तब सबसे अच्छा काम करती है जब "स्थानीय" विशेषज्ञ (छोटे एआई मॉडल) पहले से ही अपने विशिष्ट कार्यों में अच्छे हों। वे यह भी स्वीकार करते हैं कि उनके तरीके को चलाने के लिए अधिक कंप्यूटर पावर की आवश्यकता होती है क्योंकि इसे एक साथ कई पथों की जाँच करनी पड़ती है।
हालाँकि, शोध पत्र दृढ़ता से सुझाव देता है कि CDGS दीर्घकालिक योजना बनाने के बारे में एआई को स्मार्ट बनाने के लिए एक शक्तिशाली नया उपकरण है। योजना बनाने के तरीके में सीधे एक "खोज" (search) प्रक्रिया को शामिल करके, यह उन उलझे हुए समझौतों से बचता है जो पिछले तरीकों के साथ होते रहे हैं। चाहे वह एक रोबोट का हाथ हो जो मेज को व्यवस्थित करने का तरीका ढूंढ रहा हो, एक कैमरा हो जो एक विशाल परिदृश्य के माध्यम से घूम रहा हो, या एक फिल्म निर्देशक जो एक लंबी कहानी को जोड़ रहा हो, CDGS एक तरीका प्रदान करता है जिससे संपूर्ण हिस्सा अपने हिस्सों के योग से भी महान बनता है, यह सुनिश्चित करता है कि अंतिम परिणाम केवल एक गणितीय औसत नहीं है, बल्कि एक सुसंगत, कार्यशील वास्तविकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।