LpWM: A Case for Sparse Representations in World Models
यह शोध पत्र LpWM प्रस्तुत करता है, जो एक जॉइंट-एम्बेडिंग प्रेडिक्टिव आर्किटेक्चर है जो पारंपरिक डेंस रिप्रेजेंटेशन की तुलना में प्रेडिक्टर जटिलता को महत्वपूर्ण रूप से कम करने और प्लानिंग सफलता में सुधार करने के लिए रेक्टिफाइड डिस्ट्रीब्यूशन मैचिंग द्वारा नियमित (regularized) स्पार्स, नॉन-नेगेटिव लेटेंट रिप्रेजेंटेशन का उपयोग करता है, और साथ ही व्याख्या योग्य, मोड-फैक्टर्ड डायनामिकल स्ट्रक्चर्स को प्रकट करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यह समझने के लिए कि एक मशीन दुनिया के माध्यम से आगे बढ़ना कैसे सीखती है, एक बच्चे को कमरे में रास्ता खोजने के बारे में सिखाने की कल्पना करें। बच्चा केवल एक स्थिर मानचित्र को याद नहीं करता; वह एक मानसिक मॉडल बनाता है कि जब वह किसी कुर्सी को धकेलता है या दरवाजा खोलता है तो कमरा कैसे बदलता है। आर्टिफिशियल इंटेलिजेंस के क्षेत्र में, इस मानसिक मॉडल को "वर्ल्ड मॉडल" (world model) कहा जाता है। एक कंप्यूटर के लिए रास्ता तय करने या कोई कार्य करने के लिए, उसे यह अनुमान लगाने की आवश्यकता होती है कि उसकी वर्तमान स्थिति और उसके द्वारा किए गए कार्यों के आधार पर आगे क्या होगा। एक सामान्य दृष्टिकोण जटिल दृश्य दुनिया को संख्याओं की एक सरल, आंतरिक भाषा में अनुवादित करना है, जिसे "लेटेंट स्पेस" (latent space) के रूप में जाना जाता है। इस छिपे हुए स्थान में, कंप्यूटर इन संख्याओं को आगे बढ़ाकर भविष्य की भविष्यवाणी करता है। हालाँकि, एक निरंतर समस्या यह रही है कि ये आंतरिक प्रतिनिधित्व अक्सर बहुत सघन (dense) हो जाते हैं, जहाँ सेट की हर एक संख्या में कुछ न कुछ मान होता है, जिससे भविष्यवाणी का कार्य अविश्वसनीय रूप से कठिन और त्रुटियों के प्रति संवेदनशील हो जाता है।
शोधकर्ता लंबे समय से यह सोच रहे थे कि इस आंतरिक भाषा को संरचित करने का कोई बेहतर तरीका हो सकता है। क्या होगा यदि, हर स्लॉट को जानकारी से भरने के बजाय, कंप्यूटर एक विरल (sparse) भाषा का उपयोग करे, जहाँ अधिकांश संख्याएँ शून्य हों और केवल कुछ ही अर्थ रखती हों? यह विचार सुझाव देता है कि सिस्टम को चयनात्मक होने के लिए मजबूर करके, दुनिया कैसे बदलती है इसके नियम सीखना सरल हो सकता है। यह केंद्रीय प्रश्न है जिसे NYU, ड्यूक यूनिवर्सिटी और ब्राउन यूनिवर्सिटी सहित संस्थानों के शोधकर्ताओं की एक टीम द्वारा किए गए एक नए अध्ययन में खोजा गया है। उन्होंने यह परीक्षण करने के लिए प्रयास किया कि क्या यह विरल दृष्टिकोण आर्टिफिशियल इंटेलिजेंस के लिए अपने वातावरण को समझना और नियंत्रित करना आसान बना सकता है, विशेष रूप से यह देखते हुए कि इन आंतरिक संख्याओं की ज्यामिति (geometry) कार्य की कठिनाई को कैसे प्रभावित करती है।
टीम ने LpWorldModel नामक एक नई प्रणाली पेश की, जिसे इन विरल (sparse) निरूपणों को सीखने के लिए डिज़ाइन किया गया है। पिछले तरीकों के विपरीत, जो आंतरिक कोड के हर हिस्से को सक्रिय रहने के लिए प्रोत्साहित करते थे, यह प्रणाली एक विशिष्ट गणितीय बाधा का उपयोग करती है ताकि यह सुनिश्चित हो सके कि कोड की अधिकांश संख्याएँ बिल्कुल शून्य रहें। उन्होंने इस प्रणाली को दो अलग-अलग वातावरणों पर प्रशिक्षित किया: एक सरल नेविगेशन कार्य जहाँ एक बिंदु (dot) एक दरवाजे से होकर गुजरता है, और एक अधिक जटिल हेरफेर (manipulation) कार्य जहाँ एक रोबोटिक हाथ को एक T-आकार के ब्लॉक को लक्ष्य स्थान तक धकेलना होता है। सरल वातावरण में, यह प्रणाली अच्छी तरह से काम करती थी चाहे आंतरिक कोड सघन हो या विरल, क्योंकि गति के नियम इतने सीधे थे कि एक बुनियादी प्रेडिक्टर भी उन्हें संभाल सके। हालाँकि, परिणाम अधिक कठिन 'पुशिंग' (धकेलने वाले) कार्य में नाटकीय रूप से बदल गए।
जब शोधकर्ताओं ने विभिन्न जटिलता वाले प्रेडिक्टर्स के साथ सिस्टम का परीक्षण किया, तो उन्होंने पाया कि विरल दृष्टिकोण ने एक स्पष्ट लाभ प्रदान किया। मध्यम श्रेणी की जटिलता में, जहाँ प्रेडिक्टिव मॉडल सघन, अव्यवस्थित निरूपणों को संभालने के लिए पर्याप्त शक्तिशाली नहीं था, वहाँ विरल प्रणाली सफल रही जहाँ सघन प्रणाली विफल रही। विशेष रूप से, पुशिंग कार्य पर, मध्यम क्षमता वाले प्रेडिक्टर्स का उपयोग करते समय, विरल प्रणाली ने सघन प्रणाली की तुलना में नियोजन (planning) की सफलता दर में 57 प्रतिशत तक सुधार किया। यह सुझाव देता है कि जानकारी को विरल प्रारूप में व्यवस्थित करके, सिस्टम ने दुनिया की गतिशीलता (dynamics) को मॉडल करने के लिए आवश्यक जटिलता को कम कर दिया। सघन प्रणाली संघर्ष कर रही थी क्योंकि उसे अंतःक्रियाओं के एक जटिल जाल को सीखना था, जबकि विरल प्रणाली एक सरल, अधिक प्रत्यक्ष नियमों के सेट पर भरोसा कर सकती थी।
केवल प्रदर्शन में सुधार करने के अलावा, शोधकर्ताओं ने पाया कि विरल निरूपणों ने जानकारी को एक आश्चर्यजनक रूप से व्याख्या योग्य (interpretable) तरीके से व्यवस्थित किया। सिस्टम ने स्वाभाविक रूप से दुनिया के "मोड" (mode) को स्थिति के विशिष्ट विवरणों से अलग कर दिया। एक परीक्षण वातावरण में जहाँ एजेंट के किस ज़ोन में होने के आधार पर भौतिकी (physics) बदल जाती थी, सिस्टम ने यह पहचानने के लिए कि वह किस ज़ोन में है, विशिष्ट संख्याओं की उपस्थिति या अनुपस्थिति (support) का उपयोग किया, जो प्रभावी रूप से भौतिकी के प्रकार के लिए एक स्विच के रूप में कार्य करता था। गैर-शून्य संख्याओं के वास्तविक मानों ने फिर एजेंट की ज़ोन के भीतर सटीक स्थिति जैसे निरंतर विवरणों को कैप्चर किया। इस अलगाव ने सिस्टम को यह समझने में मदद की कि दुनिया के नियम बदल गए हैं, न कि केवल बदलते पिक्सेल का एक समूह देख रहा है।
एक क्यूब के साथ बातचीत करने वाले रोबोटिक हाथ वाले अधिक जटिल परिदृश्य में, शोधकर्ताओं ने पाया कि विरल प्रणाली वस्तु की भौतिक स्थिति को ट्रैक कर सकती है, जैसे कि हाथ क्यूब को छू रहा है या नहीं। हालाँकि, अतिरिक्त मार्गदर्शन के बिना, सिस्टम दृश्य के सबसे तेज़ चलने वाले हिस्सों, जैसे कि हाथ पर ध्यान केंद्रित करने लगा, न कि संपर्क की धीमी लेकिन महत्वपूर्ण घटना पर। एक सरल बाधा जोड़कर जो सिस्टम को समय के साथ स्थिर रहने के लिए प्रोत्साहित करती थी, वे ध्यान को इस तरह बदलने में सक्षम हुए कि विरल कोड हाथ और क्यूब के बीच के संपर्क को ट्रैक करे। इसने प्रदर्शित किया कि विरल निरूपण को सबसे भौतिक रूप से सार्थक घटनाओं को उजागर करने के लिए ट्यून किया जा सकता है, जिससे आंतरिक कोड दुनिया की गतिशीलता के एक पठनीय मानचित्र में बदल गया।
अध्ययन निष्कर्ष निकालता है कि विरल निरूपण आर्टिफिशियल इंटेलिजेंस में वर्तमान में उपयोग किए जाने वाले सघन (dense) तरीकों के मुकाबले एक शक्तिशाली विकल्प प्रदान करते हैं। सिस्टम को चयनात्मक होने के लिए मजबूर करके, शोधकर्ताओं ने दिखाया कि भविष्य की भविष्यवाणी करने के कार्य को काफी आसान बनाना संभव है, जिससे सरल मॉडल बेहतर परिणाम प्राप्त कर सकते हैं। निष्कर्ष बताते हैं कि आंतरिक भाषा की ज्यामिति बहुत मायने रखती है; एक विरल, संरचित दृष्टिकोण एक सघन, असंरचित एक की तुलना में किसी प्रणाली के अंतर्निहित नियमों को अधिक स्पष्ट रूप से प्रकट कर सकता है। हालाँकि सिस्टम को सही भौतिक घटनाओं को ट्रैक करने के लिए सावधानीपूर्वक ट्यूनिंग की आवश्यकता होती है, लेकिन परिणाम संकेत देते हैं कि विरलता (sparsity) अधिक कुशल और व्याख्या योग्य वर्ल्ड मॉडल की ओर एक आशाजनक मार्ग है, जो मशीनों को कम कम्प्यूटेशनल पावर के साथ जटिल व्यवहार सीखने की अनुमति दे सकती है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।