← नवीनतम पेपर
🤖 AI

Vector Symbolic Policy Gradient

यह शोध पत्र वेक्टर सिम्बॉलिक पॉलिसी ग्रेडिएंट (VSPG) प्रस्तुत करता है, जो एक डिस्क्रीट-एक्शन एक्टर है जो संकुचित कर्नेल मेमोरी के साथ एडवांटेज-वेटेड लर्निंग और बिट-फ्लिप त्रुटियों के विरुद्ध प्रमाणिक सुदृढ़ता को सक्षम करने के लिए क्रियाओं को हाइपरवेक्टर्स के रूप में निरूपित करता है।

मूल लेखक: Ryozo Masukawa, Sanggeon Yun, SungHeon Jeong, Hyunwoo Oh, Raheeb Hassan, Pietro Mercati, Nathaniel D. Bastian, Mahdi Imani, Mohsen Imani

प्रकाशित 2026-08-20
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ryozo Masukawa, Sanggeon Yun, SungHeon Jeong, Hyunwoo Oh, Raheeb Hassan, Pietro Mercati, Nathaniel D. Bastian, Mahdi Imani, Mohsen Imani

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि एक ऐसी दुनिया है जहाँ स्वायत्त रोबोटों को निर्देशित करने वाले या स्मार्ट इमारतों का प्रबंधन करने वाले कंप्यूटर नाजुक, कोमल मशीनें नहीं, बल्कि ऐसे मजबूत सिस्टम हैं जो तब भी कार्य करने में सक्षम हैं जब उनकी आंतरिक स्मृति (मेमोरी) थोड़ी क्षतिग्रस्त या अपरिष्कृत हो। यह 'वेक्टर सिम्बोलिक आर्किटेक्चर' नामक एक क्षेत्र का वादा है, जो आर्टिफिशियल इंटेलिजेंस के बारे में सोचने का एक ऐसा तरीका है जो इस बात से प्रेरित है कि मानव मस्तिष्क सूचनाओं को कैसे संग्रहीत करता है। सटीक, नाजुक संख्याओं पर निर्भर रहने के बजाय, यह दृष्टिकोण डेटा के विशाल, उच्च-आयामी पैटर्न (high-dimensional patterns) का उपयोग करता है जिन्हें सरल गणित का उपयोग करके संयोजित और तुलना किया जा सकता है। मुख्य विचार यह है कि ये पैटर्न इतने असंख्य और विशिष्ट हैं कि वे एक-दूसरे को भ्रमित किए बिना ओवरलैप हो सकते हैं, ठीक वैसे ही जैसे विभिन्न भाषाएं बोलने वाले लोगों से भरे एक भीड़भाड़ वाले कमरे में आप पृष्ठभूमि के शोर के जंजाल बनने के बजाय एक एकल बातचीत पर ध्यान केंद्रित कर सकते हैं। यह लचीलापन इस दृष्टिकोण को "एज" (edge) उपकरणों के लिए विशेष रूप से आकर्षक बनाता है—ऐसे कंप्यूटर जो सीमित शक्ति पर चलते हैं या कठोर वातावरण में होते हैं जहाँ पूर्ण डेटा भंडारण की गारंटी नहीं दी जा सकती।

कैलिफोर्निया विश्वविद्यालय, इरविन के शोधकर्ताओं और उनके सहयोगियों ने अब इस अवधारणा को लिया है और इसे सीधे इस तरीके पर लागू किया है जिससे मशीनें निर्णय लेना सीखती हैं। उनके द्वारा क्या किया गया है, इसे समझने के लिए, पहले उस समस्या को समझना सहायक है जिसे वे हल कर रहे हैं। सुदृढीकरण शिक्षण (reinforcement learning) में, एक कृत्रिम एजेंट कार्यों को आज़माकर और यह देखकर सीखता है कि क्या होता है, धीरे-धीरे पुरस्कार को अधिकतम करने के लिए एक रणनीति बनाता है। पारंपरिक रूप से, यह रणनीति जटिल न्यूरल नेटवर्क में संग्रहीत होती है, जो जटिल कनेक्शनों के जाल की तरह होती है जिन्हें सटीक ट्यूनिंग की आवश्यकता होती है। यदि इन नेटवर्कों के भीतर की संख्याएं विद्युत शोर या विनिर्माण दोष के कारण दूषित हो जाती हैं, तो एजेंट की निर्णय लेने की क्षमता ढह सकती है। शोधकर्ताओं ने एक सरल प्रश्न पूछा: क्या हम एक ऐसा निर्णय लेने वाला सिस्टम बना सकते हैं जो स्वाभाविक रूप से इस प्रकार के नुकसान के प्रति प्रतिरोधी हो, जो इस तरह से यादें संग्रहीत करे जो स्वाभाविक रूप से क्षमशील (forgiving) हो?

इसका उत्तर उन्हें मिल गया है: हाँ। टीम ने एक ऐसा सिस्टम विकसित किया है जहाँ एजेंट द्वारा लिया जा सकने वाला प्रत्येक संभावित कार्य एक अद्वितीय, उच्च-आयामी पैटर्न, या "हाइपरवेक्टर" द्वारा दर्शाया जाता है। जब एजेंट अपने परिवेश का अवलोकन करता है, तो वह उस अवलोकन को एक समान पैटर्न में परिवर्तित करता है। क्या करना है, यह तय करने के लिए, सिस्टम बस यह जाँचता है कि कौन सा क्रिया पैटर्न वर्तमान अवलोकन के साथ सबसे अधिक समान दिखता है। उनकी पद्धति की प्रतिभा इस बात में निहित है कि सिस्टम कैसे सीखता है। अपने आंतरिक भार (weights) को समायोजित करने के लिए जटिल, बहु-चरणीय गणनाओं का उपयोग करने के बजाय, सिस्टम अपने मेमोरी को एक एकल, प्रत्यक्ष चरण में अपडेट करता है। जब एक एजेंट एक अच्छा कार्य करता है और उसे पुरस्कार प्राप्त होता है, तो सिस्टम उस क्रिया के पैटर्न और उस अवलोकन के बीच के संबंध को मजबूत करता है जिसने उसे प्रेरित किया था। यदि क्रिया खराब थी, तो यह उस संबंध को कमजोर करता है। यह प्रक्रिया एक मानक सीखने की पद्धति के गणितीय रूप से समकक्ष है, लेकिन इसे इन बड़े पैटर्न के सरल जोड़ और घटाव के बाद, पैटर्न को स्थिर रखने के लिए एक सामान्यीकरण (normalization) चरण का उपयोग करके किया जाता है।

यह खोज क्यों महत्वपूर्ण है, यह इस बात में है कि समय के साथ मेमोरी के साथ क्या होता है। जैसे-जैसे एजेंट सीखता है, वह अपने द्वारा किए गए हर एक अनुभव की सूची संग्रहीत नहीं करता है। इसके बजाय, वह अपने पूरे अनुभव को एक निश्चित-आकार के मेमोरी बैंक में संकुचित (compress) कर देता है। प्रत्येक क्रिया की मेमोरी उन सभी समयों का एक संकुचित सारांश बन जाती है जब वह क्रिया सहायक थी, जिसे परिणाम की अच्छाई के आधार पर भारित (weighted) किया गया है। इसका अर्थ है कि सिस्टम भारी मात्रा में कच्चा डेटा संग्रहीत करने की आवश्यकता के बिना कुशलतापूर्वक सीख सकता है। इसके अलावा, शोधकर्ताओं ने सिद्ध किया कि यह विधि त्रुटियों के प्रति अविश्वसनीय रूप से मजबूत है। उन्होंने परीक्षण किया कि यदि मेमोरी में रैंडम बिट्स बदल दिए जाते हैं, तो क्या होगा, जो उस प्रकार के भ्रष्टाचार का अनुकरण करता है जो अविश्वसनीय हार्डवेयर में होता है। जबकि पारंपरिक न्यूरल नेटवर्क और सरल रैखिक मॉडल इन स्थितियों में प्रदर्शन में महत्वपूर्ण गिरावट का शिकार हुए, नया वेक्टर-आधारित सिस्टम अपनी स्थिति बनाए रखने में सफल रहा। त्रुटियों को पैटर्न के विशाल आकार और संरचना द्वारा औसत निकाला गया, जिससे सिस्टम दोषपूर्ण मेमोरी के बावजूद सही निर्णय लेने में सक्षम रहा।

टीम ने अपने तरीके का परीक्षण विभिन्न चुनौतियों पर किया, जैसे कि चलती हुई गाड़ी पर डंडे को संतुलित करने जैसे क्लासिक कंट्रोल टास्क से लेकर जटिल भूलभुलैया (mazes) में नेविगेट करने और मल्टी-एजेंट बिल्डिंग सिस्टम में ऊर्जा प्रबंधित करने तक। इन परीक्षणों में, नया तरीका मानक न्यूरल नेटवर्क दृष्टिकोणों के समान या अक्सर उनसे भी तेज़ गति से सीखा। इसने लक्ष्यों तक पहुँचने और पुरस्कारों को अधिकतम करने में प्रतिस्पर्धी परिणाम प्राप्त किए, जिससे यह प्रदर्शित हुआ कि यह मजबूती के लिए प्रदर्शन का त्याग नहीं करता है। भूलभुलैया नेविगेशन कार्यों में, जहाँ एजेंट को दरवाजा खोलने से पहले चाबी उठाने के लिए याद रखना होता है, सिस्टम ने क्रियाओं के क्रम को सफलतापूर्वक सीखा। बिल्डिंग कंट्रोल सिमुलेशन में, जहाँ कई एजेंटों को तापमान और आर्द्रता प्रबंधित करने के लिए समन्वय करना होता है, विधि ने विभिन्न जलवायु स्थितियों में अच्छा प्रदर्शन किया।

शायद सबसे महत्वपूर्ण बात यह है कि अध्ययन ने दिखाया कि सिस्टम की सामान्यीकरण (generalize) करने की क्षमता—एक स्थिति में जो सीखा है उसे थोड़ी भिन्न स्थिति में लागू करने की क्षमता—सीधे तौर पर इस बात से जुड़ी थी कि प्रारंभिक पैटर्न कैसे बनाए गए थे। शोधकर्ताओं ने पाया कि कच्चे अवलोकनों को इन उच्च-आयामी पैटर्न में बदलने का तरीका बहुत मायने रखता है। रूपांतरण के कुछ तरीकों ने अन्य की तुलना में बेहतर सीखने और अधिक स्थिर मेमोरी की ओर ले जाने वाले परिणाम दिए, जो सुझाव देते हैं कि एजेंट किस "भाषा" में सोचता है, यह उसकी सफलता के लिए महत्वपूर्ण है। हालाँकि, एक बार सिस्टम प्रशिक्षित हो जाने के बाद, उसे अपने प्रशिक्षण सत्रों के कच्चे डेटा को रखने की आवश्यकता नहीं थी। वह इतिहास को हटा सकता था और केवल संकुचित, निश्चित-आकार की मेमोरी पर भरोसा कर सकता था, जिससे यह वास्तविक दुनिया के उपकरणों पर तैनाती के लिए अत्यधिक कुशल बन गया।

शोधकर्ताओं ने यह भी पता लगाया कि इन पैटर्न के आकार ने प्रदर्शन को कैसे प्रभावित किया। उन्होंने पाया कि आयामनता (dimensionality), या प्रत्येक पैटर्न में तत्वों की संख्या बढ़ाने से विभिन्न स्थितियों के बीच अंतर करने की सिस्टम की क्षमता में सुधार हुआ और स्मरियों के बीच हस्तक्षेप कम हुआ। हालाँकि, उन्होंने यह भी नोट किया कि यह सुधार अंततः एक पठार (plateau) पर पहुँच गया, जिसका अर्थ है कि एक ऐसा बिंदु है जहाँ पैटर्न को बड़ा बनाने से बहुत अधिक लाभ नहीं होता है। मेमोरी आकार और प्रदर्शन के बीच यह संतुलन उन इंजीनियरों के लिए एक व्यावहारिक विचार है जिन्हें इन सिस्टमों को छोटे चिप्स पर फिट करने की आवश्यकता होती है।

अंत में, यह कार्य सैद्धांतिक मजबूती और व्यावहारिक अनुप्रयोग के बीच के अंतर को पाटता है। यह प्रदर्शित करता है कि ऐसे सीखने वाले एजेंट बनाना संभव है जो न केवल कुशल और तेज़ हैं, बल्कि वास्तविक दुनिया की खामियों के प्रति लचीले भी हैं। निर्णयों को सटीक संख्याओं के बजाय वितरित पैटर्न के रूप में प्रस्तुत करके, सिस्टम उस नाजुकता से बचता है जो कई आधुनिक आर्टिफिशियल इंटेलिजेंस मॉडल को प्रभावित करती है। निष्कर्ष बताते हैं कि यह अनिश्चित मौसम में नेविगेट करने वाले स्वायत्त वाहनों से लेकर संसाधन-सीमित सेटिंग्स में काम करने वाले चिकित्सा उपकरणों तक, जहाँ विश्वसनीयता सर्वोपरि है, वहां तैनात करने के लिए एक भविष्य का मार्ग प्रशस्त करता है। इस पद्धति के लिए जटिल हार्डवेयर या विशाल डेटा केंद्रों की आवश्यकता नहीं है; यह एक सरल, सुरुचिपूर्ण गणितीय संरचना पर निर्भर करती है जो शोर वाली मेमोरी की संभावित कमजोरी को एक ताकत में बदल देती है। जैसा कि शोधकर्ता निष्कर्ष निकालते हैं, यह दृष्टिकोण अगली पीढ़ी के मजबूत, एज-आधारित आर्टिफिशियल इंटेलिजेंस के लिए एक आशाजनक आधार प्रदान करता है, जो यह सिद्ध करता है कि कभी-कभी, एक स्मार्ट मशीन बनाने का सबसे अच्छा तरीका इसे ऐसे पैटर्न में सोचने देना है जो टूटने के लिए बहुत बड़े हों।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →