Structural Plasticity as Active Inference: A Biologically-Inspired Architecture for Homeostatic Control
यह शोध पत्र SAPIN को प्रस्तुत करता है, जो एक जैविक रूप से प्रेरित कम्प्यूटेशनल मॉडल है जो स्थानीय भविष्यवाणी त्रुटियों (local prediction errors) को कम करने के लिए सिनैप्टिक और संरचनात्मक प्लास्टिसिटी दोनों का उपयोग करता है, और होमियोस्टैटिक नियंत्रण के माध्यम से कार्टपोल (CartPole) कार्य को हल करने की अपनी क्षमता प्रदर्शित करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। यह एक ऐसे प्रीप्रिंट की AI से तैयार की गई व्याख्या है जिसकी अभी सहकर्मी समीक्षा नहीं हुई है। यह चिकित्सकीय सलाह नहीं है। इस सामग्री के आधार पर स्वास्थ्य संबंधी फैसले न लें। पूरा डिस्क्लेमर पढ़ें
"स्मार्ट मूविंग लेगो" ब्रेन: SAPIN के लिए एक सरल गाइड
कल्पना कीजिए कि आप एक रोबोट बना रहे हैं, लेकिन धातु के कठोर हिस्सों और पहले से निर्धारित निर्देशों के बजाय, आप इसे जादुई, जीवित लेगो ब्रिक्स (Lego bricks) से बना रहे हैं।
ये ब्रिक्स केवल वहीं पड़े नहीं रहते; वे अपनी "शक्ति" (वे एक-दूसरे से कैसे बात करते हैं) को बदल सकते हैं और सबसे महत्वपूर्ण बात यह है कि वे बेहतर स्थिति खोजने के लिए वास्तव में फर्श पर रेंगकर इधर-उधर जा सकते हैं। यह SAPIN नामक एक नए शोध पत्र के पीछे का मूल विचार है।
इस "जीवित" कंप्यूटर के काम करने का विवरण यहाँ दिया गया है:
1. ब्रिक्स के सीखने के दो तरीके
एक सामान्य कंप्यूटर या AI (जैसे ChatGPT) में, "दिमाग" एक फिक्स्ड सर्किट बोर्ड की तरह होता है। तार अपनी जगह पर सोल्डर किए हुए होते हैं। सीखने के लिए, कंप्यूटर बस उन फिक्स्ड तारों के माध्यम से बिजली के प्रवाह को बदल देता है।
SAPIN मॉडल एक साथ दो चीजें करता है:
- "वॉल्यूम नॉब" (सिनैप्टिक प्लास्टिसिटी - Synaptic Plasticity): कल्पना कीजिए कि दो लेगो ब्रिक्स एक-दूसरे से बात कर रहे हैं। यदि एक ब्रिक कुछ ऐसा कहता है जो दूसरे को चौंका देता है, तो वे अपने "वॉल्यूम" को एडजस्ट करते हैं। वे यह अनुमान लगाने के लिए सीखते हैं कि पड़ोसी क्या कहने वाला है ताकि वे लगातार चौंके नहीं। यह अपने दोस्त के चुटकुलों का अनुमान लगाना सीखने जैसा है ताकि आप हमेशा अचानक हैरान न हों।
- "म्यूजिकल चेयर्स" (स्ट्रक्चरल प्लास्टिसिटी - Structural Plasticity): यही वह खास चीज़ है। यदि कोई ब्रिक एक "बुरे इलाके" में है—जिसका अर्थ है कि वह लगातार शोर से अभिभूत हो रहा है या पूरी तरह से बोर होकर अनदेखा किया जा रहा है—तो वह केवल वहीं बैठा नहीं रहता। वह जानकारी का बेहतर "नज़रिया" पाने के लिए ग्रिड पर एक नई जगह पर भौतिक रूप से (physically) मूव करता है। यह एक भीड़ भरे कैफे में एक व्यक्ति के समान है जो एक ऐसी जगह बैठने के लिए अपनी सीट बदल लेता है जहाँ वह वास्तव में बातचीत को सुन सके।
2. लक्ष्य: "शांत क्षेत्र" खोजना (होमियोस्टैसिस - Homeostasis)
अधिकांश AI को "गाजर और छड़ी" (इनाम और सजा) के साथ प्रशिक्षित किया जाता है—उन्हें कुछ सही करने के लिए एक "पॉइंट" मिलता है (गाजर) और कुछ गलत करने के लिए "पेनल्टी" मिलती है (छड़ी)।
SAPIN मॉडल अलग है। इसे पॉइंट्स या सजाओं की परवाह नहीं है। इसे केवल अनुमान लगाने की क्षमता (predictability) की परवाह है।
इसे सोने की कोशिश करने वाले व्यक्ति के रूप में सोचें। आपको एक शांत कमरे को खोजने के लिए किसी इनाम की आवश्यकता नहीं है; आप स्वाभाविक रूप से शोर वाले निर्माण स्थल से दूर और शांत बेडरूम की ओर बढ़ जाते हैं क्योंकि आपका शरीर "आश्चर्य" (शोर) को कम करना चाहता है।
प्रयोग में, शोधकर्ताओं ने SAPIN मॉडल को एक "कार्ट पोल" (Cart Pole) कार्य दिया (एक चलती हुई गाड़ी पर डंडे को संतुलित करना)। मॉडल ने डंडे को संतुलित करना इसलिए सीखा क्योंकि वह पॉइंट्स के लिए नहीं चाहता था, बल्कि एक संतुलित डंडा अनुमान लगाने योग्य (predictable) है। गिरता हुआ डंडा अराजक और "शोर भरा" होता है जो मस्तिष्क के लिए कठिन होता है। मॉडल ने अपने "ब्रिक्स" को हिलाया और अपने "वॉल्यूम नॉब्स" को तब तक एडजस्ट किया जब तक कि उसे एक पूरी तरह से संतुलित पोल की शांत, अनुमान लगाने योग्य लय नहीं मिल गई।
3. "लॉकिंग" (Locking) का तरीका
शोधकर्ताओं ने एक मजेदार समस्या पाई: क्योंकि ब्रिक्स हमेशा हिलते और बदलते रहते हैं, रोबोट कभी-कभी "अच्छा होना" भूल जाता है। यह उस छात्र की तरह है जो गणित में परफेक्ट सीखता है, लेकिन फिर अपनी पढ़ाई की आदतें इतनी बार बदलता है कि अंततः वह जोड़ना भी भूल जाता है।
इसे ठीक करने के लिए, उन्होंने पाया कि एक बार जब रोबोट विशेषज्ञ बन जाता है, तो आप ब्रिक्स को अपनी जगह पर "लॉक" कर सकते हैं। यह एक आदर्श फॉर्मेशन की फोटो लेने और उसे फ्रीज करने जैसा है। लॉक होने के बाद, रोबोट अविश्वसनीय रूप से स्थिर हो गया और लगभग हर बार पोल को संतुलित करने में सक्षम रहा।
सारांश: यह क्यों मायने रखता है?
वर्तमान AI बहुत शक्तिशाली है, लेकिन यह "कठोर" (stiff) है। यह एक डिजिटल दुनिया में रहता है जहाँ कुछ भी हिलता नहीं है।
SAPIN "एम्बॉडीड इंटेलिजेंस" (Embodied Intelligence) की ओर एक कदम है। यह सुझाव देता है कि वास्तविक बुद्धिमत्ता केवल स्मार्ट होने से नहीं आती, बल्कि एक ऐसे शरीर (या संरचना) से आती है जो दुनिया को बेहतर ढंग से समझने के लिए खुद को भौतिक रूप से नया आकार दे सके। यह उत्तरों की "गणना" करने से हटकर समाधानों को "विकसित" करने की ओर एक बदलाव है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।