Reinforcement Learning for Secrecy Optimization in Underwater Energy Harvesting Relay Network
यह शोध पत्र एक अंडरवॉटर हाइब्रिड ऑप्टिकल-अकौस्टिक एनर्जी हार्वेस्टिंग नेटवर्क में रिले पावर एलोकेशन को अनुकूलित करने के लिए एक मॉडल-आधारित सुदृढीकरण लर्निंग (रीइन्फोर्समेंट लर्निंग) रणनीति प्रस्तावित करता है, जो गतिशील चैनल स्थितियों और बैटरी बाधाओं के अनुकूल होते हुए, ध्वनिक जासूसी (अकौस्टिक ईव्सड्रॉपिंग) के विरुद्ध दीर्घकालिक गोपनीयता प्रदर्शन को प्रभावी ढंग से अधिकतम करता है।
मूल लेखक:Shalini Tripathi, Ankur Bansal, Chinmoy Kundu
मूल लेखक: Shalini Tripathi, Ankur Bansal, Chinmoy Kundu
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि पानी के नीचे अन्वेषकों (explorers) की एक टीम सतह पर मौजूद एक जहाज से गहराई में स्थित एक पनडुब्बी (submarine) को एक गुप्त संदेश भेजने की कोशिश कर रही है। उनके पास एक बिचौलिया है—एक रिले नोड (relay node)—जो संदेश को आगे बढ़ाने में मदद करता है। लेकिन एक पेंच है: समुद्र एक पेचीदा जगह है, और पास में ही एक चालाक जासूस (eavesdropper) छिपा बैठा है, जो संदेश चुराने की कोशिश कर रहा है।
यहाँ वह कहानी है कि कैसे शोधकर्ताओं ने इस पेपर में संदेश को गुप्त रखने और साथ ही यह सुनिश्चित करने की समस्या को हल किया कि बिचौलिया अपनी बैटरी खत्म न कर दे।
परिवेश: एक दो-चरणों वाली यात्रा
संदेश वितरण को एक रिले रेस की तरह समझें जिसके दो बहुत अलग चरण हैं:
पहला चरण (सतह से रिले तक): इसमें प्रकाश (जैसे कि एक हाई-स्पीड टॉर्चलाइट) का उपयोग किया जाता है। यह अविश्वसनीय रूप से तेज़ है और बहुत सारा डेटा ले जा सकता है, लेकिन यह नाजुक है। यदि कोई मछली बीम के सामने तैरती है या पानी धुंधला हो जाता है (विक्षोभ/turbulence), तो प्रकाश बाधित या बिखर जाता है। यह एक धुंधली खिड़की के माध्यम से लेजर पॉइंटर चमकाने की तरह है; कभी यह काम करता है, कभी नहीं।
दूसरा चरण (रिले से पनडुब्बी तक): इसमें ध्वनि (जैसे कि एक सोनार पिंग) का उपयोग किया जाता है। यह धीमा है और कम डेटा ले जाता है, लेकिन यह दूर तक जाता है और विश्वसनीय है। हालाँकि, ध्वनि तरंगें पानी के माध्यम से तालाब में उठने वाली लहरों की तरह यात्रा करती हैं—वे हर तरफ फैल जाती हैं। इसका मतलब है कि चालाक जासूस आसानी से संदेश सुन सकता है।
समस्या: "स्मार्ट" बिचौलिया
रिले नोड (बिचौलिया) विशेष है। इसके पास दीवार से जुड़ा हुआ कोई विशाल बैटरी पैक नहीं है। इसके बजाय, यह सौर ऊर्जा से चलने वाली घड़ी की तरह है जो समुद्र (शायद लहरों या धाराओं) से ऊर्जा प्राप्त करती है।
ऊर्जा का मुद्दा: कभी इसे ऊर्जा का एक बड़ा झटका मिलता है; कभी इसे कुछ नहीं मिलता। इसके पास एक छोटी बैटरी है जो केवल एक निश्चित मात्रा में ही ऊर्जा रख सकती है।
सुरक्षा का मुद्दा: यदि रिले बहुत ज़ोर से चिल्लाता है (बहुत अधिक शक्ति का उपयोग करता है), तो जासूस संदेश को स्पष्ट रूप से सुन लेता है। यदि यह बहुत धीरे फुसफुसाता है, तो शायद संदेश पनडुब्बी तक न पहुँचे, या जासूस इसे पनडुब्बी की तुलना में बेहतर सुन ले। ज goal (लक्ष्य)? जितने संभव हो सके उतने गुप्त बिट्स भेजें, इससे पहले कि नेटवर्क टूट जाए या समय समाप्त हो जाए।
समाधान: तीन अलग-अलग रणनीतियाँ
शोधकर्ताओं ने तीन अलग-अलग तरीकों का परीक्षण किया जिनसे रिले यह तय करता है कि उसे कितनी ज़ोर से चिल्लाना चाहिए (कितनी शक्ति का उपयोग करना चाहिए)।
उपमा: एक शतरंज के ग्रैंडमास्टर की कल्पना करें जो केवल अगली चाल को ही नहीं देखता, बल्कि पूरे खेल की गणना करता है। यह AI एजेंट एक सिमुलेशन में हज़ारों बार खेल खेलकर सीखता है। यह सीखता है कि "यदि मैं अभी थोड़ी शक्ति का उपयोग करता हूँ, तो मैं बाद में उस समय के लिए ऊर्जा बचा लेता हूँ जब पानी अधिक साफ होगा, और तब मैं एक बड़ा गुप्त संदेश भेज सकता हूँ।"
यह कैसे काम करता है: यह वर्तमान बैटरी स्तर, मौसम (विक्षोभ), और जासूस के स्थान को देखता है। यह ऐसा निर्णय लेता है जो अभी "बर्बादी" जैसा लग सकता है, लेकिन लंबे समय में सबसे अधिक गुप्त संदेश भेजने की गारंटी देता है।
परिणाम: यह विजेता रहा। इसने समुद्र की बदलती स्थितियों के साथ पूरी तरह से तालमेल बिठाया।
2. "लालची" (Greedy) रणनीति (GA)
उपमा: यह उस व्यक्ति की तरह है जिसे केवल अभी के बारे में परवाह है। "मुझे भूख लगी है, इसलिए मैं पूरा केक खा लूँगा!"
यह कैसे काम करता है: रिले वर्तमान क्षण को देखता है और पूछता है, "इस सेकंड में मुझे सबसे अधिक गुप्त डेटा क्या दे सकता है?" इसे इस बात की परवाह नहीं है कि अगले एक मिनट में इसकी ऊर्जा खत्म हो जाएगी।
परिणाम: इसने ठीक-ठाक प्रदर्शन किया, लेकिन अक्सर यह अपनी ऊर्जा बहुत तेज़ी से जला देता था, जिससे बाद में कठिन परिस्थितियों में भेजने के लिए इसके पास कुछ नहीं बचता था।
3. "नाइव" (Naive) रणनीति (NA)
उपमा: यह उस बच्चे की तरह है जो अपने पूरे पिग्गी बैंक को मेज पर उलट देता है और सब कुछ एक बार में खर्च कर देता है।
यह कैसे काम करता है: रिले अपनी बैटरी में मौजूद सब कुछ हर एक संदेश के लिए उपयोग करता है। कोई योजना नहीं, कोई बचत नहीं।
परिणाम: इसका प्रदर्शन सबसे खराब रहा। यह लगभग तुरंत ही अपनी ऊर्जा खत्म कर देता है और बहुत कम गुप्त संदेश भेज पाता है।
मुख्य निष्कर्ष
शोधकर्ताओं ने पाया कि:
आगे की सोचना फायदेमंद है: "क्रिस्टल बॉल" रणनीति (RL) सबसे अच्छी थी क्योंकि इसने अभी डेटा भेजने की आवश्यकता और बाद में जीवित रहने की आवश्यकता के बीच संतुलन बनाया।
बाधाएं मायने रखती हैं: यदि "धुंध" (बाधाएं) घनी होती है, तो लाइट लिंक अधिक बार विफल हो जाता है, और सभी कम संदेश भेजते हैं।
बैटरी का आकार मदद करता है: एक बड़ी बैटरी रिले को स्मार्ट विकल्प बनाने के लिए अधिक जगह देती है।
जासूस एक समस्या है: यदि जासूस रिले के करीब आता है, तो "गुप्त" हिस्सा छोटा हो जाता है, क्योंकि रिले को इतना धीरे फुसफुसाना पड़ता है कि पनडुब्बी शायद उसे सुन ही न पाए।
संक्षेप में
यह पेपर एक पानी के नीचे के रोबोट को एक स्मार्ट, दीर्घकालिक योजनाकार बनने के बारे में है। केवल वर्तमान क्षण पर प्रतिक्रिया देने (जैसे कि Greedy या Naive रोबोट) के बजाय, स्मार्ट रोबोट अपनी ऊर्जा बचाने और जासूस को मात देने और गुप्त संदेश को सुरक्षित रखने के लिए अपने प्रसारणों को सही समय पर करने के लिए सीखता है, भले ही समुद्र अराजक और अप्रत्याशित हो।
यहाँ शोध पत्र "Reinforcement Learning for Secrecy Optimization in Underwater Energy Harvesting Relay Network" का विस्तृत तकनीकी सारांश दिया गया है।
1. समस्या विवरण (Problem Statement)
यह शोध पत्र एक हाइब्रिड अंडरवॉटर वायरलेस कम्युनिकेशन (UWC) नेटवर्क में सुरक्षित संचार की चुनौती को संबोधित करता है। यह प्रणाली निम्नलिखित से बनी है:
स्रोत (Source - S): एक सतह वाहन (surface vehicle) जो अंडरवॉटर ऑप्टिकल (UWO) लिंक के माध्यम से डेटा प्रसारित करता है।
रिले (Relay - R): एक ऊर्जा संचयन (Energy Harvesting - EH) क्षमताओं से लैस एक अंतर्जलीय नोड, जो डेटा को ऑप्टिकल रूप से प्राप्त करता है और उसे अंडरवॉटर एकॉस्टिक (UWA) लिंक के माध्यम से आगे भेजता है।
गंतव्य (Destination - D): इच्छित रिसीवर।
ईव्सड्रॉपर (Eavesdropper - E): एक निष्क्रिय नोड जो एककोस्टिक लिंक की निगरानी करता है।
मुख्य चुनौतियाँ:
हाइब्रिड चैनल डायनेमिक्स: UWO लिंक (S-से-R) उच्च गति वाला है लेकिन टर्बुलेंस (turbulence), पॉइंटिंग एरर और बाधाओं द्वारा भौतिक अवरोध के प्रति संवेदनशील है। UWA लिंक (R-से-D) लंबी दूरी के लिए विश्वसनीय है लेकिन इसमें बैंडविड्थ कम होती है और यह इंटरसेप्शन (interception) के प्रति असुरक्षित है।
ऊर्जा संबंधी बाधाएँ: रिले सीमित बैटरी क्षमता पर कार्य करता है और स्टोकेस्टिक (stochastic) ऊर्जा संचयन पर निर्भर करता है (जिसे बर्नौली प्रक्रिया के रूप में मॉडल किया गया है)।
नेटवर्क का जीवनकाल: हार्डवेयर विफलता या भौतिक क्षति के कारण नेटवर्क का जीवनकाल अनिश्चित होता है, जिसे ज्यामितीय यादृच्छिक चर (geometric random variable) के रूप में मॉडल किया गया है।
उद्देश्य: रिले की ट्रांसमिट पावर को इष्टतम रूप से आवंटित करके, सुरक्षा बाधाओं (Secrecy Rate ≥ Threshold) को पूरा करते हुए, दीर्घकालिक अपेक्षित सुरक्षित बिट्स की संख्या को अधिकतम करना है, इससे पहले कि नेटवर्क विफल हो जाए।
2. कार्यप्रणाली (Methodology)
लेखक पावर एलोकेशन समस्या को एक इनफिनिट-होराइजन मार्कोव डिसीजन प्रोसेस (MDP) के रूप में तैयार करते हैं और इसे हल करने के लिए तीन अलग-अलग रणनीतियाँ प्रस्तावित करते हैं।
A. सिस्टम मॉडलिंग (System Modeling)
स्टेट स्पेस (State Space - S): रिले-गंतव्य (GRD) और रिले-ईव्सड्रॉपर (GRE) लिंक के चैनल गेन और वर्तमान बैटरी स्तर (BR) द्वारा परिभाषित है।
एक्शन स्पेस (Action Space - A): रिले द्वारा उपलब्ध ट्रांसमिट पावर स्तरों का सेट।
रिवॉर्ड (Reward): एककोस्टिक लिंक की तात्कालिक गोपनीयता क्षमता (CS), बशर्ते कि यह QoS थ्रेशोल्ड (Rth) को पूरा करती हो। यदि थ्रेशोल्ड पूरा नहीं होता है, तो रिवॉर्ड शून्य होता है।
चैनल मॉडल:
UWO: इसे पॉइंटिंग एरर और बाइनरी ऑब्स्ट्रक्शन कोएफिशिएंट के साथ एक कंपोजिट गामा-गामा टर्बुलेंस चैनल के रूप में मॉडल किया गया है।
UWA: इसे फ्रीक्वेंसी-डिपेंडेंट एटेन्यूएशन और एम्बिएंट नॉइज़ के साथ मॉडल किया गया है।
B. प्रस्तावित समाधान (Proposed Solutions)
ऑप्टिमल पावर एलोकेशन (OPA) - मॉडल-आधारित RL:
यह MDP को हल करने के लिए पॉलिसी इटरेशन (PI) का उपयोग करता है।
प्लानिंग फेज: 'पॉलिसी इवैल्यूएशन' (बेलमैन समीकरणों के माध्यम से वैल्यू फंक्शन को अपडेट करना) और 'पॉलिसी इम्प्रूवमेंट' (वैल्यू फंक्शन को अधिकतम करने वाले एक्शन चुनना) को पुनरावृत्त रूप से करके एक इष्टतम स्थिर नियतात्मक नीति (लुकअप टेबल) की गणना करता है।
ट्रांसमिशन फेज: रिले भविष्य के ज्ञान की आवश्यकता के बिना, वर्तमान स्थिति (बैटरी और चैनल स्थितियों) के आधार पर इष्टतम पावर स्तर चुनने के लिए पूर्व-गणना की गई लुकअप टेबल का उपयोग करता है।
लक्ष्य: इनफिनिट होराइजन पर संचयी डिस्काउंटेड रिवॉर्ड को अधिकतम करना।
ग्रीडी एल्गोरिदम (Greedy Algorithm - GA):
एक उप-इष्टतम (sub-optimal), कम जटिलता वाला दृष्टिकोण।
यह केवल वर्तमान टाइम स्लॉट में तात्कालिक रिवॉर्ड को अधिकतम करने वाले पावर लेवल का चयन करता है (भविष्य के परिणामों की अनदेखी करता है)।
नाइव एल्गोरिदम (Naive Algorithm - NA):
यह सबसे सरल दृष्टिकोण है।
रिले प्रत्येक टाइम स्लॉट में पूरी उपलब्ध बैटरी ऊर्जा का उपयोग करता है (PR=BR/Ts), चाहे चैनल की स्थिति या भविष्य की ऊर्जा आवश्यकताएं कुछ भी हों।
3. मुख्य योगदान (Key Contributions)
हाइब्रिड सीक्रेसी फ्रेमवर्क: यह शोध पत्र पहला है जो ऊर्जा संचयन और सुरक्षा बाधाओं के साथ एक हाइब्रिड ऑप्टिकल-एकॉस्टिक अंडरवॉटर रिले सिस्टम को मॉडल करता है, जो ऑप्टिकल ब्लॉकेज और एकॉस्टिक ईव्सड्रॉपिंग के बीच के ट्रेड-ऑफ को संबोधित करता है।
MDP फॉर्मूलेशन: ऊर्जा संचयन, चैनल फेडिंग और रैंडम नेटवर्क समाप्ति की स्टोकेस्टिक प्रकृति को संभालने के लिए इस समस्या को कठोरता से एक इनफिनिट-होरिजन MDP के रूप में तैयार किया गया है।
एल्गोरिदम विकास:
बैटरी डायनेमिक्स और चैनल अनिश्चितता के अनुकूल होने के लिए एक मॉडल-आधारित RL (पॉलिसी इटरेशन) समाधान (OPA) प्रस्तावित करता है।
प्रदर्शन के लिए बेंचमार्क के रूप में दो बेसलाइन एल्गोरिदम (GA और NA) पेश करता है।
जटिलता विश्लेषण: यह एक सैद्धांतिक विश्लेषण प्रदान करता है जो दिखाता है कि जबकि OPA की प्लानिंग फेज में उच्च कम्प्यूटेशनल लागत (O(NS2NA)) होती है, इसका ट्रांसमिशन फेज कुशल (O(K)) होता है। GA और NA की प्लानिंग लागत कम होती है लेकिन प्रदर्शन उप-इष्टतम होता है।
4. सिमुलेशन परिणाम (Simulation Results)
लेखकों ने गामा-गामा टर्बुलेंस, बर्नौली एनर्जी हार्वेस्टिंग और बदलते बाधा घनत्व जैसे मापदंडों का उपयोग करके योजनाओं का मूल्यांकन किया।
प्रदर्शन तुलना:
OPA लगातार उच्चतम सुरक्षित थ्रूपुट प्राप्त करता है। यह तत्काल ट्रांसमिशन आवश्यकताओं और भविष्य की ऊर्जा उपलब्धता एवं चैनल स्थितियों के बीच प्रभावी ढंग से संतुलन बनाता है।
GA मध्यम रूप से अच्छा प्रदर्शन करता है लेकिन दीर्घकालिक दूरदर्शिता की कमी के कारण OPA से पीछे रह जाता है।
NA का प्रदर्शन सबसे खराब होता है क्योंकि इसकी रणनीति "शॉर्ट-साइटेड" (अल्पदर्शी) है, जो बैटरी को तुरंत खत्म कर देती है, जिससे समय से पहले नेटवर्क विफल हो जाता है।
डिस्काउंट फैक्टर (Γ) का प्रभाव:Γ (भविष्य के रिवॉर्ड पर जोर देना) को बढ़ाने से OPA का प्रदर्शन काफी बेहतर होता है, जो दीर्घकालिक योजना के लाभ की पुष्टि करता है।
बाधा घनत्व (Obstacle Density): ऑप्टिकल लिंक में उच्च बाधा घनत्व सभी योजनाओं के लिए समग्र रिवॉर्ड को कम करता है, क्योंकि रिले तक पहुँचने वाले डेटा पैकेट कम हो जाते हैं।
एनर्जी हार्वेस्टिंग (EH) प्रोबेबिलिटी (p):
जैसे-जैसे p बढ़ता है, OPA, GA और NA के बीच का प्रदर्शन अंतर कम होता जाता है। जब ऊर्जा प्रचुर मात्रा में होती है, तो जटिल दीर्घकालिक योजना का लाभ कम हो जाता है।
अधिक संचित ऊर्जा (ER) सीधे सुरक्षा प्रदर्शन में सुधार करती है।
बैटरी क्षमता: बड़ी बैटरी क्षमता बेहतर ऊर्जा भंडारण की अनुमति देती है, जिससे नेटवर्क का जीवनकाल बढ़ता है और कुल सुरक्षित बिट्स में वृद्धि होती है।
ईव्सड्रॉपर की दूरी: रिले और ईव्सड्रॉपर के बीच की दूरी (lRE) कम होने से सीक्रेसी क्षमता काफी कम हो जाती है, जो एककोस्टिक सुरक्षा के लिए भौतिक दूरी की महत्वपूर्ण भूमिका को रेखांकित करती है।
5. महत्व और निष्कर्ष (Significance and Conclusion)
यह शोध पत्र प्रदर्शित करता है कि Reinforcement Learning गतिशील, ऊर्जा-सीमित वातावरण में सुरक्षित अंडरवॉटर संचार को अनुकूलित करने के लिए एक महत्वपूर्ण उपकरण है।
व्यावहारिक निहितार्थ: प्रस्तावित OPA रणनीति अंडरवॉटर नेटवर्क को अधिक बुद्धिमानी से संचालित करने में सक्षम बनाती है, जिससे वे सुरक्षा को अधिकतम करने के लिए अप्रत्याशित ऊर्जा स्रोतों और चैनल ब्लॉकेज के अनुकूल हो सकते हैं।
ट्रेड-ऑफ प्रबंधन: यह अध्ययन स्पष्ट करता है कि हालांकि सरल ग्रीडी या नाइव दृष्टिकोण कम्प्यूटेशनल रूप से सस्ते हैं, वे वास्तविक स्टोकेस्टिक अंडरवॉटर वातावरण में नेटवर्क के जीवनकाल और सुरक्षा को अधिकतम करने में विफल रहते हैं।
भविष्य का दृष्टिकोण: यह कार्य एक बुद्धिमान, अनुकूलन योग्य अंडरवॉटर नेटवर्क की नींव रखता है जो संसाधनों का प्रबंधन करने और ईव्सड्रॉपिंग खतरों का मुकाबला करने के लिए स्वायत्त रूप से कार्य कर सकता है, जो पर्यावरणीय निगरानी और समुद्री निगरानी जैसे अनुप्रयोगों के लिए अत्यंत महत्वपूर्ण है।