← नवीनतम पेपर
🤖 AI

Decision Transformer for UAV-Mounted RIS-Assisted Dynamic D2D Communications

यह शोध पत्र गतिशील D2D संचार के लिए UAV प्रक्षेपवक्र (trajectory), अभिवृत्ति (attitude) और RIS चरणों को अनुकूलित करने हेतु एक डिसीजन ट्रांसफॉर्मर-आधारित ढांचे का प्रस्ताव करता है, जो पारंपरिक डीप रिइन्फोर्समेंट लर्निंग दृष्टिकोणों की तुलना में उत्कृष्ट क्रॉस-परिदृश्य सामान्यीकरण और ज़ीरो-शॉट ट्रांसफर क्षमताओं का प्रदर्शन करता है।

मूल लेखक: Yaxuan Liu

प्रकाशित 2026-09-10
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yaxuan Liu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

आधुनिक कारखानों और गोदामों के भीड़भाड़ वाले, अव्यवस्थित स्थानों में, वायरलेस सिग्नल अक्सर एक स्पष्ट रास्ता खोजने के लिए संघर्ष करते हैं। एक-दूसरे से बात करने की कोशिश कर रहे उपकरणों को अक्सर भारी मशीनरी, भंडारण रैक, या वातावरण के घनत्व द्वारा बाधित किया जाता है। इसे हल करने के लिए, इंजीनियरों ने 'रीकॉन्फ़िगर करने योग्य इंटेलिजेंट सरफेस' (reconfigurable intelligent surface) नामक तकनीक की ओर रुख किया है। इसे एक स्मार्ट दीवार या पैनल के रूप में सोचें जो हजारों छोटे, ट्यून करने योग्य तत्वों से ढका होता है जो एक रेडियो तरंग को पकड़ सकते हैं और उसे ठीक उसी दिशा में उछाल सकते हैं जहाँ उसकी आवश्यकता होती है, जिससे प्रभावी रूप से डेटा यात्रा करने के लिए एक नया, स्पष्ट पथ बन जाता है। हालाँकि ये सतहें आमतौर पर एक ही स्थान पर स्थिर रहती हैं, शोधकर्ता अब इन्हें ड्रोन पर माउंट करने के तरीके तलाश रहे हैं। एक ड्रोन आदर्श स्थान पर उड़ सकता है और अपनी सतह को किसी भी कोण से सिग्नल पकड़ने के लिए झुका सकता है, जो एक ऐसा लचीलापन प्रदान करता है जो स्थिर दीवारों के लिए संभव नहीं है। हालाँकि, एक ऐसे ड्रोन को नियंत्रित करना जो एक जटिल, कोण-संवेदनशील दर्पण भी ले जा रहा है, एक कठिन संतुलन कार्य है, जिसके लिए यह गणना करने की आवश्यकता होती है कि कहाँ उड़ना है, कैसे झुकना है, और वास्तविक समय में दर्पण की सतह को कैसे समायोजित करना है।

एक शोधकर्ता ने इस चुनौती से निपटने के लिए इन ड्रोन-माउंटेड सिस्टम को निर्णय लेना सिखाने का एक नया तरीका विकसित किया है। इन उपकरणों को कठोर नियमों के साथ प्रोग्राम करने या हर बार एक नए कमरे में प्रवेश करने पर सब कुछ शून्य से सीखने के लिए मजबूर करने के बजाय, उन्होंने एक ऐसी विधि का उपयोग किया जो विशेषज्ञों को देखकर सीखने के मानवीय तरीके की नकल करती है। उन्होंने पहले कंप्यूटर सिमुलेशन में विभिन्न प्रकार के कारखाने के लेआउट में उड़ने और दर्पण को समायोजित करने के सर्वोत्तम तरीकों को खोजने के लिए कई मानक लर्निंग एल्गोरिदम को प्रशिक्षित किया। इन सिमुलेशनों से, उन्होंने सबसे सफल "विशेषज्ञ" रणनीतियों को चुना और उन सटीक रास्तों और गतिविधियों को रिकॉर्ड किया जो ड्रोन ने उच्च प्रदर्शन प्राप्त करने के लिए अपनाए थे। इसके बाद, उन्होंने इस विशेषज्ञ अनुभवों के संग्रह को 'डिसीजन ट्रांसफॉर्मर' (Decision Transformer) नामक एक विशेष लर्निंग मॉडल में फीड किया। यह मॉडल केवल डेटा को याद नहीं करता है; यह उस अंतर्निya पैटर्न को सीखता है कि कैसे एक विशिष्ट स्थिति एक विशिष्ट क्रिया की ओर ले जाती है, जिससे यह उस कमरे में भी सबसे अच्छा कदम अनुमानित कर पाता है जिसे इसने पहले कभी नहीं देखा है।

शोधकर्ता ने एक सघन औद्योगिक स्थान का प्रतिनिधित्व करने वाले सिम्युलेटेड वातावरण में इस दृष्टिकोण का परीक्षण किया, जिसमें क्षेत्र को 40 गुणा 40 मीटर और ऊंचाई को 8 मीटर के रूप में मापा गया था। इस स्थान के भीतर, चार सिंगल-एंटीना वाले उपकरणों ने डेटा का आदान-प्रदान करने के लिए जोड़े बनाने का प्रयास किया, जबकि ड्रोन 4.5 मीटर की ऊंचाई पर मंडरा रहा था। सिस्टम को इस तथ्य को ध्यान में रखना था कि सिग्नल की ताकत इस बात पर निर्भर करती है कि लहर किस कोण से दर्पण से टकराती है, जो एक ऐसा विवरण है जिसे सरल मॉडलों में अक्सर अनदेखा कर दिया जाता है। ड्रोन का कार्य अपने उड़ान पथ, अपने त्रि-आयामी झुकाव और दर्पण के 16 परावर्तक तत्वों की सेटिंग्स को समायोजित करना था ताकि उपकरणों के बीच बहने वाले कुल डेटा की मात्रा को अधिकतम किया जा सके। शोधकर्ता ने अपने नए तरीके की तुलना कई अन्य लर्निंग तकनीकों से की, जिसमें एक ऐसी तकनीक भी शामिल थी जो केवल पास के परिदृश्य से एक विशेषज्ञ के व्यवहार की नकल करने का प्रयास करती है। परिणामों ने दिखाया कि नया तरीका, जब ड्रोन को एक पूरी तरह से नई शुरुआती स्थिति दी गई, तो वह बिना किसी अतिरिक्त प्रशिक्षण के तुरंत उच्च स्तर पर प्रदर्शन कर सका। यह "जीरो-शॉट" क्षमता, एक समान लेकिन अलग परिदृश्य से रणनीति स्थानांतरित करने की तुलना में काफी बेहतर थी।

जब शोधकर्ता ने सिस्टम को नए वातावरण के साथ थोड़े समय के लिए बातचीत करने की अनुमति दी और फिर देखे गए सर्वोत्तम परिणामों के आधार पर अपने ज्ञान को और बेहतर बनाया, तो प्रदर्शन और भी सुधर गया। इन परीक्षणों में, फाइन-ट्यून्ड सिस्टम ने उसी उच्च स्तर का प्रदर्शन प्राप्त किया जैसा कि एक ऐसा सिस्टम करता है जिसे ठीक उसी कमरे के लिए शून्य से प्रशिक्षित किया गया हो। अध्ययन में पाया गया कि DDPG विशेषज्ञ एल्गोरिदम, जो सिस्टम की क्षमता के लिए बेंचमार्क के रूप में कार्य करता था, ने लगभग 29.5 बिट्स प्रति सेकंड प्रति हर्ट्ज़ की औसत डेटा दर प्राप्त की, जो कि अन्य परीक्षण किए गए लर्निंग तरीकों की तुलना में काफी अधिक थी, जो क्रमशः 25, 20.5 और 17 पर टिक गए थे। मुख्य निष्कर्ष यह है कि पहले से ही विशेषज्ञों के विविध उदाहरणों से सीखकर, सिस्टम अपने ज्ञान को अनदेखी स्थितियों में सामान्यीकृत कर सकता है, जिससे वास्तविक दुनिया में महंगी और समय लेने वाली 'ट्रायल-एंड-एरर' (प्रयास और त्रुटि) सीखने की आवश्यकता से बचा जा जा सकता है। यह सुझाव देता है कि भविष्य के वायरलेस नेटवर्क जटिल वातावरण में सिग्नल अवरोधों को गतिशील रूप से ठीक करने के लिए ड्रोन का उपयोग कर सकते हैं, जो न्यूनतम मानवीय हस्तक्षेप के साथ नए लेआउट के अनुकूल हो सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →