← नवीनतम पेपर
💻 computer science

ER-Curriculum-DDQN for Critical Task Offloading in UAV-MEC via Transparent LEO Relays

यह शोध पत्र ER-Curriculum-DDQN का प्रस्ताव करता है, जो एक डीप रिइन्फोर्समेंट लर्निंग फ्रेमवर्क है जो पारदर्शी LEO रिले के माध्यम से UAV-MEC सिस्टम में ऑनलाइन टास्क ऑफलोडिंग को अनुकूलित करने के लिए फिजिबिलिटी मास्किंग, क्रिटिकल टास्क प्रेशर फीचर्स और रिजर्वेशन-गाइडेड करिकुलम लर्निंग को एकीकृत करता है, जिससे सख्त सर्विस विंडो बाधाओं के तहत क्रिटिकल टास्क के समय पर पूरा होने के अनुपात को अधिकतम किया जा सके।

मूल लेखक: Ziang Zhang, Zhenjiang Zhang, Jiaxing Du, Zhaoyuan Liu, Yujie Wang

प्रकाशित 2026-09-23
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ziang Zhang, Zhenjiang Zhang, Jiaxing Du, Zhaoyuan Liu, Yujie Wang

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

आकाश के विशाल, शांत विस्तार में जहाँ ज़मीन का बुनियादी ढांचा धुंधला पड़ जाता है, एक नए प्रकार का नेटवर्क आकार ले रहा है। कल्पना कीजिए कि आपदा क्षेत्र या किसी दूरस्थ पहाड़ी श्रृंखला के ऊपर ड्रोनों, या मानव रहित हवाई वाहनों (UAVs) का एक बेड़ा मंडरा रहा है, जो सेंसर और कैमरों से प्राप्त महत्वपूर्ण डेटा का भार ढो रहा है। ये ड्रोन उड़ते हुए कंप्यूटरों की तरह कार्य करते हैं, लेकिन उनकी सीमाएँ हैं। जटिल समस्याओं को हल करने के लिए, उन्हें अपना भारी डेटा ज़मीन पर या क्लाउड में स्थित शक्तिशाली सर्वरों तक भेजना पड़ता है। जब ज़मीन बहुत दूर हो या सड़कें अवरुद्ध हों, तो ये ड्रोन मदद के लिए सितारों की ओर देखते हैं। वे लो-ऑर्बिट उपग्रहों से जुड़ते हैं जो पारदर्शी दर्पणों की तरह कार्य करते हैं, जो सूचना को स्वयं प्रोसेस किए बिना, केवल ड्रोन और एक दूर स्थित गेटवे के बीच संकेतों को उछालने (बाउंस करने) का काम करते हैं। यह एक क्षणिक सेतु बनाता है, समय की एक संकीर्ण खिड़की जहाँ ड्रोन, उपग्रह और ग्राउंड स्टेशन सभी एक सीध में होते हैं। चुनौती यह है कि यह खिड़की छोटी और कठोर होती है। यदि कोई ड्रोन इस सेतु के माध्यम से एक विशाल, गैर-जरूरी फ़ाइल भेजने की कोशिश करता है, तो वह पूरे लेनदेन की अवधि के लिए पूरे कनेक्शन को लॉक कर सकता है। यदि उस दौरान कोई महत्वपूर्ण आपातकालीन संदेश आता है, तो उसे पहले कार्य के पूरा होने तक नहीं भेजा जा सकता, जिससे जीवन बचाने वाली समय-सीमा छूट सकती है। वैज्ञानिकों के लिए मुख्य प्रश्न यह है कि इस दुर्लभ, समय-सीमित कनेक्शन का प्रबंधन कैसे किया जाए ताकि सबसे महत्वपूर्ण कार्य हमेशा पूरे हो सकें, भले ही सिस्टम भीड़भाड़ वाला क्यों न हो।

बीजिंग जियाओतोंग विश्वविद्यालय और पीएलए के आर्मी आर्म्स यूनिवर्सिटी के शोधकर्ताओं ने इन उड़ते हुए नेटवर्कों के लिए एक स्मार्ट निर्णय लेने वाली प्रणाली को डिजाइन करके इस समस्या का समाधान निकाला है। उन्होंने एक ऐसे परिदृश्य पर ध्यान केंद्रित किया जहाँ बीस ड्रोन मिलकर काम कर रहे हैं, दो ज़मीनी कंप्यूटिंग केंद्रों और दो उपग्रह पथों को साझा कर रहे हैं। सिस्टम को यह निर्णय लेना होता है कि जैसे ही एक नया कार्य आता है, उसे स्थानीय रूप에는 ड्रोन पर प्रोसेस किया जाए, पास के ग्राउंड सर्वर पर भेजा जाए, या उपग्रह के माध्यम से आगे बढ़ाया जाए। पेच यह है कि उपग्रह पथ एक सख्त "पहले आओ, पहले पाओ" के नियम पर काम करता है जिसे शुरू होने के बाद बाधित नहीं किया जा सकता। यदि एक सामान्य कार्य को उपग्रह पथ के लिए स्वीकार कर लिया जाता है, तो वह अपनी यात्रा के लिए पूरे कनेक्शन को आरक्षित कर लेता है, जिससे कोई भी अन्य कार्य, चाहे वह कितना भी महत्वपूर्ण क्यों न हो, राउंड ट्रिप पूरा होने तक रुक जाता है। शोधकर्ताओं को यह अनुमान लगाने का एक तरीका चाहिए था कि भविष्य के आपातकाल के लिए उपग्रह पथ को बचाने हेतु एक सामान्य कार्य को कब "ना" कहना है, और वह भी यह जाने बिना कि आगे कौन से कार्य आने वाले हैं।

इसे हल करने के लिए, टीम ने ER-Curriculum-DDQN नामक एक नई विधि विकसित की। यह एक प्रकार का आर्टिफिशियल इंटेलिजेंस है जो परीक्षण और त्रुटि (ट्रायल एंड एरर) के माध्यम से सीखता है, लेकिन वास्तविकता से जुड़े रहने के लिए इसके पास विशिष्ट नियमों का एक सेट है। यह सिस्टम एक "फिजिबिलिटी मास्क" (व्यवहार्यता मास्क) का उपयोग करता है, जो एक फिल्टर की तरह कार्य करता है जो तुरंत किसी भी असंभव विकल्प को हटा देता है। उदाहरण के लिए, यदि उपग्रह विंडो बंद है या ड्रोन की स्थानीय मेमोरी भर गई है, तो सिस्टम उन विकल्पों पर विचार ही नहीं कर सकता। यह एआई को उन कार्यों पर समय बर्बाद करने से रोकता है जो भौतिक बाधाओं के कारण विफल हो जाएंगे। केवल यह जानने के अलावा कि क्या संभव है, सिस्टम एक "प्रेशर" (दबाव) फीचर को ट्रैक करता है। यह हाल के समय में महत्वपूर्ण कार्यों द्वारा उपग्रह पथ की मांग के स्तर का एक माप है। यदि सिस्टम महसूस करता है कि महत्वपूर्ण कार्य बार-बार आ रहे हैं, तो वह सामान्य कार्यों को उपग्रह का उपयोग करने देने के प्रति अधिक सतर्क हो जाता है, प्रभावी रूप से उस पुल को उन आपात स्थितियों के लिए बचा लेता है जो अगली आ सकती हैं।

सीखने की प्रक्रिया स्वयं एक "करिकुलम" (पाठ्यचर्या) द्वारा निर्देशित थी, जो एक ऐसी शिक्षण रणनीति है जो सरल से शुरू होकर कठिन होती जाती है। प्रशिक्षण के शुरुआती चरणों में, एआई को स्पष्ट रूप से दंडित किया गया था जब उसने एक सामान्य कार्य को उपग्रह का उपयोग करने दिया जिससे सिस्टम पर दबाव बढ़ गया। इसने एआई को संसाधनों को रोक कर रखने के मूल्य को सिखाया। जैसे-जैसे प्रशिक्षण आगे बढ़ा, यह स्पष्ट दंड धीरे-धीरे कम कर दिया गया, जिससे एआई को केवल एक सरल नियम का पालन करने के बजाय, सीखे गए पैटर्न के आधार पर सही निर्णय लेने के लिए मजबूर किया गया। लक्ष्य केवल कार्यों को पूरा करना नहीं था, बल्कि यह सुनिश्चित करना था कि सबसे महत्वपूर्ण कार्य समय पर पूरे हों।

शोधकर्ताओं ने अपने सिस्टम का परीक्षण व्यापक कंप्यूटर सिमुलेशन के माध्यम से किया, जिसमें उन्होंने इसे अन्य ज्ञात विधियों और सरल नियम-आधारित दृष्टिकोणों के विरुद्ध परखा। उन्होंने स्थितियों को बदला, जैसे कि प्रति सेकंड कितने कार्य आ रहे हैं, उपग्रह विंडो कितनी लंबी रहती है, और कार्यों में कितने महत्वपूर्ण आपातकालीन कार्य शामिल हैं। हर परिदृश्य में, विशेष रूप से जब सिस्टम भारी लोड के तहत था या उपग्रह विंडो बहुत छोटी थी, नया तरीका अन्य सभी से बेहतर प्रदर्शन करता रहा। इसने महत्वपूर्ण कार्यों को समय पर पूरा करने की उच्चतम दर हासिल की। उदाहरण के लिए, जब आने वाले कार्यों की संख्या अधिक थी और उपग्रह विंडो सीमित थी, तब नए सिस्टम ने लगभग 69% समय महत्वपूर्ण कार्यों को पूरा करने में सफलता प्राप्त की, जबकि अन्य विधियाँ काफी कम संघर्ष कर रही थीं। परिणामों ने दिखाया कि एक सख्त फिल्टर और मांग के इतिहास से सीखी गई समझ को मिलाकर, सिस्टम भविष्य को जाने बिना भी सबसे महत्वपूर्ण डेटा की रक्षा कर सकता है।

यह अध्ययन पुष्टि करता है कि इन उच्च-दांव वाले, समय-संवेदनशील वातावरणों में, सबसे अच्छी रणनीति केवल वर्तमान में जो हो रहा है उस पर प्रतिक्रिया देना नहीं है, बल्कि कनेक्शन की कमी (scarcity) को समझना है। शोधकर्ताओं ने पाया कि केवल महत्वपूर्ण कार्यों को उच्च वेटेज देकर प्राथमिकता देना पर्याप्त नहीं था; सिस्टम को उपग्रह पथ को एक सामान्य कार्य के साथ घेरने की लागत को समझना था। एक ऐसा सीखने वाला दृष्टिकोण अपनाकर जो नेटवर्क की भौतिक सीमाओं का सम्मान करता है और मांग के इतिहास से सीखता है, ड्रोन अधिक स्मार्ट निर्णय ले सकते हैं। यह कार्य यह दावा नहीं करता है कि इसने अंतरिक्ष संचार की हर समस्या को हल कर दिया है, न ही यह हर संभावित भविष्य के परिदृश्य में काम करने का वादा करता है, लेकिन यह एक नेटवर्क में जहाँ समय सबसे मूल्यवान संसाधन है, नियमित कार्य और तत्काल जरूरतों के बीच नाजुक संतुलन को प्रबंधित करने का एक स्पष्ट और प्रभावी तरीका प्रदर्शित करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →