← नवीनतम पेपर
🤖 machine learning

Hierarchical Reinforcement Learning for the Dynamic VNE with Alternatives Problem

यह शोध पत्र HRL-VNEAP का प्रस्ताव करता है, जो एक पदानुक्रमित सुदृढीकरण शिक्षण (hierarchical reinforcement learning) ढांचा है जो सबसे उपयुक्त लचीली अनुरोध संरचना (malleable request structure) को संयुक्त रूप से चुनने और उसे सब्सट्रेट नेटवर्क पर एम्बेड करके वैकल्पिक टोपोलॉजी के साथ गतिशील वर्चुअल नेटवर्क एम्बेडिंग को अनुकूलित करता है, जिससे मौजूदा बेसलाइनों की तुलना में स्वीकृति अनुपात, राजस्व और दक्षता में महत्वपूर्ण सुधार प्राप्त होता है।

मूल लेखक: Ali Al Housseini, Cristina Rottondi, Omran Ayoub

प्रकाशित 2026-04-29
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Ali Al Housseini, Cristina Rottondi, Omran Ayoub

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक विशाल, व्यस्त शहर की कल्पना करें जिसे "सबस्ट्रेट नेटवर्क" (Substrate Network) कहा जाता है। इस शहर में सड़कों, पुलों और बिजली की लाइनों (कंप्यूटिंग संसाधनों) की एक निश्चित मात्रा है जो हमेशा वहीं रहती है। अब, कल्पना करें कि हर दिन लोगों के नए समूह एक विशिष्ट योजना के साथ आते हैं: वे एक अस्थायी गाँव (एक वर्चुअल नेटवर्क) बनाने के लिए आते हैं ताकि एक उत्सव आयोजित किया जा सके।

पुरानी समस्या: कठोर ब्लूप्रिंट (The Rigid Blueprint)
अतीत में, जब कोई समूह आता था, तो वे अपने गाँव के लिए एक एकल, अपरिवर्तनीय ब्लूप्रिंट लेकर आते थे। यदि शहर के पास उस सटीक ब्लूप्रिंट को फिट करने के लिए पर्याप्त जगह या सही प्रकार की सड़कें नहीं होती थीं, तो उस समूह को वापस भेज दिया जाता था, भले ही वे एक थोड़ा अलग गाँव बना सकते थे जो पूरी तरह से फिट बैठ जाता। यह एक चौकोर खांचे में गोल चीज़ डालने की कोशिश करने जैसा था; यदि वह फिट नहीं बैठता, तो पार्टी रद्द कर दी जाती थी।

नई चुनौती: लचीला वास्तुकार (The Flexible Architect)
हाल ही में, एक नया विचार जिसे "VNE with Alternatives" (VNEAP) कहा जाता है, पेश किया गया है। अब, जब कोई समूह आता है, तो वे केवल एक ब्लूपिंट नहीं लाते। वे विकल्पों का एक पोर्टफोलियो लाते हैं।

  • विकल्प A: एक बड़ा, फैला हुआ गाँव जिसे बहुत सारी ज़मीन की आवश्यकता है लेकिन बहुत कम बिजली की लाइनों की।
  • विकल्प B: एक सघन, ऊँचा गाँव जिसे बहुत कम ज़मीन की आवश्यकता है लेकिन भारी मात्रा में बिजली की।
  • विकल्प C: एक मध्यम आकार का गाँव जो दोनों के बीच संतुलन बनाता है।

ये सभी विकल्प समूह के लिए बिल्कुल एक ही काम करते हैं, लेकिन वे शहर के संसाधनों का उपयोग अलग-अलग तरीके से करते हैं। यह अच्छा है क्योंकि यह शहर को "हाँ" कहने के अधिक अवसर देता है। हालाँकि, यह एक नई समस्या पैदा करता है: कौन तय करेगा कि किस ब्लूपिंट का उपयोग किया जाए? यदि शहर का प्रबंधक गलत वाला चुन लेता है, तो वे संसाधनों को बर्बाद कर सकते हैं या समूह को अनावश्यक रूप से मना कर सकते हैं।

समाधान: दो-स्तरीय प्रबंधक (The Two-Level Manager: HRL-VNEAP)
यह शोध पत्र इस पहेली को सुलझाने के लिए HRL-VNEAP नामक एक स्मार्ट, दो-स्तरीय प्रबंधन प्रणाली पेश करता है। इसे दो प्रबंधकों की एक टीम के रूप में सोचें जो मिलकर काम करते हैं:

  1. उच्च-स्तरीय प्रबंधक (रणनीतिकार - The High-Level Manager): यह प्रबंधक समूह के अनुरोध और शहर की वर्तमान स्थिति को देखता है। वे अभी बारीक विवरणों की चिंता नहीं करते हैं। उनका एकमात्र काम समूह के पोर्टफोलियो में से सर्वश्रेष्ठ ब्लूपिंट चुनना है। वे पूछते हैं, "क्या हमारे पास पर्याप्त बिजली लाइनें हैं? चलिए विकल्प B चुनते हैं।" या, "हम बहुत भीड़भाड़ वाले हैं; चलिए इस समूह को विनम्रता से मना करते हैं।"
  2. निम्न-स्तरीय प्रबंधक (निर्माता - The Low-Level Manager): एक बार जब उच्च-स्तरीय प्रबंधक एक ब्लूपिंट चुन लेता है, तो निम्न-स्तरीय प्रबंधक काम पर लग जाता है। उनका काम गाँव को शहर के मानचित्र पर भौतिक रूप से स्थापित करना है, सड़कों और बिजली की लाइनों को ठीक वहीं जोड़ना जहाँ उनकी आवश्यकता है ताकि ट्रैफिक जाम न हो।

इन प्रबंधकों को Hierarchical Reinforcement Learning तकनीक का उपयोग करके प्रशिक्षित किया जाता है। इसे ऐसे समझें जैसे उन्हें इस खेल को हजारों बार खेलकर प्रशिक्षित किया जाता है, जिससे वे अपनी गलतियों और सफलताओं से सीखते हैं और अंततः तुरंत सही निर्णय लेने में विशेषज्ञ बन जाते हैं।

परिणाम
शोधकर्ताओं ने इस प्रणाली का परीक्षण पुराने तरीकों और यहाँ तक कि एक सुपर-स्लो, सटीक गणितीय कैलकुलेटर (जिसे MILP कहा जाता है) के विरुद्ध किया। परिणाम प्रभावशाली थे:

  • अधिक "हाँ" उत्तर: इस नई प्रणाली ने पिछले सर्वोत्तम तरीकों की तुलना में लगभग 20.7% अधिक समूहों को स्वीकार किया।
  • अधिक पैसा कमाया: क्योंकि उन्होंने अधिक समूहों को स्वीकार किया और संसाधनों का अधिक कुशलता से उपयोग किया, इसलिए शहर का कुल राजस्व 36.2% बढ़ गया।
  • बेहतर मूल्य: उन्होंने प्रत्येक इकाई संसाधन के लिए अधिक मूल्य प्राप्त किया, जिससे दक्षता में 22.1% का सुधार हुआ।

मुख्य निष्कर्ष (The Bottom Line)
केवल अनुमान लगाना (नाइव रणनीतियाँ) बहुत अधिक मदद नहीं कर सका। लेकिन इस स्मार्ट, दो-स्तरीय टीम ने लगातार सही निर्णय लेना सीख लिया। जबकि इस स्मार्ट सिस्टम की क्षमता और एक पूर्ण, धीमे गणितीय कैलकुलेटर के बीच अभी भी एक छोटा सा अंतर है, यह दृष्टिकोण यह सिद्ध करता है कि लचीले नेटवर्क अनुरोधों को प्रबंधित करने के लिए AI का उपयोग करना हमारे डिजिटल शहरों को सुचारू रूप से चलाने के लिए एक बड़ा कदम है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →