← नवीनतम पेपर
🤖 AI

Agentic AI for Bilevel Long-Term Optimization of Policy-Driven Physical Layer Systems

यह शोध पत्र Agentic-LTPO प्रस्तुत करता है, जो एक नेस्टेड बाइलेवल ऑप्टिमाइज़ेशन फ्रेमवर्क है जो विकसित होती नीतियों और ऐतिहासिक अनुभवों के आधार पर फिजिकल लेयर समस्याओं को गतिशील रूप से कॉन्फ़िगर करने के लिए एजेंटिक AI का लाभ उठाता है, जो पारंपरिक तरीकों की तुलना में सेल-फ्री MIMO बीमफॉर्मिंग के लिए दीर्घकालिक प्रदर्शन में 57.2% का सुधार प्रदर्शित करता है।

मूल लेखक: Bingnan Xiao, Chenhao Yang, Wei Ni, Xin Wang, Tony Q. S. Quek

प्रकाशित 2026-06-24
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Bingnan Xiao, Chenhao Yang, Wei Ni, Xin Wang, Tony Q. S. Quek

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि एक विशाल, हाई-टेक वायरलेस नेटवर्क एक विशाल ऑर्केस्ट्रा की तरह है। इस ऑर्केस्ट्रा में, सेल टावर्स (एक्सेस पॉइंट्स) संगीतकार हैं, फोन दर्शक हैं, और सिग्नल बीम्स बजाया जाने वाला संगीत हैं।

लंबे समय तक, इस ऑर्केस्ट्रा का संचालन कठोर था। कंडक्टर (नेटवर्क ऑपरेटर) एक निश्चित स्कोर लिखता था: "ज़ोर से बजाओ!" या "ऊर्जा बचाओ!" एक बार जब स्कोर लिख दिया जाता था, तो संगीतकार उसे ठीक उसी तरह बजाते थे जब तक कि कंडक्टर पूरी शीट म्यूजिक को न बदल दे। समस्या यह थी कि वास्तविक जीवन अव्यवस्थित है। कभी-कभी दर्शक रॉक कॉन्सर्ट (हाई स्पीड) चाहते हैं, और पांच मिनट बाद, वे एक शांत जैज़ सत्र (एनर्जी सेविंग) चाहते हैं। यदि कंडक्टर स्कोर को पर्याप्त तेज़ी से नहीं बदल सकता है, तो संगीत खराब हो जाता है।

यह पेपर एक नए प्रकार के कंडक्टर को पेश करता है जिसे Agentic-LTPO कहा जाता है। केवल एक स्कोर पढ़ने के बजाय, यह कंडक्टर एक AI एजेंट है जो सोचता है, सीखता है और वास्तविक समय में अनुकूलित (adapt) होता है।

यह कैसे काम करता है, इसे सरल अवधारणाओं में विभाजित किया गया है:

1. दो-गति वाला मस्तिष्क (बाइलेवल ऑप्टिमाइज़ेशन)

इस सिस्टम के पास अलग-अलग गति से काम करने वाले दो "मस्तिष्क" हैं:

  • धीमा मस्तिष्क (रणनीतिकार): यह Agentic AI है। यह "बड़े चित्र" (big picture) के टुकड़ों में सोचता है (जैसे हर 20 मिनट में)। यह ऑपरेटर के प्राकृतिक भाषा के अनुरोधों को सुनता है (जैसे, "अभी वीडियो कॉल को प्राथमिकता दें" या "बैटरी लाइफ बचाएं")। यह सीधे रेडियो तरंगों को नहीं छूता है; इसके बजाय, यह खेल के लिए नियम निर्धारित करता है।
  • तेज़ मस्तिष्क (रणनीतिज्ञ): यह पारंपरिक गणितीय सॉल्वर है। यह "मिलीसेकंड" में काम करता है। यह धीमे मस्तिष्क द्वारा निर्धारित नियमों को लेता है और फोन को सिग्नल भेजने के लिए तुरंत गणना करता है ताकि उन नियमों का पूरी तरह से पालन किया जा सके।

उपमा: एक जनरल और एक सैनिक के बारे में सोचें। जनरल (धीमा मस्तिष्क) मानचित्र को देखता है और कहता है, "हमें दोपहर तक पहाड़ी सुरक्षित करनी है, लेकिन गोला-बारूद बचाकर रखें।" सैनिक (तेज़ मस्तिष्क) तुरंत उस पहाड़ी पर चढ़ने के लिए विशिष्ट कदम तय करता है ताकि एक भी गोली बर्बाद न हो। जनरल सैनिक को यह नहीं बताता कि उसे कैसे कदम रखना है; जनरल बस लक्ष्य निर्धारित करता है।

2. "मेमोरी बुक" (रिट्रीवल-ऑगमेंटेड जनरेशन)

AI केवल अनुमान नहीं लगा रहा है। इसके पास एक मेमोरी बुक (जिसे RAG मॉड्यूल कहा जाता है) है।

  • जब जनरल को नया आदेश मिलता है, तो वह केवल मनगढ़ंत चीज़ नहीं करता। वह अपनी मेमोरी बुक को पलटता है ताकि समान स्थितियों को खोज सके।
  • उदाहरण: यदि आदेश "ऊर्जा बचाएं" है, तो AI अपनी किताब चेक करता है: "पिछली बार जब हमने ऊर्जा बचाने की कोशिश की थी, तो हमने आधे टावर बंद कर दिए थे, लेकिन सिग्नल बहुत कम हो गया था। चलिए इसके बजाय पावर को थोड़ा कम करके देखते हैं।"
  • यह AI को एक ही गलती दोबारा करने से रोकता है।

3. "संपादक और आलोचक" टीम (मल्टी-एजेंट कोलैबोरेशन)

यह पेपर केवल एक AI का उपयोग नहीं करता है; यह मिलकर काम करने वाले चार विशिष्ट AI एजेंटों की एक टीम का उपयोग करता है:

  • इंटरप्रेटर (व्याख्याकार): यह इंसान की अस्पष्ट अंग्रेजी ("इसे तेज़ बनाओ!") को सख्त, गणितीय नियमों की सूची में अनुवादित करता है।
  • ऑब्जर्वर (अवलोकनकर्ता): पिछले दौर में क्या हुआ उस पर नज़र रखता है और कहता, "हे, पिछली बार हम बहुत आक्रामक थे; टावर ओवरहीट हो रहे थे।"
  • प्लानर (योजनाकार): इंटरप्रेटर और ऑब्जर्वर के आधार पर नियमों का एक नया सेट प्रस्तावित करता है।
  • क्रिटिक (आलोचक): यह सबसे महत्वपूर्ण हिस्सा है। क्रिटिक एक सख्त संपादक की तरह कार्य करता है। यह प्लानर के नए नियमों को देखता है और मेमोरी बुक के साथ उनकी जांच करता है।
    • क्रिटिक पूछता है: "क्या यह योजना ऐसी दिखती है जो पहले काम आई थी? क्या यह सुरक्षित है?"
    • यदि योजना जोखिम भरी लगती है, तो क्रिटिक प्लानर को इसे ठीक करने के लिए वापस भेज देता है। यह लूप तब तक चलता रहता है जब तक कि योजना परफेक्ट न हो जाए।

4. परिणाम: यह क्यों मायने रखता है

शोधकर्ताओं ने एक सिम्युलेटेड शहर में 16 सेल टावरों और 8 उपयोगकर्ताओं के साथ इस सिस्टम का परीक्षण किया। उन्होंने अपने नए "Agentic" सिस्टम की तुलना निम्नलिखित से की:

  • स्टैटिक स्ट्रैटेजी: एक सिस्टम जो अपनी सेटिंग्स कभी नहीं बदलता।
  • सिंगल एजेंट: एक सिस्टम जिसमें केवल एक AI सब कुछ अकेले करने की कोशिश करता है।
  • नो मेमोरी: एक सिस्टम जो अपने पिछले अनुभवों को भूल जाता है।

परिणाम:
Agentic-LTPO सिस्टम पुराने स्टैटिक तरीकों की तुलना में लंबे समय तक नेटवर्क को खुश रखने में 57.2% बेहतर था।

  • जब ऑपरेटर चाहता था कि गति बढ़े, तो सिस्टम ने प्रदर्शन को आक्रामक रूप से बढ़ाया।
  • जब ऑपरेटर ऊर्जा बचाना चाहता था, तो सिस्टम ने शांति से इसे कम कर दिया।
  • महत्वपूर्ण रूप से, इसने बिना क्रैश हुए या गलतियां किए ऐसा किया, क्योंकि "क्रिटिक" एजेंट ने इसे नियंत्रण में रखा।

सारांश

यह पेपर एक तरीका प्रस्तावित करता है जिससे वायरलेस नेटवर्क को इंसानी लक्ष्यों को सुनने के लिए स्मार्ट और अपनी रणनीति को तुरंत बदलने के लिए अनुकूलनीय बनाया जा सके, और यह सब एक "AI टीम" का उपयोग करके किया जा सके जो यह सुनिश्चित करती है कि नई रणनीति सुरक्षित और प्रभावी है। यह एक कठोर, प्री-प्रोग्राम्ड मशीन को एक लचीले, सीखने वाले साथी में बदल देता है जो वास्तविक दुनिया के नेटवर्क की अप्रत्याशित प्रकृति को संभाल सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →