← नवीनतम पेपर
💬 NLP

Taming "Zombie'' Agents: A Markov State-Aware Framework for Resilient Multi-Agent Evolution

यह शोधपत्र AgentRevive प्रस्तुत करता है, जो एक मार्कोव स्टेट-अवेयर (Markov state-aware) फ्रेमवर्क है जो सॉफ्ट ट्रांज़िशन और रिस्क-अवेयर पॉलिसियों के माध्यम से एजेंट स्टेट्स को गतिशील रूप से प्रबंधित करके LLM-आधारित मल्टी-एजेंट सिस्टम की लचीलापन और दक्षता को बढ़ाता है, जिससे टोकन खपत को अनुकूलित करते हुए संभावित रूप से सुधारा जा सकने वाले "ज़ोंबी" एजेंटों के समयपूर्व निष्कासन को रोका जा सके।

मूल लेखक: Taolin Zhang, Pukun Zhao, Qizhou Chen, Jiuheng Wan, Chen Chen, Xiaofeng He, Chengyu Wang, Richang Hong

प्रकाशित 2026-05-19
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Taolin Zhang, Pukun Zhao, Qizhou Chen, Jiuheng Wan, Chen Chen, Xiaofeng He, Chengyu Wang, Richang Hong

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही कठिन पहेली को हल करने के लिए विशेषज्ञों की एक टीम का नेतृत्व कर रहे हैं। अतीत में, यदि टीम का कोई सदस्य बड़बड़ाने लगता, भ्रमित हो जाता, या मनगढ़ंत तथ्य बनाने लगता (एक ऐसी घटना जिसे पेपर "हैलुसिनेशन" कहता है), तो मानक नियम यह था कि उन्हें तुरंत हमेशा के लिए टीम से बाहर निकाल दिया जाए। यह हार्ड प्रूनिंग (hard pruning) की तरह है: एक बार जब आप पेड़ से एक शाखा काट देते हैं, तो वह चली जाती है, भले ही वह शाखा केवल अस्थायी रूप से बीमार रही हो और ठीक हो सकती थी।

यह पेपर एक नया सिस्टम पेश करता है जिसे AgentRevive कहा जाता है जो इस नियम को बदल देता है। उन्हें तुरंत निकालने के बजाय, यह टीम को एक जीवित जीव की तरह एक लचीली अवस्था प्रणाली (flexible state system) के रूप में मानता है। यह कैसे काम करता है, इसके लिए सरल उपमाओं का उपयोग किया गया है:

1. एक एजेंट की तीन "अवस्थाएं" (Three "States" of an Agent)

केवल "ऑन" या "ऑफ" होने के बजाय, इस प्रणाली में प्रत्येक एजेंट के पास तीन संभावित मूड या अवस्थाएं होती हैं:

  • एक्टिव (Active): एजेंट कड़ी मेहनत कर रहा है, सोच रहा है और विचार साझा कर रहा है।
  • स्टैंडबाय (Standby): एजेंट ब्रेक ले रहा है। वे नया टेक्स्ट जेनरेट नहीं कर रहे हैं (जो पैसे और समय बचाता है), लेकिन वे अभी भी टीम में हैं। वे "ज़ोंबी" के अर्थ में हैं क्योंकि वे रुके हुए हैं, मृत नहीं।
  • टर्मिनेटेड (Terminated): एजेंट को वास्तव में निकाल दिया गया है। उन्हें स्थायी रूप से टीम से हटा दिया गया है क्योंकि वे लगातार अविश्वसनीय रहे हैं।

2. "रिस्क मैनेजर" (स्टेट-अवेयर पॉलिसी)

सिस्टम के पास एक स्मार्ट मैनेजर (एक पॉलिसी नेटवर्क) है जो हर एजेंट पर नज़र रखता है।

  • समस्या: कभी-कभी एक एजेंट गलती करता है क्योंकि वह थका हुआ या भ्रमित होता है। यदि आप उन्हें निकाल देते हैं, तो आप उनके अद्वितीय कौशल को खो देते हैं।
  • समाधान: मैनेजर एक "रिस्क एस्टीमेटर" का उपयोग करता है। यदि कोई एजेंट भ्रमित करने लगता है या दूसरों का खंडन करने लगता है, तो मैनेजर उन्हें तुरंत नहीं निकालता। इसके बजाय, वह उन्हें स्टैंडबाय पर डाल देता है।
  • जादू: यदि टीम की बातचीत बदलती है और एजेंट के पास अचानक एक अच्छा विचार आता है या संदर्भ बदल जाता है, तो मैनेजर उन्हें स्टैंडबाय से वापस एक्टिव में ला सकता है। यही मुख्य नवाचार है: लचीलापन (resilience)। आप मूल्यवान प्रतिभा को केवल इसलिए नहीं खोते क्योंकि उनका एक दौर बुरा रहा था।

3. "कन्वर्सेशन मैप" (स्टेट-अवेयर एज ऑप्टिमाइज़ेशन)

एक मल्टी-एजेंट सिस्टम में, हर कोई हर किसी से बात करता है, जो बहुत अस्त-व्यस्त और महंगा हो जाता है (जैसे एक भीड़भाड़ वाला कमरा जहाँ हर कोई चिल्ला रहा हो)।

  • पुराना तरीका: आप "बुरे" लोगों के कनेक्शन स्थायी रूप से काट देते हैं।
  • नया तरीका: सिस्टम एक गतिशील मानचित्र (dynamic map) बनाता है।
    • यदि कोई एजेंट टर्मिनेटेड है, तो उनके कनेक्शन की रेखाएं हमेशा के लिए काट दी जाती हैं।
    • यदि कोई एजेंट स्टैंडबाय पर है, तो उनके कनेक्शन की रेखाएं रखी जाती हैं, लेकिन वे नई चीजें चिल्लाना बंद कर देते हैं। इसके बजाय, वे केवल जो उन्होंने पहले कहा था उसका एक संक्षिप्त सारांश फुसफुसाते हैं। यह "टोकन" (AI कंप्यूटिंग लागत की मुद्रा) की भारी बचत करता है।
    • यदि कोई एजेंट एक्टिव है, तो वे सामान्य रूप से बात करते हैं।

4. यह क्यों मायने रखता है (परिणाम)

लेखकों ने गणित की समस्याओं, कोडिंग और तथ्य-जांच (झूठ पकड़ने के लिए) जैसे विभिन्न कठिन कार्यों पर इसका परीक्षण किया।

  • बेहतर प्रदर्शन: एजेंटों को बहुत जल्दी न निकालने के कारण, इस सिस्टम ने उन सिस्टमों की तुलना में अधिक समस्याओं को सही ढंग से हल किया जो केवल लोगों को काट देते थे।
  • सस्ता: क्योंकि "स्टैंडबाय" एजेंट नया टेक्स्ट जेनरेट नहीं करते हैं, इसलिए यह सिस्टम अन्य उन्नत तरीकों की तुलना में लगभग 15% कम कंप्यूटिंग पावर (टोकन) का उपयोग करता है।
  • मजबूत: जब शोधकर्ताओं ने एक एजेंट को जिद्दी बनाने के लिए सिस्टम पर "हमला" करने की कोशिश की, तो AgentRevive ने इसे बेहतर तरीके से संभाला। इसने बस जिद्दी एजेंट को अलग-थलग करने के लिए "स्टैंडबाय" पर रख दिया, बजाय इसके कि उनके बुरे विचारों को पूरे टीम को बर्बाद करने दें या उनकी भविष्य की मदद की क्षमता को खोने के लिए उन्हें निकाल दें।

सारांश उपमा

एक स्पोर्ट्स टीम के बारे में सोचें।

  • पुराना तरीका: यदि कोई खिलाड़ी लड़खड़ाता है या शॉट मिस करता है, तो कोच उसे पूरे खेल के लिए हमेशा के लिए बेंच पर बैठा देता है।
  • AgentRevive तरीका: यदि कोई खिलाड़ी लड़खड़ाता है, तो कोच उसे आराम करने और देखने के लिए बेंच (स्टैंडबाय) पर बैठा देता है। यदि खेल की स्थिति बदलती है और उस खिलाड़ी के पास बाद में आवश्यक विशिष्ट कौशल होता है, तो कोच उसे वापस बुला सकता है (रिवाइव)। यदि खिलाड़ी बार-बार एक ही गलती करता रहता है, तब कोच उसे टीम से हटा देता है (टर्मिनेटेड)।

यह दृष्टिकोण सुनिश्चित करता है कि टीम या तो अधिक स्मार्ट है (उन अच्छे खिलाड़ियों को बनाए रखकर जिनका एक क्षण बुरा रहा था) या अधिक कुशल है (यह सुनिश्चित करके कि बेंच पर बैठे खिलाड़ी अनावश्यक रूप से बात न करें)।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →