AgensFlow: A Coordination-Policy Substrate for Multi-Agent Systems
यह शोध पत्र AgensFlow को प्रस्तुत करता है, जो एक ओपन-सोर्स फ्रेमवर्क है जो मल्टी-एजेंट समन्वय को आंशिक अवलोकन (partial observability) के तहत एक ऑनलाइन पॉलिसी-लर्निंग समस्या के रूप में मानता है, और यह प्रदर्शित करता है कि सीखा गया, ऑडिट करने योग्य रूटिंग जटिल वर्कफ़्लो में स्टैटिक पाइपलाइनों की तुलना में बेहतर प्रदर्शन करता है क्योंकि यह कौशल, भूमिकाओं, मॉडलों और टोपोलॉजी के संबंध में निर्णयों को गतिशील रूप से अनुकूलित करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक व्यस्त, उच्च-जोखिम वाले किचन के मैनेजर हैं। आपके पास शेफ की एक टीम है (एजेंट्स), राशन और औजारों का एक भंडार है (स्किल्स), और कुछ अलग-अलग ओवन हैं जो अलग-अलग गति और लागत पर खाना पकाते हैं (मॉडेल्स)।
पुराने तरीके में (एक स्टैटिक पाइपलाइन), आप हर व्यंजन के लिए एक कठोर रेसिपी कार्ड लिखते थे। "सूप के लिए, हमेशा शेफ A का उपयोग करें, राशन की जाँच करें, फिर ओवन 1 का उपयोग करें।" "सलाद के लिए, हमेशा शेफ B का उपयोग करें, राशन को छोड़ दें, ओवन 2 का उपयोग करें।"
समस्या यह है कि वास्तविक जीवन इतना सरल नहीं होता। कभी-कभी सूप की सामग्री अजीब होती है, या ओवन खराब हो जाता है, या आपको एक ऐसा सलाद बनाना पड़ता है जिसके लिए सूप के बर्तन की आवश्यकता होती है। यदि आप कठोर रेसिपी पर टिके रहते हैं, तो आप समय, पैसा बर्बाद कर सकते हैं, या खराब भोजन परोस सकते हैं।
AgensFlow इस किचन को चलाने का एक नया तरीका है। एक निश्चित रेसिपी के बजाय, यह एक स्मार्ट, सीखने वाला मैनेजर है जो हर बार खाना पकाने के दौरान क्या हो रहा है उसे देखता है और मौके पर ही योजना को बदल देता है।
यह कैसे काम करता है, यहाँ सरल अवधारणाओं में दिया गया है:
1. "फोल्डेड सिग्नेचर" (स्थिति को पहचानना)
मैनेजर हर ऑर्डर के हर एक विवरण को नहीं देखता (जिससे वह अभिभूत हो सकता है)। इसके बजाय, वह ऑर्डर्स को "सिग्नेचर" में समूहित करता है।
- उपमा: इसे ट्रैफिक लाइट सिस्टम की तरह समझें। मैनेजर यह नहीं पूछता, "क्या यह एक लाल टोयोटा है या एक नीला फोर्ड?" वह पूछता है, "क्या यह एक रश ऑवर (भीड़भाड़ का समय) की स्थिति है (उच्च जोखिम, गति की आवश्यकता है)?" या "क्या यह एक धीमा मंगलवार (कम जोखिम, सावधानी बरती जा सकती है) है?"
- पेपर में: यह कार्य को देखता है कि क्या वह अस्पष्ट, जोखिम भरा है, या उसे बहुत अधिक साक्ष्य की आवश्यकता है। यह समान कार्यों को एक साथ समूहित करता है ताकि वह उस प्रकार की स्थिति को संभालने का सबसे अच्छा तरीका सीख सके, न कि हर एक ऑर्डर को याद रख सके।
2. "स्किप" बटन (टोपोलॉजी लर्निंग)
एक कठोर किचन में, आपको हर व्यंजन के लिए एक कटोरा धोना, एक प्याज काटना और एक बर्तन चलाना पड़ सकता है, भले ही उस व्यंजन को इसकी आवश्यकता न हो।
- उपमा: AgensFlow मैनेजर को एक "स्किप" बटन देता है। यदि मैनेजर एक सरल ऑर्डर देखता है (जैसे पानी का एक गिलास), तो वह प्याज काटने और सजावट करने के चरणों को छोड़ना सीख जाता है। यदि ऑर्डर जटिल है (जैसे 5-कोर्स का भोज), तो वह अतिरिक्त कदम जोड़ना सीख जाता है, जैसे कि दो शेफ से काम की दोबारा जाँच करवाना।
- पेपर में: इसे skip:X कहा जाता है। सिस्टम सीखता है कि कुछ प्रकार के कार्यों के लिए, वह महंगे चरणों (जैसे वेब सर्च करना या तथ्यों को सत्यापित करना) को पूरी तरह से छोड़ सकता है, जिससे परिणाम खराब किए बिना समय और पैसा बचता है।
3. "लर्निंग लूप" (पॉलिसी ग्राफ)
सिस्टम केवल अनुमान नहीं लगाता; यह एक स्कोरकार्ड रखता है।
- उपमा: कल्पना करें कि मैनेजर एक नोटबुक रखता है। हर भोजन के बाद, एक फूड क्रिटिक (जज) व्यंजन को रेटिंग देता है। मैनेजर लिखता है: "जब हमारे पास एक 'रश ऑवर' का ऑर्डर था, तो शेफ B का उपयोग करने और गार्निश को छोड़ने से 9/10 मिला और लागत कम आई। शेफ A का उपयोग करने से 7/10 मिला लेकिन लागत अधिक आई।"
- पेपर में: यह पॉलिसी ग्राफ है। यह प्रत्येक "सिग्नेचर" (स्थिति) के लिए एक "पॉलिसी" (नियमों का एक सेट) सीखता है। यह नई चीजों को आज़माने (एक्सप्लोरेशन) और जो काम करता है उस पर टिके रहने (एक्सप्लोइटेशन) के बीच संतुलन बनाने के लिए UCB1 नामक गणितीय ट्रिक का उपयोग करता है।
4. "डबल-चेक" (रिवॉर्ड ऑडिट)
AI के साथ सबसे बड़ी समस्याओं में से एक यह है कि "क्रिटिक" पक्षपाती हो सकता है। हो सकता है कि एक क्रिटिक को तीखा खाना पसंद हो, जबकि दूसरा इसे नापसंद करता हो।
- उपमा: AgensFlow केवल एक फूड क्रिटिक से नहीं पूछता। वह भोजन को रेट करने के लिए अलग-अलग पृष्ठभूमि के तीन अलग-अलग क्रिटिक्स से पूछता है। यदि वे सभी सहमत होते हैं, तो मैनेजर उस स्कोर पर भरोसा करता है। यदि वे असहमत होते हैं, तो मैनेजर जानता है कि स्कोर अस्थिर है और वह उस आधार पर नियम नहीं बदलता है।
- पेपर में: यह क्रॉस-जज ऑडिट है। पेपर में पाया गया कि केवल एक जज पर निर्भर रहने से सिस्टम को यह सोचने के लिए धोखा दिया जा सकता है कि वह वास्तव में बेहतर प्रदर्शन कर रहा है। कई जजों का उपयोग करने से सफलता की अधिक सच्ची तस्वीर मिलती है।
उन्होंने क्या पाया?
शोधकर्ताओं ने इस "स्मार्ट मैनेजर" का परीक्षण दो बहुत अलग प्रकार के कार्यों पर किया:
- कंप्यूटर सिस्टम क्रैश को ठीक करना (डिस्ट्रीब्यूटेड सिस्टम्स)।
- सुरक्षा चेतावनियों का विश्लेषण करना (सिक्योरिटी एडवाइजरीज)।
परिणाम:
- कठिन कार्यों में बेहतर: लर्निंग मैनेजर जटिल कार्यों (जैसे कई स्रोतों से जानकारी को संयोजित करना) के लिए कठोर रेसिपी की तुलना में बहुत बेहतर था। इसने कठिन कार्यों के लिए उत्तर की गुणवत्ता में काफी सुधार किया।
- सरल कार्यों में अच्छा: बहुत सरल कार्यों के लिए, लर्निंग मैनेजर कठोर रेसिपी के लगभग बराबर था (इसने चीजों को खराब नहीं किया, लेकिन इसे बहुत फैंसी होने की आवश्यकता नहीं थी)।
- "वार्म स्टार्ट" ट्रिक: उन्होंने कंप्यूटर क्रैश के बारे में पहले से मौजूद ज्ञान का उपयोग करके मैनेजर को सुरक्षा चेतावनियों के बारे में सिखाने की कोशिश की। यह काम कर गया! मैनेजर ने नए काम को तेजी से सीखा और कम समय में महारत हासिल की, भले ही विषय अलग थे।
निचोड़ (The Bottom Line)
AgensFlow यह सिद्ध करता है कि जटिल AI टीमों के लिए, आपको नियम हार्ड-कोड नहीं करने चाहिए। इसके बजाय, आपको एक ऐसा सिस्टम बनाना चाहिए जो देखता है, सीखता है और अनुकूलित होता है। यह निर्णय कि "कौन क्या करेगा, कब करेगा, और क्या हमें इसकी आवश्यकता भी है" को एक फिक्स्ड सेटिंग के बजाय एक कौशल के रूप में देखता है जिसे सीखा जा सकता है।
सबसे महत्वपूर्ण बात यह है कि यह दिखाता है कि आपको इस बारे में सावधान रहने की आवश्यकता है कि सफलता को कैसे मापा जाता है। यदि आपका "जज" पक्षपाती है, तो आपकी "लर्निंग" गलत होगी। जजों का स्वयं ऑडिट करके, सिस्टम ईमानदार और प्रभावी बना रहता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।