MASPO: Joint Prompt Optimization for LLM-based Multi-Agent Systems
MASPO एक नवीन ढांचा है जो स्थानीय एजेंट उद्देश्यों को वैश्विक प्रणाली लक्ष्यों के साथ संरेखित करने के लिए एक संयुक्त मूल्यांकन तंत्र और विकासवादी बीम सर्च का उपयोग करके LLM-आधारित मल्टी-एजेंट सिस्टम के लिए प्रॉम्प्ट्स को स्वचालित रूप से अनुकूलित करता है, जिससे यह विविध सहयोगात्मक कार्यों में मौजूदा विधियों से बेहतर प्रदर्शन करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक बहुत ही कठिन पहेली को हल करने के लिए काम कर रहे विशेषज्ञ रोबोटों की एक टीम है। प्रत्येक रोबोट का एक विशिष्ट कार्य है: एक सुराग पढ़ता है, दूसरा गणित करता है, तीसरा त्रुटियों की जाँच करता है, और चौथा अंतिम उत्तर लिखता है।
अतीत में, यदि टीम विफल हो जाती थी, तो यह जानना कठिन था कि किसे दोष दिया जाए। क्या गणित करने वाला रोबोट गणित में खराब था? या क्या पढ़ने वाले रोबोट ने उसे गलत सुराग दिए थे? यह वही समस्या है जिसे MASPO हल करता है।
यहाँ बताया गया है कि MASPO कैसे काम करता है, सरल उपमाओं के माध्यम से:
1. समस्या: एक टीम में "दोषारोपण का खेल" (The Blame Game)
आमतौर पर, जब हम इन रोबोट टीमों को प्रशिक्षित करते हैं, तो हम केवल अंतिम उत्तर को देखते हैं। यदि उत्तर गलत है, तो हमें नहीं पता चलता कि किस रोबोट ने गड़बड़ी की।
- उपमा: एक रिले रेस की कल्पना करें। यदि टीम हार जाती है, तो आप केवल आखिरी धावक पर चिल्ला नहीं सकते। हो सकता है कि पहले धावक ने बैटन गिरा दिया हो, या दूसरे धावक ने गलत रास्ता चुना हो। यदि आप केवल अंतिम धावक को तेज़ दौड़ने के लिए प्रशिक्षित करते हैं, तो टीम फिर भी हार जाएगी क्योंकि बैटन सौंपने (hand-off) की प्रक्रिया टूटी हुई है।
- पेपर का अंतर्दृष्टि (Insight): लेखकों ने महसूस किया कि एक मल्टी-एजेंट सिस्टम में, एक रोबोट अपना काम पूरी तरह से कर सकता है (स्थानीय सफलता/Local Success), लेकिन फिर भी वह अगले रोबोट को ऐसी जानकारी दे सकता है जिससे कुल विफलता हो जाए (वैश्विक विफलता/Global Failure)। इसे "लोकल-ग्लोबल मिसअलाइनमेंट" (Local-Global Misalignment) कहा जाता है।
2. समाधान: MASPO (एक स्मार्ट कोच)
MASPO एक नया फ्रेमवर्क है जो एक स्मार्ट कोच की तरह काम करता है जो केवल फिनिश लाइन को नहीं देखता, बल्कि रिले रेस में हर एक 'हैंड-ऑफ' को भी देखता है। यह पूरी टीम को बेहतर तरीके से काम करने के लिए हर रोबोट के "निर्देश मैनुअल" (प्रॉम्प्ट्स) को स्वचालित रूप से फिर से लिखता है।
यह तीन मुख्य तरीकों से काम करता है:
A. "फ्यूचर-प्रूफ" स्कोरकार्ड (संयुक्त मूल्यांकन/Joint Evaluation)
केवल यह पूछने के बजाय कि, "क्या इस रोबोट ने अपना काम किया?" MASPO पूछता है, "क्या इस रोबोट के काम ने अगले रोबोट को सफल होने में मदद की?"
- उपमा: एक शेफ की कल्पना करें जो भोजन तैयार कर रहा है। एक मानक जज केवल सूप को चख सकता है और कह सकता है, "यह नमकीन है।" लेकिन MASPO एक ऐसे जज की तरह है जो यह भी पूछता है, "क्या यह सूप इतना नमकीन है कि यह उस ब्रेड के साथ अच्छा लगेगा जिसे अगला शेफ बना रहा है?"
- यह कैसे काम करता है: MASPO हर रोबोट को तीन चीजों के आधार पर स्कोर देता है:
- क्या उन्होंने अपने नियमों का पालन किया? (स्थानीय वैधता/Local Validity)
- क्या उनके आउटपुट ने अगले रोबोट के काम को आसान बनाया? (लुकअहेड पोटेंशियल/Lookahead Potential)
- क्या इसने टीम को अंतिम खेल जीतने में मदद की? (ग्लोबल अलाइनमेंट/Global Alignment)
B. "लगभग" आपदाओं से सीखना (मिसअलाइनमेंट माइनिंग/Misalignment Mining)
अधिकांश सिस्टम केवल उन गलतियों से सीखते हैं जहाँ अंतिम उत्तर गलत होता है। MASPO एक विशिष्ट, छिपी हुई प्रकार की गलती को खोजता है: जब एक रोबोट ने अपना काम पूरी तरह से किया, लेकिन टीम फिर भी विफल रही।
- उपमा: एक ड्राइवर की कल्पना करें जो हर ट्रैफिक नियम का पूरी तरह से पालन करता है (स्थानीय सफलता) लेकिन गलती से एक डेड-एंड (बंद सड़क) में चला जाता है क्योंकि मैप भ्रमित करने वाला था (वैश्विक विफलता)। एक सामान्य कोच कहेगा, "अच्छा काम किया, ड्राइवर!" MASPO कहता है, "रुको, तुमने नियमों का पालन किया, लेकिन हम फिर भी खो गए। आइए आपके निर्देशों को ठीक करें ताकि अगली बार आप डेड-एंड में न फंसें।"
- यह कैसे काम करता है: सिस्टम इन "स्थानीय सफलता, वैश्विक विफलता" वाले मामलों को सुरक्षित रखता है और रोबोट को उन्हें अध्ययन करने के लिए मजबूर करता है, यह सुनिश्चित करता है कि वे एक ही समन्वय त्रुटियों (coordination errors) को न दोहराएं।
C. "री-अलाइनमेंट" ड्रिल (बीम रिफ्रेश/Beam Refresh)
जैसे-जैसे रोबोट सीखते हैं और अपने व्यवहार को बदलते हैं, अगले रोबोट के लिए निर्देश अचानक पुराने या अप्रासंगिक हो सकते हैं।
- उपमा: एक डांस टीम की कल्पना करें। यदि पहला डांसर अपनी गति बढ़ाता है, तो दूसरे डांसर की टाइमिंग अब गलत हो जाती है। यदि वे पुराने रूटीन का अभ्यास जारी रखते हैं, तो वे एक-दूसरे के पैरों पर पैर रखते रहेंगे।
- यह कैसे काम करता है: MASPO लगातार टीम की जाँच करता रहता है। यदि पहले रोबोट ने अपनी शैली बदल दी है, तो MASPO तुरंत दूसरे रोबोट के निर्देशों के लिए "स्कोर" को अपडेट कर देता है ताकि वे टीम के पुराने संस्करण के बजाय वर्तमान वास्तविकता के विरुद्ध अभ्यास कर सकें।
3. परिणाम: एक बेहतर टीम
लेखकों ने जटिल गणित, तर्क पहेलियों और कंप्यूटर कोड लिखने सहित 6 विभिन्न प्रकार के कठिन कार्यों पर इसका परीक्षण किया।
- परिणाम: MASPO-प्रशिक्षित टीमें लगातार अन्य तरीकों से बेहतर प्रदर्शन करती हैं। उन्होंने मौजूदा सर्वोत्तम तरीकों की तुलना में औसतन 2.9% सटीकता में सुधार किया।
- यह क्यों महत्वपूर्ण है: यह साबित करता है कि रोबोटों को यह सिखाकर कि वे अपने साथियों के काम को कैसे प्रभावित करते हैं (न कि केवल अपने स्वयं के कार्य को), पूरा सिस्टम बहुत अधिक स्मार्ट हो जाता है।
सारांश
MASPO को एक ऐसे टीम कोच के रूप में सोचें जो वास्तविक समय में 'प्लेबुक' को फिर से लिखता है। केवल खिलाड़ियों को "अपना सर्वश्रेष्ठ देने" के लिए कहने के बजाय, यह विश्लेषण करता है कि खिलाड़ी A का पास, खिलाड़ी B के कैच को कैसे प्रभावित करता है, और यह दोनों के लिए निर्देशों को फिर से लिखता है ताकि पूरी टीम जीत सके, न कि केवल व्यक्तिगत खिलाड़ी। यह "मैंने अपना काम किया, लेकिन हम फिर भी हार गए" की समस्या को हल करता है, यह सुनिश्चित करके कि हर किसी का काम टीम को जिताने में मदद करने के लिए डिज़ाइन किया गया है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।