SRPO: Setwise Relative Policy Optimization for Multi-Agent LLMs
यह शोध पत्र SRPO (सेटवाइज़ रिलेटिव पॉलिसी ऑप्टिमाइज़ेशन) को पेश करता है, जो मल्टी-एजेंट LLMs के लिए एक नवीन सुदृढीकरण शिक्षण (रिनफोर्समेंट लर्निंग) ढांचा है, जो एकल अवस्था संक्रमण (स्टेट ट्रांज़िशन) में उपभोग किए गए आउटपुट के न्यूनतम सेट को एक एकीकृत क्रिया मानकर श्रम विभाजन और संयुक्त सह-विकास को एकीकृत करता है, जिससे विविध वर्कफ़्लो और मॉडल पैमानों में स्थिर और प्रभावी प्रशिक्षण सक्षम होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने नहीं लिखा है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
आर्टिफिशियल इंटेलिजेंस की तेजी से बदलती दुनिया में, बड़े लैंग्वेज मॉडल्स ने एजेंट के रूप में कार्य करना सीख लिया है, जो तर्क करने, जानकारी खोजने और जटिल समस्याओं को हल करने के लिए टूल्स का उपयोग करने में सक्षम हैं। जब ये मॉडल अकेले काम करते हैं, तो वे विचार के एक एकल पथ का अनुसरण करते हैं। हालांकि, कठिन चुनौतियों से निपटने के लिए, शोधकर्ता अक्सर कई एजेंटों को तैनात करते हैं जो विशेषज्ञों की एक टीम की तरह सहयोग करते हैं। कभी-कभी, ये टीमें किसी कार्य को इस तरह विभाजित करती हैं कि प्रत्येक सदस्य एक विशिष्ट भूमिका संभालता है, जबकि अन्य समय में, वे समाधान को मिलकर परिष्कृत करने के लिए एक साथ कई अलग-अलग विचार उत्पन्न करते हैं। ऐसी टीमों को प्रशिक्षित करने में केंद्रीय कठिनाई उन्हें पुरस्कृत करने का तरीका खोजने में रही है। पारंपरिक तरीके प्रत्येक एजेंट के आउटपुट को एक अलग घटना के रूप में देखते हैं, भले ही कई एजेंट एक एकल परिणाम उत्पन्न करने के लिए मिलकर काम कर रहे हों। यह एक विसंगति पैदा करता है: सिस्टम पहेली के व्यक्तिगत टुकड़ों से सीखता है बजाय उस पूर्ण चित्र के जो वे मिलकर बनाते हैं, जिससे उन टीमों को प्रशिक्षित करना कठिन हो जाता है जो अकेले काम करने और संयुक्त रूप से काम करने के बीच स्विच करती हैं।
एक शोधकर्ता दल ने इस विसंगति को संबोधित करने के लिए 'सेटवाइज रिलेटिव पॉलिसी ऑप्टिमाइजेशन' (SRPO) नामक एक नई प्रशिक्षण पद्धति प्रस्तावित करके इस समस्या का समाधान किया है। व्यक्तिगत प्रतिक्रियाओं को देखने के बजाय, यह दृष्टिकोण आउटपुट के पूरे समूह को क्रिया की एक एकल इकाई के रूप में मानता है जो वातावरण में परिवर्तन लाता है। कल्पना कीजिए कि खोजकर्ताओं की एक टीम सड़क के एक मोड़ पर पहुँचती है; चाहे एक व्यक्ति रास्ता चुनता है, या पूरी टीम बहस करती है और फिर मिलकर एक मार्ग चुनती है, वह निर्णय जो उन्हें आगे बढ़ाता है, सामूहिक परिणाम है। शोधकर्ताओं ने पाया कि इन आउटपुट्स को एक "एक्टिव सेट" (सक्रिय सेट) में समूहित करके, वे सिस्टम को यह समझने के लिए प्रशिक्षित कर सकते हैं कि टीम का संयुक्त प्रयास ही वास्तविक क्रिया है। यह विधि अनुमति देती है कि समान प्रशिक्षण नियम लागू हों, चाहे टीम श्रम के सख्त विभाजन में काम कर रही हो, जहाँ एक व्यक्ति एक काम करता है, या सह-विकास (co-evolution) के मोड में, जहाँ कई लोग एक साझा विचार में एक साथ योगदान देते हैं।
शोधकर्ताओं ने इस विचार का परीक्षण दो बहुत अलग प्रकार के कार्यों पर किया: कठिन गणितीय समस्याओं को हल करना और विशिष्ट तथ्यों को खोजने के लिए मल्टी-टर्न सर्च (बहु-चरणीय खोज) करना। गणित के प्रयोगों में, सिस्टम को संभावित समाधान उत्पन्न करने थे और फिर उन्हें सत्यापित करना था, एक ऐसी प्रक्रिया जिसमें कभी एक एजेंट को हल करना होता था और दूसरे को जांचना होता था, और अन्य समय में कई एजेंटों को एक साथ विभिन्न व्युत्पत्तियों (derivations) का प्रस्ताव देना होता था। खोज प्रयोगों में, सिस्टम को यह तय करना था कि कब अधिक जानकारी मांगनी है, जिसमें कई एजेंटों द्वारा एक एग्रीगेटर (संयोजक) द्वारा परिणामों को संयोजित करने से पहले एक साथ खोज प्रश्न जारी किए जा सकते हैं। चार अलग-अलग आकार के लैंग्वेज मॉडल्स पर, नई विधि ने लगातार मौजूदा दृष्टिकोणों से बेहतर प्रदर्शन किया। गणितीय बेंचमार्क पर, सिस्टम ने एक औसत सटीकता प्राप्त की जहाँ इसके द्वारा उत्पन्न किए गए लगभग 61 से 62 प्रतिशत समाधान सही थे, और इसने लगभग 78 प्रतिशत समस्याओं के लिए कम से कम एक सही उत्तर खोज निकाला। खोज कार्यों में, सुधार और भी स्पष्ट था, जिसमें नया तरीका औसतन 60 प्रतिशत से अधिक प्रश्नों के लिए सही उत्तर खोज रहा था, जो पिछले तरीकों की तुलना में एक महत्वपूर्ण उछाल है।
इस खोज का एक प्रमुख हिस्सा कई एजेंटों के योगदान को संतुलित करने के तरीके को समझना था। यदि सिस्टम केवल प्रत्येक एजेंट द्वारा किए गए परिवर्तनों को जोड़ देता, तो एक बड़ी टीम को एक छोटी टीम की तुलना में बहुत बड़ा प्रभाव पड़ता प्रतीत होता, केवल इसलिए क्योंकि वहां अधिक आवाजें थीं। शोधकर्ताओं ने समूह के योगदान को सामान्य (normalize) करके इस समस्या को हल किया, यह सुनिश्चित करते हुए कि पांच एजेंटों की टीम को केवल उसके आकार के कारण एक एकल एजेंट के विरुद्ध अनुचित रूप से भारित न किया जाए। उन्होंने यह भी प्रदर्शित किया कि सिस्टम इन मोड के बीच गतिशील रूप से स्विच करना सीख सकता है। कुछ मामलों में, सिस्टम ने सीखा कि एक एकल विशेषज्ञ एजेंट सबसे अच्छा विकल्प था, जबकि अन्य मामलों में, इसने एक छोटे समूह के एजेंटों को एक साथ काम करने के लिए सक्रिय किया। इस लचीलेपन का अर्थ था कि प्रशिक्षण प्रक्रिया को विभिन्न टीम संरचनाओं के लिए फिर से लिखने की आवश्यकता नहीं थी; उसी अंतर्नि प्रस्तुत तर्क ने दोनों परिदृश्यों को सहजता से संभाला।
अध्ययन ने इन सुधारों की लागत का भी बारीकी से निरीक्षण किया। शोधकर्ता यह सुनिश्चित करने के लिए सतर्क थे कि बेहतर परिणाम केवल इसलिए नहीं थे क्योंकि नई विधि अधिक टेक्स्ट उत्पन्न कर रही थी या अधिक कंप्यूटिंग पावर का उपयोग कर रही थी। उन्होंने उत्पन्न किए गए टोकन की संख्या और टूल कॉल की संख्या को मापा, और पाया कि सुधार बेहतर समन्वय से आए थे, न कि केवल अधिक शक्ति (brute force) से। वास्तव में, प्रशिक्षण प्रक्रिया अक्सर समय के साथ अधिक संक्षिप्त और कुशल प्रतिक्रियाओं की ओर ले गई। शोधकर्ताओं ने उल्लेख किया कि हालांकि परिणाम मजबूत थे, लेकिन वे विशिष्ट बेंचमार्क और अन्य प्रकाशित तरीकों के साथ तुलना पर आधारित थे, और भविष्य के कार्यों को यह पता लगाने की आवश्यकता होगी कि ये लाभ वास्तविक दुनिया के दीर्घकालिक कार्यान्वयन में कैसे टिके रहते हैं। फिर भी, मुख्य निष्कर्ष बना हुआ है: टीम के सामूहिक आउटपुट को क्रिया की मौलिक इकाई के रूप में परिभाषित करके, ऐसे मल्टी-एजेंट सिस्टम को प्रशिक्षित करना संभव है जो अधिक स्थिर, कुशल और जटिल समस्याओं को हल करने में प्रभावी हैं, चाहे वे अकेले काम कर रहे हों या एक साथ।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।