MASPRM: Multi-Agent System Process Reward Model
यह शोध पत्र MASPRM को प्रस्तुत करता है, जो टर्मिनल परिणामों पर प्रशिक्षित एक मल्टी-एजेंट सिस्टम प्रोसेस रिवॉर्ड मॉडल है जो मध्यवर्ती एजेंट संदेशों को स्कोर करने के लिए है, जो प्रभावी स्टेप-लेवल बीम सर्च और मोंटे कार्लो ट्री सर्च को सक्षम करके मौजूदा मॉडलों की तुलना में रीजनिंग बेंचमार्क पर इन्फरेंस-टाइम सर्च प्रदर्शन में महत्वपूर्ण सुधार करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक बहुत ही कठिन पहेली को हल करने की कोशिश कर रहे हैं, जैसे कि कोई जटिल गणितीय समस्या या तर्क वाली पहेली। आर्टिफिशियल इंटेलिजेंस की दुनिया में, हमारे पास "लार्ज लैंग्वेज मॉडल्स" (LLMs) हैं जो बहुत बुद्धिमान, लेकिन कभी-कभी बिखरे हुए छात्रों की तरह होते हैं। यदि आप उनसे कोई कठिन प्रश्न पूछते हैं, तो वे उसे एक बार में ही हल करने की कोशिश कर सकते हैं, लेकिन वे अक्सर बीच में ही अटक जाते हैं या शुरुआत में ही कोई गलती कर देते हैं और गलत रास्ते पर चलते रहते हैं। इसे ठीक करने के लिए, वैज्ञानिकों ने "मल्टी-एजेंट सिस्टम्स" का उपयोग करना शुरू कर दिया है। इसे एक अकेले काम करने वाले छात्र के रूप में नहीं, बल्कि एक स्टडी ग्रुप (अध्ययन समूह) के रूप में सोचें। आपके पास एक "रीडर" (पठनकर्ता) है जो प्रश्न पढ़ता है, एक "प्लानर" (योजनाकार) है जो रणनीति बनाता है, एक "सॉल्वर" (समाधानकर्ता) है जो गणित करता है, और एक "वेरिफायर" (सत्यापनकर्ता) है जो काम की जाँच करता है। वे एक विशिष्ट क्रम में एक-दूसरे को नोट्स भेजते हैं।
हालाँकि, इसमें एक पेच है। यदि आप इस स्टडी ग्रुप को बेतहाशा दौड़ने देते हैं, तो वे बहुत सारा समय और ऊर्जा (कंप्यूटिंग पावर) उन विचारों पर बहस करने में बर्बाद कर सकते हैं जो पहले से ही गलत हैं। यह दोस्तों के एक समूह की तरह है जो एक रहस्य सुलझाने की कोशिश कर रहे हैं, लेकिन वे एक गलत सुराग (red herring) के पीछे भागते रहते हैं क्योंकि किसी ने रुककर यह नहीं कहा, "रुको, यह सुराग समझ में नहीं आ रहा है।" इसे रोकने के लिए, शोधकर्ता "सर्च एल्गोरिदम" का उपयोग करते हैं जैसे कि मोंटे कार्लो ट्री सर्च (MCTS)। यह एक कोच की तरह है जो कहता है, "अगले कदम के लिए पाँच अलग-अलग रास्ते आज़माओ, देखो कौन सा सबसे अधिक आशाजनक लग रहा है, और फिर उसी पर ध्यान केंद्रित करो।" लेकिन यहाँ बड़ी समस्या यह है कि कोच को कैसे पता चलता है कि कौन सा रास्ता आशाजनक है? आमतौर पर, कोच को केवल यह पता चलता है कि अंतिम उत्तर सही है या गलत। उन्हें यह नहीं पता होता कि बीच के चरण अच्छे थे या नहीं। यह पेपर कोच को खेल के बीच में बेहतर निर्णय लेने में मदद करने के लिए एक नया उपकरण पेश करता है।
द पेपर: MASPRM
इस पेपर के पीछे के शोधकर्ता, जो यूनिवर्सिटी ऑफ ब्रिटिश कोलंबिया और हुआवेई (Huawei) से हैं, ठीक इसी समस्या से निपट रहे हैं। उन्होंने MASPRM (मल्टी-एजेंट सिस्टम प्रोसेस रिवॉर्ड मॉडल) नामक कुछ बनाया है। आप MASPRM को एक "सुपर कोच" या "प्रोसेस जज" के रूप में देख सकते हैं जो केवल यह देखने के लिए नहीं रुकता कि समूह सफल हुआ या नहीं, बल्कि यह भी देखता है कि समूह की बातचीत चल रही है और हर एक नोट को स्कोर देता है जो वे एक-दूसरे को भेजते हैं।
अतीत में, यदि एक AI टीम ने तीसरे चरण में गलती की, तो सिस्टम को तब तक पता नहीं चलता था जब तक अंत में अंतिम उत्तर गलत नहीं हो जाता था। तब तक, AI ने उस गलत रास्ते को खोजने में बहुत सारी ऊर्जा बर्बाद कर दी होती थी। MASPRM खेल बदल देता है। यह "रूटेड ट्रांसक्रिप्ट" (routed transcript) को देखता है—जो वास्तव में उन संदेशों की क्रमबद्ध सूची है जो एजेंटों ने एक-दूसरे को भेजे हैं। यह इन संदेशों को स्कोर देता है ताकि कह सके, "हे, प्लानर का यह विशिष्ट संदेश एक शानदार विचार था, चलिए आगे बढ़ते हैं," या "सॉल्वर का यह संदेश हमें कहीं नहीं ले जा रहा है, आइए इस शाखा को तुरंत काट दें।"
उन्होंने कोच को कैसे सिखाया
इस पेपर का सबसे दिलचस्प हिस्सा यह है कि उन्होंने इस सुपर कोच को कैसे प्रशिक्षित किया। आमतौर पर, कंप्यूटर को चरणों को परखना सिखाने के लिए, आपको एक इंसान की आवश्यकता होती है जो हर एक चरण को "अच्छा" या "बुरा" के रूप में लेबल करे। यह अविश्वसनीय रूप से महंगा और धीमा है। लेखकों ने एक चतुर शॉर्टकट खोजा। उन्होंने AI एजेंटों को MCTS नामक एक सर्च विधि का उपयोग करके हजारों सिमुलेशन चलाने दिया। इन सिमुलेशन में, एजेंट कई अलग-अलग रास्तों का पता लगाते थे। प्रत्येक पथ के बिल्कुल अंत में, उन्हें पता चल जाता था कि उत्तर सही (+1) है या गलत (-1)।
फिर, उन्होंने "बैकप्रोपैगेशन" (backpropagation) नामक एक गणितीय ट्रिक का उपयोग किया। एक पेड़ की कल्पना करें जहाँ पत्तियाँ अंतिम परिणाम हैं। यदि एक पत्ती "जीत" है, तो उस जीत का मूल्य शाखाओं के माध्यम से ऊपर की ओर बढ़ता है, जिससे शुरुआती चरण मूल्यवान लगने लगते हैं। यदि एक पत्ती "हार" है, तो उसका मूल्य नकारात्मक रूप के रूप में ऊपर की ओर बढ़ता है। MASPRM ने बिना किसी इंसान के यह कहे कि "यह चरण अच्छा था," केवल बातचीत के इतिहास को देखकर इन मूल्यों की भविष्यवाणी करना सीख लिया। इसने यह सीखने के लिए कि कौन सी बातचीत आशाजनक है और कौन सी अंतहीन बहस है, केवल यह देखकर कि कौन सी अंततः सही उत्तर की ओर ले जाती है।
उन्होंने क्या पाया
टीम ने इस नए कोच का परीक्षण चार प्रसिद्ध बेंचमार्क पर किया: GSM8K और MATH (गणित समस्याओं के लिए), और MMLU और LOGIQA (सामान्य ज्ञान और तर्क के लिए)। उन्होंने MASPRM की तुलना दो अन्य विधियों से की:
- पॉलिसी लाइकलीहुड (Policy Likelihood): यह ऐसा है जैसे AI बस यह अनुमान लगा रहा है, "मुझे लगता है कि अगला शब्द संभवतः यह होगा," बिना किसी वास्तविक लक्ष्य की समझ के।
- ORM (आउटकम रिवॉर्ड मॉडल): यह पुराना कोच है जो केवल अंतिम उत्तर की जाँच करता है, बीच के चरणों को अनदेखा करता है।
परिणाम काफी स्पष्ट थे। जब शोधकर्ताओं ने खोज को निर्देशित करने के लिए MASPRM का उपयोग किया (विशेष रूप से MCTS और स्टेप-लेवल बीम सर्च नामक विधि का उपयोग करके), तो AI समस्याओं को हल करने में काफी बेहतर हो गया।
- 1.5 बिलियन पैरामीटर वाले मॉडल (एक छोटा, तेज़ AI) पर, MASPRM ने पुराने आउटकम रिवॉर्ड मॉडल की तुलना में सफलता दर में 2.0 से 3.0 अंक का सुधार किया।
- 7 बिलियन पैरामीटर वाले मॉडल (एक बड़ा, अधिक बुद्धिमान AI) पर, सुधार बहुत बड़ा था, जो 4.1 से 14.5 अंक तक उछल गया।
- सबसे कठिन टेस्ट (GSM8K) में, 7B मॉडल और MASPRM के संयोजन ने 82.9% का Hit@1 प्राप्त किया, जिसका अर्थ है कि इसने पहली बार में ही लगभग 83% बार सही उत्तर दिया।
पेपर सुझाव देता है कि MASPRM "स्टेपवाइज सर्च" (चरणवार खोज) के लिए विशेष रूप से अच्छा है। यह तब होता है जब AI को निर्णयों की एक श्रृंखला लेनी होती है, जैसे कि यह चुनना कि अगला एजेंट कौन बोलेगा या अगला वाक्य क्या होगा। क्योंकि MASPRM इन मध्यवर्ती चरणों का निर्णय ले सकता है, यह AI को खराब विचारों पर समय बर्बाद करने से रोकता है। इसने AI के विकल्पों को अधिक विश्वसनीय भी बनाया; "सर्वश्रेष्ठ" अनुमान और "पांचवें सर्वश्रेष्ठ" अनुमान के बीच का अंतर कम हो गया, जिसका अर्थ है कि AI अपने शीर्ष विकल्पों में अधिक आश्वस्त था।
सीमाएं और भविष्य
लेखक सावधानी से नोट करते हैं कि यह कोई जादुई छड़ी नहीं है जो सब कुछ ठीक कर देती है। उनका सिस्टम तब सबसे अच्छा काम करता है जब एजेंटों का एक निश्चित शेड्यूल (जैसे कि कौन कब बोलता है इसका सख्त क्रम) होता है और जब अंतिम उत्तर को स्पष्ट रूप से जांचा जा सकता है (जैसे कि एक गणित की समस्या जिसमें एक विशिष्ट संख्या होती है)। वे स्वीकार करते हैं कि खुले अंत वाले कार्यों के लिए जहाँ कोई एक एकल "सही" उत्तर नहीं है, या ऐसे सिस्टम के लिए जहाँ एजेंट गतिशील रूप से भूमिकाएँ बदलते हैं, इस पद्धति पर अभी भी काम किया जा रहा है। उन्होंने यह भी पाया कि यदि कोच केवल वही देखता है जो एक एजेंट देखता है (पूरे समूह की बातचीत के बजाय), तो यह उतना अच्छा काम नहीं करता है, जो यह सुझाव देता है कि सर्वोत्तम प्रदर्शन के लिए टीम की चैट का "ग्लोबल व्यू" (वैश्विक दृश्य) होना महत्वपूर्ण है।
संक्षेप में, MASPRM AI टीमों को वास्तविक समय में खुद को सुधारने के तरीके सिखाने में एक बड़ी उपलब्धि है। अंत तक प्रतीक्षा करने के बजाय कि वे गलत थे, अब उनके पास एक कोच है जो एक खराब रास्ते को जल्दी पहचान सकता है और टीम को वापस सही रास्ते पर ला सकता है, जिससे समय बचता है और बेहतर परिणाम मिलते हैं। यह सुझाव देता है कि जटिल तर्क कार्यों के लिए, रहस्य केवल एक बड़ा दिमाग होने में नहीं है, बल्कि चल रही सोच प्रक्रिया को बेहतर तरीके से निर्देशित करने के तरीके में है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।