← नवीनतम पेपर
💬 NLP

Scaling Multiagent Systems with Process Rewards

यह शोध पत्र MAPPA को प्रस्तुत करता है, जो एक फाइन-ट्यूनिंग विधि है जो मल्टी-एजेंट सिस्टम में क्रेडिट असाइनमेंट और सैंपल एफिशिएंसी की चुनौतियों को हल करने के लिए AI फीडबैक से प्राप्त प्रति-एक्शन प्रोसेस रिवार्ड्स का लाभ उठाती है, जो जटिल गणित और डेटा विश्लेषण कार्यों पर महत्वपूर्ण प्रदर्शन सुधार प्रदर्शित करती है।

मूल लेखक: Ed Li, Junyu Ren, Cat Yan

प्रकाशित 2026-02-05
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ed Li, Junyu Ren, Cat Yan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही कठिन पहेली को हल करने के लिए तीन विशेषज्ञों की एक टीम है: एक प्रॉब्लम सॉल्वर (समस्या समाधानकर्ता) जो विचार सोचता है, एक कोड एक्जीक्यूटर (कोड निष्पादक) जो उन विचारों का परीक्षण करने के लिए उपकरण बनाता है, और एक वेरिफायर (सत्यापनकर्ता) जो अंतिम उत्तर की जाँच करता है।

अतीत में, यदि टीम विफल हो जाती थी, तो पूरी टीम को "थम्स डाउन" (अंगूठा नीचे) मिलता था, और यदि वे सफल होते थे, तो उन्हें "थम्स अप" (अंगूठा ऊपर) मिलता था। इससे यह जानना कठिन हो जाता था कि गलती किसने की। क्या विचारक के पास बुरा विचार था? क्या निर्माता ने गलत उपकरण का उपयोग किया? या क्या चेकर ने टाइपिंग की गलती छोड़ दी?

यह पेपर इन टीमों को प्रशिक्षित करने का एक नया तरीका पेश करता है जिसे MAPPA कहा जाता है। टीम के हर कदम को देखने और तत्काल फीडबैक देने के लिए एक AI कोच का उपयोग करके, यह पूरे समूह को अंत में ग्रेड देने के बजाय काम करता है।

यह कैसे काम करता है, यहाँ सरल उपमाओं के साथ दिया गया है:

1. समस्या: "ग्रुप ग्रेड" का जाल

एक रिले रेस की कल्पना करें जहाँ टीम को केवल अंत में एक स्कोर मिलता है। यदि वे हार जाते हैं, तो आप नहीं जान पाते कि पहले धावक ने बैटन गिरा दिया, दूसरे धावक ने ठोकर खाई, या तीसरे धावक ने गलत दिशा में दौड़ लगाई।

  • पेपर की चुनौती: मल्टी-एजेंट सिस्टम में, यदि अंतिम परिणाम गलत है, तो यह बताना कठिन होता है कि किसका दोष है। साथ ही, इन सिमुलेशन को चलाने में बहुत समय लगता है (जैसे एक फुल मैराथन चलाना), इसलिए आप केवल एक "थम्स अप" या "थम्स डाउन" प्राप्त करने के लिए उन्हें कई बार नहीं चला सकते।

2. समाधान: "AI कोच"

MAPPA एक AI कोच (एक स्मार्ट लैंग्वेज मॉडल) लाता है जो एक खेल को वास्तविक समय में देखने वाले स्पोर्ट्स कोच की तरह कार्य करता है।

  • हर खेल पर नज़र रखना: खेल के अंत का इंतज़ार करने के बजाय, कोच हर पास, दौड़ और टैकल को देखता है।
  • संदर्भ मायने रखता है: कोच प्रत्येक खिलाड़ी की भूमिका को जानता है। यदि "कोड एक्जीक्यूटर" एक ऐसी फ़ाइल खोलने की कोशिश करता है जिसे "प्रॉब्लम सॉल्वर" को बनाना चाहिए था, तो कोच जानता है कि गायब फ़ाइल के लिए प्रॉब्लम सॉल्वर को दोषी ठहराना है, न कि एक्जीक्यूटर को फ़ाइल खोलने में विफल होने के लिए।
  • सघन फीडबैक (Dense Feedback): कोच हर क्रिया के लिए एक स्कोर (0 से 10) देता है। इसका मतलब है कि टीम को एक लंबे कार्य के दौरान सैकड़ों छोटे सबक मिलते हैं, न कि केवल अंत में एक बड़ा ग्रेड।

3. प्रशिक्षण कैसे काम करता है

यह पेपर REINFORCE++ (एक प्रकार का लर्निंग एल्गोरिदम) का उपयोग करता है।

  • लूप: टीम एक समस्या को हल करने का प्रयास करती है (जैसे गणित प्रतियोगिता का प्रश्न या डेटा साइंस प्रोजेक्ट)।
  • समीक्षा: प्रत्येक चरण के बाद, AI कोच कहता है, "यह एक अच्छा कदम था," या "यह एक बुरा कदम था क्योंकि आप फ़ाइल सहेजना भूल गए।"
  • सबक: टीम इन स्कोर का उपयोग अपनी "मसल मेमोरी" (उनके आंतरिक वेट्स) को एडजस्ट करने के लिए करती है ताकि वे अगली बार बेहतर कदम उठा सकें।

4. परिणाम: क्या हुआ?

शोधकर्ताओं ने इसका परीक्षण दो बहुत अलग "खेलों" पर किया:

  • गणित प्रतियोगिताएं (AIME और AMC): टीम कठिन गणित समस्याओं को हल करने में काफी बेहतर हो गई।
    • उपमा: यह एक गणित टीम की तरह है जो पहले 30 में से 25 समस्याओं को हल करती थी, और अचानक स्टेप-बाय-स्टेप अपनी सोचने की प्रक्रिया को ठीक करने के बाद 30 में से 30 समस्याएं हल करने लगी।
  • डेटा साइंस पाइपलाइन्स (DSBench): टीम जटिल डेटा विश्लेषण वर्कफ़्लो (डेटा को साफ करना, मॉडल को प्रशिक्षित करना, भविष्यवाणियां करना) बनाना सीख गई।
    • उपमा: एक निर्माण दल (construction crew) की कल्पना करें जो घर बनाना सीख रहा है। पहले, वे दीवारें तो बना सकते थे लेकिन छत बनाना भूल जाते थे। कोच के साथ, उन्होंने सीखा कि यदि "डेटा इंजीनियर" नींव रखने के लिए भूल जाता है, तो "मॉडलर" दीवारें नहीं बना सकता। कोच ने उन्हें पहले नींव ठीक करना सिखाया।

5. यह एक बड़ी बात क्यों है

  • "ग्राउंड ट्रुथ" की आवश्यकता नहीं: आमतौर पर, AI को प्रशिक्षित करने के लिए, आपको एक सटीक उत्तर कुंजी की आवश्यकता होती है। MAPPA तब भी काम करता है जब आपके पास उत्तर कुंजी नहीं होती। कोच केवल तर्क का उपयोग करके कहता है, "यह कदम समझ में आता है," या "यह कदम भ्रमित करने वाला है।"
  • विशेषज्ञता (Specialization): क्योंकि प्रत्येक एजेंट को उनकी अपनी भूमिका के लिए विशिष्ट फीडबैक मिलता है, वे दूसरों को परेशान किए बिना अपने विशिष्ट कार्य में विशेषज्ञ बन जाते हैं।
  • दक्षता (Efficiency): चूंकि कोच हर कदम पर फीडबैक देता है, इसलिए टीम बहुत तेज़ी से सीखती है। उन्हें यह जानने के लिए सिमुलेशन को 100 बार चलाने की आवश्यकता नहीं है कि क्या गलत हुआ; कोच उन्हें तुरंत बता देता है।

सारांश

यह पेपर दिखाता है कि खेल के अंत में मिलने वाले एकल ग्रेड को एक रियल-टाइम AI कोच से बदलकर, जो हर चाल की आलोचना करता है, हम AI एजेंटों की टीमों को जटिल, लंबे कार्यों को बहुत बेहतर और तेज़ी से हल करने के लिए प्रशिक्षित कर सकते हैं। यह एक अराजक सामूहिक प्रयास को एक अच्छी तरह से प्रशिक्षित टीम में बदल देता है जहाँ सभी को पता होता है कि उन्हें कहाँ सुधार करने की आवश्यकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →