Who Deserves the Reward? SHARP: Shapley Credit-based Optimization for Multi-Agent System
यह शोध पत्र SHARP को प्रस्तुत करता है, जो एक नवीन ढांचा है जो Shapley-आधारित सीमांत-क्रेडिट पुरस्कारों का उपयोग करके योगदानों को सटीक रूप से आरोपित करता है, जिससे बड़े भाषा मॉडल (Large Language Models) वाले बहु-एजेंट प्रणालियों में क्रेडिट असाइनमेंट की चुनौती को संबोधित किया जाता है, और इस प्रकार प्रशिक्षण स्थिरता और प्रदर्शन में मौजूदा अत्याधुनिक विधियों से काफी बेहतर प्रदर्शन करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक उच्च-स्तरीय शोध टीम के प्रबंधक हैं। आपका लक्ष्य एक जटिल रहस्य को सुलझाना है, जैसे कि एक नए कंप्यूटर चिप के सटीक विनिर्देशों (specifications) को खोजना। आपके पास एक प्लानर (बॉस जो बड़े काम को छोटे कार्यों में तोड़ता है) और कई वर्कर्स (विशेषज्ञ जो वास्तव में काम करते हैं, जैसे वेब पर खोज करना या गणना करना) हैं।
अतीत में, जब यह टीम सफल या विफल होती थी, तो उनका पुरस्कार तंत्र बहुत ही सरल था। यदि टीम को सही उत्तर मिल जाता था, तो सभी को एक गोल्ड स्टार मिलता था। यदि वे विफल होते, तो सभी को एक रेड कार्ड मिलता था।
इससे एक बड़ी समस्या पैदा हुई: वास्तव में श्रेय किसे मिलना चाहिए?
- क्या प्लानर ने एक बेहतरीन रोडमैप दिया?
- क्या वर्कर A ने एक आदर्श लेख खोजा?
- क्या वर्कर B ने एक बेकार खोज में समय बर्बाद किया?
- क्या वर्कर C ने गणना में कोई त्रुटि की?
क्योंकि टीम को व्यक्तिगत प्रदर्शन के बावजूद एक ही पुरस्कार मिलता था, इसलिए उनकी "सीखने" की प्रक्रिया अव्यवस्त थी। प्लानर को यह नहीं पता चल पाता था कि उसकी रणनीति अच्छी थी या नहीं, और वर्कर्स को यह नहीं पता चल पाता था कि उनके विशिष्ट कार्य सहायक थे या हानिकारक। यह एक स्पोर्ट्स टीम की तरह था जहाँ पूरी टीम को जीत के लिए ट्रॉफी मिलती है, भले ही एक खिलाड़ी बार-बार गेंद से टकराकर गिर रहा हो।
SHARP से परिचय: एक "फेयर शेयर" (उचित हिस्सा) प्रणाली
यह पेपर एक नई विधि पेश करता है जिसे SHARP (Shapley Credit-based Optimization for Reinforcement Policy) कहा जाता है। SHARP को एक परिष्कृत अकाउंटिंग सिस्टम के रूप में समझें जो यह गणना करता है कि टीम के प्रत्येक सदस्य ने अंतिम परिणाम में वास्तव में कितना योगदान दिया है।
यहाँ बताया गया है कि SHARP कैसे काम करता है, एक सरल उपमा का उपयोग करते हुए:
1. तीन-भाग वाला स्कोरकार्ड
एक बड़ा इनाम देने के बजाय, SHARP टीम के प्रत्येक सदस्य के लिए स्कोर को तीन विशिष्ट भागों में विभाजित करता है:
- "क्या हम जीते?" बोनस (ग्लोबल एक्यूरेसी): यदि टीम रहस्य को सुलझा लेती है, तो सभी को एक आधार बोनस मिलता है। यह सभी को मुख्य लक्ष्य के साथ जोड़े रखता है।
- "क्या होता अगर?" बोनस (शापली क्रेडिट): यह जादुई हिस्सा है। SHARP एक काल्पनिक प्रश्न पूछता है: "क्या होता यदि हम इस विशिष्ट व्यक्ति को टीम से हटा देते?"
- यदि वर्कर A के बिना टीम विफल हो जाती, लेकिन उनके साथ सफल होती है, तो वर्कर A को एक बहुत बड़ा "मार्जिनल क्रेडिट" स्कोर मिलता है। वे अनिवार्य थे!
- यदि टीम वर्कर B के बिना भी उतनी ही अच्छी करती, या उससे भी बेहतर करती, तो वर्कर B को कम (या नकारात्मक) स्कोर मिलता। वे मदद नहीं कर रहे थे।
- यह शापली वैल्यूज (Shapley Values) नामक एक गणितीय अवधारणा पर आधारित है, जो पिज्जा को केवल समान रूप से बांटने के बजाय, इस आधार पर बांटने का एक निष्पक्ष तरीका है कि वास्तव में कौन कितना भूखा है।
- "क्या आपने अपना काम किया?" बोनस (टूल प्रोसेस): यह जांचता है कि क्या वर्कर्स ने वास्तव में अपने उपकरणों का सही उपयोग किया। यदि एक वर्कर ने कैलकुलेटर का उपयोग करने की कोशिश की लेकिन गलत फॉर्मूला टाइप कर दिया, तो वे यहाँ अंक खो देते हैं, भले ही भाग्यवश अंतिम उत्तर सही रहा हो।
2. "प्लानर बनाम वर्कर" का तालमेल
इस प्रणाली में, प्लानर और वर्कर्स को एक साझा मस्तिष्क (एक एकल लार्ज लैंग्वेज मॉडल) का उपयोग करके एक साथ प्रशिक्षित किया जाता है।
- प्लानर को इस आधार पर क्रेडिट मिलता है कि उनके द्वारा सौंपे गए वर्कर्स का प्रदर्शन कैसा रहा। यदि प्लानर किसी ऐसे वर्कर को कार्य सौंपता है जो विफल हो जाता है, तो प्लानर अगली बार बेहतर वर्कर्स चुनने के लिए सीखता है।
- वर्कर्स को इस आधार पर क्रेडिट मिलता है कि क्या उनके विशिष्ट कार्यों ने परिणाम को बदला।
3. परिणाम: एक बेहतर टीम
इस पेपर ने वास्तविक दुनिया की पहेलियों (जैसे जटिल गणितीय समस्याएं और वेब खोज) पर इस प्रणाली का परीक्षण किया। यहाँ उन्हें क्या पता चला:
- बेहतर प्रदर्शन: SHARP के साथ प्रशिक्षित टीमों ने पुराने तरीकों की तुलना में काफी अधिक समस्याओं को सही ढंग से हल किया। वे सिंगल-पर्सन टीमों की तुलना में लगभग 23% और अन्य मल्टी-पर्सन टीमों की तुलना में 14% बेहतर रहे।
- कम बर्बादी: सिस्टम ने "बुरे" व्यवहार को रोकना सीख लिया। इसने उन मामलों की संख्या को कम कर दिया जहाँ वर्कर्स बेकार या हानिकारक कार्य (जैसे गलत चीज़ की खोज करना) कर रहे थे, उन्हें फ़िल्टर करके।
- स्थिरता: प्रशिक्षण प्रक्रिया अधिक सुचारू थी। क्योंकि हर कोई ठीक जानता था कि उन्होंने क्या सही या गलत किया, इसलिए टीम भ्रमित नहीं हुई या गलत आदतों के चक्र में नहीं फंसी।
निचोड़
SHARP AI टीमों को प्रशिक्षित करने का एक नया तरीका है। टीम को एक एकल समूह के रूप में मानने के बजाय जिसे एक सामान्य इनाम मिलता है, यह एक निष्पक्ष रेफरी की तरह काम करता है जो हर चाल पर नज़र रखता है। यह पूछता है, "किसने वास्तव में अंतर पैदा किया?" और प्रत्येक एजेंट को तदनुसार पुरस्कृत (या सुधार) करता है। इससे अधिक स्मार्ट, अधिक कुशल टीमें बनती हैं जो बेकार कार्यों में समय बर्बाद किए बिना कठिन समस्याओं को हल कर सकती हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।