CANTANTE: Optimizing Agentic Systems via Contrastive Credit Attribution
CANTANTE एक नवीन फ्रेमवर्क है जो सिस्टम-स्तरीय पुरस्कारों को व्यक्तिगत एजेंटों के प्रति विरोधाभासी एट्रिब्यूशन (contrastive attribution) के माध्यम से क्रेडिट-असाइनमेंट समस्या को हल करके LLM-आधारित मल्टी-एजेंट सिस्टम को अनुकूलित करता है, जिससे विविध बेंचमार्क में प्रॉम्प्ट ऑप्टिमाइज़ेशन में अत्याधुनिक प्रदर्शन प्राप्त होता है और इन्फरेंस लागत कम होती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक कठिन पहेली को हल करने के लिए काम करने वाली तीन विशेषज्ञों की एक टीम है: एक प्लानर (Planner) जो चरणों का खाका खींचता है, एक कोडर (Coder) जो समाधान लिखता है, और एक वैलिडेटर (Validator) जो जाँचता है कि क्या यह काम करता है। यह वही है जिसे पेपर एक "मल्टी-एजेंट सिस्टम" (Multi-Agent System) कहता है।
लेखकों ने जिस समस्या की पहचान की है वह यह है: जब टीम विफल होती है, तो आपको पूरे समूह के लिए एक ही ग्रेड मिलता है (जैसे, "आपको C मिला")। लेकिन आपको यह नहीं पता चलता कि किसने गलती की। क्या प्लानर ने गलत निर्देश दिए? क्या कोडर ने कोई टाइपिंग की गलती की? या क्या वैलिडेटर किसी गलती को पहचानने में चूक गया?
पारंपरिक मशीन लर्निंग में, पूरी टीम को एक ही ग्रेड मिलता है, और सभी उस एकल स्कोर के आधार पर अपने व्यवहार को बदलने का प्रयास करते हैं। यह एक फुटबॉल टीम को यह बताने जैसा है, "आप खेल हार गए," और फिर गोलकीपर, स्ट्राइकर और रेफरी तीनों से उसी एक वाक्य के आधार पर अपनी रणनीतियों को बदलने के लिए कहना। यह अक्षम और भ्रमित करने वाला है।
समाधान: CANTANTE
लेखक एक नया फ्रेमवर्क पेश करते हैं जिसे CANTANTE कहा जाता है। CANTANTE को एक सुपर-स्मार्ट स्पोर्ट्स एनालिस्ट (खेल विश्लेषक) के रूप में समझें जो टीम को एक ही खेल को थोड़ी अलग-अलग रणनीतियों के साथ कई बार खेलते हुए देखता है, और फिर विस्तार से बताता है कि किसने जीत या हार में योगदान दिया।
यह इस प्रकार काम करता है, एक सरल उपमा का उपयोग करते हुए:
1. "क्या होगा अगर" का खेल (कॉन्ट्रास्टिव एट्रिब्यूशन - Contrastive Attribution)
टीम को केवल एक बार ग्रेड देने के बजाय, CANTANTE टीम को एक ही पहेली को लगातार तीन या चार बार चलाने के लिए कहता है।
- रन A: प्लानर एक सख्त लहजे का उपयोग करता है, कोडर एक तेज़ शैली का उपयोग करता है।
- रन B: प्लानर एक दोस्ताना लहजे का उपयोग करता है, कोडर उसी तेज़ शैली का उपयोग करता है।
- रन C: प्लानर एक सख्त लहजे का उपयोग करता है, कोडर एक धीमी शैली का उपयोग करता है।
इन रन को चलाने के बाद, टीम को प्रत्येक रन के लिए एक स्कोर मिलता है। अब, एट्रिब्यूटर (Attributor) (विश्लेषक) काम में आता है। यह अंतरों को देखता है:
- "रन A और रन B में, कोडर समान था, लेकिन प्लानर बदल गया। स्कोर बढ़ गया। इसलिए, प्लानर का नया लहजा मददगार था!"
- "रन A और रन C में, प्लानर समान था, लेकिन कोडर बदल गया। स्कोर कम हो गया। इसलिए, कोडर की नई शैली हानिकारक थी।"
इसे कॉन्ट्रास्टिव एट्रिब्यूशन (Contrastive Attribution) कहा जाता है। यह अंतिम स्कोर को देखने के बजाय, एक-दूसरे के साथ तुलना करके प्रत्येक व्यक्ति के योगदान को अलग करता है।
2. प्रत्येक एजेंट के लिए "क्रेडिट स्कोर"
एक बार जब विश्लेषक यह पता लगा लेता है कि किसने टीम की मदद की और किसने नुकसान पहुँचाया, तो वह प्रत्येक एजेंट को एक विशिष्ट क्रेडिट स्कोर ( -1 से +1 के बीच) देता है।
- यदि प्लानर को +0.8 मिलता है, तो सिस्टम जानता है कि प्लानर के निर्देशों को उस सफल संस्करण के अधिक समान बनाने के लिए ट्यून करना है।
- यदि कोडर को -0.5 मिलता है, तो सिस्टम जानता है कि कोडर को उस विशिष्ट शैली से दूर कैसे ले जाना है।
महत्वपूर्ण रूप से, पेपर का दावा है कि यह केवल वैश्विक स्कोर (global score) की नकल करने से बेहतर है। पुराने तरीके में, यदि टीम विफल हो जाती है, तो प्लानर को भी दोषी ठहराया जा सकता है भले ही प्लानर ने बहुत अच्छा काम किया हो और कोडर समस्या का कारण रहा हो। CANTANTE इसे यह कहकर ठीक करता है, "प्लानर ठीक था; कोडर को बदलने की आवश्यकता है।"
3. परिणाम: स्मार्ट टीमें, कम बर्बादी
लेखकों ने इसका परीक्षण तीन बहुत अलग प्रकार के "पहेलियों" पर किया:
- कोडिंग (MBDP): कंप्यूटर प्रोग्राम लिखना।
- गणित (GSM8K): वर्ड प्रॉब्लम्स (शब्द समस्याओं) को हल करना।
- रिसर्च (HotpotQA): जटिल प्रश्नों के उत्तर देना जिनके लिए कई स्थानों से जानकारी खोजने की आवश्यकता होती है।
निष्कर्ष:
- बेहतर स्कोर: CANTANTE ने लगातार अन्य तरीकों को पछाड़ दिया। कोडिंग कार्य पर, इसने अगली सबसे अच्छी विधि की तुलना में सटीकता में लगभग 19% का सुधार किया। गणित कार्य पर, इसमें 12.5% का सुधार हुआ।
- चलाने में सस्ता: आश्चर्यजनक रूप से, CANTANTE द्वारा अनुकूलित (optimized) टीमों को सही उत्तर पाने के लिए अधिक "सोचने" या अधिक कंप्यूटर पावर का उपयोग करने की आवश्यकता नहीं पड़ी। वास्तव में, कोडिंग और गणित कार्यों में, उन्होंने अन-ऑप्टिमाइज्ड टीमों की तुलना में कम संसाधनों (टोकन) का उपयोग किया।
- स्थिरता: यह तरीका केवल एक बार किस्मत से सफल नहीं हुआ; यह विभिन्न रैंडम स्टार्ट के साथ लगातार काम करता रहा।
यह क्यों मायने रखता है (पेपर के अनुसार)
पेपर का तर्क है कि इन AI टीमों को बनाना "अनुमान और जांच" (guess and check) का खेल नहीं होना चाहिए जहाँ मनुष्य मैन्युअल रूप से प्रॉम्प्ट को ट्यून करते हैं। इसके बजाय, इसे क्रेडिट असाइनमेंट (Credit Assignment) का विज्ञान होना चाहिए।
जिस तरह एक कोच तब पूरे दल पर चिल्लाता नहीं है जब एक खिलाड़ी शॉट मिस कर देता है, CANTANTE यह सुनिश्चित करता है कि AI सिस्टम ठीक से सीखे कि टीम के किस हिस्से को सुधार की आवश्यकता है। यह मल्टी-एजेंट सिस्टम के "ब्लैक बॉक्स" को एक पारदर्शी मशीन में बदल देता है जहाँ प्रत्येक एजेंट जानता है कि बेहतर कैसे बनना है।
संक्षेप में: CANTANTE एक ऐसा तरीका है जो AI टीमों को यह पूछकर अपनी गलतियों से सीखने में मदद करता है कि, "विशेष रूप से किसने इस परिणाम का कारण बनाया?" बजाय इसके कि केवल यह कहा जाए कि, "हम विफल रहे, और प्रयास करो।" यह अधिक स्मार्ट, अधिक कुशल और अधिक सटीक AI सिस्टम की ओर ले जाता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।