Not All Skills Help: Measuring and Repairing Agent Knowledge
यह शोध पत्र ASSAY को प्रस्तुत करता है, जो एक ऐसा ढांचा (framework) है जो विशिष्ट कार्यों पर नकारात्मक कारण प्रभाव (negative causal effects) डालने वाले व्यक्तिगत कौशलों को अनुभवजन्य रूप से मापकर और उन्हें चुनिंदा रूप से दबाकर LLM एजेंट के प्रदर्शन में सुधार करता है, जिससे बिना वेट अपडेट के अत्याधुनिक परिणाम प्राप्त होते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
मुख्य विचार: "गलत सलाह" की समस्या
कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान लेकिन अनुभवहीन सहायक (एक AI एजेंट) को घर के काम करने का तरीका सिखा रहे हैं। आप उसे कहते हैं, "यहाँ 10-100 सुझावों की एक सूची है जो मैंने इन कार्यों को करते समय सीखे हैं।"
AI के काम करने का वर्तमान तरीका यह है कि वह इस सूची पर पूरी तरह भरोसा करता है। वह यह मान लेता है कि यदि कोई सुझाव एक कार्य के लिए अच्छा था, तो वह हर कार्य के लिए अच्छा होगा। वह हर नए काम को शुरू करने से पहले पूरी सूची पढ़ लेता है।
यह शोध पत्र तर्क देता है कि यह एक गलती है। सिर्फ इसलिए कि एक सुझाव आपको केक बनाने में मदद करता है, इसका मतलब यह नहीं है कि वह आपको लीक होता पाइप ठीक करने में मदद करेगा। वास्तव में, पाइप ठीक करने की कोशिश करते समय "बेकिंग टिप्स" पढ़ना आपको विचलित कर सकता है और आपको असफल बना सकता है।
लेखक इसे "कॉज़ल हेट्रोजेनिटी" (Causal Heterogeneity) कहते हैं। सरल भाषा में: एक कौशल जो एक कार्य में मदद करता है, अक्सर दूसरे कार्य में नुकसान पहुँचाता है।
समाधान: ASSAY (द "स्किल फ़िल्टर")
शोधकर्ताओं ने ASSAY नामक एक नया सिस्टम बनाया है। इसे AI के निर्देश मैनुअल के लिए एक स्मार्ट संपादक (editor) के रूप में समझें। AI के निर्णय पर आँख मूँदकर भरोसा करने के बजाय, ASSAY हर एक सुझाव का परीक्षण करने के लिए एक वैज्ञानिक प्रयोग का उपयोग करता है।
ASSAY कैसे काम करता है, इसके तीन सरल चरण यहाँ दिए गए हैं:
1. "रैंडमाइज्ड मास्किंग" प्रयोग (स्वाद परीक्षण)
कल्पना कीजिए कि आपके पास 50 सामग्रियों वाला एक सूप है। आप जानना चाहते हैं कि क्या "कैयेन पेपर" (cayenne pepper) वास्तव में स्वाद में मदद कर रहा है।
- पुराना तरीका: आप शेफ से पूछते हैं, "क्या आपको कैयेन पसंद है?" शेफ कहता है, "हाँ, यह तीखा है!" (लेकिन शायद शेफ को बस तीखा खाना पसंद है)।
- ASSAY का तरीका: आप एक ब्लाइंड टेस्ट (blind taste test) करते हैं।
- आप सूप के 12 कटोरे बनाते हैं।
- कुछ कट ओरों में, आप कैयेन शामिल करते हैं। दूसरों में, आप इसे छोड़ देते हैं।
- आप उन सभी को चखते हैं।
- परिणाम: आप गणना करते हैं कि औसतन कैयेन ने सूप में कितनी मदद की या कितना नुकसान पहुँचाया।
इस शोध पत्र में, वे इसे AI कार्यों के साथ करते हैं। वे यादृच्छिक रूप से (randomly) अलग-अलग "कौशल" (सुझाव) को छिपा देते हैं और देखते हैं कि AI सफल होता है या विफल। इससे उन्हें प्रत्येक कौशल के लिए एक स्कोर मिलता है:
- ग्रीन स्कोर: यह कौशल मदद करता है।
- रेड स्कोर: यह कौशल नुकसान पहुँचाता है।
- जाल (The Trap): कुछ कौशलों का स्कोर शून्य होता है क्योंकि वे 50% कार्यों में मदद करते हैं और अन्य 50% में नुकसान पहुँचाते हैं। एक साधारण पर्यवेक्षक के लिए, वे बेकार दिखते हैं। लेकिन ASSAY के लिए, वे खतरनाक दिखते हैं क्योंकि वे अप्रत्याशित हैं।
2. "ऑफलाइन रीस्ट्रक्चरिंग" (मैनुअल को संपादित करना)
एक बार स्कोर मिल जाने के बाद, वे कौशलों की लाइब्रेरी को साफ करते हैं:
- विभाजन (Split): यदि कोई कौशल "कभी अच्छा, कभी बुरा" है, तो वे उसे फिर से लिखते हैं। वे "हमेशा संपर्क चेक करें" को बदलकर "बिल बांटते समय ही संपर्क चेक करें" कर देते हैं।
- रिटायर (Retire): यदि कोई सुझाव उबाऊ है और कभी मदद नहीं करता (स्कोर शून्य के करीब है), तो वे उसे फेंक देते हैं।
- विलय (Merge): यदि उनके पास दो ऐसे सुझाव हैं जो एक ही बात कहते हैं, तो वे उन्हें मिला देते हैं।
3. "पर-टास्क मास्किंग" (दरवाजे पर स्मार्ट फ़िल्टर)
यह सबसे महत्वपूर्ण हिस्सा है। मैनुअल को साफ करने के बाद भी, AI हर काम के लिए पूरी चीज़ नहीं पढ़ता है।
- परिदृश्य: आप कॉफी ग्राइंडर खरीदने जा रहे हैं।
- समस्या: आपके मैनुअल में "Spotify प्लेलिस्ट चेक करने" का एक टिप है। यदि AI ग्राइंडर खरीदते समय इसे पढ़ता है, तो वह विचलित हो जाता है और असफल हो जाता है।
- ASSAY का समाधान: AI कार्य शुरू करने से पहले, ASSAY कार्य के विवरण को देखता है। यह पूछता है, "हमारे पिछले प्रयोगों के आधार पर, कौन से कौशल इस विशिष्ट कार्य के लिए नुकसानदेह होंगे?"
- कार्रवाई: यह चुपचाप Spotify वाले टिप को ब्लॉक (mask) कर देता है। यह केवल "Amazon साइज-चेक" वाले टिप को ही आगे जाने देता है।
यह क्यों मायने रखता है (परिणाम)
शोधकर्ताओं ने दो बड़े चुनौतियों पर इसका परीक्षण किया: AppWorld (ऐप उपयोग का अनुकरण) और τ-bench (ग्राहक सेवा का अनुकरण)।
- "पहले" की स्थिति: कौशलों की एक बड़ी लाइब्रेरी जोड़ने से अक्सर कठिन कार्यों पर AI और खराब हो जाता था क्योंकि वह अप्रासंगिक सुझावों से भ्रमित हो जाता था।
- "बाद" की स्थिति: प्रत्येक विशिष्ट कार्य के लिए खराब सुझावों को फ़िल्टर करने के लिए ASSAY का उपयोग करके:
- DeepSeek-V3 (एक शक्तिशाली AI) AppWorld पर असफल होने से बदलकर दुनिया का सबसे बेहतरीन बन गया, जिसने उन मॉडल्स को भी पीछे छोड़ दिया जिन्हें भारी री-ट्रेनिंग (जिसमें बहुत अधिक काम लगता है) की आवश्यकता थी।
- GPT-4.1 रिटेल टेस्ट के लीडरबोर्ड पर उछल गया, जिसने o1 और o4-mini जैसे अन्य शीर्ष मॉडलों को पछाड़ दिया, और यह सब कोड की एक भी लाइन बदले बिना किया।
मुख्य निष्कर्ष
यह शोध पत्र सिद्ध करता है कि अधिक कौशल हमेशा बेहतर नहीं होते।
इसे एक टूलबॉक्स की तरह समझें। यदि आप एक बढ़ई को हथौड़ा, आरी और रिंच देते हैं, तो वे घर बना सकते हैं। लेकिन यदि आप उन्हें एक टेनिस रैकेट, एक फ्राइंग पैन और एक जोड़ी स्की भी दे देते हैं, तो वे भ्रमित हो सकते हैं और हथौड़ा गिरा सकते हैं।
ASSAY वह सिस्टम है जो काम (घर बनाना) को देखता है और कहता है, "ठीक है, उन्हें हथौड़ा और आरी दो। स्की और फ्राइंग पैन को छिपा दो।" इसे बढ़ई को फिर से बनाने की ज़रूरत नहीं है; इसे बस उनके द्वारा पकड़े गए औजारों को व्यवस्थित करने की ज़रूरत है।
मुख्य खोज: सबसे बड़ी बाधा यह नहीं है कि AI के पास कौशलों की कमी है; बल्कि यह है कि AI को यह नहीं पता कि किस काम के लिए कौन से कौशल का उपयोग करना है। ASSAY इसी बेमेल (mismatch) को ठीक करता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।