Evaluating Tool-Using Language Agents: Judge Reliability, Propagation Cascades, and Runtime Mitigation in AgentProp-Bench
यह शोधपत्र AgentProp-Bench प्रस्तुत करता है, जो एक मानव-सत्यापित बेंचमार्क है जो यह प्रकट करता है कि टूल-उपयोग करने वाले LLM एजेंटों के लिए स्वचालित जज अक्सर संयोग के स्तर (chance levels) पर प्रदर्शन करते हैं, यह लक्षणित करता है कि पैरामीटर इंजेक्शन त्रुटियां अंतिम उत्तरों तक कैसे प्रसारित होती हैं, और यह प्रदर्शित करता है कि रनटाइम शमन रणनीतियाँ विशिष्ट मॉडलों में मतिभ्रम (hallucinations) को महत्वपूर्ण रूप से कम कर सकती हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपने बहुत बुद्धिमान, लेकिन थोड़े अनाड़ी रोबोट सहायकों की एक टीम को काम पर रखा है। उनका काम उपकरणों के एक सेट का उपयोग करके समस्याओं को हल करना है, जैसे कि कैलेंडर ऐप, मौसम पूर्वानुमानकर्ता, या मेडिकल डेटाबेस। आप उनसे पूछते हैं, "कल के लिए एक मीटिंग बुक करें," और उन्हें यह करने के लिए कंप्यूटर में सही कमांड टाइप करने होते हैं।
यह पेपर इन रोबोटों को परखने का एक नया तरीका बताता है कि वे कितनी बार गलती करते हैं, वे क्यों गलती करते हैं, और क्या हम उन्हें विफल होने से पहले पकड़ने के लिए एक सुरक्षा जाल (safety net) बना सकते हैं।
यहाँ उनके निष्कर्षों का विवरण दिया गया है, जिसमें रोजमर्रा के उपमाओं (analogies) का उपयोग किया गया है।
1. समस्या: "खराब जज" (The Bad Judge)
लंबे समय तक, लोग इन रोबोट सहायकों का परीक्षण उनके अंतिम उत्तर को देखकर और यह जाँचकर करते थे कि उसमें सही कीवर्ड्स शामिल हैं या नहीं।
- पुराना तरीका: यदि रोबोट को कहना था "लंदन में मौसम धूप वाला है," और उसने कहा "लंदन में मौसम बहुत धूप वाला है," तो पुराना परीक्षण कहता, "बहुत बढ़िया! आपने इसे सही कर लिया।"
- वास्तविकता: शोधकर्ताओं ने पाया कि यह तरीका मूल रूप से सिक्का उछालने (flipping a coin) जैसा है। यह इतना अविश्वसनीय है कि यह मानव विशेषज्ञों के साथ केवल 5% समय सहमत होता है (जो कि रैंडम अनुमान लगाने से भी बदतर है)। यह एक शिक्षक की तरह है जो गणित के टेस्ट को केवल इसलिए ग्रेड देता है क्योंकि छात्र ने पेज पर कहीं भी संख्या "5" लिख दी है, इस बात को नजरअंदाज करते हुए कि क्या गणित वास्तव में सही था।
समाधान: उन्होंने एक "सुपर-जज पैनल" बनाया जो उत्तरों पर वोट देने के लिए तीन अलग-अलग AI मॉडल से बना है। यह पैनल बहुत बेहतर है (मानव के साथ लगभग 43% सहमति), लेकिन यह भी पूर्ण नहीं है। यह एक "सख्त शिक्षक" की तरह व्यवहार करता है, अक्सर उत्तरों को गलत घोषित कर देता है, भले ही वे वास्तव में ठीक हों।
2. प्रयोग: "तोड़फोड़ परीक्षण" (The Sabotage Test)
गलतियाँ कैसे फैलती हैं, यह देखने के लिए, शोधकर्ताओं ने केवल रोबोटों के स्वाभाविक रूप से गलती करने का इंतज़ार नहीं किया। उन्होंने जानबूझकर उन्हें सबोटेज (sabotage/तोड़फोड़) किया।
- उपमा: कल्पना कीजिए कि एक शेफ (रोबोट) सूप बना रहा है। शोधकर्ताओं ने शेफ के खाना शुरू करने से पहले ही नमक की जगह चीनी बदल दी।
- प्रश्न: क्या शेफ उस चीनी को नोटिस करता है और उसे ठीक करता है? या क्या शेफ खाना बनाना जारी रखता है, मीठा सूप परोसता है, और आपसे कहता है कि यह स्वादिष्ट है?
उन्होंने पाया कि जब उन्होंने एक महत्वपूर्ण जानकारी को बदला (जैसे मौसम संबंधी क्वेरी में "लंदन" को "मैनचेस्टर" में बदलना):
- 62% बार, रोबोट ने बदलाव को नोटिस नहीं किया। उसने गलत जानकारी का उपयोग किया, बाकी का काम किया, और आपको आत्मविश्वास के साथ गलत उत्तर दे दिया।
- "डोमिनो प्रभाव" (The Domino Effect): एक बार जब रोबोट ने वह पहली छोटी सी गलती की, तो वह शायद ही कभी सुधर पाया। यह एक डोमिनो गिरने जैसा था; एक बार जब पहला गिरा, तो पूरी लाइन ढह गई।
3. दो अलग-अलग कौशल: "बाउंसर" बनाम "डिटेक्टिव"
शोधकर्ताओं ने पाया कि त्रुटियों के मामले में रोबोटों के पास दो पूरी तरह से अलग कौशल होते हैं, और एक में अच्छा होने का मतलब यह नहीं है कि आप दूसरे में भी अच्छे हैं।
- कौशल A: बाउंसर (Rejection): यह रोबोट की क्षमता है कि वह कहे, "रुको, यह टूल कॉल अजीब लग रहा है। मैं इसे नहीं भेज रहा हूँ।"
- उदाहरण: एक रोबोट (Gemini) एक बहुत ही सख्त बाउंसर था। उसने 95% खराब इनपुट को इमारत से बाहर जाने से पहले ही पकड़ लिया।
- कौशल B: डिटेक्टिव (Recovery): यह रोबोट की क्षमता है कि वह महसूस करे, "ओह नहीं, मैंने पहले ही गलत अनुरोध भेज दिया है। क्या मैं फिर भी अंतिम उत्तर को ठीक कर सकता हूँ?"
- उदाहरण: दूसरा रोबोट (GPT-4o-mini) एक बहुत ही बुरा डिटेक्टिव था। भले ही उसने एक गलत अनुरोध को जाने दिया हो, वह लगभग कभी भी अंतिम परिणाम को ठीक करने का तरीका नहीं खोज पाया।
बड़ी हैरानी: एक बेहतरीन बाउंसर होना आपको एक अच्छा डिटेक्टिव नहीं बनाता। आपके पास एक ऐसा रोबोट हो सकता है जो त्रुटियों को रोकने में उत्कृष्ट है लेकिन उन्हें ठीक करने में बहुत खराब है, या इसके विपरीत। इसका मतलब है कि हम केवल यह नहीं कह सकते कि एक रोबोट "स्मार्ट" है; हमें इन दोनों कौशलों का अलग-अलग परीक्षण करना होगा।
4. सुरक्षा जाल: "रनटाइम इंटरसेप्टर" (The Runtime Interceptor)
टीम ने एक "सुरक्षा जाल" (जिसे इंटरसेप्टर कहा जाता है) बनाया है जो रोबोट को काम करते समय देखता रहता है। यह एक सुरक्षा गार्ड की तरह है जो शेफ के बगल में खड़ा है, रेसिपी और सामग्री को पढ़ते हुए जा रहा है।
- यह कैसे काम करता है: यदि रोबोट एक अजीब पैरामीटर के साथ किसी टूल का उपयोग करने की कोशिश करता है, या यदि रोबोट के आंतरिक विचार भ्रमित करने वाले लगते हैं ("मुझे यकीन नहीं है," "यह गलत लग रहा है"), तो गार्ड ब्रेक लगा देता है।
- परिणाम:
- उस रोबोट के लिए जो एक "खराब डिटेक्टिव" था (GPT-4o-mini), सुरक्षा जाल ने 23% अधिक त्रुटियों को पकड़ा। इसने स्थिति को संभाल लिया!
- उस रोबोट के लिए जो पहले से ही एक "सुपर बाउंसर" था (Gemini), सुरक्षा जाल ने कुछ नहीं किया। क्यों? क्योंकि रोबोट पहले से ही त्रुटियों को रोक रहा था, इससे पहले कि गार्ड को देखने का मौका मिलता। गार्ड अनावश्यक था।
5. मुख्य सीख (The Takeaway)
यह पेपर हमें भविष्य के AI के लिए तीन मुख्य बातें सिखाता है:
- कीवर्ड चेक का उपयोग बंद करें: जटिल रोबोट कार्यों को परखने के लिए वे बेकार हैं। हमें उन्हें ग्रेड देने के लिए स्मार्ट, मानव-सत्यापित तरीकों की आवश्यकता है।
- गलतियाँ तेजी से फैलती हैं: यदि कोई रोबोट एक छोटी सी जानकारी भी गलत प्राप्त करता है, तो यह आमतौर पर पूरे उत्तर को खराब कर देता है। हमें त्रुटियों को जल्दी पकड़ने की आवश्यकता है।
- एक ही आकार सबके लिए उपयुक्त नहीं है (One size does not fit all): कुछ रोबोट त्रुटियों को रोकने में अच्छे होते हैं, अन्य उन्हें ठीक करने में। और सुरक्षा जाल तभी काम करते हैं जब रोबोट को वास्तव में उनकी आवश्यकता हो।
संक्षेप में: हम केवल रोबोटों पर उनके काम करने के लिए भरोसा नहीं कर सकते। हमें उन्हें "तोड़फोड़" (sabotage) के साथ परखने, उन्हें मानव-समान जजों से ग्रेड देने और ऐसे सुरक्षा जाल बनाने की आवश्यकता है जो विशेष रूप से रोबोट की कमजोरियों के अनुरूप हों।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।