Skill Coverage: A Test Adequacy Metric for Agent Skills
यह शोध पत्र "स्किल कवरेज" (skill coverage) को प्रस्तुत करता है, जो एक टेस्ट पर्याप्तता मीट्रिक है जो यह मूल्यांकन करता है कि एजेंट के कौशल कितनी व्यापकता से प्रशिक्षित किए गए हैं, यह मापने के लिए कि एजेंट के प्रक्षेप पथों (trajectories) में प्रलेखित व्यवहार बाधाओं का अवलोकन किस सीमा तक किया जाता है, जिससे यह पता चलता है कि वर्तमान बेंचमार्क कार्य सफलता के बावजूद इन बाधाओं के 44% से भी कम हिस्से को कवर करते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपने एक जटिल भोजन पकाने के लिए एक अत्यधिक कुशल शेफ (AI एजेंट) को काम पर रखा है, जो एक विशिष्ट, पुन: प्रयोज्य रेसिपी कार्ड (एक एजेंट स्किल) का उपयोग करता है।
अतीत में, यह देखने के लिए कि क्या शेफ अच्छा था, हम केवल अंतिम व्यंजन को देखते थे। यदि भोजन स्वादिष्ट था और ग्राहक खुश था, तो हम मान लेते थे कि शेफ़ ने रेसिपी का पूरी तरह से पालन किया था। हमने सोचा, "बहुत बढ़िया काम! रेसिपी काम कर गई!"
लेकिन यह नया पेपर एक अलग सवाल पूछता है: सिर्फ इसलिए कि भोजन अच्छा था, क्या शेफ ने वास्तव में रेसिपी कार्ड के हर एक निर्देश का उपयोग किया था?
हो सकता कि रेसिपी में लिखा हो, "हमेशा तेज चाकू से प्याज काटें," लेकिन शेफ ने एक कुंद (dull) चाकू का उपयोग किया और फिर भी एक स्वादिष्ट भोजन बना दिया। या शायद इसमें लिखा था, "सॉस को 20 मिनट तक उबलने दें," लेकिन शेफ ने इसे केवल 5 मिनट तक उबाला और यह फिर भी ठीक लगा। हम केवल भोजन चखकर इन चीजों को नहीं जान पाएंगे।
समस्या: "अच्छा भोजन" का जाल (The "Good Meal" Trap)
लेखकों का तर्क है कि AI एजेंटों के लिए वर्तमान परीक्षण केवल अंतिम व्यंजन चखने के समान हैं। वे हमें बताते हैं कि कार्य सफलतापूर्वक पूरा हुआ या नहीं, लेकिन वे हमें यह नहीं बताते कि कौशल (skill) के कौन से हिस्से वास्तव में टेस्ट किए गए और किन हिस्सों को अनदेखा कर दिया गया।
यदि कोई AI एजेंट किसी कार्य को सफलतापूर्वक पूरा करता है, तो इसका मतलब यह नहीं है कि उसने अपने स्किल डॉक्यूमेंट में लिखे हर नियम, चेतावनी या चरण का अभ्यास किया है। हो सकता है कि वह केवल भाग्यशाली रहा हो या उसने कोई शॉर्टकट ढूंढ लिया हो।
समाधान: "स्किल कवरेज" (Skill Coverage)
यह पेपर टेस्टिंग को मापने का एक नया तरीका पेश करता है जिसे स्किल कवरेज कहा जाता है। केवल अंतिम परिणाम की जांच करने के बजाय, वे रेसिपी कार्ड को ही टेस्ट की जाने वाली चीज़ मानते हैं।
यहाँ बताया गया है कि वे इसे एक सरल उपमा (analogy) का उपयोग करके कैसे करते हैं:
रेसिपी को नियमों में तोड़ना: सबसे पहले, वे उस अव्यवस्थित, लंबी रेसिपी कार्ड को लेते हैं और उसे विशिष्ट, जांचने योग्य नियमों में तोड़ देते हैं।
- उदाहरण: "पास्ता पकाने" के पूरे पैराग्राफ के बजाय, वे एक विशिष्ट नियम निकालते हैं: "जब पानी उबाल रहे हों, तो एजेंट को पास्ता डालने से पहले नमक डालना चाहिए।"
- वे इन्हें स्किल बिहेवियर कंस्ट्रेंट्स (Skill Behavior Constraints) कहते हैं। वे फालतू बातों (जैसे "यह रेसिपी शेफ जॉन द्वारा 2026 में लिखी गई थी") को नजरअंदाज करते हैं और केवल उन वास्तविक निर्देशों पर ध्यान केंद्रित करते हैं जिनका एजेंट को पालन करना है।
"कवर्ड" बनाम "अनकवर्ड" की जाँच: इसके बाद, वे एजेंट को कार्य करते हुए देखते हैं। वे प्रत्येक नियम के लिए दो प्रश्न पूछते हैं:
- क्या वह स्थिति वास्तव में घटी? (जैसे, क्या एजेंट ने वास्तव में पानी उबालने की कोशिश की?)
- क्या हम सबूत देख सकते हैं? (जैसे, क्या एजेंट के लॉग ने दिखाया कि उसने नमक डाला, या उसने बिना किसी सबूत के केवल यह कह दिया कि "मैंने नमक डाल दिया"?)
यदि दोनों का उत्तर "हाँ" है, तो नियम कवर्ड (Covered) है। यदि एजेंट के सामने वह स्थिति कभी आई ही नहीं, या यदि वह आई भी तो उसने कोई पता लगाने योग्य सबूत नहीं छोड़ा, तो नियम अनकवर्ड (Uncovered) है।
महत्वपूर्ण रूप से: एक नियम कवर्ड हो सकता है भले ही एजेंट ने उसे गलत तरीके से किया हो। उद्देश्य यह देखना नहीं है कि वे पास हुए या नहीं; बल्कि यह देखना है कि क्या उन्होंने उस विशिष्ट निर्देश का उस तरह से प्रयास किया जिसे हम सत्यापित (verify) कर सकें।
उन्हें क्या पता चला
शोधकर्ताओं ने इसका परीक्षण SkillsBench नामक लोकप्रिय AI कार्यों के सेट पर किया। उन्होंने देखा कि विभिन्न AI मॉडल (जैसे Gemini, Claude, और Codex) अपने रेसिपी कार्ड का कितनी अच्छी तरह पालन करते हैं।
परिणाम आश्चर्यजनक थे:
- भले ही AI ने कार्य को सफलतापूर्वक पूरा किया, लेकिन उसने रेसिपी कार्ड के नियमों में से केवल लगभग 40% का ही "अभ्यास" या "कवरेज" किया।
- इसका मतलब है कि 60% निर्देश अनटेस्टेड रह गए। या तो AI ने उन्हें छोड़ दिया, या कार्य ने AI को उनका उपयोग करने के लिए मजबूर नहीं किया, या AI ने उन्हें किया लेकिन हमें देखने के लिए पर्याप्त सबूत नहीं छोड़े।
मुख्य निष्कर्ष (The Big Takeaway)
पेपर निष्कर्ष निकालता है कि सफलता गहन परीक्षण (Success Thorough Testing)।
सिर्फ इसलिए कि एक AI एजेंट ने सफलतापूर्वक काम पूरा कर लिया है, इसका मतलब यह नहीं है कि उसे उन सभी कौशलों पर कड़ाई से परखा गया है जिनका वह दावा करता है। यह उस ड्राइवर की तरह है जो समय पर काम पर तो पहुँच जाता है लेकिन यात्रा के दौरान कभी भी अपने इंडिकेटर का उपयोग नहीं करता या ब्लाइंड स्पॉट की जाँच नहीं करता। हम जानते हैं कि वह पहुँच गया, लेकिन हमें यह नहीं पता कि क्या उसने सभी सुरक्षा नियमों का पालन किया।
स्किल कवरेज एक नया उपकरण है जो हमें बताता है कि "रेसिपी" का वास्तव में कितना हिस्सा उपयोग और सत्यापित किया गया है, जिससे हमें इस बात की बहुत स्पष्ट तस्वीर मिलती है कि एक AI एजेंट वास्तव में कितना अच्छी तरह प्रशिक्षित है, न कि केवल यह कि उसने काम पूरा किया या नहीं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।