← नवीनतम पेपर
💬 NLP

How Well Do Agentic Skills Work in the Wild: Benchmarking LLM Skill Usage in Realistic Settings

यह शोध पत्र यथार्थवादी सेटिंग्स में LLM एजेंट कौशल का पहला व्यापक बेंचमार्क प्रस्तुत करता है, जो यह प्रकट करता है कि कौशलों से होने वाले प्रदर्शन लाभ नाजुक हैं और महत्वपूर्ण रूप से घट जाते हैं जब एजेंटों को बड़े संग्रहों से स्वायत्त रूप से पुनर्प्राप्त (retrieve) करना पड़ता है, हालांकि क्वेरी-विशिष्ट परिशोधन रणनीतियाँ इस खोए हुए प्रदर्शन को काफी हद तक पुनः प्राप्त कर सकती हैं।

मूल लेखक: Yujian Liu, Jiabao Ji, Li An, Tommi Jaakkola, Yang Zhang, Shiyu Chang

प्रकाशित 2026-04-07
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yujian Liu, Jiabao Ji, Li An, Tommi Jaakkola, Yang Zhang, Shiyu Chang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक शानदार, अत्यंत बुद्धिमान सहायक (AI) है जो दुनिया के बारे में बहुत कुछ जानता है लेकिन उसे बहुत विशिष्ट, कठिन कार्यों के लिए मदद की आवश्यकता है। उनकी मदद करने के लिए, आप उन्हें निर्देशों का एक "टूलबॉक्स" देते हैं जिसे Skills (कौशल) कहा जाता है। ये कौशल किसी चीज़ के लिए "कैसे करें" के निर्देश, रेसिपी या चरण-दर-चरण मार्गदर्शिका की तरह होते हैं, जैसे कि "लीकी पाइप को कैसे ठीक करें" या "किसी विशिष्ट वेबसाइट के लिए कोड कैसे लिखें।"

यह शोध पत्र एक सरल लेकिन महत्वपूर्ण प्रश्न पूछता है: क्या यह टूलबॉक्स वास्तव में काम करता है जब वास्तविक दुनिया अव्यवस्थित हो जाती है?

यहाँ शोधकर्ताओं ने जो पाया है उसका विवरण दिया गया, जिसमें रोजमर्रा के उदाहरणों का उपयोग किया गया है।

1. "आदर्श दुनिया" बनाम "वास्तविक दुनिया"

पुराना तरीका (एक आदर्श प्रयोगशाला):
कल्पना कीजिए कि आप ड्राइविंग टेस्ट दे रहे हैं। पुराने अध्येशनों में, प्रशिक्षक आपको एक ऐसा नक्शा देता था जिसमें हर मोड़ को चमकीले लाल रंग से अंकित किया गया था और हर मोड़ को लेबल किया गया था। प्रशिक्षक यह भी कहता था, "आपको इसी नक्शे का उपयोग करना चाहिए।"

  • परिणाम: ड्राइवर (AI) आसानी से पास हो गया।
  • समस्या: वास्तविक जीवन में ऐसा नहीं होता है। वास्तविक दुनिया में, कोई आपको पहले से बना-बनाया नक्शा नहीं थमाता। आपको अपना नक्शा खुद ढूंढना पड़ता है, और यदि आप वास्तव में एक कीचड़ भरे रास्ते पर गाड़ी चला रहे हैं, तो आपको "सिटी ड्राइविंग" और "ऑफ-रोडिंग" के बीच के नक्शों में से एक को चुनना पड़ सकता है।

नया अध्ययन (वास्तविक दुनिया):
शोधकर्ताओं ने 34,000 वास्तविक दुनिया के कौशलों (जैसे कि औजारों से भरा एक विशाल, अव्यवस्थित गैरेज) की एक विशाल लाइब्रेरी बनाई। फिर उन्होंने AI को एक कार्य दिया और कहा, "जाओ और अपने औजार खुद ढूंढो।"

  • परिणाम: AI का प्रदर्शन गिर गया। जब AI को अपने औजार खुद खोजने पड़े, तो वह भ्रमित हो गया, गलत औजार चुन लिए या अच्छे औजारों को अनदेखा कर दिया। सबसे कठिन परिदृश्यों में, AI का प्रदर्शन लगभग उतना ही खराब था जितना कि बिना किसी औजार के होता।

2. तीन बड़ी बाधाएं

शोध पत्र तीन विशिष्ट कारणों की पहचान करता है जिनकी वजह से AI संघर्ष करता है, जिन्हें हम इस प्रकार समझ सकते हैं:

  • बाधा 1: "बहुत अधिक विकल्प" की समस्या (चयन - Selection)
    कल्पना कीजिए कि आप एक हार्डवेयर स्टोर में हैं जहाँ 10,000 हथौड़े हैं। आपको एक तस्वीर टांगनी है। AI अक्सर गलत हथौड़ा (एक विशाल स्लेजहैमर) चुन लेता है या इतना अभिभूत हो जाता है कि कोई भी हथौड़ा नहीं चुन पाता। यहाँ तक कि जब सही उपकरण उसके ठीक सामने था, तब भी AI अक्सर उसे पकड़ना भूल गया।

  • बाधा 2: "खराब खोज" की समस्या (रिट्रीवल - Retrieval)
    कल्पना कीजिए कि आप लाइब्रेरियन से "पास्ता पकाने" पर एक किताब मांगते हैं, लेकिन लाइब्रेरियन आपको "नाव कैसे बनाएं" पर एक किताब थमा देता है क्योंकि कीवर्ड थोड़े अलग थे। AI का सर्च इंजन परफेक्ट नहीं था; इसने अक्सर सही कौशल को मिस कर दिया या अप्रासंगिक चीजें उठा लीं।

  • बाधा 3: "कच्चा मसौदा" की समस्या (अनुकूलन - Adaptation)
    कल्पना कीजिए कि आपको "स्पैगेटी कार्बोनारा" की रेसिपी मिलती है, लेकिन आपका कार्य "पेस्टो के साथ पास्ता" बनाना है। रेसिपी करीब है, लेकिन पूरी तरह सही नहीं है। AI इस रेसिपी को बदलने में संघर्ष करता है। उसने पेस्टो डिश के लिए कार्बोनारा के निर्देशों का पालन करने की कोशिश की और विफल रहा। वह सामान्य कौशल को विशिष्ट आवश्यकता में "अनुवादित" नहीं कर सका।

3. समाधान: "स्मार्ट एडिटर" (परिष्करण - Refinement)

शोधकर्ताओं को एहसास हुआ कि AI पर केवल औजारों का ढेर लगा देना काफी नहीं था। उन्हें AI द्वारा उपयोग करने से पहले उन औजारों को ठीक करने का एक तरीका चाहिए था। उन्होंने दो रणनीतियों का परीक्षण किया:

  • रणनीति A: "सामान्य पॉलिश" (क्वेरी-अज्ञेय - Query-Agnostic)
    कल्पना कीजिए कि एक पेशेवर संपादक लाइब्रेरी में जाता है और हर किताब की गलतियाँ सुधारता है और व्याकरण में सुधार करता है, बिना यह जाने कि बाद में आप कौन सी विशिष्ट किताब पढ़ने जा रहे हैं।

  • परिणाम: इसने थोड़ा मदद की (साफ टेक्स्ट), लेकिन यह मुख्य समस्या को हल नहीं कर सका क्योंकि किताबें अभी भी गलत विषयों पर थीं।

  • रणनीति B: "कस्टम टेलर" (क्वेरी-विशिष्ट - Query-Specific)
    कल्पना कीजिए कि एक दर्जी आपके विशिष्ट पहनावे (कार्य) को देखता है और फिर अलमारी में जाकर सही कपड़े ढूंढता है। वे "विंटर कोट" के पैटर्न का एक हिस्सा और "समर शर्ट" के पैटर्न का एक हिस्सा लेते हैं, उन्हें काटते हैं और आपके विशेष दिन के लिए एकदम सही जैकेट सिलने के लिए उन्हें आपस में जोड़ देते हैं।

  • परिणाम: इसने अद्भुत काम किया! जब AI को पहले कार्य देखने, फिर कौशल खोजने और अंत में उन कौशलों के सर्वोत्तम हिस्सों को "सीवन" (stitch together) करने की अनुमति दी गई, तो इसका प्रदर्शन वापस ऊपर आ गया। इसने खोई हुई अधिकांश जमीन को वापस पा लिया।

4. एक पेच (The Catch)

इस "स्मार्ट एडिटर" की एक बड़ी सीमा है।
यदि लाइब्रेरी में सही सामग्री ही नहीं है, तो दर्जी शून्य से सूट नहीं बना सकता।

  • यदि AI "पास्ता" की रेसिपी खोजता है और लाइब्रेरी में केवल "नाव निर्माण" के मैनुअल हैं, तो कितना भी संपादन कर लें, कोई मदद नहीं मिलेगी। AI के पास काम करने के लिए कुछ प्रासंगिक शुरुआती सामग्री होनी चाहिए।

निष्कर्ष (The Bottom Line)

  • कौशल शक्तिशाली हैं, लेकिन नाजुक हैं। वे तब बहुत अच्छा काम करते हैं जब आप AI को एक सटीक, पहले से चयनित मार्गदर्शिका देते हैं।
  • वास्तविक दुनिया में, वे अक्सर विफल हो जाते हैं क्योंकि AI शोर में खो जाता है या गलत मार्गदर्शिका चुन लेता है।
  • समाधान: हमें ऐसे AI की आवश्यकता है जो न केवल कौशल ढूंढे, बल्कि उन्हें अनुकूलित (adapt) भी करे। यदि AI उन बिखरे हुए, अपूर्ण औजारों को देख सकता है और कह सकता है, "ठीक है, मैं इस विशिष्ट समस्या को हल करने के लिए टूल A से यह हिस्सा और टूल B से वह हिस्सा लूंगा," तो सिस्टम फिर से काम करने लगता है।

संक्षेप में: AI को एक टूलबॉक्स देना अच्छा है, लेकिन AI को एक टूलबॉक्स और एक स्मार्ट मैकेनिक देना जो विशिष्ट कार्य के लिए औजारों को संशोधित करना जानता हो, वही कार को वास्तव में चलाने के योग्य बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →