← नवीनतम पेपर
💬 NLP

Skill-Use: Can LLMs Actually Use Skills in Agentic Harnesses?

यह शोध पत्र Skill-Use को प्रस्तुत करता है, जो इस बात का मूल्यांकन करता है कि क्या LLM एजेंट अलग-थलग वातावरणों में स्वतंत्र रूप से संरचित कौशलों (skills) को पहचान और सही ढंग से लागू कर सकते हैं, जो यह प्रकट करता है कि विश्वसनीय कौशल उपयोग अभी भी एक महत्वपूर्ण चुनौती बनी हुई है और यह मॉडल की अंतर्निहित क्षमता के बजाय विशिष्ट एजेंट हार्नेस (agent harness) पर अत्यधिक निर्भर है।

मूल लेखक: Jinyi Han, Yuanjian Xu, Ying Liao, Xinyi Wang, Zishang Jiang, Zixiang Di, Fanyang Lu, Zhichao Hu, Yanghua Xiao

प्रकाशित 2026-08-06
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Jinyi Han, Yuanjian Xu, Ying Liao, Xinyi Wang, Zishang Jiang, Zixiang Di, Fanyang Lu, Zhichao Hu, Yanghua Xiao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बेहद बुद्धिमान, अति-रचनात्मक इंटर्न को काम पर रख रहे हैं जो कोड लिख सकता है, डेटा का विश्लेषण कर सकता है और ईमेल ड्राफ्ट कर सकता है। आप उन्हें "स्किल बुक्स" (कौशल पुस्तकों) का एक विशाल पुस्तकालय देते हैं। प्रत्येक पुस्तक एक विशिष्ट कार्य की रेसिपी है, जैसे कि "एक खराब सर्वर को कैसे ठीक करें" या "एक कानूनी अनुबंध कैसे लिखें।" पेच यह है कि आप उन्हें पूरी किताब एक साथ नहीं देते। इसके बजाय, आप उन्हें केवल शीर्षक और पीछे के कवर पर एक छोटा सा विवरण दिखाते हैं। यदि उन्हें लगता है कि पुस्तक प्रासंगिक है, तो उन्हें इसे माँगना होगा, पूर्ण निर्देश ढूँढने होंगे और फिर बिना किसी चरण को छोड़े या कुछ भी वर्जित किए उन निर्देशों का बिल्की सटीक रूप से पालन करना होगा। यह AI "एजेंट्स" द्वारा "स्किल" (कौशल) का उपयोग करने की कोशिश करने की दुनिया है। कुछ समय के लिए, लोगों को उम्मीद थी कि यदि आप इन AI इंटर्न को सही किताबें दे दें, तो वे तुरंत पूर्ण कार्यकर्ता बन जाएंगे। लेकिन किसी को वास्तव में पता नहीं था कि क्या AI वास्तव में यह समझ पाएगा कि कौन सी किताब उठानी है, या वह बस अनुमान लगाएगा और किस्मत पर छोड़ देगा।

टेन्सेंट हुनयुआन (Tencent Hunyuan) के शोधकर्ताओं की एक टीम और कई शीर्ष विश्वविद्यालयों ने इस विचार का परीक्षण करने का निर्णय लिया। उन्होंने एक विशाल प्लेग्राउंड बनाया जिसे SKILL-USE कहा जाता है, जो एक बेंचमार्क है जिसे यह देखने के लिए डिज़ाइन किया गया है कि क्या AI एजेंट वास्तव में "माहौल को समझ" (read the room) सकते हैं और इन स्किल बुक्स का सही उपयोग कर सकते हैं। उन्होंने केवल यह नहीं पूछा, "क्या AI ने कार्य पूरा किया?" बल्कि उन्होंने तीन बहुत कठिन प्रश्न पूछे: ट्रिगर (क्या AI को पता चला कि सही किताब कब उठानी है?), अनुपालन (क्या इसने रेसिपी का चरण-दर-चरण पालन किया?), और सीमा (क्या इसने किताब में सूचीबद्ध वर्जित चीजों को करने से परहेज किया?)। उन्होंने सॉफ्टवेयर बग्स को ठीक करने से लेकर बिजनेस रिपोर्ट लिखने तक, 177 विभिन्न वास्तविक दुनिया के कार्यों का परीक्षण किया, जिसमें 79 वास्तविक स्किल दस्तावेज़ और आज के आठ सबसे स्मार्ट AI मॉडल शामिल थे।

परिणाम थोड़े वास्तविकता का अहसास कराने वाले थे। शोधकर्ताओं ने पाया कि बेहतरीन AI सेटअप भी केवल लगभग 0.613 का "स्किल-यूज़" स्कोर (0 से 1 के पैमाने पर) ही प्राप्त कर सके। इसका मतलब है कि विश्वसनीय कौशल उपयोग अभी भी पहुंच से बाहर है। सबसे बड़ी समस्या यह नहीं थी कि AI किताब मिलने के बाद नियमों का पालन नहीं कर सका; बल्कि यह थी कि AI अक्सर यह भी नहीं जान पाता था कि किताब उठानी है या नहीं। यह एक ऐसे जीनियस शेफ की तरह है जो रेसिपी का पूरी तरह से पालन कर सकता है, लेकिन वह सामग्री लेने के लिए फ्रिज खोलने की बात बार-बार भूल जाता है। इसके अलावा, शोधकर्ताओं ने पाया कि AI का प्रदर्शन केवल इस बात पर निर्भर नहीं था कि मॉडल कितना "स्मार्ट" है; यह काफी हद तक उसके चारों ओर के "हार्नेस" (harness) या सॉफ्टवेयर रैपर पर निर्भर था। रैपर को बदलना रसोई के लेआउट को बदलने जैसा था: कभी-कभी वही शेफ एक स्टार बन जाता था, और कभी-कभी वह लड़खड़ा जाता था।

संक्षेप में, यह पेपर सुझाव देता है कि AI एजेंटों को कौशल का पुस्तकालय देने से वे स्वचालित रूप से बेहतर कार्यकर्ता नहीं बन जाते हैं। "कौशल होने" और "कौशल का उपयोग करने" के बीच का अंतर बहुत बड़ा है। AI अक्सर यह पहचानने में विफल रहता है कि कब कोई कौशल लागू होता है, या बहुत अधिक विकल्प होने पर वह गलत कौशलों से विचलित हो जाता है। हालांकि AI वर्जित चालों से बचने में बेहतर हो रहा है, लेकिन यह जटिल प्रक्रियाओं का निष्ठापूर्वक पालन करने में अभी भी संघर्ष करता है। लेखक निष्कर्ष निकालते हैं कि हम यह मानकर नहीं चल सकते कि ये एजेंट जादुई रूप से अपने उपकरणों का उपयोग करना सीख जाएंगे; हमें ऐसे सिस्टम बनाने की आवश्यकता है जो उन्हें यह पहचानने में मदद करें कि कब एक कौशल का उपयोग करना है और कैसे योजना पर टिके रहना है, क्योंकि फिलहाल, यही पहेली का सबसे कठिन हिस्सा है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →