Skill-Use: Can LLMs Actually Use Skills in Agentic Harnesses?
यह शोध पत्र Skill-Use को प्रस्तुत करता है, जो इस बात का मूल्यांकन करता है कि क्या LLM एजेंट अलग-थलग वातावरणों में स्वतंत्र रूप से संरचित कौशलों (skills) को पहचान और सही ढंग से लागू कर सकते हैं, जो यह प्रकट करता है कि विश्वसनीय कौशल उपयोग अभी भी एक महत्वपूर्ण चुनौती बनी हुई है और यह मॉडल की अंतर्निहित क्षमता के बजाय विशिष्ट एजेंट हार्नेस (agent harness) पर अत्यधिक निर्भर है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक बेहद बुद्धिमान, अति-रचनात्मक इंटर्न को काम पर रख रहे हैं जो कोड लिख सकता है, डेटा का विश्लेषण कर सकता है और ईमेल ड्राफ्ट कर सकता है। आप उन्हें "स्किल बुक्स" (कौशल पुस्तकों) का एक विशाल पुस्तकालय देते हैं। प्रत्येक पुस्तक एक विशिष्ट कार्य की रेसिपी है, जैसे कि "एक खराब सर्वर को कैसे ठीक करें" या "एक कानूनी अनुबंध कैसे लिखें।" पेच यह है कि आप उन्हें पूरी किताब एक साथ नहीं देते। इसके बजाय, आप उन्हें केवल शीर्षक और पीछे के कवर पर एक छोटा सा विवरण दिखाते हैं। यदि उन्हें लगता है कि पुस्तक प्रासंगिक है, तो उन्हें इसे माँगना होगा, पूर्ण निर्देश ढूँढने होंगे और फिर बिना किसी चरण को छोड़े या कुछ भी वर्जित किए उन निर्देशों का बिल्की सटीक रूप से पालन करना होगा। यह AI "एजेंट्स" द्वारा "स्किल" (कौशल) का उपयोग करने की कोशिश करने की दुनिया है। कुछ समय के लिए, लोगों को उम्मीद थी कि यदि आप इन AI इंटर्न को सही किताबें दे दें, तो वे तुरंत पूर्ण कार्यकर्ता बन जाएंगे। लेकिन किसी को वास्तव में पता नहीं था कि क्या AI वास्तव में यह समझ पाएगा कि कौन सी किताब उठानी है, या वह बस अनुमान लगाएगा और किस्मत पर छोड़ देगा।
टेन्सेंट हुनयुआन (Tencent Hunyuan) के शोधकर्ताओं की एक टीम और कई शीर्ष विश्वविद्यालयों ने इस विचार का परीक्षण करने का निर्णय लिया। उन्होंने एक विशाल प्लेग्राउंड बनाया जिसे SKILL-USE कहा जाता है, जो एक बेंचमार्क है जिसे यह देखने के लिए डिज़ाइन किया गया है कि क्या AI एजेंट वास्तव में "माहौल को समझ" (read the room) सकते हैं और इन स्किल बुक्स का सही उपयोग कर सकते हैं। उन्होंने केवल यह नहीं पूछा, "क्या AI ने कार्य पूरा किया?" बल्कि उन्होंने तीन बहुत कठिन प्रश्न पूछे: ट्रिगर (क्या AI को पता चला कि सही किताब कब उठानी है?), अनुपालन (क्या इसने रेसिपी का चरण-दर-चरण पालन किया?), और सीमा (क्या इसने किताब में सूचीबद्ध वर्जित चीजों को करने से परहेज किया?)। उन्होंने सॉफ्टवेयर बग्स को ठीक करने से लेकर बिजनेस रिपोर्ट लिखने तक, 177 विभिन्न वास्तविक दुनिया के कार्यों का परीक्षण किया, जिसमें 79 वास्तविक स्किल दस्तावेज़ और आज के आठ सबसे स्मार्ट AI मॉडल शामिल थे।
परिणाम थोड़े वास्तविकता का अहसास कराने वाले थे। शोधकर्ताओं ने पाया कि बेहतरीन AI सेटअप भी केवल लगभग 0.613 का "स्किल-यूज़" स्कोर (0 से 1 के पैमाने पर) ही प्राप्त कर सके। इसका मतलब है कि विश्वसनीय कौशल उपयोग अभी भी पहुंच से बाहर है। सबसे बड़ी समस्या यह नहीं थी कि AI किताब मिलने के बाद नियमों का पालन नहीं कर सका; बल्कि यह थी कि AI अक्सर यह भी नहीं जान पाता था कि किताब उठानी है या नहीं। यह एक ऐसे जीनियस शेफ की तरह है जो रेसिपी का पूरी तरह से पालन कर सकता है, लेकिन वह सामग्री लेने के लिए फ्रिज खोलने की बात बार-बार भूल जाता है। इसके अलावा, शोधकर्ताओं ने पाया कि AI का प्रदर्शन केवल इस बात पर निर्भर नहीं था कि मॉडल कितना "स्मार्ट" है; यह काफी हद तक उसके चारों ओर के "हार्नेस" (harness) या सॉफ्टवेयर रैपर पर निर्भर था। रैपर को बदलना रसोई के लेआउट को बदलने जैसा था: कभी-कभी वही शेफ एक स्टार बन जाता था, और कभी-कभी वह लड़खड़ा जाता था।
संक्षेप में, यह पेपर सुझाव देता है कि AI एजेंटों को कौशल का पुस्तकालय देने से वे स्वचालित रूप से बेहतर कार्यकर्ता नहीं बन जाते हैं। "कौशल होने" और "कौशल का उपयोग करने" के बीच का अंतर बहुत बड़ा है। AI अक्सर यह पहचानने में विफल रहता है कि कब कोई कौशल लागू होता है, या बहुत अधिक विकल्प होने पर वह गलत कौशलों से विचलित हो जाता है। हालांकि AI वर्जित चालों से बचने में बेहतर हो रहा है, लेकिन यह जटिल प्रक्रियाओं का निष्ठापूर्वक पालन करने में अभी भी संघर्ष करता है। लेखक निष्कर्ष निकालते हैं कि हम यह मानकर नहीं चल सकते कि ये एजेंट जादुई रूप से अपने उपकरणों का उपयोग करना सीख जाएंगे; हमें ऐसे सिस्टम बनाने की आवश्यकता है जो उन्हें यह पहचानने में मदद करें कि कब एक कौशल का उपयोग करना है और कैसे योजना पर टिके रहना है, क्योंकि फिलहाल, यही पहेली का सबसे कठिन हिस्सा है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।