A Framework for Evaluating Agentic Skills at Scale
यह शोध पत्र यथार्थवादी कार्यों और स्कोरिंग रूब्रिक्स को उत्पन्न करके एजेंटिक कौशल का आकलन करने के लिए एक स्केलेबल मूल्यांकन ढांचे को प्रस्तुत करता है, जिसे 19 मॉडलों में 500 वास्तविक दुनिया के कौशलों पर लागू किया गया था यह प्रदर्शित करने के लिए कि जबकि कौशल एजेंट के व्यवहार को महत्वपूर्ण रूप से बदलते हैं, कौशल निर्देशों के प्रति मॉडल का पालन व्यापक रूप से भिन्न होता है, जो समग्र प्रदर्शन लाभ को प्रभावित करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, लेकिन कुछ हद तक सामान्य (generic) रोबोट सहायक है। वह दुनिया के बारे में बहुत कुछ जानता है क्योंकि उसने इंटरनेट पढ़ा है, लेकिन वह आपके काम करने के विशिष्ट तरीके को नहीं जानता। शायद आपके कोड लिखने का एक बहुत ही खास तरीका हो, या सुरक्षा के लिए एक विशिष्ट चेकलिस्ट हो, या फाइलों को व्यवस्थित करने का आपका अपना अनूठा तरीका हो।
AI की दुनिया में, इन विशिष्ट निर्देशों को "Skills" (कौशल) कहा जाता है। ये उन छोटे 'चीट शीट्स' या नियमपुस्तिकाओं की तरह हैं जो आप रोबोट को यह समझाने के लिए देते हैं कि वह किसी काम को बिल्कुल वैसे ही करे जैसा आप चाहते हैं।
यह शोध पत्र इस बारे में है कि ये "Skills" वास्तव में काम करती हैं या नहीं, इसे परखने का एक नया तरीका। लेखकों ने एक विशाल परीक्षण स्थल बनाया ताकि यह देखा जा सके कि:
- क्या रोबट वास्तव में नियमपुस्तिका को पढ़ता है?
- क्या नियमपुस्तिका का पालन करने से वह बेहतर काम करता है?
- क्या एक सस्ता, छोटा रोबोट एक महंगे, सुपर-स्मार्ट रोबोट जितना ही अच्छा बन सकता है यदि उसके पास सही नियमपुस्तिका हो?
उन्होंने इसे कैसे किया, इसका सरल विवरण यहाँ दिया गया है:
1. "मैजिक रेसिपी" जनरेटर
हजारों परीक्षण प्रश्न लिखने के लिए इंसानों को काम पर रखने के बजाय, लेखकों ने इसके लिए AI का उपयोग किया।
- उपमा: कल्पना कीजिए कि आपके पास एक कुकबुक (Skill) है। लेखकों ने एक 'रोबोट शेफ' बनाया जो कुकबुक को पढ़ता है और स्वचालित रूप से 1,000 अलग-अलग डिनर पार्टियाँ (टास्क) बना देता है जहाँ उस भोजन को सही ढंग से पकाने के लिए वह कुकबुक ही एकमात्र तरीका है।
- प्रक्रिया: सिस्टम एक Skill को देखता है, यह पता लगाता है कि किन उपकरणों की आवश्यकता है (जैसे कि एक विशेष ओवन या एक विशेष चाकू), एक नकली किचन वातावरण बनाता है, और फिर AI को खाना पकाने के लिए कहता है।
2. दो-भाग वाला परीक्षण
प्रत्येक कार्य के लिए, उन्होंने AI को दो दौरों से गुजारा:
- राउंड A (बिना Skill के): AI केवल अपने दिमाग का उपयोग करके भोजन पकाने की कोशिश करता है।
- राउंड B (Skill के साथ): AI फिर से प्रयास करता है, लेकिन इस बार उसके पास काउंटर पर "Skill" (नियमपुस्तिका) खुली हुई है।
फिर, एक "जज" (एक अन्य AI) ने दोनों प्रयासों का मूल्यांकन किया। जज ने केवल यह नहीं देखा कि खाना पका या नहीं (लक्ष्य पूरा होना); उन्होंने यह भी देखा कि खाना कैसे पकाया गया। क्या AI ने सही सामग्री का उपयोग किया? क्या उसने नियमपुस्तिका के विशिष्ट चरणों का पालन किया? (निर्देशों का पालन)।
3. मुख्य निष्कर्ष
500 वास्तविक दुनिया के "Skills" और 19 विभिन्न AI मॉडल (छोटे और सस्ते से लेकर विशाल और महंगे तक) का परीक्षण करने के बाद, उन्हें कुछ आश्चर्यजनक बातें पता चलीं:
- "नियमपुस्तिका" का प्रभाव: जब किसी AI को एक Skill दी गई, तो उसने निर्देशों का पालन बहुत बेहतर तरीके से किया। यह एक छात्र को एक विशिष्ट अध्ययन गाइड देने जैसा है; वे अनुमान लगाना बंद कर देते हैं और ठीक उसी पथ का पालन करते हैं जिसे आप चाहते हैं।
- सभी रोबोट समान नहीं हैं: कुछ AI मॉडल नियमपुस्तिका पढ़ने में बहुत अच्छे थे (जैसे महंगे "Opus" मॉडल)। अन्य, जैसे कि कुछ ओपन-सोर्स मॉडल, ऐसा लगे कि उन्होंने किताब को अनदेखा कर दिया और बस अपनी मर्जी से काम किया।
- महान समानता (The Great Equalizer): यह सबसे रोमांचक हिस्सा है। आमतौर पर, महंगे, सुपर-स्मार्ट AI मॉडल सस्ते, छोटे मॉडलों की तुलना में बहुत बेहतर होते हैं। लेकिन, जब आप सस्ते मॉडलों को एक अच्छी Skill देते हैं, तो वे अचानक महंगे मॉडलों के लगभग बराबर हो जाते हैं।
- रूपक: यह एक साधारण साइकिल को टर्बोचार्जर देने जैसा है। अचानक, सस्ती साइकिल फेरारी के साथ मुकाबला कर सकती है। लेखकों ने पाया कि एक छोटी, सस्ती मॉडल जिसमें एक Skill है, वह शीर्ष श्रेणी के महंगे मॉडल के समान काम कर सकती है, और वह भी बहुत कम लागत पर।
4. Skills कहाँ सबसे अच्छा काम करती हैं
शोध में पाया गया कि Skills तब सबसे अच्छा काम करती हैं जब वे सख्त असेंबली निर्देशों की तरह होती हैं (जैसे, "चरण 1: X करें, चरण 2: Y करें")।
- उच्च प्रभाव: वीडियो एडिटिंग, सुरक्षा चेकलिस्ट, या फाइल प्रोसेसिंग जैसी चीजों के लिए Skills ने भारी सुधार देखा। ये वे कार्य हैं जिनमें स्पष्ट, कठोर चरण होते हैं।
- कम प्रभाव: Skills जो केवल सामान्य सलाह थीं (जैसे, "अच्छा कोड लिखें" या "रचनात्मक बनें") उनसे ज्यादा मदद नहीं मिली। AI पहले से ही सामान्य सलाह जानता था, उसे व्यवहार बदलने के लिए विशिष्ट चरणों की आवश्यकता थी।
5. यह क्यों महत्वपूर्ण है
लेखक केवल यह नहीं कह रहे हैं कि "AI बेहतर हो रहा है।" वे कह रहे हैं: "हमारे पास अंततः एक तरीका है जिससे हम माप सकते हैं कि एक विशिष्ट AI टूल वास्तव में मदद करता है या नहीं।"
इससे पहले, यदि कोई नया Skill बनाता था, तो उसके पास यह साबित करने का कोई अच्छा तरीका नहीं था कि वह काम करता है। अब, वे एक परीक्षण उत्पन्न कर सकते हैं, उसे चला सकते हैं और देख सकते हैं कि AI नियमों का पालन करने में कहाँ विफल हो रहा है। यह रचनाकारों को उनके Skills को ठीक करने में मदद करता है और कंपनियों को यह निर्णय लेने में मदद करता है: "क्या मुझे महंगे AI की आवश्यकता है, या क्या मैं बस एक सस्ते AI को एक बेहतर नियमपुस्तिका दे सकता हूँ?"
संक्षेप में: लेखकों ने AI "नियमपुस्तिकाओं" का परीक्षण करने वाला एक कारखाना बनाया है। उन्होंने पाया कि सही नियमपुस्तिका एक सस्ते AI को एक अमीर वाले की तरह व्यवहार करने के लिए मजबूर कर सकती है, लेकिन केवल तभी जब नियमपुस्तिका सामान्य सलाह के बजाय स्पष्ट, चरण-दर-चरण निर्देश देती है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।