SkillGate: Training In-Policy Skill Selection in Long-Horizon Agents
SkillGate एक नवीन प्रशिक्षण ढांचा पेश करता है जो क्रेडिट असाइनमेंट को विलगित चैनलों में विभाजित करके लॉन्ग-होरिजन एजेंटों में "सेलेक्टर क्रेडिट स्टार्वेशन" को हल करता है, जिससे मानक आउटकम-रिवॉर्डेड सुदृढीकरण शिक्षण की तुलना में इन-पॉलिसी स्किल सिलेक्शन सटीकता और समग्र कार्य सफलता में महत्वपूर्ण सुधार होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
आर्टिफिशियल इंटेलिजेंस के आधुनिक परिदृश्य में, लार्ज लैंग्वेज मॉडल्स केवल निष्क्रिय टेक्स्ट जनरेटर से विकसित होकर सक्रिय एजेंट बन गए हैं जो जटिल डिजिटल वातावरणों में नेविगेट करने में सक्षम हैं। ये सिस्टम केवल दुनिया का वर्णन नहीं करते; वे इसके साथ अंतःक्रिया करते हैं, कोड को ठीक करने, फाइलों को प्रबंधित करने और तर्क के चरणों एवं कार्यों की एक श्रृंखला के माध्यम से समस्याओं को हल करने के लिए सॉफ्टवेयर टूल्स का उपयोग करते हैं। उनके सामने आने वाले कार्यों की विशाल श्रृंखला को संभालने के लिए, डेवलपर्स ने प्रक्रियात्मक ज्ञान (procedural knowledge) को 'स्किल्स' (skills) नामक पुन: प्रयोज्य मॉड्यूल में पैक करना शुरू कर दिया है। एक डिजिटल लाइब्रेरी की कल्पना करें जिसमें इन हजारों स्किल्स का संग्रह है, जिनमें से प्रत्येक का एक नाम और एक संक्षिप्त विवरण है, जो एजेंट द्वारा आवश्यकता पड़ने पर खोले जाने की प्रतीक्षा कर रहे हैं। इन एजेंटों के लिए महत्वपूर्ण चुनौती केवल इस लाइब्रेरी तक पहुंच होना नहीं है, बल्कि यह जानना है कि सही क्षण में कौन सी विशिष्ट फाइल खोली जाए। यह निर्णय कार्य के बीच में लिया जाना चाहिए, जो अक्सर विवरण की एक एकल पंक्ति पर आधारित होता है, इससे पहले कि एजेंट फाइल की पूरी सामग्री देख सके। यदि एजेंट गलत स्किल चुन लेता है, तो पूरा प्रयास विफल हो सकता है, फिर भी अब तक, एजेंट को यह सिखाने का कोई विश्वसनीय तरीका नहीं था कि वह इस चुनाव को सही ढंग से कैसे करे।
शोधकर्ताओं ने लंबे समय से यह माना है कि इन एजेंटों को प्रशिक्षित करने की मानक विधि पर्याप्त होगी: एजेंट को संभावित स्किल्स की एक सूची प्रस्तुत करें, उसे कार्य हल करने दें, और उसे केवल तभी पुरस्कृत करें जब अंतिम परिणाम सफल हो। विचार यह था कि एजेंट स्वाभाविक रूप से सही स्किल चुनने के लिए सीख जाएगा क्योंकि वह चुनाव एक अच्छे परिणाम की ओर ले जाता है। हालांकि, एक नया अध्ययन बताता है कि इस दृष्टिकोण में एक मौलिक दोष है जो एजेंटों को प्रभावी ढंग से स्किल चुनने में सक्षम होने से रोकता है, विशेष रूप से लंबे और जटिल कार्यों में। शोधकर्ताओं ने पाया कि जब एक एजेंट किसी कार्य को पूरा करने में विफल रहता है, तो प्रशिक्षण संकेत (training signal) जो उसे बताता है कि क्या गलत हुआ, उसके द्वारा उत्पन्न प्रत्येक शब्द में समान रूप से प्रसारित होता है। कार्यों के एक लंबी श्रृंखला में, चुने गए स्किल का नाम लेने वाले कुछ शब्द तर्क और निष्पादन के लिए उपयोग किए गए हजारों शब्दों के बीच दब जाते हैं। फलस्वरूप, एजेंट को अपने प्रारंभिक चुनाव के बारे में लगभग कोई फीडबैक नहीं मिलता है। इससे भी बुरा यह है कि यदि एजेंट ने सही स्किल चुना लेकिन बाद में किसी अन्य गलती के कारण विफल रहा, तो प्रशिक्षण प्रणाली प्रारंभिक चुनाव को दंडित करती है, जिससे एजेंट को यह सिखाया जाता है कि सही निर्णय वास्तव में गलत था। यह घटना, जिसे लेखक "सेलेक्टर क्रेडिट स्टार्वेशन" (selector credit starvation) कहते हैं, का अर्थ है कि एक लंबी श्रृंखला में सबसे मूल्यवान निर्णय अक्सर वही होता है जिसे सबसे कम और सबसे भ्रामक निर्देश प्राप्त होते हैं।
इसे हल करने के लिए, शोध टीम ने 'स्किलगेट' (SkillGate) नामक एक नई प्रशिक्षण विधि विकसित की। पूरे क्रियाओं के अनुक्रम को एक एकल ब्लॉक के रूप में मानने के बजाय, स्किलगेट सीखने की प्रक्रिया को दो अलग-अलग चैनलों में विभाजित करता है। एक चैनल कार्य के निष्पादन का मूल्यांकन करता है, एजेंट को अंतिम लक्ष्य प्राप्त करने या न करने के आधार पर पुरस्कृत या दंडित करता है। दूसरा चैनल विशेष रूप से उस क्षण पर ध्यान केंद्रित करता है जब एजेंट एक स्किल का नाम लेता है। यह दूसरा चैनल केवल चुने गए फाइल की पहचान करने के लिए उपयोग किए गए विशिष्ट शब्दों को देखता है और एक सरल प्रश्न पूछता है: क्या यह काम के लिए एकमात्र सही फाइल थी? यदि एजेंट ने सही स्किल चुना और ऐसा केवल एक बार किया, तो उसे उस विशिष्ट चुनाव के लिए सकारात्मक फीडबैक मिलता है, चाहे कार्य सफल हुआ हो या विफल। यदि उसने गलत फाइल चुनी या कई फाइलें चुनीं, तो उसे नकारात्मक फीडबैक मिलता है। स्किल के नाम लेने के निर्णय को कार्य के परिणाम से अलग करके, यह प्रणाली यह सुनिश्चित करती है कि एजेंट एक ऐसे अच्छे चुनाव को जो बुरे परिणाम की ओर ले गया, और एक बुरे चुनाव को जो बुरे परिणाम की ओर ले गया, के बीच अंतर करना सीख सके।
इस दृष्टिकोण के परिणामों का परीक्षण जटिल एजेंट कार्यों से जुड़े पांच विभिन्न बेंचमार्क में किया गया। शोधकर्ताओं ने इस नई विधि का उपयोग करके 9 बिलियन पैरामीटर्स वाले एक मॉडल को प्रशिक्षित किया और इसे केवल अंतिम परिणामों पर प्रशिक्षित मॉडल के 47.0 प्रतिशत सफलता दर के मुकाबले 53.2 प्रतिशत सफलता दर के साथ तुलना की। यह सुधार केवल मॉडल के सामान्य रूप से स्मार्ट होने का मामला नहीं था; व्यवहार विशिष्ट और मापने योग्य तरीके से बदला। स्किलगेट-प्रशिक्षित मॉडल भ्रामक या अप्रासंगिक स्किल्स को पढ़ने की संभावना बहुत कम थी, जिससे गलत विकल्पों के प्रति उसका एक्सपोजर दो-तिहाई कम हो गया, और इसने कुल मिलाकर कम स्किल्स पढ़ीं, जो एक अधिक निर्णायक और सटीक चयन प्रक्रिया का संकेत देती है। अध्ययन ने यह भी दिखाया कि केवल मॉडल को बड़ा बनाना समस्या को हल नहीं करता था; यहाँ तक कि स्किलगेट के साथ प्रशिक्षित छोटे मॉडल की तुलना में बहुत बड़े मॉडल भी स्किल चयन कार्य को प्रभावी ढंग से सीखने में विफल रहे।
इस कार्य का महत्व इस बात के प्रदर्शन में निहित है कि एजेंट कैसे सीखता है, यह उस डेटा से भी अधिक महत्वपूर्ण है जिसे वह देखता है। शोधकर्ताओं ने पुराने तरीके से प्रशिक्षित मॉडलों के प्रशिक्षण डेटा का ऑडिट करके अपने निदान को सत्यापित किया। उन्होंने पाया कि जैसे-जैसे कार्य लंबे होते गए, लर्निंग सिग्नल का हिस्सा जो स्किल-नेमिंग शब्दों तक पहुँचता था, नाटकीय रूप से सिकुड़ गया, और लगभग अदृश्य हो गया। इसके अलावा, जो सिग्नल पहुँचा वह अक्सर उसके विपरीत था जो होना चाहिए था, जो सही विकल्पों को केवल इसलिए दंडित कर रहा था क्योंकि कार्य अंततः विफल हो गया था। एक ऐसी प्रणाली का निर्माण करके जहाँ स्किल के चुनाव को उसके अपने गुणों पर परखा जाता है, कार्य के निष्पादन से अलग, शोधकर्ताओं ने इस संरचनात्मक बाधा को हटा दिया। नई विधि एजेंट को यह सीखने की अनुमति देती है कि सही टूल चुनना अपने आप में एक विशिष्ट और मूल्यवान कौशल है, जिसे स्पष्ट और प्रत्यक्ष निर्देश की आवश्यकता है। यह निष्कर्ष बताता है कि एजेंटों को जटिल वातावरण में वास्तव में विश्वसनीय बनने के लिए, उनका प्रशिक्षण कार्य करने के निर्णय और कार्य के परिणाम के बीच अंतर करने के लिए पर्याप्त सटीक होना चाहिए।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।