SKILLC: Learning Autonomous Skill Internalization in LLM Agents via Contrastive Credit Assignment
यह शोध पत्र SkillC का प्रस्ताव करता है, जो एक ऐसा ढांचा है जो युग्मित रोलआउट्स (paired rollouts) और अनुकूली पाठ्यक्रम शिक्षण (adaptive curriculum learning) के माध्यम से कौशल-मुक्त सफलता की ओर नीतियों को सीधे अनुकूलित करने के लिए कंट्रास्टिव स्किल क्रेडिट असाइनमेंट (Contrastive Skill Credit Assignment) पेश करके LLM एजेंटों में स्वायत्त कौशल आंतरिककरण (autonomous skill internalization) को बढ़ाता है, जो रनटाइम स्किल एक्सेस के बिना लंबी अवधि के कार्यों पर मौजूदा बेसलाइन से बेहतर प्रदर्शन करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान रोबोट को जटिल पहेलियाँ हल करना सिखा रहे हैं, जैसे कि एक बिखरे हुए घर को व्यवस्थित करना या ऑनलाइन विशिष्ट वस्तुएं खरीदना। इसे तेज़ी से सीखने में मदद करने के लिए, आप इसे एक "चीट शीट" (एक कौशल/skill) देते हैं जो इसे बताती है कि ठीक क्या कदम उठाने हैं।
आप रोबोट को सिखाने के दो मुख्य तरीके हैं:
- "हमेशा के लिए चीट शीट वाला" तरीका: आप रोबोट को हमेशा के लिए चीट शीट रखने देते हैं। यह पहेली को हल करना सीख जाता है, लेकिन यह बिना कागज़ के इसे करना कभी नहीं सीख पाता। यदि आप कागज़ छीन लेते हैं, तो यह असफल हो जाता है।
- "धीरे-धीरे हटा देने का" तरीका: आप शुरुआत में रोबोट को चीट शीट देते हैं, लेकिन धीरे-धीरे इसे हटाना शुरू कर देते हैं। लक्ष्य यह है कि रोबोट अंततः पूरी तरह से अपने दम पर पहेली को हल करना सीख जाए।
समस्या: "आंतरीकरण अंधापन" (Internalization Blindness)
लेख तर्क देता है कि वर्तमान "धीरे-धीरे हटाने वाले" तरीकों में एक बड़ी खामी है, जिसे लेखक आंतरीकरण अंधापन कहते हैं।
कल्पना कीजिए कि एक शिक्षक छात्र के टेस्ट को ग्रेड कर रहा है।
- पुराने तरीके में, शिक्षक एक ऐसा टेस्ट देखता है जहाँ छात्र ने चीट शीट का उपयोग किया और उसे 'A' ग्रेड मिलता है। फिर, शिक्षक एक ऐसा टेस्ट देखता है जहाँ छात्र ने चीट शीट का उपयोग नहीं किया और उसे 'B' ग्रेड मिलता है।
- शिक्षक कहता है, "बहुत अच्छा काम किया, 'A' के लिए!" और छात्र को उच्च स्कोर देता है।
- खामी: शिक्षक यह महसूस नहीं कर पाता कि 'A' केवल चीट शीट के कारण ही संभव हो पाया था। वह छात्र को चीट शीट का उपयोग करने के लिए पुरस्कृत करता रहता है, जबकि लक्ष्य छात्र को बिना चीट शीट के सामग्री सीखने के लिए प्रेरित करना है। रोबोट भ्रमित हो जाता है: "क्या मैं अपनी बुद्धिमत्ता के कारण सफल हुआ, या इसलिए क्योंकि मुझे मदद मिली?" वह अंतर नहीं समझ पाता, इसलिए वह वास्तव में स्वतंत्र रूप से सीखना कभी नहीं सीख पाता।
समाधान: SKILLC (एक "साथ-साथ" कोच)
लेखक इस समस्या को ठीक करने के लिए SKILLC नामक एक नया ढांचा प्रस्तावित करते हैं। वे कॉन्ट्रास्टिव स्किल क्रेडिट असाइनमेंट (Contrastive Skill Credit Assignment) नामक तकनीक का उपयोग करते हैं।
यह इस प्रकार काम करता है, एक सरल उपमा का उपयोग करते हुए:
1. "साथ-साथ" दौड़ (Paired Rollouts)
केवल एक बार मदद के साथ और एक बार बिना मदद के रोबोट को दौड़ते हुए देखने के बजाय, SKILLC हर कार्य के लिए रोबोट को एक ही समय में दो दौड़ लगाने के लिए कहता है:
- दौड़ A: रोबोट चीट शीट के साथ पहेली को हल करने की कोशिश करता है।
- दौड़ B: रोबोट ठीक उसी पहेली को चीट शीट के बिना हल करने की कोशिश करता है।
2. "निष्पक्ष जज" (Dual-Stream Advantage)
अब, शिक्षक (लर्निंग एल्गोरिदम) दोनों दौड़ को अगल-बगल से देखता है।
- यदि रोबोट दौड़ A जीतता है (मदद के साथ) लेकिन दौड़ B हार जाता है (बिना मदद के), तो शिक्षक को एहसास होता है: "आह, रोबोट केवल चीट शीट के कारण सफल हुआ। मुझे इसे अभी पूरी तरह से स्मार्ट होने के लिए श्रेय नहीं देना चाहिए।"
- यदि रोबोट दोनों दौड़ जीतता है, तो शिक्षक कहता है: "शानदार! आपने बिना मदद के इसे हल किया। यह वास्तविक कौशल है!"
सिस्टम विशेष रूप से रोबोट को दौड़ B (स्वतंत्र जीत) जीतने के लिए अधिक पुरस्कृत करता है और दौड़ A जीतने के लिए इसे कम पुरस्कृत करता है यदि वह दौड़ B में विफल रहा हो। यह रोबोट को यह सीखने के लिए मजबूर करता है कि वास्तव में केवल वही मायने रखता है कि वह बिना किसी मदद के समस्या को हल करे।
3. "स्मार्ट कोच" (Adaptive Curriculum)
सिस्टम एक स्मार्ट कोच की तरह भी काम करता है जो वास्तविक समय में रोबोट की प्रगति को देखता है।
- शुरुआत में: रोबोट बिना चीट शीट के बहुत बुरा प्रदर्शन करता है। कोच कहता है, "चीट शीट का उपयोग करना जारी रखें, लेकिन आइए इसे बिना इसके थोड़ा सा करने की कोशिश करें।"
- मध्य में: रोब सहित बेहतर होने लगता है। कोच देखता है कि "मदद के साथ" और "बिना मदद के" के बीच का अंतर कम हो रहा है। कोच चीट शीट को तेज़ी से हटाना शुरू कर देता है।
- अंत में: रोबोट अकेले बहुत अच्छा कर रहा है। कोच कहता है, "आपको अब चीट शीट की आवश्यकता नहीं है। आइए इसे पूरी तरह से रिटायर करें और इस विशिष्ट कार्य पर प्रशिक्षण देना बंद करें।"
यह क्यों महत्वपूर्ण है
लेखकों ने इसे दो वातावरणों में परखा:
- ALFWorld: एक टेक्स्ट-आधारित गेम जहाँ एजेंट को घरेलू काम करने होते हैं (जैसे "साफ शर्ट को दराज में रखना")।
- WebShop: एक सिम्युलेटेड ऑनलाइन शॉपिंग कार्य जहाँ एजेंट को विशिष्ट वस्तुएं ढूंढनी और खरीदनी होती हैं।
परिणाम:
- SKILLC ने इन कार्यों को अंत में बिना किसी चीट शीट के हल करना सीख लिया।
- इसने पिछले "धीरे-धीरे हटाने वाले" तरीकों की तुलना में काफी बेहतर प्रदर्शन किया (सफलता दर में लगभग 4-5% का सुधार)।
- इसने उन तरीकों के समान प्रदर्शन भी किया जिन्होंने चीट शीट को हमेशा के लिए रखा, जिससे साबित हुआ कि रोबोट वास्तव में कौशल को आंतरिक रूप से सीख सकता है।
कमी (सीमाएँ)
लेख स्वीकार करता है कि यह तरीका पूर्ण नहीं है:
- यह महंगा है: एक साथ दो दौड़ (मदद के साथ और बिना मदद के) चलाने के लिए शुरुआत में लगभग 26% अधिक कंप्यूटर पावर की आवश्यकता होती है।
- इसे अच्छे डेटा की आवश्यकता है: यदि रोबोट पहले से ही किसी कार्य में बहुत अच्छा है, या यदि कार्य बहुत दुर्लभ हैं, तो सिस्टम इस बारे में भ्रमित हो सकता है कि चीट शीट का उपयोग करना कब बंद किया जाए।
संक्षेप में:
SKILLC एक AI एजेंट को प्रशिक्षित करने का एक नया तरीका है। केवल धीरे-धीरे मदद हटाने के बजाय, यह लगातार "मदद वाले" प्रयासों की तुलना "बिना मदद वाले" प्रयासों से करता है। एजेंट को विशेष रूप रूप से बिना मदद के सफल होने के लिए पुरस्कृत करके, यह AI को वास्तव में कौशल को आत्मसात करने के लिए मजबूर करता है, जिससे एक "चीट-शीट उपयोगकर्ता" एक "आत्मनिर्भर विशेषज्ञ" में बदल जाता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।