ToolSelf: Unifying Task Execution and Self-Reconfiguration via Tool-Driven Emergent Adaptation
यह शोधपत्र ToolSelf प्रस्तुत करता है, जो एक ऐसा प्रतिमान (paradigm) है जो स्थिर विन्यास (static configurations) की कठोरता को दूर करने के लिए कार्य निष्पादन और रनटाइम स्व-पुनर्गठन को एक ही नीति के भीतर एकीकृत करता है, और एक नवीन कॉन्फ़िगरेशन-अवेयर टू-स्टेज ट्रेनिंग (CAT) दृष्टिकोण के माध्यम से महत्वपूर्ण प्रदर्शन लाभ प्राप्त करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक बहुत ही जटिल, बहु-चरणीय रहस्य को सुलझाने के लिए एक अत्यधिक बुद्धिमान सहायक को काम पर रख रहे हैं।
पुराना तरीका (स्थिर कॉन्फ़िगरेशन - Static Configuration):
पारंपरिक AI सिस्टम में, आपको अपने सहायक के लिए काम शुरू करने से पहले एक सख्त "नियम पुस्तिका" (rulebook) लिखनी होती है। आप उन्हें बताते हैं: "आप एक जासूस हैं। इन 5 विशिष्ट उपकरणों का उपयोग करें। अपनी नोट्स इस विशिष्ट नोटबुक प्रारूप में रखें। आपका लक्ष्य एक खोई हुई बिल्ली को ढूंढना है।"
समस्या यह है कि एक बार काम शुरू हो जाने के बाद, सहायक उसी नियम पुस्तिका से बंधा रहता है।
- यदि उन्हें एहसास होता है कि उन्हें एक अलग उपकरण की आवश्यकता है (जैसे आवर्धक लेंस के बजाय सूक्ष्मदर्शी/microscope), तो वे उसे प्राप्त नहीं कर सकते।
- यदि उन्हें लगता है कि उनका "जासूस" वाला व्यक्तित्व बहुत कठोर है और उन्हें अधिक "वैज्ञानिक" होने की आवश्यकता है, तो वे बदल नहीं सकते।
- यदि उनकी नोटबुक बेकार नोट्स से बहुत ज्यादा भर जाती है, तो वे उसे साफ नहीं कर सकते।
वे अक्सर गलत उपकरणों और गलत मानसिकता के साथ काम करने के लिए मजबूर होते हैं, और इसलिए विफल हो जाते हैं क्योंकि स्थिति बदल गई थी, लेकिन उनके निर्देश नहीं बदले।
नया तरीका (TOOLSELF):
यह शोध TOOLSELF नामक एक सिस्टम पेश करता है, जहाँ सहायक केवल एक नियम पुस्तिका का पालन नहीं कर रहा है; वह काम करते समय अपनी खुद की नियम पुस्तिका लिख रहा है।
TOOLSELF को एक ऐसे सहायक के रूप में सोचें जिसके पास एक विशेष "जादुई छड़ी" (एक टूल जिसे reconfigure कहा जाता है) है।
- लूप (The Loop): सहायक कार्य के एक हिस्से पर काम करता है। जब वे किसी बाधा से टकराते हैं या एक चरण पूरा करते हैं, तो वे रुकते हैं।
- चेक-इन (The Check-in): वे खुद से पूछते हैं: "क्या मेरी वर्तमान योजना काम कर रही है? क्या मेरे पास सही उपकरण हैं? क्या मेरी नोटबुक बहुत अव्यवस्थित है?"
- जादुई छड़ी (The Magic Wand): यदि उत्तर "नहीं" है, तो वे जादुई छड़ी घुमाते हैं। यह टूल उन्हें केवल एक नया उपकरण ही नहीं देता; बल्कि यह उन्हें अगले चरण के लिए अपना पूरा जॉब डिस्क्रिप्शन (कार्य विवरण) फिर से लिखने की अनुमति देता है।
- "ठीक है, अगले चरण के लिए, मैं अब एक जासूस नहीं हूँ; मैं एक डेटा एनालिस्ट हूँ।"
- "मुझे अपने आवर्धक लेंस को कैलकुलेटर से बदलने की आवश्यकता है।"
- "मुझे पुराने नोट्स को हटा देना चाहिए और एक नया सारांश शुरू करना चाहिए।"
- परिणाम (The Result): सहायक तुरंत उस नई पहचान को अपना लेता है, नए उपकरणों का उपयोग करता है, और आगे बढ़ता है। वे कार्य की मांग के अनुसार उसी क्षण खुद को ढाल लेते हैं।
उन्होंने सहायक को यह करना कैसे सिखाया (CAT ट्रेनिंग):
आप पूछ सकते हैं, "AI को यह कैसे पता चलता है कि उसे कब अपना मन बदलना है और उसे किस चीज़ में बदलना है?" लेखकों ने CAT (कॉन्फ़िगरेशन-अवेयर टू-स्टेज ट्रेनिंग) नामक दो-चरणीय प्रशिक्षण पद्धति का उपयोग किया:
- चरण 1: "अच्छे उदाहरणों" का चरण (RFT): उन्होंने AI को सफल मिशनों के कई उदाहरण दिखाए जहाँ सहायक ने अपने आप सही बदलावों को पहचाना। AI ने उन अच्छे व्यवहारों की नकल करना सीखा।
- चरण 2: "स्कोरकार्ड" का चरण (KTO): उन्होंने AI को अपने आप कार्यों को करने दिया। यदि AI ने पूरे मिशन को सफलतापूर्वक पूरा किया, तो उसे "गोल्ड स्टार" मिला। यदि वह विफल रहा, तो उसे "रेड X" मिला। महत्वपूर्ण रूप से, AI ने यह सीखा कि उनके द्वारा बीच में लिया गया हर एक निर्णय (जिसमें यह निर्णय भी शामिल है कि उन्हें अपने नियम कब बदलने हैं) उस अंतिम गोल्ड स्टार या रेड X में योगदान देता है। इसने AI को बेहतर स्व-समायोजन (self-adjustment) विकल्प बनाने के लिए प्रशिक्षित किया ताकि वे अंत में जीत सकें।
परिणाम:
इस शोध का परीक्षण डीप रिसर्च (कई वेबसाइटों से तथ्य खोजना), सामान्य AI सहायता और सॉफ्टवेयर कोड को ठीक करने जैसे कठिन कार्यों पर किया गया।
- बिना अतिरिक्त प्रशिक्षण के (Zero-shot): केवल "जादुई छड़ी" पद्धति का उपयोग करके भी, TOOLSELF सहायक उन विशिष्ट कार्यों के लिए मैन्युअल रूप से प्रोग्राम किए गए विशेष सहायकों की तुलना में बेहतर प्रदर्शन करता है।
- प्रशिक्षण के साथ (CAT): दो-चरणीय प्रशिक्षण के बाद, TOOLSELF सहायक ने पुराने "स्थिर नियम पुस्तिका" वाले सहायकों की तुलना में औसतन 28.8 अंक का भारी सुधार किया।
सारांश में:
TOOLSELF एक ऐसे AI को काम पर रखने जैसा है जहाँ वह काम करते समय अपने स्वयं के बॉस को बर्खास्त कर सकता है, नए उपकरण किराए पर ले सकता है, और अपने निर्देशों को फिर से लिख सकता है, और यह सब उसके सामने जो वास्तव में हो रहा है, उसके आधार पर होता है। यह इसे उन प्रणालियों की तुलना में बहुत अधिक लचीला और सफल बनाता है जो उस योजना से बंधी होती हैं जो काम शुरू होने से पहले बनाई गई थी।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।