← नवीनतम पेपर
🤖 AI

ToolSelf: Unifying Task Execution and Self-Reconfiguration via Tool-Driven Emergent Adaptation

यह शोधपत्र ToolSelf प्रस्तुत करता है, जो एक ऐसा प्रतिमान (paradigm) है जो स्थिर विन्यास (static configurations) की कठोरता को दूर करने के लिए कार्य निष्पादन और रनटाइम स्व-पुनर्गठन को एक ही नीति के भीतर एकीकृत करता है, और एक नवीन कॉन्फ़िगरेशन-अवेयर टू-स्टेज ट्रेनिंग (CAT) दृष्टिकोण के माध्यम से महत्वपूर्ण प्रदर्शन लाभ प्राप्त करता है।

मूल लेखक: Jingqi Zhou, Sheng Wang, Dezhao Deng, Junwen Lu, Junwei Su, Qintong Li, Jiahui Gao, Hao Wu, Jiyue Jiang, Lingpeng Kong, Dunhong Jin, Chuan Wu

प्रकाशित 2026-06-02
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jingqi Zhou, Sheng Wang, Dezhao Deng, Junwen Lu, Junwei Su, Qintong Li, Jiahui Gao, Hao Wu, Jiyue Jiang, Lingpeng Kong, Dunhong Jin, Chuan Wu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही जटिल, बहु-चरणीय रहस्य को सुलझाने के लिए एक अत्यधिक बुद्धिमान सहायक को काम पर रख रहे हैं।

पुराना तरीका (स्थिर कॉन्फ़िगरेशन - Static Configuration):
पारंपरिक AI सिस्टम में, आपको अपने सहायक के लिए काम शुरू करने से पहले एक सख्त "नियम पुस्तिका" (rulebook) लिखनी होती है। आप उन्हें बताते हैं: "आप एक जासूस हैं। इन 5 विशिष्ट उपकरणों का उपयोग करें। अपनी नोट्स इस विशिष्ट नोटबुक प्रारूप में रखें। आपका लक्ष्य एक खोई हुई बिल्ली को ढूंढना है।"

समस्या यह है कि एक बार काम शुरू हो जाने के बाद, सहायक उसी नियम पुस्तिका से बंधा रहता है।

  • यदि उन्हें एहसास होता है कि उन्हें एक अलग उपकरण की आवश्यकता है (जैसे आवर्धक लेंस के बजाय सूक्ष्मदर्शी/microscope), तो वे उसे प्राप्त नहीं कर सकते।
  • यदि उन्हें लगता है कि उनका "जासूस" वाला व्यक्तित्व बहुत कठोर है और उन्हें अधिक "वैज्ञानिक" होने की आवश्यकता है, तो वे बदल नहीं सकते।
  • यदि उनकी नोटबुक बेकार नोट्स से बहुत ज्यादा भर जाती है, तो वे उसे साफ नहीं कर सकते।
    वे अक्सर गलत उपकरणों और गलत मानसिकता के साथ काम करने के लिए मजबूर होते हैं, और इसलिए विफल हो जाते हैं क्योंकि स्थिति बदल गई थी, लेकिन उनके निर्देश नहीं बदले।

नया तरीका (TOOLSELF):
यह शोध TOOLSELF नामक एक सिस्टम पेश करता है, जहाँ सहायक केवल एक नियम पुस्तिका का पालन नहीं कर रहा है; वह काम करते समय अपनी खुद की नियम पुस्तिका लिख रहा है।

TOOLSELF को एक ऐसे सहायक के रूप में सोचें जिसके पास एक विशेष "जादुई छड़ी" (एक टूल जिसे reconfigure कहा जाता है) है।

  1. लूप (The Loop): सहायक कार्य के एक हिस्से पर काम करता है। जब वे किसी बाधा से टकराते हैं या एक चरण पूरा करते हैं, तो वे रुकते हैं।
  2. चेक-इन (The Check-in): वे खुद से पूछते हैं: "क्या मेरी वर्तमान योजना काम कर रही है? क्या मेरे पास सही उपकरण हैं? क्या मेरी नोटबुक बहुत अव्यवस्थित है?"
  3. जादुई छड़ी (The Magic Wand): यदि उत्तर "नहीं" है, तो वे जादुई छड़ी घुमाते हैं। यह टूल उन्हें केवल एक नया उपकरण ही नहीं देता; बल्कि यह उन्हें अगले चरण के लिए अपना पूरा जॉब डिस्क्रिप्शन (कार्य विवरण) फिर से लिखने की अनुमति देता है।
    • "ठीक है, अगले चरण के लिए, मैं अब एक जासूस नहीं हूँ; मैं एक डेटा एनालिस्ट हूँ।"
    • "मुझे अपने आवर्धक लेंस को कैलकुलेटर से बदलने की आवश्यकता है।"
    • "मुझे पुराने नोट्स को हटा देना चाहिए और एक नया सारांश शुरू करना चाहिए।"
  4. परिणाम (The Result): सहायक तुरंत उस नई पहचान को अपना लेता है, नए उपकरणों का उपयोग करता है, और आगे बढ़ता है। वे कार्य की मांग के अनुसार उसी क्षण खुद को ढाल लेते हैं।

उन्होंने सहायक को यह करना कैसे सिखाया (CAT ट्रेनिंग):
आप पूछ सकते हैं, "AI को यह कैसे पता चलता है कि उसे कब अपना मन बदलना है और उसे किस चीज़ में बदलना है?" लेखकों ने CAT (कॉन्फ़िगरेशन-अवेयर टू-स्टेज ट्रेनिंग) नामक दो-चरणीय प्रशिक्षण पद्धति का उपयोग किया:

  • चरण 1: "अच्छे उदाहरणों" का चरण (RFT): उन्होंने AI को सफल मिशनों के कई उदाहरण दिखाए जहाँ सहायक ने अपने आप सही बदलावों को पहचाना। AI ने उन अच्छे व्यवहारों की नकल करना सीखा।
  • चरण 2: "स्कोरकार्ड" का चरण (KTO): उन्होंने AI को अपने आप कार्यों को करने दिया। यदि AI ने पूरे मिशन को सफलतापूर्वक पूरा किया, तो उसे "गोल्ड स्टार" मिला। यदि वह विफल रहा, तो उसे "रेड X" मिला। महत्वपूर्ण रूप से, AI ने यह सीखा कि उनके द्वारा बीच में लिया गया हर एक निर्णय (जिसमें यह निर्णय भी शामिल है कि उन्हें अपने नियम कब बदलने हैं) उस अंतिम गोल्ड स्टार या रेड X में योगदान देता है। इसने AI को बेहतर स्व-समायोजन (self-adjustment) विकल्प बनाने के लिए प्रशिक्षित किया ताकि वे अंत में जीत सकें।

परिणाम:
इस शोध का परीक्षण डीप रिसर्च (कई वेबसाइटों से तथ्य खोजना), सामान्य AI सहायता और सॉफ्टवेयर कोड को ठीक करने जैसे कठिन कार्यों पर किया गया।

  • बिना अतिरिक्त प्रशिक्षण के (Zero-shot): केवल "जादुई छड़ी" पद्धति का उपयोग करके भी, TOOLSELF सहायक उन विशिष्ट कार्यों के लिए मैन्युअल रूप से प्रोग्राम किए गए विशेष सहायकों की तुलना में बेहतर प्रदर्शन करता है।
  • प्रशिक्षण के साथ (CAT): दो-चरणीय प्रशिक्षण के बाद, TOOLSELF सहायक ने पुराने "स्थिर नियम पुस्तिका" वाले सहायकों की तुलना में औसतन 28.8 अंक का भारी सुधार किया।

सारांश में:
TOOLSELF एक ऐसे AI को काम पर रखने जैसा है जहाँ वह काम करते समय अपने स्वयं के बॉस को बर्खास्त कर सकता है, नए उपकरण किराए पर ले सकता है, और अपने निर्देशों को फिर से लिख सकता है, और यह सब उसके सामने जो वास्तव में हो रहा है, उसके आधार पर होता है। यह इसे उन प्रणालियों की तुलना में बहुत अधिक लचीला और सफल बनाता है जो उस योजना से बंधी होती हैं जो काम शुरू होने से पहले बनाई गई थी।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →